151 Artikel
Labs & Industrie Ziegen statt Neuronen: Microsoft-Forscher demonstriert KI-Anthropomorphismus im Videospiel

Ein Microsoft-Forscher baut ein funktionierendes neuronales Netz in Age of Empires II, um zu zeigen, wie Sprachmodelle fälschlicherweise als menschenähnlich beschrieben werden.

17.06.2026 · The Decoder (DE)
Agenten & Tool-Use Das selbstfahrende Labor – warum Materialforschung die nächste KI-Grenze ist

Radical AI argumentiert, dass der wahre Wettbewerbsvorteil in der Materialforschung nicht im Modell liegt, sondern in der Fähigkeit, physische Experimente zu automatisieren.

17.06.2026 · Latent Space
Coding-Modelle Die KI-Revolution in der Softwareentwicklung: Code wurde über Nacht disposabel

Charity Majors warnt: Weil KI Code nun kostenlos und instant erzeugt, hat sich die Ökonomie der Softwareentwicklung radikal verschoben – und mit ihr die Anforderungen an Ingenieurdisziplin.

17.06.2026 · Simon Willison
Architektur-Innovation MolmoMotion: Sprachgesteuerte 3D-Bewegungsvorhersage

Ein neues Modell kombiniert Sprachverständnis mit 3D-Bewegungsvorhersage und kann komplexe menschliche Bewegungen aus natürlichsprachlichen Beschreibungen vorhersagen.

17.06.2026 · HuggingFace Blog
Agenten & Tool-Use Nvidia zeigt selbstlernende Roboterflotte – Agenten trainieren Griffe ohne menschliche Anleitung

Ein KI-Projekt von Nvidia, CMU und UC Berkeley lässt Roboter-Agenten eigenständig komplexe Handgriffe wie Kabelbinder-Schneiden trainieren – mit teilweise beeindruckenden Erfolgsraten, aber auch klaren Lücken zwischen Simulation und Realität.

17.06.2026 · The Decoder (DE)
Frontier-Modelle Deployment Simulation: So testet OpenAI KI-Modelle in der Realität

OpenAI-Forscher zeigen eine Methode, die mit echten Nutzergesprächen vorhersagt, wie fehleranfällig neue Modelle nach dem Release sein werden – und schlägt traditionelle Tests damit deutlich.

17.06.2026 · The Decoder (DE)
Benchmarks & Evals LifeSciBench: Benchmark für KI in der Lebenswissenschaft

Ein neuer Benchmark bewertet, wie gut KI-Systeme echte Aufgaben aus der Lebenswissenschaftsforschung lösen können.

17.06.2026 · OpenAI Blog
Agenten & Tool-Use Agenten auf Ressourcensuche: Neue Fähigkeiten für autonome KI-Systeme

Eine neue Methode ermöglicht es KI-Agenten, eigenständig nach relevanten Ressourcen und Informationen zu suchen, statt auf vordefinierte Quellen beschränkt zu sein.

17.06.2026 · HuggingFace Blog
Benchmarks & Evals Wie resistent sind KI-Modelle gegen russische Propaganda? Neuer Benchmark gibt Aufschluss

Ein estnisches Institut hat einen Benchmark entwickelt, der misst, wie anfällig KI-Sprachmodelle für russische Desinformation und Propagandanarrative sind.

16.06.2026 · The Decoder (DE)
Architektur-Innovation Die Sequenz-Wissensfabrik #878: Jenseits von Transformer – Was wir gelernt haben

Eine neue Serie über Distillation und aktuelle Erkenntnisse über die Grenzen und Alternativen zu Transformer-Architekturen.

16.06.2026 · The Sequence
Frontier-Modelle OpenAI testet KI-Verhalten schon vor dem Start – mit echten Nutzer-Daten

OpenAI stellt „Deployment Simulation" vor: eine Methode, um Modell-Verhalten vor dem Live-Gang mit echten Gesprächsdaten zu simulieren und so Sicherheit zu verbessern.

16.06.2026 · OpenAI Blog
Architektur-Innovation Mirage: Wie Video-KI räumliches Langzeitgedächtnis bekommt

Microsoft-Forschung zeigt, wie Video-Modelle räumliche Szenen im latenten Raum speichern können – effizienter und stabiler als bisherige Ansätze.

14.06.2026 · The Decoder (DE)
Benchmarks & Evals Die blinde Stelle der Coding-Agenten: Dateien ja, aber nicht die Zeilen

Der neue Benchmark SWE-Explore offenbart: KI-Coding-Agenten scheitern beim präzisen Lokalisieren fehlerhafter Code-Zeilen, obwohl sie die richtige Datei finden.

14.06.2026 · The Decoder (DE)
Frontier-Modelle «Count Anything»: KI-Modell zählt Objekte in Bildern halb so fehlerhaft

Ein neues KI-Modell kann per Texteingabe Objekte in beliebigen Bildern zählen – von Menschenmengen bis zu Zellen – und halbiert dabei die Fehlerrate bestehender Systeme.

13.06.2026 · The Decoder (DE)
Agenten & Tool-Use SkillOpt: Microsofts neuer Trick für schlauere KI-Agenten – ohne Neutraining

Forscher zeigen, wie man KI-Agenten wie neuronale Netze trainiert, indem man nur Handlungsanleitungen optimiert – statt Modellgewichte zu ändern.

13.06.2026 · The Decoder (DE)
Benchmarks & Evals Claude Fable 5 dominiert Mathematik-Benchmark FrontierMath mit Rekordwert

Anthropics neues Modell Claude Fable 5 erreicht 88 % Genauigkeit im schwierigsten FrontierMath-Level und schlägt damit OpenAIs GPT-5.5 deutlich.

13.06.2026 · The Decoder (DE)
Benchmarks & Evals OLMo-Eval: Werkstatt zur Bewertung von Sprachmodellen

Ein neuer Evaluierungs-Framework hilft Entwicklern, Sprachmodelle systematisch zu testen und zu verbessern.

12.06.2026 · HuggingFace Blog
Agenten & Tool-Use Open Models, Model Labs gegen Agent Labs – und was sich nicht trainieren lässt

Sarah Guo reflektiert in einem Essay über die Unterschiede zwischen traditionellen Model Labs und modernen Agent Labs sowie über die Grenzen des Trainings in der KI-Entwicklung.

11.06.2026 · Latent Space
Coding-Modelle Mit KI-Programmierung zum Schwarzen Loch: Astrophysiker nutzt Codex für Simulationen

Ein Astrophysiker setzt Codex ein, um komplexe Schwarzloch-Simulationen schneller zu bauen und Einsteins Relativitätstheorie zu testen.

11.06.2026 · OpenAI Blog
Architektur-Innovation DiffusionGemma: Google forscht an Diffusion statt Auto-Regession für schnellere Textgenerierung

Google veröffentlicht ein 26-Milliarden-Parameter-Modell, das Text durch Diffusion statt Tokensorientiert generiert und dabei vierfach schneller ist – mit Qualitätsabstrichen.

10.06.2026 · The Decoder (DE)