151 Artikel
Frontier-Modelle Mistral betritt die Robotik: 8B-Modell navigiert mit nur einer Kamera

Mistral lanciert Robostral Navigate, ein spezialisiertes 8B-Modell, das Roboter allein per RGB-Kamera durch unbekannte Umgebungen lenkt – ein Einstieg in ein neues Anwendungsfeld für den französischen KI-Konzern.

08.07.2026 · The Decoder (DE)
Benchmarks & Evals Zweifel an SWE-Bench Pro: OpenAI attackiert populäres Coding-Benchmark

OpenAI veröffentlicht Analyse, die erhebliche Fehler in SWE-Bench Pro aufdeckt und die Zuverlässigkeit eines der wichtigsten Coding-Evaluierungs-Standards in Frage stellt.

08.07.2026 · OpenAI Blog
Frontier-Modelle KI denkt jetzt wirklich – oder doch nur anders?

Ein Gedankenexperiment über die neuen Fähigkeiten moderner Sprachmodelle und was „echtes Denken" überhaupt bedeutet.

08.07.2026 · Matthew Berman (YT)
Architektur-Innovation Wie KI wirklich funktioniert: Neue Forschung zu J-Space und Global Workspace

Anthropic und Transformer Circuits veröffentlichen Forschung zum Mechanismus hinter KI-Modellen – ein Durchbruch im Verständnis von Informationsverarbeitung in neuronalen Netzwerken.

08.07.2026 · Matthew Berman (YT)
Architektur-Innovation Lilian Weng fasst 35 Papiere zu Harness Engineering zusammen

Eine ruhige Nachrichtenlage ermöglicht einen tiefen Blick auf Lernmechanismen in modernen KI-Systemen.

08.07.2026 · Latent Space
Architektur-Innovation Die Entwicklung der Modell-Destillation: Ein historischer Überblick

Ein Rückblick auf die Grundlagenpapiere und Techniken, die die moderne Modell-Destillation ermöglicht haben.

07.07.2026 · The Sequence
Frontier-Modelle Baidu öffnet große Türen: Neue OCR liest ganze Bücher auf einmal

Baidus Unlimited OCR kann Dutzende Dokumentseiten in einem Durchgang erfassen – ein großer Sprung gegenüber bisherigen Systemen, die kaum zehn Seiten bewältigen.

05.07.2026 · The Decoder (DE)
Agenten & Tool-Use Neuer Benchmark DiscoBench: Warum KI-Agenten lieber fragen als suchen sollten

Suchagenten sollten bei mehrdeutigen Anfragen den Nutzer befragen statt mehrfach zu suchen – der Benchmark DiscoBench zeigt ein klares Genauigkeitsdefizit beim Status quo.

05.07.2026 · The Decoder (DE)
Policy & Ethik KI-Hausaufgaben führen zu Lernverlusten in Prüfungen

Große chinesische Studie zeigt: Schüler mit generativer KI bei Hausaufgaben erledigen diese schneller, schneiden aber in Klausuren bis zu 24 Prozent schlechter ab.

04.07.2026 · The Decoder (DE)
Coding-Modelle Mistral veröffentlicht Leanstral: KI für formale Mathematik und Code-Verifikation

Mistral AI bringt ein Open-Source-Modell für formale Verifikation in Lean 4 und findet dabei unbekannte Bugs in echtem Code.

04.07.2026 · The Decoder (DE)
Infrastruktur Open-Source-KI: Neue Gap Map zeigt den Stand des Ökosystems

Current AI, eine neu gegründete Non-Profit-Initiative mit 400 Millionen Dollar Kapital, veröffentlicht eine umfassende Karte des Open-Source-KI-Ökosystems mit über 421 detailliert erfassten Produkten.

03.07.2026 · Simon Willison
Enterprise KI findet dreimal mehr Sicherheitslücken – CVE-Meldungen explodieren

Im Juni 2026 wurden über 1.500 schwere Sicherheitslücken gemeldet – mehr als dreieinhalb Mal so viele wie je zuvor in einem Monat, zeitgleich mit dem Einsatz von KI-gestützten Bug-Hunting-Tools.

03.07.2026 · The Decoder (DE)
Agenten & Tool-Use Britisches KI-Institut: Standard-Benchmarks unterschätzen Agenten-Fähigkeiten massiv

Gängige KI-Bewertungen verschleiern die echten Leistungen von Agenten – der tatsächliche Fortschritt ist deutlich steiler als bisher gemessen.

03.07.2026 · The Decoder (DE)
Agenten & Tool-Use DSPy zur Optimierung von SQL-Prompts in Datasette Agent

Praktische Anwendung von DSPy für die systematische Verbesserung von System-Prompts eines Agenten, der SQL-Queries ausführt – mit konkreten Erkenntnissen über Prompt-Design.

02.07.2026 · Simon Willison
Agenten & Tool-Use Verstehen, um teilzunehmen: Das Dilemma der Code-Agenten

Geoffrey Litt warnt vor „kognitiver Schuld" bei der Zusammenarbeit mit KI-Coding-Agenten und argumentiert, dass Entwickler die generierten Änderungen verstehen müssen, um kreativ mitgestalten zu können.

02.07.2026 · Simon Willison
Frontier-Modelle Anthropic verkürzt Claude-Prompts um 80 Prozent – Kontext statt Verbote

Anthropic zeigt, dass kleinere System-Prompts für Claude stärker wirken als detaillierte Anweisungen.

02.07.2026 · The Decoder (DE)
Agenten & Tool-Use KI-Agenten erledigen viermal mehr professionelle Aufträge – innerhalb weniger Monate

Ein Benchmark zeigt: Spezialisierte KI-Agenten liefern Freiberufler-Projekte in Profiqualität ab und ihre Fähigkeiten sind in nur acht Monaten um das Vierfache gestiegen.

02.07.2026 · The Decoder (DE)
Frontier-Modelle Das Rennen um KI im All: Plattformen, Use-Cases und die grossen Herausforderungen

Ein Überblick über die wachsende Rolle von Künstlicher Intelligenz in der Raumfahrt und Satelliteninfrastruktur.

02.07.2026 · The Sequence
Agenten & Tool-Use AI-Forschung und menschliche Kontrolle: Spannungen beim "Software Factory"-Ansatz

Diskussion über Autoresearch offenbart grundsätzliche Konflikte zwischen autonomen KI-Systemen und der Forderung nach menschlicher Kontrolle und Verständnis.

02.07.2026 · Latent Space
Agenten & Tool-Use Autoresearch: Wie sich selbstverbessernde Agenten selbst optimieren

Introspection-Mitgründer Roland Gavrilescu erläutert, wie Agenten durch Rückkopplungsschleifen eigenständig lernen und sich verbessern – und warum Menschen dabei unverzichtbar bleiben.

01.07.2026 · Latent Space