27 Artikel · 2026-07
Benchmarks & Evals Zweifel an SWE-Bench Pro: OpenAI attackiert populäres Coding-Benchmark

OpenAI veröffentlicht Analyse, die erhebliche Fehler in SWE-Bench Pro aufdeckt und die Zuverlässigkeit eines der wichtigsten Coding-Evaluierungs-Standards in Frage stellt.

08.07.2026 · OpenAI Blog
Benchmarks & Evals KI-Spitze wechselt alle paar Wochen – vom GPT-4-Monopol zur Sprint-Konkurrenz

Seit Claude 3 Opus GPT-4 im Februar 2024 verdrängte, führt kein Modell länger als sieben Wochen – die KI-Entwicklung ist rapider und fragmentierter geworden.

06.07.2026 · The Decoder (DE)
Agenten & Tool-Use Neuer Benchmark DiscoBench: Warum KI-Agenten lieber fragen als suchen sollten

Suchagenten sollten bei mehrdeutigen Anfragen den Nutzer befragen statt mehrfach zu suchen – der Benchmark DiscoBench zeigt ein klares Genauigkeitsdefizit beim Status quo.

05.07.2026 · The Decoder (DE)
Agenten & Tool-Use Britisches KI-Institut: Standard-Benchmarks unterschätzen Agenten-Fähigkeiten massiv

Gängige KI-Bewertungen verschleiern die echten Leistungen von Agenten – der tatsächliche Fortschritt ist deutlich steiler als bisher gemessen.

03.07.2026 · The Decoder (DE)
Benchmarks & Evals Der blinde Fleck der Frontier-Modelle: Spezialisiertes Finanz-KI-Modell schlägt GPT und Claude

Bridgewater und Mira Muratis Start-up zeigen mit einem feinabgestimmten Qwen3-Modell, dass spezialisierte KI bei Finanzaufgaben die grossen Frontier-Modelle schlagen kann – bei einem Bruchteil der Kosten.

03.07.2026 · The Decoder (DE)
Benchmarks & Evals Frontier-Modelle im Vergleich: GPT 5.6 Sol gegen Fable 5, Regulierung und China-Angle

Neuer Vergleich zwischen OpenAIs GPT 5.6 Sol und Anthropics überarbeiteter Fable 5, dazu US-Regierung sichert sich 5%-Anteil an OpenAI und es gibt Spannungen um chinesische Modelle.

02.07.2026 · AI Explained (YT)
Agenten & Tool-Use KI-Agenten erledigen viermal mehr professionelle Aufträge – innerhalb weniger Monate

Ein Benchmark zeigt: Spezialisierte KI-Agenten liefern Freiberufler-Projekte in Profiqualität ab und ihre Fähigkeiten sind in nur acht Monaten um das Vierfache gestiegen.

02.07.2026 · The Decoder (DE)