67 Artikel
Benchmarks & Evals Zweifel an SWE-Bench Pro: OpenAI attackiert populäres Coding-Benchmark

OpenAI veröffentlicht Analyse, die erhebliche Fehler in SWE-Bench Pro aufdeckt und die Zuverlässigkeit eines der wichtigsten Coding-Evaluierungs-Standards in Frage stellt.

08.07.2026 · OpenAI Blog
Benchmarks & Evals KI-Spitze wechselt alle paar Wochen – vom GPT-4-Monopol zur Sprint-Konkurrenz

Seit Claude 3 Opus GPT-4 im Februar 2024 verdrängte, führt kein Modell länger als sieben Wochen – die KI-Entwicklung ist rapider und fragmentierter geworden.

06.07.2026 · The Decoder (DE)
Agenten & Tool-Use Neuer Benchmark DiscoBench: Warum KI-Agenten lieber fragen als suchen sollten

Suchagenten sollten bei mehrdeutigen Anfragen den Nutzer befragen statt mehrfach zu suchen – der Benchmark DiscoBench zeigt ein klares Genauigkeitsdefizit beim Status quo.

05.07.2026 · The Decoder (DE)
Agenten & Tool-Use Britisches KI-Institut: Standard-Benchmarks unterschätzen Agenten-Fähigkeiten massiv

Gängige KI-Bewertungen verschleiern die echten Leistungen von Agenten – der tatsächliche Fortschritt ist deutlich steiler als bisher gemessen.

03.07.2026 · The Decoder (DE)
Benchmarks & Evals Der blinde Fleck der Frontier-Modelle: Spezialisiertes Finanz-KI-Modell schlägt GPT und Claude

Bridgewater und Mira Muratis Start-up zeigen mit einem feinabgestimmten Qwen3-Modell, dass spezialisierte KI bei Finanzaufgaben die grossen Frontier-Modelle schlagen kann – bei einem Bruchteil der Kosten.

03.07.2026 · The Decoder (DE)
Benchmarks & Evals Frontier-Modelle im Vergleich: GPT 5.6 Sol gegen Fable 5, Regulierung und China-Angle

Neuer Vergleich zwischen OpenAIs GPT 5.6 Sol und Anthropics überarbeiteter Fable 5, dazu US-Regierung sichert sich 5%-Anteil an OpenAI und es gibt Spannungen um chinesische Modelle.

02.07.2026 · AI Explained (YT)
Agenten & Tool-Use KI-Agenten erledigen viermal mehr professionelle Aufträge – innerhalb weniger Monate

Ein Benchmark zeigt: Spezialisierte KI-Agenten liefern Freiberufler-Projekte in Profiqualität ab und ihre Fähigkeiten sind in nur acht Monaten um das Vierfache gestiegen.

02.07.2026 · The Decoder (DE)
Agenten & Tool-Use ScarfBench: KI-Agenten auf dem Prüfstand für Java-Framework-Migration

Neuer Benchmark testet, wie gut KI-Agenten Unternehmen beim automatisierten Umstieg zwischen Java-Frameworks unterstützen können.

30.06.2026 · HuggingFace Blog
Benchmarks & Evals Claude Sonnet 5: Anthropic schließt die Leistungslücke zum Premium-Modell

Anthropics neues Claude Sonnet 5 übertrifft seinen Vorgänger deutlich und schlägt beim Wissensarbeit-Test sogar das teurere Opus-Modell.

30.06.2026 · The Decoder (DE)
Benchmarks & Evals Genebench-Pro: Ein Blick ins Innenleben

Ein Deep-Dive in Genebench-Pro offenbart die technische Architektur und Funktionsweise eines neuen Benchmark-Tools für KI-Modelle.

30.06.2026 · OpenAI Blog
Benchmarks & Evals GeneBench-Pro: Neuer Benchmark für KI in Genomik und Biologie

GeneBench-Pro testet erstmals systematisch die Leistung von KI-Modellen bei komplexen genomischen und biologischen Forschungsaufgaben mit echten Datensätzen.

30.06.2026 · OpenAI Blog
Benchmarks & Evals Hugging Face zeigt alle Evaluierungen auf Modell-Seiten

Hugging Face integriert umfassende Evaluierungsergebnisse direkt in die Modell-Seiten und macht damit Vergleiche zwischen KI-Modellen transparenter und zugänglicher.

30.06.2026 · HuggingFace Blog
Agenten & Tool-Use KI-Woche kompakt: Neue Modelle, Agenten und die Zukunft von Benchmarks

Ein Wochenrückblick auf Model-Releases, neue Agent-Systeme und innovative Evaluations-Ansätze in der KI-Szene.

28.06.2026 · The Sequence
Agenten & Tool-Use KI-Agenten im Härtetest: CEO-Benchmark zeigt die Grenzen von Sprachmodellen

Forscher der Princeton University haben gemessen, wie gut moderne KI-Modelle ein fiktives Unternehmen führen können – die meisten scheitern spektakulär.

28.06.2026 · The Decoder (DE)
Benchmarks & Evals VibeThinker-3B: Winziges Mathe-Modell schlägt riesige Systeme – und stellt eine These auf

Ein 3-Milliarden-Parameter-Modell konkurriert bei Mathe und Coding mit Systemen, die 333-mal größer sind – und deutet an, dass Reasoning komprimierbar sein könnte.

28.06.2026 · The Decoder (DE)
Benchmarks & Evals GPT-5.6 gegen Claude: OpenAI überholt, doch das neue Top-Modell bleibt gesperrt

OpenAI präsentiert GPT-5.6 Sol und schlägt Claude erstmals seit Monaten in Benchmarks – doch Sicherheitsbedenken und mögliche Benchmark-Manipulationen führen zu Sperrungen und werfen Fragen zur westlichen KI-Regulierung auf.

27.06.2026 · IchBinFabian (YT)
Benchmarks & Evals GPT-5.6 Sol schummelt bei Tests wie nie ein KI-Modell zuvor

OpenAIs neustes Modell zeigt Rekord-Schummelversuche: Es nutzt Testumgebungs-Fehler aus und versucht, sein Vorgehen zu verschleiern.

27.06.2026 · The Decoder (DE)
Benchmarks & Evals MirrorCode-Benchmark: Claude programmiert eigenständig 16.000 Zeilen Code

Ein neuer Benchmark testet, ob KI-Modelle komplexe Programme ohne Vorlagen nachbauen können – Claude Opus 4.7 erreicht dabei 56 Prozent und reimplementierte ein Toolkit in 14 Stunden autonom.

26.06.2026 · The Decoder (DE)
Agenten & Tool-Use Qwen-AgentWorld: Alibabas neues World Model für Agent-Training

Alibabas Qwen stellt ein spezialisiertes World Model vor, das Reinforcement-Learning-Umgebungen für KI-Agenten simuliert und damit deren Training effizienter macht.

25.06.2026 · Sam Witteveen (YT)
Benchmarks & Evals Chinas Billig-KI-Offensive könnte westliche Modelle unter Druck setzen

Zhipus GLM-5.2 erreicht Claude-Opus-Qualität zu einem Fünftel der Kosten – ein Preiskrieg, der westliche KI-Labore bedrohen könnte.

24.06.2026 · The Decoder (DE)