12 Artikel · 2026-09
Benchmarks & Evals Claude Fable 5.1 wird nüchterner: Weniger KI-Floskeln, mehr Substanz

Anthropics neues Modell Claude Fable 5.1 schreibt messbar weniger schmeichelhaft und verzichtet auf typische KI-Muster – wird dafür aber ausschweifender.

10.09.2026 · The Decoder (DE)
Benchmarks & Evals GPT-6 Astra knackt schwierigste Matheprobleme – obwohl OpenAI das gar nicht wollte

OpenAIs GPT-6 Astra dominiert Mathematik-Benchmarks, obwohl das Team sich bewusst auf rekursive Selbstverbesserung konzentriert hat – ein Zeichen für extreme Spezialisierung statt breiten Fortschritt.

10.09.2026 · The Decoder (DE)
Benchmarks & Evals Wie misst man KI-Modelle wirklich? Chatbot Arena und die Grenzen von Rankings

Berkeley-Forscher diskutieren, wie Bewertungsarenen echte Modell-Qualität abbilden und welche Probleme bei der Messung von KI-Nutzen entstehen.

10.09.2026 · The Sequence
Benchmarks & Evals Artificial Analysis verbessert sein KI-Ranking – GPT-6 Astra gewinnt Punkte, bleibt aber hinter Claude

Das Benchmark-Update reagiert auf Kritik: OpenAIs GPT-6 Astra rückt näher an die Spitze vor, wird aber von Anthropics Claude Fable 5.1 übertroffen.

05.09.2026 · The Decoder (DE)
Benchmarks & Evals Praxistest: Wie GPT-6 Astra gegen die GPT-5.6-Familie abschneidet

Ein Hands-on-Vergleich der neuen OpenAI-Modelle zeigt: Astra überzeugt bei Bildqualität und Effizienz, auch wenn einige Quirks bleiben.

04.09.2026 · Simon Willison
Benchmarks & Evals GPT-6 Astra: OpenAIs neues Flaggschiff verunsichert die Branche

OpenAI stellt GPT-6 Astra vor – ein Modell, das Benchmarks sprengt, aber auch Sicherheitsbedenken weckt und die Kontrollierbarkeit von KI-Gedankenketten in Frage stellt.

04.09.2026 · AI Explained (YT)
Benchmarks & Evals GPT-6 Astra: Benchmarks spalten die KI-Gemeinde

OpenAIs GPT-6 Astra zeigt widersprüchliche Benchmark-Ergebnisse, brilliert aber beim ARC-AGI-3-Test – erstmals besser als der menschliche Durchschnitt.

04.09.2026 · The Decoder (DE)
Benchmarks & Evals GPT-6 Astra: OpenAI stellt neues Flaggschiff-Modell vor

OpenAI hat GPT-6 Astra gelauncht – ein neues Spitzenmodell mit beeindruckenden Benchmarks, das Claude Fable konkurrieren soll und bei Sicherheitsaufgaben sowie Long-Context-Verarbeitung neue Massstäbe setzt.

03.09.2026 · Simon Willison
Benchmarks & Evals GPT-6 ist da – Astra im ersten Test

Ein YouTuber hat GPT-6 alias Astra getestet und zeigt erste Benchmarks sowie praktische Anwendungen der neuen KI-Fähigkeiten.

03.09.2026 · Matthew Berman (YT)
Benchmarks & Evals Fable 5.1 setzt neue Benchmark-Standards – und die Model-Stack-Frage neu

Fable 5.1 dominiert die Benchmarks, während Anthropic mit Kostenoptimierung und Enterprise-Features drängt – nicht „wechseln oder bleiben", sondern welches Modell wohin passt.

02.09.2026 · AI Daily Brief (YT)
Benchmarks & Evals Claude Fable 5.1: Anthropic setzt neue Benchmarks – und zeichnet bessere Pelikane

Anthropic hat Claude Fable 5.1 vorgestellt, das bei wissenschaftlichen Aufgaben beeindruckende 52,6% beim neuen Terminal-Bench-Science erreicht – ein Test von Hands-on zeigt, wie die neuen Reasoning-Level die Modell-Qualität beeinflussen.

01.09.2026 · Simon Willison
Benchmarks & Evals BenchMIRT: Was messen LLM-Benchmarks wirklich?

Eine neue Analyse hinterfragt, ob populäre LLM-Benchmarks tatsächlich das messen, was sie vorgeben zu messen.

01.09.2026 · HuggingFace Blog