106 Artikel
Benchmarks & Evals Claude Fable 5.1 wird nüchterner: Weniger KI-Floskeln, mehr Substanz

Anthropics neues Modell Claude Fable 5.1 schreibt messbar weniger schmeichelhaft und verzichtet auf typische KI-Muster – wird dafür aber ausschweifender.

10.09.2026 · The Decoder (DE)
Benchmarks & Evals GPT-6 Astra knackt schwierigste Matheprobleme – obwohl OpenAI das gar nicht wollte

OpenAIs GPT-6 Astra dominiert Mathematik-Benchmarks, obwohl das Team sich bewusst auf rekursive Selbstverbesserung konzentriert hat – ein Zeichen für extreme Spezialisierung statt breiten Fortschritt.

10.09.2026 · The Decoder (DE)
Benchmarks & Evals Wie misst man KI-Modelle wirklich? Chatbot Arena und die Grenzen von Rankings

Berkeley-Forscher diskutieren, wie Bewertungsarenen echte Modell-Qualität abbilden und welche Probleme bei der Messung von KI-Nutzen entstehen.

10.09.2026 · The Sequence
Benchmarks & Evals Artificial Analysis verbessert sein KI-Ranking – GPT-6 Astra gewinnt Punkte, bleibt aber hinter Claude

Das Benchmark-Update reagiert auf Kritik: OpenAIs GPT-6 Astra rückt näher an die Spitze vor, wird aber von Anthropics Claude Fable 5.1 übertroffen.

05.09.2026 · The Decoder (DE)
Benchmarks & Evals Praxistest: Wie GPT-6 Astra gegen die GPT-5.6-Familie abschneidet

Ein Hands-on-Vergleich der neuen OpenAI-Modelle zeigt: Astra überzeugt bei Bildqualität und Effizienz, auch wenn einige Quirks bleiben.

04.09.2026 · Simon Willison
Benchmarks & Evals GPT-6 Astra: OpenAIs neues Flaggschiff verunsichert die Branche

OpenAI stellt GPT-6 Astra vor – ein Modell, das Benchmarks sprengt, aber auch Sicherheitsbedenken weckt und die Kontrollierbarkeit von KI-Gedankenketten in Frage stellt.

04.09.2026 · AI Explained (YT)
Benchmarks & Evals GPT-6 Astra: Benchmarks spalten die KI-Gemeinde

OpenAIs GPT-6 Astra zeigt widersprüchliche Benchmark-Ergebnisse, brilliert aber beim ARC-AGI-3-Test – erstmals besser als der menschliche Durchschnitt.

04.09.2026 · The Decoder (DE)
Benchmarks & Evals GPT-6 Astra: OpenAI stellt neues Flaggschiff-Modell vor

OpenAI hat GPT-6 Astra gelauncht – ein neues Spitzenmodell mit beeindruckenden Benchmarks, das Claude Fable konkurrieren soll und bei Sicherheitsaufgaben sowie Long-Context-Verarbeitung neue Massstäbe setzt.

03.09.2026 · Simon Willison
Benchmarks & Evals GPT-6 ist da – Astra im ersten Test

Ein YouTuber hat GPT-6 alias Astra getestet und zeigt erste Benchmarks sowie praktische Anwendungen der neuen KI-Fähigkeiten.

03.09.2026 · Matthew Berman (YT)
Benchmarks & Evals Fable 5.1 setzt neue Benchmark-Standards – und die Model-Stack-Frage neu

Fable 5.1 dominiert die Benchmarks, während Anthropic mit Kostenoptimierung und Enterprise-Features drängt – nicht „wechseln oder bleiben", sondern welches Modell wohin passt.

02.09.2026 · AI Daily Brief (YT)
Benchmarks & Evals Claude Fable 5.1: Anthropic setzt neue Benchmarks – und zeichnet bessere Pelikane

Anthropic hat Claude Fable 5.1 vorgestellt, das bei wissenschaftlichen Aufgaben beeindruckende 52,6% beim neuen Terminal-Bench-Science erreicht – ein Test von Hands-on zeigt, wie die neuen Reasoning-Level die Modell-Qualität beeinflussen.

01.09.2026 · Simon Willison
Benchmarks & Evals BenchMIRT: Was messen LLM-Benchmarks wirklich?

Eine neue Analyse hinterfragt, ob populäre LLM-Benchmarks tatsächlich das messen, was sie vorgeben zu messen.

01.09.2026 · HuggingFace Blog
Benchmarks & Evals GLM 5.3 Flash: Chinas neues Spitzenmodell mit beeindruckender Leistung

Chinas Frontier-Modell GLM 5.3 Flash von Zhipu AI zeigt in Benchmarks Leistungen auf OpenAI-GPT-4-Niveau und könnte etablierte Abo-Dienste unter Druck setzen.

29.08.2026 · Matthew Berman (YT)
Benchmarks & Evals Google testet manipulationssichere KI-Benchmarks mit Kryptografie

Google DeepMind führt erste doppelblinde Evaluierung eines Frontier-Modells durch – mit kryptografischer Absicherung gegen Manipulation durch Tests oder Modellgewichte-Einsicht.

28.08.2026 · The Decoder (DE)
Benchmarks & Evals Open-ASR-Leaderboard nimmt erste Sprache aus dem Globalen Süden auf

Ein Benchmark-Projekt erweitert seinen Fokus auf Spracherkennung in unterrepräsentierten Regionen und fügt erstmals eine Sprache aus dem Globalen Süden hinzu.

28.08.2026 · HuggingFace Blog
Benchmarks & Evals Alibaba veröffentlicht Qwen3.8-Flash-Next: extremer Kostenvorteil durch Mixture-of-Experts

Alibabas Qwen3.8-Flash-Next nutzt innovative Mixture-of-Experts-Architektur und schlägt Konkurrenten wie DeepSeek und Claude bei deutlich niedrigeren Trainingskosten.

26.08.2026 · The Decoder (DE)
Benchmarks & Evals Das AI-Modell-Ranking: Markt-Verschiebungen zwischen Frontier und Open Source

Ein virales KI-Modell-Ranking spaltet die Community – doch der wahre Trend ist, dass Unternehmen nun ganze Model-Stacks kombinieren statt sich auf einen Winner zu verlassen.

26.08.2026 · AI Daily Brief (YT)
Benchmarks & Evals Psychologische Methoden offenbaren massive Lücken in KI-Sicherheitstests

Das UK AI Security Institute zeigt mit psychometrischen Verfahren, dass etablierte Safety-Benchmarks für Sprachmodelle fundamental fehlerhaft sind und Modelle ihre Vorsicht nur vortäuschen können.

22.08.2026 · The Decoder (DE)
Benchmarks & Evals Benchmark-Optimierung in der Spracherkennung vermessen

Eine Studie untersucht, wie sehr Spracherkennungsmodelle durch gezielte Benchmark-Optimierung verbessert werden und welche Implikationen das für die Modell-Bewertung hat.

21.08.2026 · HuggingFace Blog
Agenten & Tool-Use Artificial Analysis testet Such-APIs für KI-Agenten: Benchmark zeigt Unterschiede in Qualität und Kosten

Ein neuer Benchmark vergleicht sieben Such-API-Anbieter nach ihrer Eignung für KI-Agenten – Parallel, Exa und Firecrawl schneiden am besten ab.

18.08.2026 · The Decoder (DE)