38 Artikel · 2026-06
Benchmarks & Evals GLM 5.2: Chinesisches Open-Weights-Modell überrascht in den Rankings

Zhipus neues GLM 5.2 klettert an die Spitze der Open-Source-Modelle und schlägt dabei überraschend viele proprietäre Systeme auf unabhängigen Benchmarks.

17.06.2026 · Sam Witteveen (YT)
Benchmarks & Evals Zhipu AIs GLM-5.2 bei Coding-Aufgaben auf Augenhöhe mit OpenAI und Anthropic

Das chinesische Modell GLM-5.2 schließt beim FrontierSWE-Benchmark für komplexe Programmieraufgaben zu den Closed-Source-Platzhirschen auf – Open Source, 1-Million-Token-Kontext, nur ein Prozentpunkt hinter Claude Opus.

17.06.2026 · The Decoder (DE)
Benchmarks & Evals LifeSciBench: Benchmark für KI in der Lebenswissenschaft

Ein neuer Benchmark bewertet, wie gut KI-Systeme echte Aufgaben aus der Lebenswissenschaftsforschung lösen können.

17.06.2026 · OpenAI Blog
Benchmarks & Evals Wie resistent sind KI-Modelle gegen russische Propaganda? Neuer Benchmark gibt Aufschluss

Ein estnisches Institut hat einen Benchmark entwickelt, der misst, wie anfällig KI-Sprachmodelle für russische Desinformation und Propagandanarrative sind.

16.06.2026 · The Decoder (DE)
Benchmarks & Evals Die blinde Stelle der Coding-Agenten: Dateien ja, aber nicht die Zeilen

Der neue Benchmark SWE-Explore offenbart: KI-Coding-Agenten scheitern beim präzisen Lokalisieren fehlerhafter Code-Zeilen, obwohl sie die richtige Datei finden.

14.06.2026 · The Decoder (DE)
Benchmarks & Evals Claude Fable 5 dominiert Mathematik-Benchmark FrontierMath mit Rekordwert

Anthropics neues Modell Claude Fable 5 erreicht 88 % Genauigkeit im schwierigsten FrontierMath-Level und schlägt damit OpenAIs GPT-5.5 deutlich.

13.06.2026 · The Decoder (DE)
Benchmarks & Evals Anthropic Claude Fable 5: Doppelte Kosten für marginale Leistungsgewinne

Anthropics neue Claude Fable 5 führt Benchmarks an, aber der Leistungssprung von nur 5,7 Prozent rechtfertigt die verdoppelten Betriebskosten fragwürdig.

12.06.2026 · The Decoder (DE)
Benchmarks & Evals OLMo-Eval: Werkstatt zur Bewertung von Sprachmodellen

Ein neuer Evaluierungs-Framework hilft Entwicklern, Sprachmodelle systematisch zu testen und zu verbessern.

12.06.2026 · HuggingFace Blog
Benchmarks & Evals Claude Fable 5 unter der Lupe: Was die System Card wirklich verrät

Eine tiefgehende Analyse der 319-seitigen Dokumentation von Anthropics neuem Flaggschiff-Modell Claude Fable 5 deckt überraschende Stärken, aber auch bemerkenswerte Schwächen auf.

10.06.2026 · AI Explained (YT)
Benchmarks & Evals Claude Fable 5: Anthropics neues Top-Modell setzt Benchmark-Rekorde – kostet aber doppelt so viel

Anthropic startet die Mythos-Modellklasse mit Claude Fable 5, das fast alle Benchmarks dominiert, aber strengere Sicherheitsfilter und höhere Kosten mit sich bringt.

10.06.2026 · The Decoder (DE)
Agenten & Tool-Use Können Voice Agents mit zweisprachigen Kunden umgehen? Benchmark für Spracherkennung mit Code-Switching

Neue Benchmark-Studie prüft, wie gut moderne ASR-Systeme mit gemischten Sprachen in realen Kundenkommunikationen zurechtkommen.

09.06.2026 · HuggingFace Blog
Benchmarks & Evals FrontierCode: Benchmarking für Code-Qualität statt Pfusch

Ein neues Benchmarking-Tool soll helfen, die tatsächliche Code-Qualität von KI-Modellen zu messen statt oberflächliche Metriken zu verfolgen.

09.06.2026 · Latent Space
Benchmarks & Evals VendingBench: Wie Frontier-Modelle wirklich evaluiert werden

Andon Labs zeigt, wie man robuste Benchmark-Suites für Claude und andere Frontier-Modelle von Grund auf entwickelt.

04.06.2026 · Latent Space
Agenten & Tool-Use EVA-Bench Data 2.0: Benchmark für KI-Agenten mit 121 Tools und 213 Szenarien

Neues Benchmark-Dataset für die Evaluierung von KI-Agenten über drei Domänen mit über 100 Tools und realistischen Szenarien.

04.06.2026 · HuggingFace Blog
Benchmarks & Evals Ideogram 4.0: Neues Open-Weight-Bildmodell mit nativer 2K-Auflösung

Ideogram veröffentlicht sein Text-zu-Bild-Modell 4.0 als Open-Weight-Modell mit 2K-Auflösung und präziser Textdarstellung – führend unter offenen Systemen.

03.06.2026 · The Decoder (DE)
Agenten & Tool-Use MiniMax M3: Chinesisches Coding-Modell schlägt GPT 4.5 – aber lohnt sich wirklich?

Das neue chinesische Modell MiniMax M3 verspricht überlegene Coding-Performance, 1 Million Token Context und sensationelle Preise – ein Hands-on-Test mit ehrlicher Einordnung.

02.06.2026 · IchBinFabian (YT)
Benchmarks & Evals SWEbench ist abgelöst

Ein bekanntes Benchmark-System für Software-Engineering-KI-Modelle wird als obsolet erklärt – möglicherweise weil neue Systeme es übertroffen haben.

01.06.2026 · Matthew Berman (YT)
Benchmarks & Evals Nemotron 3 Ultra: Nvidias neues Open-Source-Modell Top-Performer in den USA

Nvidias Nemotron 3 Ultra ist laut Artificial Analysis das stärkste offene KI-Modell aus den USA und verfügt über 550 Milliarden Parameter.

01.06.2026 · The Decoder (DE)