67 Artikel
Architektur-Innovation FFASR-Leaderboard: Spracherkennung in der echten Welt im Test

Ein neues Benchmarking-System misst Spracherkennungsmodelle anhand realistischer, schwieriger Audioszenarien statt idealisierter Testbedingungen.

24.06.2026 · HuggingFace Blog
Benchmarks & Evals Die KI-Weltmeisterschaft: Wenn Sprachmodelle Fußball spielen

Ein Experiment zeigt, wie verschiedene KI-Modelle in simulierten Fußball-Szenarien konkurrieren und ihre Stärken offenbaren.

22.06.2026 · The Sequence
Benchmarks & Evals VibeThinker 3B – Kann ein Winzling gegen Riesen antreten?

Ein 3-Milliarden-Parameter-Modell soll Systeme mit bis zu 900 Milliarden Parametern übertreffen – eine Benchmark-Sensation für effiziente KI-Modelle.

19.06.2026 · Sam Witteveen (YT)
Benchmarks & Evals Ernüchternd: Top-KI-Modelle lösen nur 3 Prozent echter Wissensaufgaben perfekt

Selbst die besten aktuellen KI-Modelle scheitern bei realistischen Wissensarbeit-Szenarien und lösen nur 3 Prozent der Aufgaben vollständig korrekt.

19.06.2026 · The Decoder (DE)
Benchmarks & Evals VibeThinker 3B – winziges Modell schlägt Models 300x größer

Das 3-Milliarden-Parameter-Modell VibeThinker schlägt deutlich größere Sprachmodelle bei speziellen Aufgaben durch verbesserte Reasoning-Techniken.

19.06.2026 · Sam Witteveen (YT)
Agenten & Tool-Use Sind offene Modelle agentic genug? Benchmark mit eigenen Tools

Ein praktischer Leitfaden zum Testen von Open-Source-KI-Modellen auf ihre Fähigkeit, autonome Agenten in realen Szenarien zu spielen.

18.06.2026 · HuggingFace Blog
Benchmarks & Evals GLM-5.2: Chinas neustes Mega-Modell schafft es an die Spitze der Open-Source-Ranglisten

Das chinesische Unternehmen Z.ai hat GLM-5.2 unter MIT-Lizenz freigegeben – ein 753-Milliarden-Parameter-Modell, das jetzt führend auf unabhängigen Benchmarks rangiert und sogar Claude im Coding schlägt.

17.06.2026 · Simon Willison
Benchmarks & Evals GLM 5.2: Chinesisches Open-Weights-Modell überrascht in den Rankings

Zhipus neues GLM 5.2 klettert an die Spitze der Open-Source-Modelle und schlägt dabei überraschend viele proprietäre Systeme auf unabhängigen Benchmarks.

17.06.2026 · Sam Witteveen (YT)
Benchmarks & Evals Zhipu AIs GLM-5.2 bei Coding-Aufgaben auf Augenhöhe mit OpenAI und Anthropic

Das chinesische Modell GLM-5.2 schließt beim FrontierSWE-Benchmark für komplexe Programmieraufgaben zu den Closed-Source-Platzhirschen auf – Open Source, 1-Million-Token-Kontext, nur ein Prozentpunkt hinter Claude Opus.

17.06.2026 · The Decoder (DE)
Benchmarks & Evals LifeSciBench: Benchmark für KI in der Lebenswissenschaft

Ein neuer Benchmark bewertet, wie gut KI-Systeme echte Aufgaben aus der Lebenswissenschaftsforschung lösen können.

17.06.2026 · OpenAI Blog
Benchmarks & Evals Wie resistent sind KI-Modelle gegen russische Propaganda? Neuer Benchmark gibt Aufschluss

Ein estnisches Institut hat einen Benchmark entwickelt, der misst, wie anfällig KI-Sprachmodelle für russische Desinformation und Propagandanarrative sind.

16.06.2026 · The Decoder (DE)
Benchmarks & Evals Die blinde Stelle der Coding-Agenten: Dateien ja, aber nicht die Zeilen

Der neue Benchmark SWE-Explore offenbart: KI-Coding-Agenten scheitern beim präzisen Lokalisieren fehlerhafter Code-Zeilen, obwohl sie die richtige Datei finden.

14.06.2026 · The Decoder (DE)
Benchmarks & Evals Claude Fable 5 dominiert Mathematik-Benchmark FrontierMath mit Rekordwert

Anthropics neues Modell Claude Fable 5 erreicht 88 % Genauigkeit im schwierigsten FrontierMath-Level und schlägt damit OpenAIs GPT-5.5 deutlich.

13.06.2026 · The Decoder (DE)
Benchmarks & Evals Anthropic Claude Fable 5: Doppelte Kosten für marginale Leistungsgewinne

Anthropics neue Claude Fable 5 führt Benchmarks an, aber der Leistungssprung von nur 5,7 Prozent rechtfertigt die verdoppelten Betriebskosten fragwürdig.

12.06.2026 · The Decoder (DE)
Benchmarks & Evals OLMo-Eval: Werkstatt zur Bewertung von Sprachmodellen

Ein neuer Evaluierungs-Framework hilft Entwicklern, Sprachmodelle systematisch zu testen und zu verbessern.

12.06.2026 · HuggingFace Blog
Benchmarks & Evals Claude Fable 5 unter der Lupe: Was die System Card wirklich verrät

Eine tiefgehende Analyse der 319-seitigen Dokumentation von Anthropics neuem Flaggschiff-Modell Claude Fable 5 deckt überraschende Stärken, aber auch bemerkenswerte Schwächen auf.

10.06.2026 · AI Explained (YT)
Benchmarks & Evals Claude Fable 5: Anthropics neues Top-Modell setzt Benchmark-Rekorde – kostet aber doppelt so viel

Anthropic startet die Mythos-Modellklasse mit Claude Fable 5, das fast alle Benchmarks dominiert, aber strengere Sicherheitsfilter und höhere Kosten mit sich bringt.

10.06.2026 · The Decoder (DE)
Agenten & Tool-Use Können Voice Agents mit zweisprachigen Kunden umgehen? Benchmark für Spracherkennung mit Code-Switching

Neue Benchmark-Studie prüft, wie gut moderne ASR-Systeme mit gemischten Sprachen in realen Kundenkommunikationen zurechtkommen.

09.06.2026 · HuggingFace Blog
Benchmarks & Evals FrontierCode: Benchmarking für Code-Qualität statt Pfusch

Ein neues Benchmarking-Tool soll helfen, die tatsächliche Code-Qualität von KI-Modellen zu messen statt oberflächliche Metriken zu verfolgen.

09.06.2026 · Latent Space
Benchmarks & Evals VendingBench: Wie Frontier-Modelle wirklich evaluiert werden

Andon Labs zeigt, wie man robuste Benchmark-Suites für Claude und andere Frontier-Modelle von Grund auf entwickelt.

04.06.2026 · Latent Space