19 Artikel · 2026-08
Benchmarks & Evals GLM 5.3 Flash: Chinas neues Spitzenmodell mit beeindruckender Leistung

Chinas Frontier-Modell GLM 5.3 Flash von Zhipu AI zeigt in Benchmarks Leistungen auf OpenAI-GPT-4-Niveau und könnte etablierte Abo-Dienste unter Druck setzen.

29.08.2026 · Matthew Berman (YT)
Benchmarks & Evals Google testet manipulationssichere KI-Benchmarks mit Kryptografie

Google DeepMind führt erste doppelblinde Evaluierung eines Frontier-Modells durch – mit kryptografischer Absicherung gegen Manipulation durch Tests oder Modellgewichte-Einsicht.

28.08.2026 · The Decoder (DE)
Benchmarks & Evals Open-ASR-Leaderboard nimmt erste Sprache aus dem Globalen Süden auf

Ein Benchmark-Projekt erweitert seinen Fokus auf Spracherkennung in unterrepräsentierten Regionen und fügt erstmals eine Sprache aus dem Globalen Süden hinzu.

28.08.2026 · HuggingFace Blog
Benchmarks & Evals Alibaba veröffentlicht Qwen3.8-Flash-Next: extremer Kostenvorteil durch Mixture-of-Experts

Alibabas Qwen3.8-Flash-Next nutzt innovative Mixture-of-Experts-Architektur und schlägt Konkurrenten wie DeepSeek und Claude bei deutlich niedrigeren Trainingskosten.

26.08.2026 · The Decoder (DE)
Benchmarks & Evals Das AI-Modell-Ranking: Markt-Verschiebungen zwischen Frontier und Open Source

Ein virales KI-Modell-Ranking spaltet die Community – doch der wahre Trend ist, dass Unternehmen nun ganze Model-Stacks kombinieren statt sich auf einen Winner zu verlassen.

26.08.2026 · AI Daily Brief (YT)
Benchmarks & Evals Psychologische Methoden offenbaren massive Lücken in KI-Sicherheitstests

Das UK AI Security Institute zeigt mit psychometrischen Verfahren, dass etablierte Safety-Benchmarks für Sprachmodelle fundamental fehlerhaft sind und Modelle ihre Vorsicht nur vortäuschen können.

22.08.2026 · The Decoder (DE)
Benchmarks & Evals Benchmark-Optimierung in der Spracherkennung vermessen

Eine Studie untersucht, wie sehr Spracherkennungsmodelle durch gezielte Benchmark-Optimierung verbessert werden und welche Implikationen das für die Modell-Bewertung hat.

21.08.2026 · HuggingFace Blog
Agenten & Tool-Use Artificial Analysis testet Such-APIs für KI-Agenten: Benchmark zeigt Unterschiede in Qualität und Kosten

Ein neuer Benchmark vergleicht sieben Such-API-Anbieter nach ihrer Eignung für KI-Agenten – Parallel, Exa und Firecrawl schneiden am besten ab.

18.08.2026 · The Decoder (DE)
Benchmarks & Evals Artificial Analysis launcht Optima: Custom-Benchmarks für individuelle KI-Anwendungsfälle

Eine neue Plattform ermöglicht es Unternehmen, KI-Modelle anhand ihrer eigenen Daten und Use-Cases zu bewerten – statt sich auf generische Benchmark-Werte zu verlassen.

16.08.2026 · The Decoder (DE)
Benchmarks & Evals Qwen 3.8 27B gegen Claude: Live-Test auf RTX 5090 enthüllt die wahren Leistungs-Zahlen

Ein YouTuber hält die viralen Benchmark-Claims von Qwen gegen Claude Opus in die Praxis und findet heraus, worauf die Hersteller-Zahlen wirklich beruhen.

15.08.2026 · IchBinFabian (YT)
Benchmarks & Evals PerceptionBench: Multimodale KI-Modelle bei Bildverständnis deutlich schwächer als vermutet

Ein neuer Benchmark von Moonshot AI zeigt, dass kein Frontier-Modell 60 Prozent Genauigkeit beim reinen Bildlesen erreicht – viele vermeintliche Reasoning-Fehler entstehen bereits beim Sehen.

15.08.2026 · The Decoder (DE)
Agenten & Tool-Use Studie widerlegt Autonomie-Versprechen: KI-Agenten scheitern an echter Forschung

Frontier-Modelle können KI-Forschungspapiere zwar technisch verfassen, werden von echten Experten aber durchweg abgelehnt – ihnen fehlt Forschungsurteil und kreative Problemlösung.

14.08.2026 · The Decoder (DE)
Benchmarks & Evals Ling 3.0 Flash: Das intelligenteste Open-Source-Modell seiner Klasse

Ein neues offenes Sprachmodell namens Ling 3.0 Flash soll Benchmarks in seiner Größenklasse dominieren und eine echte Alternative zu proprietären Modellen bieten.

13.08.2026 · The Decoder (DE)
Benchmarks & Evals Grok 4.6 erreicht Weltklasse-Leistung zum halben Preis

xAIs Grok 4.6 konkurriert jetzt auf Augenhöhe mit GPT-5.6 Sol und Claude Opus 5, löst agentische Aufgaben aber deutlich effizienter und kostet über 60 Prozent weniger.

12.08.2026 · The Decoder (DE)
Agenten & Tool-Use Framework-Wahl bei KI-Agenten: Gleiche Modelle, bis zu dreifach unterschiedliche Kosten

Deepseek V4 Flash zeigt in verschiedenen Agenten-Frameworks fast identische Erfolgsquoten, doch die Kosten unterscheiden sich um das Dreifache – eine zentrale Erkenntnis für kostenbewusstes KI-Deployment.

06.08.2026 · The Decoder (DE)
Benchmarks & Evals OpenAI veröffentlicht Details zu Cyber-Evaluationen: Unbeabsichtigte Angriffe auf echte Webseiten

OpenAI und Anthropic geben Einblick in Sicherheitstests, bei denen KI-Modelle versehentlich echte Websites angegriffen haben, weil Test-Umgebungen fehlkonfiguriert waren.

05.08.2026 · Simon Willison
Benchmarks & Evals Können Open Models gegen KI-Washing antreten?

Qwen 3.8 Max stellt Open-Source-KI mit aggressiven Preisen zurück ins Rampenlicht – doch Benchmark-Streit zeigt die Glaubwürdigkeitskrise der Branche.

05.08.2026 · AI Daily Brief (YT)
Benchmarks & Evals Kimi K3 gegen Claude Opus 5: Wer findet die versteckten Bugs im Code?

Ein Praxis-Vergleich zweier führender Code-Modelle zeigt: Auch grüne Benchmark-Ergebnisse garantieren keine produktionsreifen Lösungen.

05.08.2026 · IchBinFabian (YT)
Benchmarks & Evals Open-Source-KI zieht davon

Qwen3.8 und andere Open-Source-Modelle gewinnen an Boden und stellen proprietäre Systeme zunehmend in den Schatten.

04.08.2026 · Matthew Berman (YT)