106 Artikel
Benchmarks & Evals Artificial Analysis launcht Optima: Custom-Benchmarks für individuelle KI-Anwendungsfälle

Eine neue Plattform ermöglicht es Unternehmen, KI-Modelle anhand ihrer eigenen Daten und Use-Cases zu bewerten – statt sich auf generische Benchmark-Werte zu verlassen.

16.08.2026 · The Decoder (DE)
Benchmarks & Evals Qwen 3.8 27B gegen Claude: Live-Test auf RTX 5090 enthüllt die wahren Leistungs-Zahlen

Ein YouTuber hält die viralen Benchmark-Claims von Qwen gegen Claude Opus in die Praxis und findet heraus, worauf die Hersteller-Zahlen wirklich beruhen.

15.08.2026 · IchBinFabian (YT)
Benchmarks & Evals PerceptionBench: Multimodale KI-Modelle bei Bildverständnis deutlich schwächer als vermutet

Ein neuer Benchmark von Moonshot AI zeigt, dass kein Frontier-Modell 60 Prozent Genauigkeit beim reinen Bildlesen erreicht – viele vermeintliche Reasoning-Fehler entstehen bereits beim Sehen.

15.08.2026 · The Decoder (DE)
Agenten & Tool-Use Studie widerlegt Autonomie-Versprechen: KI-Agenten scheitern an echter Forschung

Frontier-Modelle können KI-Forschungspapiere zwar technisch verfassen, werden von echten Experten aber durchweg abgelehnt – ihnen fehlt Forschungsurteil und kreative Problemlösung.

14.08.2026 · The Decoder (DE)
Benchmarks & Evals Ling 3.0 Flash: Das intelligenteste Open-Source-Modell seiner Klasse

Ein neues offenes Sprachmodell namens Ling 3.0 Flash soll Benchmarks in seiner Größenklasse dominieren und eine echte Alternative zu proprietären Modellen bieten.

13.08.2026 · The Decoder (DE)
Benchmarks & Evals Grok 4.6 erreicht Weltklasse-Leistung zum halben Preis

xAIs Grok 4.6 konkurriert jetzt auf Augenhöhe mit GPT-5.6 Sol und Claude Opus 5, löst agentische Aufgaben aber deutlich effizienter und kostet über 60 Prozent weniger.

12.08.2026 · The Decoder (DE)
Agenten & Tool-Use Framework-Wahl bei KI-Agenten: Gleiche Modelle, bis zu dreifach unterschiedliche Kosten

Deepseek V4 Flash zeigt in verschiedenen Agenten-Frameworks fast identische Erfolgsquoten, doch die Kosten unterscheiden sich um das Dreifache – eine zentrale Erkenntnis für kostenbewusstes KI-Deployment.

06.08.2026 · The Decoder (DE)
Benchmarks & Evals OpenAI veröffentlicht Details zu Cyber-Evaluationen: Unbeabsichtigte Angriffe auf echte Webseiten

OpenAI und Anthropic geben Einblick in Sicherheitstests, bei denen KI-Modelle versehentlich echte Websites angegriffen haben, weil Test-Umgebungen fehlkonfiguriert waren.

05.08.2026 · Simon Willison
Benchmarks & Evals Können Open Models gegen KI-Washing antreten?

Qwen 3.8 Max stellt Open-Source-KI mit aggressiven Preisen zurück ins Rampenlicht – doch Benchmark-Streit zeigt die Glaubwürdigkeitskrise der Branche.

05.08.2026 · AI Daily Brief (YT)
Benchmarks & Evals Kimi K3 gegen Claude Opus 5: Wer findet die versteckten Bugs im Code?

Ein Praxis-Vergleich zweier führender Code-Modelle zeigt: Auch grüne Benchmark-Ergebnisse garantieren keine produktionsreifen Lösungen.

05.08.2026 · IchBinFabian (YT)
Benchmarks & Evals Open-Source-KI zieht davon

Qwen3.8 und andere Open-Source-Modelle gewinnen an Boden und stellen proprietäre Systeme zunehmend in den Schatten.

04.08.2026 · Matthew Berman (YT)
Benchmarks & Evals smevals: Ein Eval-Framework zum Testen von KI-Modellen und Prompts

Simon Willison stellt smevals vor – ein neues Open-Source-Tool zur Bewertung von KI-Modellen über verschiedene Konfigurationen hinweg mit grafischer Dashboard-Auswertung.

31.07.2026 · Simon Willison
Benchmarks & Evals Claude Mythos findet Schwächen in Kryptografie-Kandidaten

Anthropics stärkstes Modell schwächt den Post-Quanten-Kandidaten HAWK drastisch und macht Angriffe auf reduzierte AES-Varianten bis zu 800-mal schneller. Produktiv eingesetzte Verfahren sind nicht betroffen, noch nicht.

31.07.2026 · PyGround Redaktion
Benchmarks & Evals Mira Muratis Thinking Machines: Inkling Small schlägt Größe mit Effizienz

Das neue Open-Weights-Reasoning-Modell Inkling Small ist ein Drittel kleiner als sein Vorgänger, übertrifft ihn aber bei Coding- und Reasoning-Aufgaben.

31.07.2026 · The Decoder (DE)
Benchmarks & Evals Deepseek V4 Flash überholt - kostet 60 Prozent weniger als OpenAIs GPT-5.6 Luna

Deepseeks aktualisiertes Budget-Modell schließt bei der Performance-Messung fast zu OpenAIs Top-Modell auf, kostet aber deutlich weniger pro Aufgabe.

31.07.2026 · The Decoder (DE)
Benchmarks & Evals OpenAIs GPT-5.6 Sol überflügelt Claude Opus bei ARC-AGI – aber mit Asterisk

OpenAI behauptet einen Benchmark-Sieg über Anthropic, doch die Punktzahl gilt nur mit eigenem API-Setup, nicht in der offiziellen Testumgebung.

30.07.2026 · The Decoder (DE)
Benchmarks & Evals Zwei API-Einstellungen verdreifachen GPT-5.6-Performance auf ARC-AGI-3

Eine einfache Konfigurationsanpassung mit zwei API-Parametern steigerte die Scores bei GPT-5.6 auf dem ARC-AGI-3-Benchmark dramatisch – ein praktischer Optimierungstrick mit grossem Effekt.

29.07.2026 · OpenAI Blog
Benchmarks & Evals Claude Opus 5: Das Mid-Frontier-Modell im Modell-Mix

Claude Opus 5 positioniert sich als leistungsstarkes Modell mit besserer Kosteneffizienz, zeigt aber auch Schwächen wie vorzeitiges Abbrechen und Integrationsprobleme.

28.07.2026 · AI Daily Brief (YT)
Benchmarks & Evals Kimi K3: Chinesisches Open-Source-Modell rückt an Frontier-Modelle heran

Moonshot AI öffnet sein chinesisches Frontier-Modell Kimi K3 als Open Source und nähert sich damit in Benchmarks westlichen Spitzenmodellen wie GPT-4o und Claude an.

27.07.2026 · The Decoder (DE)
Benchmarks & Evals Claude Opus 5 vervierfacht Benchmark-Rekord bei logischem Denken

Anthropics neues Flaggschiff-Modell Claude Opus 5 erreicht auf dem ARC-AGI-3-Benchmark einen beispiellosen Durchbruch: 30,2 Prozent statt bisherig 7,8 Prozent – eine vierfache Steigerung mit neuen logischen Fähigkeiten.

26.07.2026 · The Decoder (DE)