35 Artikel · 2026-07
Benchmarks & Evals smevals: Ein Eval-Framework zum Testen von KI-Modellen und Prompts

Simon Willison stellt smevals vor – ein neues Open-Source-Tool zur Bewertung von KI-Modellen über verschiedene Konfigurationen hinweg mit grafischer Dashboard-Auswertung.

31.07.2026 · Simon Willison
Benchmarks & Evals Claude Mythos findet Schwächen in Kryptografie-Kandidaten

Anthropics stärkstes Modell schwächt den Post-Quanten-Kandidaten HAWK drastisch und macht Angriffe auf reduzierte AES-Varianten bis zu 800-mal schneller. Produktiv eingesetzte Verfahren sind nicht betroffen, noch nicht.

31.07.2026 · PyGround Redaktion
Benchmarks & Evals Mira Muratis Thinking Machines: Inkling Small schlägt Größe mit Effizienz

Das neue Open-Weights-Reasoning-Modell Inkling Small ist ein Drittel kleiner als sein Vorgänger, übertrifft ihn aber bei Coding- und Reasoning-Aufgaben.

31.07.2026 · The Decoder (DE)
Benchmarks & Evals Deepseek V4 Flash überholt - kostet 60 Prozent weniger als OpenAIs GPT-5.6 Luna

Deepseeks aktualisiertes Budget-Modell schließt bei der Performance-Messung fast zu OpenAIs Top-Modell auf, kostet aber deutlich weniger pro Aufgabe.

31.07.2026 · The Decoder (DE)
Benchmarks & Evals OpenAIs GPT-5.6 Sol überflügelt Claude Opus bei ARC-AGI – aber mit Asterisk

OpenAI behauptet einen Benchmark-Sieg über Anthropic, doch die Punktzahl gilt nur mit eigenem API-Setup, nicht in der offiziellen Testumgebung.

30.07.2026 · The Decoder (DE)
Benchmarks & Evals Zwei API-Einstellungen verdreifachen GPT-5.6-Performance auf ARC-AGI-3

Eine einfache Konfigurationsanpassung mit zwei API-Parametern steigerte die Scores bei GPT-5.6 auf dem ARC-AGI-3-Benchmark dramatisch – ein praktischer Optimierungstrick mit grossem Effekt.

29.07.2026 · OpenAI Blog
Benchmarks & Evals Claude Opus 5: Das Mid-Frontier-Modell im Modell-Mix

Claude Opus 5 positioniert sich als leistungsstarkes Modell mit besserer Kosteneffizienz, zeigt aber auch Schwächen wie vorzeitiges Abbrechen und Integrationsprobleme.

28.07.2026 · AI Daily Brief (YT)
Benchmarks & Evals Kimi K3: Chinesisches Open-Source-Modell rückt an Frontier-Modelle heran

Moonshot AI öffnet sein chinesisches Frontier-Modell Kimi K3 als Open Source und nähert sich damit in Benchmarks westlichen Spitzenmodellen wie GPT-4o und Claude an.

27.07.2026 · The Decoder (DE)
Benchmarks & Evals Claude Opus 5 vervierfacht Benchmark-Rekord bei logischem Denken

Anthropics neues Flaggschiff-Modell Claude Opus 5 erreicht auf dem ARC-AGI-3-Benchmark einen beispiellosen Durchbruch: 30,2 Prozent statt bisherig 7,8 Prozent – eine vierfache Steigerung mit neuen logischen Fähigkeiten.

26.07.2026 · The Decoder (DE)
Benchmarks & Evals Claude Opus 5: Anthropics neues Top-Modell überzeugt bei Performance und Preis

Anthropics Claude Opus 5 führt die KI-Benchmark-Rankings an und unterbietet dabei Konkurrenz-Modelle deutlich im Preis, besonders im Coding- und Analytics-Bereich.

25.07.2026 · The Decoder (DE)
Benchmarks & Evals Claude Opus 5: Anthropics neues Spitzenmodell schlägt Konkurrenz beim halben Preis

Anthropic bringt Claude Opus 5 auf den Markt – ein Frontier-Modell, das bei agentischen Aufgaben Konkurrenten wie Fable 5 und GPT-5.6 Sol schlägt und dazu nur halb so viel kostet.

24.07.2026 · The Decoder (DE)
Benchmarks & Evals Kimi K3: Begeisterte Benchmarks, ernüchternde Praxis

Ein praktischer Test zeigt: Das chinesische Spitzenmodell Kimi K3 glänzt zwar in Benchmarks, scheitert in der Realität aber bei anspruchsvollen Engineering-Aufgaben häufiger als geschlossen entwickelte Konkurrenten.

24.07.2026 · Cole Medin (YT)
Benchmarks & Evals Kimi K3 im Cyber-Test: Chinesisches Modell deutlich schwächer als US-Spitzenmodelle

Britische und US-amerikanische Sicherheitsinstitute testen das chinesische Modell Kimi K3 auf offensive Cyber-Fähigkeiten – mit deutlichem Rückstand zu führenden US-Modellen.

24.07.2026 · The Decoder (DE)
Benchmarks & Evals Trainieren KI-Labs ihre Modelle heimlich auf Pelikane? Eine absurd gründliche Untersuchung

Ein Entwickler hat systematisch getestet, ob KI-Hersteller ihre Modelle speziell auf die Darstellung von Pelikanen auf Fahrrädern optimieren – und fand keine Hinweise dafür.

22.07.2026 · Simon Willison
Benchmarks & Evals Trainieren AI-Labs gezielt auf Pelikan-Bicycles? Eine wissenschaftliche Untersuchung

Ein Forscher hat systematisch untersucht, ob große Sprachmodelle absichtlich darin trainiert wurden, Pelikane auf Fahrrädern zu zeichnen – ein seit Jahren kursierendes KI-Insider-Rätsel.

22.07.2026 · Simon Willison
Benchmarks & Evals Ist Moonshots Kimi K3 wirklich auf Weltklasse-Niveau?

Chinas neustes Top-Modell Kimi K3 zeigt Benchmark-Werte nahe Fable 5 und GPT-5.6, offenbart aber erhebliche Mängel bei Zuverlässigkeit, Geschwindigkeit und Kosten.

21.07.2026 · AI Daily Brief (YT)
Benchmarks & Evals Alibabas Qwen-Audio-3.0-TTS-Plus führt Text-to-Speech-Ranking an

Alibabas neues TTS-Modell erreicht Top-Platzierung in der Speech Arena Leaderboard mit 16 Sprachen und Stilsteuerung – allerdings mit langsamer Generierungsgeschwindigkeit.

21.07.2026 · The Decoder (DE)
Benchmarks & Evals Moonshots Kimi K3 dominiert Frontend-Code, scheitert aber bei komplexer Mathematik

Chinas Kimi K3 schlägt Claude und GPT beim Code-Schreiben, zeigt aber massive Schwächen bei mathematischen Problemen.

19.07.2026 · The Decoder (DE)
Benchmarks & Evals Kimi K3: Chinas neues Spitzenmodell mit 2,8 Billionen Parametern

Moonshot AI präsentiert Kimi K3, das größte Modell eines chinesischen Labs bisher, das sich in Benchmarks mit Claude Opus und GPT-5.x misst – allerdings zum Premium-Preis.

16.07.2026 · Simon Willison
Architektur-Innovation Deutsches KI-Konsortium veröffentlicht offenes Sprachmodell für Deutsch

Ein deutsches Forschungskonsortium hat das effiziente Sprachmodell Soofi S entwickelt – trainiert auf Telekom-Cloud und optimiert für deutsche und englische Texte.

13.07.2026 · The Decoder (DE)