Claude Fable 5.1: Anthropic setzt neue Benchmarks – und zeichnet bessere Pelikane

Claude Fable 5.1 made me a really nice animated pelican
9/10 Simon Willison 01.09.2026 Benchmarks & Evals Frontier-Modelle Produkt-Launch

Anthropic hat Claude Fable und Mythos 5.1 angekündigt, wobei die neue Version laut Benchmarks besonders bei wissenschaftlichen Aufgaben glänzt: 52,6% Punktzahl beim Terminal-Bench-Science (gegenüber 24,7% bei Fable 5). Ein detaillierter Hands-on-Test zeigt, wie das Modell mit fünf verschiedenen Reasoning-Leveln (low bis max) bei einer einfachen SVG-Pelikan-Aufgabe umgeht – interessanterweise zeigen die niedrigeren Level teilweise kein explizites Reasoning, während höhere Level deutlich mehr Tokens und Zeit investieren. Der Artikel diskutiert auch kritisch, wie hilfreich klassische Benchmarks noch sind und welche praktischen Erkenntnisse man aus Vergleichen innerhalb einer Modell-Familie gewinnt.

Zum Originalartikel