Anthropic hat Claude Fable und Mythos 5.1 angekündigt, wobei die neue Version laut Benchmarks besonders bei wissenschaftlichen Aufgaben glänzt: 52,6% Punktzahl beim Terminal-Bench-Science (gegenüber 24,7% bei Fable 5). Ein detaillierter Hands-on-Test zeigt, wie das Modell mit fünf verschiedenen Reasoning-Leveln (low bis max) bei einer einfachen SVG-Pelikan-Aufgabe umgeht – interessanterweise zeigen die niedrigeren Level teilweise kein explizites Reasoning, während höhere Level deutlich mehr Tokens und Zeit investieren. Der Artikel diskutiert auch kritisch, wie hilfreich klassische Benchmarks noch sind und welche praktischen Erkenntnisse man aus Vergleichen innerhalb einer Modell-Familie gewinnt.