Benchmarks & Evals
Claude Fable 5.1: Anthropic setzt neue Benchmarks – und zeichnet bessere Pelikane
Anthropic hat Claude Fable 5.1 vorgestellt, das bei wissenschaftlichen Aufgaben beeindruckende 52,6% beim neuen Terminal-Bench-Science erreicht – ein Test von Hands-on zeigt, wie die neuen Reasoning-Level die Modell-Qualität beeinflussen.
01.09.2026 · Simon Willison