OpenAIs GPT-5.6 Sol überflügelt Claude Opus bei ARC-AGI – aber mit Asterisk

GPT-5.6 Sol schlägt Claude Opus 5 bei ARC-AGI-3 mit zwei zusätzlichen API-Einstellungen
6/10 The Decoder (DE) 30.07.2026 Benchmarks & Evals Frontier-Modelle

OpenAI hat mit GPT-5.6 Sol beim ARC-AGI-3-Benchmark Anthropics Claude Opus 5 überholt – allerdings unter fragwürdigen Bedingungen. Mit Openais eigener API-Infrastruktur erreicht das Modell 38,3 Prozent, in der angeblich anbieterneutralen offiziellen Testumgebung des ARC Prize aber nur 7,8 Prozent. Das wirft Fragen auf, ob der Prize-Testbench möglicherweise veraltete API-Versionen verwendet und damit den Vergleich zu Clauds Ergebnis verzerrt. Dieses Hin-und-Her zeigt, wie fragil solche Benchmark-Siege sind und wie wichtig standardisierte, transparente Testbedingungen für aussagekräftige KI-Modell-Vergleiche wären.

Zum Originalartikel