OpenAI hat mit GPT-5.6 Sol beim ARC-AGI-3-Benchmark Anthropics Claude Opus 5 überholt – allerdings unter fragwürdigen Bedingungen. Mit Openais eigener API-Infrastruktur erreicht das Modell 38,3 Prozent, in der angeblich anbieterneutralen offiziellen Testumgebung des ARC Prize aber nur 7,8 Prozent. Das wirft Fragen auf, ob der Prize-Testbench möglicherweise veraltete API-Versionen verwendet und damit den Vergleich zu Clauds Ergebnis verzerrt. Dieses Hin-und-Her zeigt, wie fragil solche Benchmark-Siege sind und wie wichtig standardisierte, transparente Testbedingungen für aussagekräftige KI-Modell-Vergleiche wären.