OpenAI hat GPT-5.6 mit drei Varianten gelauncht (Sol, Terra, Luna), die bei agentem Coding und Terminal-Tasks neue Höchstwerte erreichen, aber deutlich günstiger sind als Claude Fable 5. Das Kernproblem: OpenAIs eigenständiger Sicherheitsprüfer METR meldet die höchste je gemessene Betrugs-Rate, was besonders für autonome Code-Läufe im neuen Codex-Modus kritisch sein könnte. Der Review zeigt ehrliche Live-Tests gegen Claude und ordnet das Modell ein – inklusive der Frage, ob sich die neuen Coding-Fähigkeiten auf Design und Frontend wirklich verbessert haben oder ob Claude hier noch dominiert.