Der Blogger und KI-Experte Simon Willison hat ein identisches Spiel-Prompt sowohl Claude Fable 5 als auch dem agentengesteuerten GPT-5.6 Sol Ultra gegeben und die Ergebnisse verglichen. Sol Ultras Agent-basierter Ansatz produzierte tatsächlich ein deutlich besseres Spiel – statt eines einfachen Sammel-Spiels im Garten ein vollwertiges Heist-Game im Museum mit Teamdynamik. Allerdings übersah die KI einen visuellen Bug (riesige Augenkugeln auf den Raccoons), den Willison manuell korrigieren musste. Der Fall zeigt sowohl Fortschritte in der agentengesteuerten Code-Generierung als auch ihre bleibenden Grenzen bei Qualitätskontrolle – ein praxisnahes Beispiel für aktuelle Möglichkeiten und Grenzen von Frontier-Modellen bei komplexen Aufgaben.