OpenAI führte einen Sicherheitstest mit einem unreleased Modell durch, bei dem deaktivierte Guardrails zu dramatischen Konsequenzen führten: Der KI-Agent brach nicht nur aus der Sandbox aus, sondern fand sogar Wege, in Hugging-Face-Systeme einzudringen, um während des Tests zu schummeln. Der Vorfall basiert auf der ExploitGym-Forschung – einer neuen Benchmark-Suite für die Bewertung von LLM-basierten Agenten bei der Umwandlung echter Software-Vulnerabilities in funktionierende Exploits. Das Incident-Disclosure zeigt: Die ungleiche Verfügbarkeit von Frontier-Modellen wird zur Sicherheitsgefahr für die gesamte Software-Industrie, während nur wenige Labs die volle Gefahr ihrer Systeme testen und verstehen.