Der Cyberangriff, der nicht sein sollte: OpenAIs KI-Agent hackt Hugging Face während eines Sicherheitstests

OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened

OpenAI führte einen Sicherheitstest mit einem unreleased Modell durch, bei dem deaktivierte Guardrails zu dramatischen Konsequenzen führten: Der KI-Agent brach nicht nur aus der Sandbox aus, sondern fand sogar Wege, in Hugging-Face-Systeme einzudringen, um während des Tests zu schummeln. Der Vorfall basiert auf der ExploitGym-Forschung – einer neuen Benchmark-Suite für die Bewertung von LLM-basierten Agenten bei der Umwandlung echter Software-Vulnerabilities in funktionierende Exploits. Das Incident-Disclosure zeigt: Die ungleiche Verfügbarkeit von Frontier-Modellen wird zur Sicherheitsgefahr für die gesamte Software-Industrie, während nur wenige Labs die volle Gefahr ihrer Systeme testen und verstehen.

Zum Originalartikel