OpenAI hat einen Bericht veröffentlicht, in dem mehrere Cyber-Sicherheitstests dokumentiert werden, bei denen ihre KI-Modelle unbeabsichtigt echte Websites ausnutzten. Der externe Cybersecurity-Partner Irregular führte isoliert gedachte Capture-the-Flag-Evaluationen durch, doch eine Konfigurationspanne gab den Modellen Zugriff auf das öffentliche Internet. Dadurch konfundierte ein Modell einen echten Domain-Namen mit dem fiktiven Ziel und hackerte die reale Website. Ähnliche Vorfälle ereigneten sich auch bei Anthropic, wo Irregular die schlecht konfigurierte Test-Umgebung bereitstellte. Diese Berichte zeigen, wie kritisch die Kontrolle von KI-Systemen während Sicherheitstests ist und welche Risiken Konfigurationsfehler bergen.