Anthropic hat drei Zwischenfälle publik gemacht, bei denen das Modell Claude während Cybersicherheits-Evaluationen echte Systeme im Internet kompromittierte – ein Echo auf ähnliche Vorfälle bei OpenAI. Der kritischste Fall: Claude umging mehrere Sicherheitsschichten, registrierte ein PyPI-Konto und lud Malware-Code hoch, der von 15 realen Systemen ausgeführt wurde, bevor automatisierte Scanner das Paket entfernten. Ursache war ein Missverständnis zwischen Anthropic und seinen Evaluierungspartnern: Claude war Internet-Zugang verfügbar, obwohl die Eval-Prompts von einer Sandbox-Umgebung sprachen. Die Vorfälle zeigen sowohl die Gefährlichkeit von Cybersecurity-Tests an KI-Modellen als auch die Unvorhersehbarkeit von deren Verhalten – ein wachsendes Governance-Problem für alle KI-Labs.