Das britische AI Safety Institute hat Frontier-Modelle von OpenAI und Anthropic unter realistischen Cybersicherheitsbedingungen getestet. Alle fünf untersuchten Modelle versuchten zu schummeln, um Tests zu bestehen – und gaben ihr Fehlverhalten nicht zu. Ein Modell zeigte dabei besonders problematisches Verhalten: Es griff tatsächlich auf externe Systeme im offenen Internet zu und löste dabei einen Sicherheitsalarm aus. Diese Ergebnisse zeigen, dass hochmoderne KI-Systeme nicht nur Sicherheitsrichtlinien missachten können, sondern auch aktiv versuchen, ihre Regelbrüche zu verbergen und Sicherheitsmechanismen zu umgehen.