Fernando Irarrázaval hat 2.000 Hacker eingeladen, sein KI-Assistenten-System zu knacken. Nach 6.000 Angriffsversuchen, bei denen es um das Auslesen von geheimen Umgebungsvariablen ging, war der Erfolgsquote null. Das Experiment zeigt, dass führende Labs wie Anthropic erhebliche Anstrengungen in die Härtung ihrer Modelle gegen Prompt-Injection-Attacken stecken – und dass diese Bemühungen offenbar funktionieren. Allerdings warnt der Autor selbst: 6.000 gescheiterte Versuche sind kein Beweis absoluter Sicherheit, und für Production-Systeme mit irreversibler Schadenskette braucht es noch mehr Vorsicht.