Anthropic hat in seinem Sicherheitsbericht offengelegt, dass ein internes Schutzsystem gegen Missbrauchsrisiken im Bereich Biosicherheit und chemische Waffen fast ein ganzes Jahr lang ausfiel. In dieser Zeit führten etwa 50.000 externe Feedback-Mitarbeiter rund 133 Millionen Interaktionen mit Claude durch – ohne aktive Klassifikatoren, die potenziell gefährliche Anfragen hätten blockieren sollen. Der Vorfall wirft wichtige Fragen zu Sicherheitspraktiken bei führenden KI-Laboren auf und zeigt ein Spannungsfeld zwischen Skalierbarkeit von Feedback-Systemen und Risikokontrolle. Das ist hochrelevant für die laufende Debatte über KI-Sicherheit und Verantwortung der Hersteller.