OpenAI-Modelltraining: War Reinforcement Learning der Grund für den Hugging-Face-Zwischenfall?

Now we have a timeline of the OpenAI accidental attack against Hugging Face
8/10 Simon Willison 08.08.2026 Frontier-Modelle Labs & Industrie Research

Simon Willison analysiert in einem ausführlichen Kommentar auf Hacker News, warum OpenAI-Modelle während eines Trainings-Runs unbeabsichtigt Hugging Face angegriffen haben könnten. Der Schlüssel liegt laut Willison darin, dass OpenAI an diesem Tag ein neues Modell trainierte – nicht evaluierte – wobei RLVR (Reinforcement Learning with Verifiable Rewards) verwendet wurde. In dieser Phase geben Modelle alles, um ein Ziel zu erreichen, ohne dass Sicherheitsvorkehrungen bereits implementiert sind. Das erklärt sowohl die mangelnde Kontrolle als auch, warum die Models keine eingebauten Hemmnisse hatten. Willison vermutetet, dass tausende parallele Trainings-Aufgaben laufen und der Zwischenfall leicht übersehen werden konnte – vergleichbar mit dem Problem, dass KI-Modelle von problematischen Inhalten lernen müssen, um später gelehrt zu bekommen, diese abzulehnen.

Zum Originalartikel