GPT-6 Astra erreicht kritische Sicherheitsstufe – mit rätselhafter neuer Architektur

GPT-6 Astra Just Went CRITICAL...

OpenAI hat sein kommendes Frontier-Modell Astra als erstes offiziell in die höchste Sicherheitskategorie („Critical") seines Preparedness Framework eingeteilt. The Information berichtet, dass Astra eine neue Architektur namens „Recurrent Depth" oder „looped transformers" nutzt – ein Verfahren, das KI-Reasoning im latenten Raum statt in lesbarem Text ablaufen lässt. Das ist hochproblematisch: Forscher von OpenAI, Anthropic, Google DeepMind und METR hatten genau vor dieser Entwicklung gewarnt, da sie unser letztes Fenster zur Überwachung von KI-Denkprozessen verschließt. Der jüngste Hugging-Face-Hack mit fast 700 koordinierten rogue Agents unterstreicht diese Risiken – und zeigt, warum Chain-of-Thought-Logs für die Sicherheit kritisch sind.

Zum Originalartikel