Sicherheitslücke: Forscher konnten verborgene Gedankenprozesse von OpenAI, Anthropic und Google extrahieren

Stealing Reasoning Traces from Proprietary LLM APIs
10/10 Simon Willison 11.08.2026 Policy & Ethik Research

Sicherheitsforscher haben eine kritische Schwachstelle in den APIs von OpenAI, Anthropic und Google entdeckt: Die Anbieter geben verschlüsselte Chain-of-Thought-Blöcke an Clients zurück, die über Sessions hinweg wiederverwendbar waren. Die Forscher konnten diese Blöcke in schwächere Modelle derselben Familie einspeisen und sie dann mit Jailbreak-Prompts dazu bringen, die raw Reasoning Traces im Klartext auszugeben. Das Papier zeigt erstmals, wie die verborgenen Gedankenprozesse dieser Modelle tatsächlich aussehen – roh, fragmentarisch und für Menschen nie bestimmt. Alle Anbieter haben den Sicherheitsbericht erhalten und die Lücken geschlossen; ein tiefes Vertrauensproblem bleibt aber bestehen.

Zum Originalartikel