Prompt Injection: Wie LLMs ihre eigenen Anweisungen verwirren

Prompt Injection as Role Confusion
9/10 Simon Willison 22.06.2026 Agenten & Tool-Use Research

Forscher haben ein fundamentales Sicherheitsproblem in großen Sprachmodellen dokumentiert: Sie können „Role Confusion" auslösen, indem sie Benutzer-Input im gleichen Schreibstil formatieren wie interne Systeminstruktionen. Das Erschreckende: Destyling-Attacken mit leicht abgeändertem Wording senken die Erfolgsrate von 61 % auf 10 % – die Modelle reagieren stärker auf Format als auf semantischen Inhalt. Dies zeigt, dass bisherige Prompt-Injection-Abwehrmaßnahmen oberflächlich sind und echter „Role Perception" bedarf, um das Problem langfristig zu lösen. Die Studie mit begleitendem Blog-Post demonstriert sowohl eine kritische Verwundbarkeit als auch ein methodisches Best Practice für Academic Writing.

Zum Originalartikel