Forscher knacken LLM-Sicherheit: Nutzer-Prompts aus Chatbot-Antworten rekonstruierbar

LLM-Hacking: Forscher können aus Chatbot-Antworten den Nutzer-Prompt rekonstrukieren
7/10 The Decoder (DE) 12.08.2026 Policy & Ethik Research

Forscher von IIT Bombay und Adobe Research haben ein Verfahren namens "Previous-Token Prediction" entwickelt, das es ermöglicht, aus den Antworten eines Sprachmodells den ursprünglichen Nutzer-Prompt rekonstruieren. Das Bemerkenswerte: Die Methode funktioniert ohne direkten Zugriff auf die Modellgewichte und lässt sich auch modellübergreifend einsetzen. Für Unternehmen mit proprietären System-Prompts stellt dies ein erhebliches Sicherheitsrisiko dar, da damit geschützte Geschäftslogiken und Anweisungen offengelegt werden könnten. Das Forschungsergebnis zeigt eine neue Angriffsfläche, die bei der Entwicklung sicherer KI-Systeme berücksichtigt werden muss.

Zum Originalartikel