KI-Glossar ·LLM

Abliteration

Auch: Abliterated, Abliteriertes Modell, Refusal Ablation, Uncensored Model

Abliteration bezeichnet ein Verfahren, mit dem einem Open Weights-Modell die Fähigkeit zur Antwortverweigerung nachträglich entfernt wird, ohne es neu zu trainieren.

Herkunft des Begriffs

Das Kunstwort setzt sich aus den englischen Wörtern ablate (entfernen) und obliterate (auslöschen) zusammen und kam 2024 auf. Zugrunde liegt eine Beobachtung aus der Interpretierbarkeitsforschung, also dem Zweig, der die inneren Zustände von Modellen untersucht: Ob ein Modell eine Anfrage zurückweist, lässt sich in diesen Zuständen auf eine einzelne Richtung zurückführen.

Vorgehen

Man lässt das Modell zwei Sammlungen von Eingaben verarbeiten, eine mit harmlosen und eine mit solchen, die es zurückweist, und vergleicht die dabei entstehenden inneren Zustände. Die Differenz ergibt die Richtung, die für die Ablehnung steht. Diese Richtung wird anschließend aus den Gewichtsmatrizen herausgerechnet, sodass das Modell sie nicht mehr ausdrücken kann.

Abgrenzung zum Nachtrainieren

Anders als beim Fine-Tuning verändert Abliteration das Modell nicht durch weiteres Training, sondern durch einen direkten Eingriff in die vorhandenen Parameter. Der Aufwand ist entsprechend gering. Nötig ist allein der Zugriff auf die Gewichte, weshalb sich das Verfahren nur auf Open Weights-Modelle anwenden lässt und auf Modelle, die ausschließlich über eine Programmierschnittstelle zugänglich sind, gar nicht.

Auswirkungen auf die Qualität

Der Eingriff bleibt nicht folgenlos. Da dieselben inneren Strukturen auch an anderen Fähigkeiten beteiligt sind, kann die allgemeine Leistung zurückgehen; wie stark, hängt von Modell und Vorgehen ab. Manche Anbieter solcher Varianten trainieren anschließend nach, um den Verlust auszugleichen.

Einordnung

Abliteration zeigt, dass die Sicherheitsschicht eines offen verfügbaren Modells nicht fest mit ihm verbunden ist. Ein Alignment, das über Trainingsverfahren wie RLHF eingebracht wurde, lässt sich bei zugänglichen Gewichten mit vergleichsweise geringem Aufwand wieder abtragen. Für den Betrieb offener Modelle folgt daraus, dass Schutzmaßnahmen zusätzlich außerhalb des Modells verankert sein müssen, etwa als Guardrails im umgebenden System.

Im Netz verbunden

setzt voraus
abzugrenzen von
Im Wissensnetz ansehen