Jailbreaking umfasst die Gesamtheit der Techniken, mit denen Nutzende versuchen, die Sicherheitsvorkehrungen und Nutzungsrichtlinien eines Sprachmodells zu umgehen, um Antworten zu erhalten, die normalerweise blockiert wären, wie gefährliche Anweisungen, verbotene Inhalte oder Informationen, für deren Nichtbereitstellung das System konzipiert wurde. Im Gegensatz zu einfachem Missbrauch zielt es darauf ab, die Grenzen des Alignment des Modells bewusst auszunutzen.
Zu den gängigsten Strategien gehören:
- Rollenspiele, bei denen das Modell aufgefordert wird, als ein Charakter ohne Einschränkungen zu agieren.
- Instruction Injection, bei der Anweisungen gegeben werden, die den Systemrichtlinien widersprechen oder diese aufheben.
- Verschleierung, indem die Anfrage in einer anderen Sprache, verschlüsselt oder fragmentiert kodiert wird.
Das Verständnis dieser Techniken ist entscheidend für die Sicherheit, da es Schwachstellen in der Filterung aufdeckt und robustere Abwehrmechanismen motiviert (Adversarial Training, Ausgabefilter, menschliche Aufsicht). Es sollte von Prompt Injection unterschieden werden, das sich auf die Manipulation von Anwendungen konzentriert, die ein Modell integrieren. In der Praxis ist kein System vollständig immun, weshalb Jailbreaking als permanentes Risiko gilt, das eine kontinuierliche Überwachung und Aktualisierung erfordert.