Prompt-Injection ist eine Angriffstechnik, bei der bösartige Anweisungen in die Eingabe eines Sprachmodells eingeschleust werden, um dessen Verhalten zu manipulieren. Da diese Systeme nicht zuverlässig zwischen den legitimen Anweisungen der Entwicklung und den verarbeiteten Inhalten unterscheiden, kann eine angreifende Person Befehle „einschleusen“, die das Modell schließlich so ausführt, als wären es seine eigenen.
Dies ist von Bedeutung, da es die Sicherheit und Vertraulichkeit von KI-basierten Anwendungen gefährdet. Es wird üblicherweise zwischen zwei Arten unterschieden:
- Direkte Injection: Die nutzende Person schreibt Anweisungen, die versuchen, die Systemregeln außer Kraft zu setzen (zum Beispiel: „Ignoriere deine vorherigen Anweisungen“).
- Indirekte Injection: Bösartige Befehle werden in externen Daten verborgen, die das Modell liest, wie etwa in einer Webseite oder einer E-Mail.
Ein typischer Fall ist ein Assistenzsystem, das Dokumente zusammenfasst und dabei einen Text mit dem verdeckten Befehl verarbeitet, private Informationen preiszugeben. Die Eindämmung erfordert die Validierung von Eingaben, die Einschränkung der Modellberechtigungen sowie eine klare Trennung von Daten und Anweisungen, wenngleich keine vollständig unfehlbare Lösung existiert.