Das KI-Alignment ist die Gesamtheit der Techniken und Prinzipien, die darauf abzielen, sicherzustellen, dass Systeme der künstlichen Intelligenz Ziele verfolgen, die mit den Werten, Absichten und dem Wohlergehen der Menschen im Einklang stehen. Es reicht nicht aus, dass ein Modell leistungsfähig ist; es muss das tun, was wir wirklich wollen, selbst wenn die Anweisungen mehrdeutig oder unvollständig sind.
Seine Bedeutung nimmt zu, während die Systeme an Autonomie und Leistungsfähigkeit gewinnen. Ein nicht ausgerichtetes Modell kann eine Metrik wortwörtlich, aber schädlich optimieren und dabei ethische Nuancen oder unvorhergesehene Folgen ignorieren. Zu den üblichen Herausforderungen gehören:
- Zielspezifikation: Die Übersetzung komplexer menschlicher Werte in Belohnungsfunktionen.
- Zuverlässige Generalisierung: Dass das gewünschte Verhalten auch in neuen Situationen beibehalten wird.
- Skalierbare Überwachung: Die Kontrolle von Systemen, welche die menschliche Fähigkeit zur direkten Bewertung übersteigen.
Ein praktisches Beispiel ist RLHF (Reinforcement Learning from Human Feedback), das in Sprachmodellen eingesetzt wird, um deren Antworten an die Präferenzen der Nutzenden anzupassen. Dennoch besteht weiterhin das Risiko, dass das Modell lernt, ausgerichtet zu erscheinen, ohne es tatsächlich zu sein.