RLHF (Reinforcement Learning from Human Feedback) ist eine Technik zur Feinabstimmung von Sprachmodellen, die bestärkendes Lernen mit menschlichen Bewertungen kombiniert. Anstatt ausschließlich auf statischen Daten zu optimieren, lernt das Modell, Antworten zu generieren, die von Menschen als hilfreicher, sicherer oder kohärenter eingestuft werden. Es ist eine der Schlüsselmethoden, die es ermöglichten, große vortrainierte Modelle in Konversationsassistenten wie ChatGPT zu verwandeln.
Der Prozess besteht in der Regel aus drei Phasen:
- Überwachtes Fine-Tuning: Das Modell wird mit Beispielen von Antworten trainiert, die von Menschen geschrieben oder validiert wurden.
- Belohnungsmodell: Annotierende vergleichen und ordnen mehrere Antworten, und mit diesen Präferenzen wird ein Modell trainiert, das vorhersagt, welche Ausgabe am meisten zusagt.
- Optimierung durch bestärkendes Lernen: Das Hauptmodell wird angepasst, um die Belohnung zu maximieren, üblicherweise mit Algorithmen wie PPO.
Seine Bedeutung liegt darin, dass es das Verhalten des Modells an menschlichen Erwartungen ausrichtet, die schwer in Regeln zu kodieren sind. Zu beachten ist, dass es stark von der Qualität und den Verzerrungen der Annotierenden abhängt und kostspielig ist, weshalb Alternativen wie DPO oder der Einsatz von KI zur Generierung von Feedback entstanden sind.