Le RLHF (Reinforcement Learning from Human Feedback) est une technique permettant d'affiner les modèles de langage en combinant l'apprentissage par renforcement avec des évaluations humaines. Au lieu d'optimiser uniquement sur des données statiques, le modèle apprend à générer des réponses que les personnes considèrent comme plus utiles, sûres ou cohérentes. C'est l'une des méthodes clés ayant permis de transformer de grands modèles pré-entraînés en assistants conversationnels tels que ChatGPT.
Le processus se compose généralement de trois phases :
- Réglage supervisé : le modèle est entraîné avec des exemples de réponses écrites ou validées par des humains.
- Modèle de récompense : des annotateurs comparent et classent plusieurs réponses, et ces préférences servent à entraîner un modèle qui prédit quelle sortie sera la plus appréciée.
- Optimisation par renforcement : le modèle principal est ajusté pour maximiser la récompense, généralement à l'aide d'algorithmes tels que PPO.
Son importance réside dans le fait qu'il aligne le comportement du modèle sur des attentes humaines difficiles à coder sous forme de règles. Nuance importante : il dépend fortement de la qualité et des biais des annotateurs, et s'avère coûteux, c'est pourquoi des alternatives telles que le DPO ou l'utilisation de l'IA pour générer des retours ont vu le jour.