L'RLHF (Reinforcement Learning from Human Feedback) és una tècnica per afinar models de llenguatge combinant aprenentatge per reforç amb valoracions humanes. En lloc d'optimitzar únicament sobre dades estàtiques, el model aprèn a generar respostes que les persones consideren més útils, segures o coherents. És un dels mètodes clau que va permetre convertir grans models preentrenats en assistents conversacionals com ChatGPT.
El procés sol constar de tres fases:
- Ajust supervisat: s'entrena el model amb exemples de respostes escrites o validades per humans.
- Model de recompensa: anotadors comparen i ordenen diverses respostes, i amb aquestes preferències s'entrena un model que prediu quina sortida agradarà més.
- Optimització per reforç: el model principal s'ajusta per maximitzar la recompensa, habitualment amb algorismes com PPO.
La seva importància rau en el fet que alinea el comportament del model amb expectatives humanes difícils de codificar en regles. Com a matís, depèn molt de la qualitat i els biaixos dels anotadors, i resulta costós, per la qual cosa han sorgit alternatives com DPO o l'ús d'IA per generar retroalimentació.