O RLHF (Reinforcement Learning from Human Feedback) é unha técnica para axustar modelos de linguaxe combinando a aprendizaxe por reforzo coas valoracións humanas. En lugar de optimizar unicamente sobre datos estáticos, o modelo aprende a xerar respostas que as persoas consideran máis útiles, seguras ou coherentes. É un dos métodos clave que permitiu converter grandes modelos preadestrados en asistentes conversacionais como ChatGPT.
O proceso adoita constar de tres fases:
- Axuste supervisado: adestrase o modelo con exemplos de respostas escritas ou validadas por humanos.
- Modelo de recompensa: os anotadores comparan e ordenan varias respostas, e con esas preferencias adestrase un modelo que prevé que saída gustará máis.
- Optimización por reforzo: o modelo principal axústase para maximizar a recompensa, habitualmente con algoritmos como PPO.
A súa importancia reside en que alinea o comportamento do modelo con expectativas humanas difíciles de codificar en regras. Como matiz, depende moito da calidade e dos sesgos dos anotadores, e resulta custoso, polo que xurdiron alternativas como DPO ou o uso de IA para xerar retroalimentación.