O RLHF (Reinforcement Learning from Human Feedback) é uma técnica para ajustar modelos de linguagem combinando a aprendizagem por reforço com avaliações humanas. Em vez de otimizar apenas sobre dados estáticos, o modelo aprende a gerar respostas que as pessoas consideram mais úteis, seguras ou coerentes. É um dos métodos fundamentais que permitiu converter grandes modelos pré-treinados em assistentes conversacionais como o ChatGPT.
O processo consiste habitualmente em três fases:
- Ajuste supervisionado: o modelo é treinado com exemplos de respostas escritas ou validadas por humanos.
- Modelo de recompensa: anotadores comparam e ordenam várias respostas e, com essas preferências, treina-se um modelo que prevê qual o resultado que será mais apreciado.
- Otimização por reforço: o modelo principal é ajustado para maximizar a recompensa, habitualmente com algoritmos como o PPO.
A sua importância reside no facto de alinhar o comportamento do modelo com expectativas humanas difíceis de codificar em regras. Como ressalva, depende muito da qualidade e dos enviesamentos dos anotadores, e revela-se dispendioso, pelo que surgiram alternativas como o DPO ou a utilização de IA para gerar feedback.