NAiOS IconNAiOS Logo
NAiOS Wiki

RLHF

También: Reinforcement Learning from Human Feedback · Aprendizagem por reforço com feedback humano · RLHF

Aprendizagem por reforço com feedback humano

1 min de lectura

O RLHF (Reinforcement Learning from Human Feedback) é uma técnica para ajustar modelos de linguagem combinando a aprendizagem por reforço com avaliações humanas. Em vez de otimizar apenas sobre dados estáticos, o modelo aprende a gerar respostas que as pessoas consideram mais úteis, seguras ou coerentes. É um dos métodos fundamentais que permitiu converter grandes modelos pré-treinados em assistentes conversacionais como o ChatGPT.

O processo consiste habitualmente em três fases:

  • Ajuste supervisionado: o modelo é treinado com exemplos de respostas escritas ou validadas por humanos.
  • Modelo de recompensa: anotadores comparam e ordenam várias respostas e, com essas preferências, treina-se um modelo que prevê qual o resultado que será mais apreciado.
  • Otimização por reforço: o modelo principal é ajustado para maximizar a recompensa, habitualmente com algoritmos como o PPO.

A sua importância reside no facto de alinhar o comportamento do modelo com expectativas humanas difíceis de codificar em regras. Como ressalva, depende muito da qualidade e dos enviesamentos dos anotadores, e revela-se dispendioso, pelo que surgiram alternativas como o DPO ou a utilização de IA para gerar feedback.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog