NAiOS Wiki

RLHF

También: Reinforcement Learning from Human Feedback · Aprendizaxe por reforzo con retroalimentación humana · RLHF

Aprendizaxe por reforzo con retroalimentación humana

1 min de lectura

O RLHF (Reinforcement Learning from Human Feedback) é unha técnica para axustar modelos de linguaxe combinando a aprendizaxe por reforzo coas valoracións humanas. En lugar de optimizar unicamente sobre datos estáticos, o modelo aprende a xerar respostas que as persoas consideran máis útiles, seguras ou coherentes. É un dos métodos clave que permitiu converter grandes modelos preadestrados en asistentes conversacionais como ChatGPT.

O proceso adoita constar de tres fases:

  • Axuste supervisado: adestrase o modelo con exemplos de respostas escritas ou validadas por humanos.
  • Modelo de recompensa: os anotadores comparan e ordenan varias respostas, e con esas preferencias adestrase un modelo que prevé que saída gustará máis.
  • Optimización por reforzo: o modelo principal axústase para maximizar a recompensa, habitualmente con algoritmos como PPO.

A súa importancia reside en que alinea o comportamento do modelo con expectativas humanas difíciles de codificar en regras. Como matiz, depende moito da calidade e dos sesgos dos anotadores, e resulta custoso, polo que xurdiron alternativas como DPO ou o uso de IA para xerar retroalimentación.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog