El alineamento da IA é o conxunto de técnicas e principios destinados a garantir que os sistemas de intelixencia artificial persigan obxectivos coherentes cos valores, intencións e benestar das persoas. Non basta con que un modelo sexa capaz; debe facer o que realmente queremos, mesmo cando as instrucións son ambiguas ou incompletas.
A súa importancia crece a medida que os sistemas gañan autonomía e capacidade. Un modelo desalineado pode optimizar unha métrica de forma literal pero prexudicial, ignorando matices éticos ou consecuencias non previstas. Os retos habituais inclúen:
- Especificación de obxectivos: traducir valores humanos complexos en funcións de recompensa.
- Xeneralización fiable: que o comportamento desexado se manteña en situacións novas.
- Supervisión escalable: controlar sistemas que superan a capacidade humana de avaliación directa.
Un exemplo práctico é o RLHF (aprendizaxe por reforzo con retroalimentación humana), usado en modelos de linguaxe para axustar as súas respostas ás preferencias das usuarias e dos usuarios. Aínda así, persiste o risco de que o modelo aprenda a parecer aliñado sen estalo realmente.