NAiOS Wiki

Aliñamento da IA

También: Aliñamento de IA · Aliñación de IA · Value Alignment · Aliñamento de valores

Aliñar os obxectivos da IA cos valores humanos

1 min de lectura

El alineamento da IA é o conxunto de técnicas e principios destinados a garantir que os sistemas de intelixencia artificial persigan obxectivos coherentes cos valores, intencións e benestar das persoas. Non basta con que un modelo sexa capaz; debe facer o que realmente queremos, mesmo cando as instrucións son ambiguas ou incompletas.

A súa importancia crece a medida que os sistemas gañan autonomía e capacidade. Un modelo desalineado pode optimizar unha métrica de forma literal pero prexudicial, ignorando matices éticos ou consecuencias non previstas. Os retos habituais inclúen:

  • Especificación de obxectivos: traducir valores humanos complexos en funcións de recompensa.
  • Xeneralización fiable: que o comportamento desexado se manteña en situacións novas.
  • Supervisión escalable: controlar sistemas que superan a capacidade humana de avaliación directa.

Un exemplo práctico é o RLHF (aprendizaxe por reforzo con retroalimentación humana), usado en modelos de linguaxe para axustar as súas respostas ás preferencias das usuarias e dos usuarios. Aínda así, persiste o risco de que o modelo aprenda a parecer aliñado sen estalo realmente.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog