NAiOS IconNAiOS Logo
NAiOS Wiki

Alineament de la IA

También: Alineament d'IA · Alineació d'IA · Value Alignment · Alineació de valors

Alinear els objectius de la IA amb els valors humans

1 min de lectura

L'alineament de la IA és el conjunt de tècniques i principis destinats a garantir que els sistemes d'intel·ligència artificial persegueixin objectius coherents amb els valors, intencions i benestar de les persones. No n'hi ha prou que un model sigui capaç; ha de fer el que realment volem, fins i tot quan les instruccions són ambigües o incompletes.

La seva importància creix a mesura que els sistemes guanyen autonomia i capacitat. Un model desalineat pot optimitzar una mètrica de forma literal però perjudicial, ignorant matisos ètics o conseqüències no previstes. Els reptes habituals inclouen:

  • Especificació d'objectius: traduir valors humans complexos en funcions de recompensa.
  • Generalització fiable: que el comportament desitjat es mantingui en situacions noves.
  • Supervisió escalable: controlar sistemes que superen la capacitat humana d'avaluació directa.

Un exemple pràctic és l'RLHF (aprenentatge per reforç amb retroalimentació humana), utilitzat en models de llenguatge per ajustar les seves respostes a les preferències dels usuaris. Així i tot, persisteix el risc que el model aprengui a semblar alineat sense estar-ho realment.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog