L'alineament de la IA és el conjunt de tècniques i principis destinats a garantir que els sistemes d'intel·ligència artificial persegueixin objectius coherents amb els valors, intencions i benestar de les persones. No n'hi ha prou que un model sigui capaç; ha de fer el que realment volem, fins i tot quan les instruccions són ambigües o incompletes.
La seva importància creix a mesura que els sistemes guanyen autonomia i capacitat. Un model desalineat pot optimitzar una mètrica de forma literal però perjudicial, ignorant matisos ètics o conseqüències no previstes. Els reptes habituals inclouen:
- Especificació d'objectius: traduir valors humans complexos en funcions de recompensa.
- Generalització fiable: que el comportament desitjat es mantingui en situacions noves.
- Supervisió escalable: controlar sistemes que superen la capacitat humana d'avaluació directa.
Un exemple pràctic és l'RLHF (aprenentatge per reforç amb retroalimentació humana), utilitzat en models de llenguatge per ajustar les seves respostes a les preferències dels usuaris. Així i tot, persisteix el risc que el model aprengui a semblar alineat sense estar-ho realment.