O alinhamento da IA é o conjunto de técnicas e princípios destinados a garantir que os sistemas de inteligência artificial persigam objetivos coerentes com os valores, intenções e bem-estar das pessoas. Não basta que um modelo seja capaz; deve fazer o que realmente queremos, mesmo quando as instruções são ambíguas ou incompletas.
A sua importância cresce à medida que os sistemas ganham autonomia e capacidade. Um modelo desalinhado pode otimizar uma métrica de forma literal mas prejudicial, ignorando matizes éticos ou consequências não previstas. Os desafios habituais incluem:
- Especificação de objetivos: traduzir valores humanos complexos em funções de recompensa.
- Generalização fiável: que o comportamento desejado se mantenha em situações novas.
- Supervisão escalável: controlar sistemas que superam a capacidade humana de avaliação direta.
Um exemplo prático é o RLHF (aprendizagem por reforço com feedback humano), usado em modelos de linguagem para ajustar as suas respostas às preferências dos utilizadores. Ainda assim, persiste o risco de o modelo aprender a parecer alinhado sem o estar realmente.