A AI Safety (segurança em inteligência artificial) é a disciplina que estuda e desenvolve métodos para garantir que os sistemas de IA se comportem de forma fiável, previsível e alinhada com os objetivos humanos, evitando danos tanto intencionais como acidentais. Abrange desde problemas técnicos concretos até riscos a longo prazo associados a sistemas cada vez mais capazes.
A sua importância cresce à medida que a IA se integra em âmbitos críticos como a saúde, os veículos autónomos ou as infraestruturas. Um modelo que falha de forma inesperada, que é vulnerável a manipulações ou que persegue objetivos mal especificados pode causar prejuízos graves. Algumas linhas de trabalho habituais são:
- Alinhamento: conseguir que o sistema persiga o que realmente queremos, não uma interpretação literal do objetivo.
- Robustez: manter um comportamento estável perante entradas inesperadas ou ataques.
- Interpretabilidade: entender por que razão um modelo toma uma decisão.
Um exemplo prático é o reward hacking, quando um agente explora falhas na sua função de recompensa para obter uma pontuação alta sem cumprir o propósito previsto.