A AI Safety (seguridade en intelixencia artificial) é a disciplina que estuda e desenvolve métodos para garantir que os sistemas de IA se comporten de forma fiable, predicible e aliñada cos obxectivos humanos, evitando danos tanto intencionados como accidentais. Abrangue desde problemas técnicos concretos ata riscos a longo prazo asociados a sistemas cada vez máis capaces.
A súa importancia crece a medida que a IA se integra en ámbitos críticos como a sanidade, os vehículos autónomos ou as infraestruturas. Un modelo que falla de forma inesperada, que é vulnerable a manipulacións ou que persegue obxectivos mal especificados pode causar prexuízos graves. Algunhas liñas de traballo habituais son:
- Aliñación: lograr que o sistema persiga o que realmente queremos, non unha interpretación literal do obxectivo.
- Robustez: manter un comportamento estable ante entradas inesperadas ou ataques.
- Interpretabilidade: entender por que un modelo toma unha decisión.
Un exemplo práctico é o reward hacking, cando un axente explota fallos na súa función de recompensa para obter unha puntuación alta sen cumprir o propósito previsto.