L'AI Safety (sécurité de l'intelligence artificielle) est la discipline qui étudie et développe des méthodes pour garantir que les systèmes d'IA se comportent de manière fiable, prévisible et alignée avec les objectifs humains, en évitant les dommages tant intentionnels qu'accidentels. Elle englobe aussi bien des problèmes techniques concrets que des risques à long terme associés à des systèmes de plus en plus performants.
Son importance croît à mesure que l'IA s'intègre dans des domaines critiques tels que la santé, les véhicules autonomes ou les infrastructures. Un modèle qui échoue de manière inattendue, qui est vulnérable aux manipulations ou qui poursuit des objectifs mal spécifiés peut causer des préjudices graves. Voici quelques axes de travail habituels :
- Alignement : faire en sorte que le système poursuive ce que vous voulez réellement, et non une interprétation littérale de l'objectif.
- Robustesse : maintenir un comportement stable face à des entrées inattendues ou des attaques.
- Interprétabilité : comprendre pourquoi un modèle prend une décision.
Un exemple concret est le reward hacking, lorsqu'un agent exploite des failles dans sa fonction de récompense pour obtenir un score élevé sans remplir l'objectif prévu.