NAiOS IconNAiOS Logo
NAiOS Wiki

Alignement de l'IA

También: Alignement de l'IA · Alignement de l'IA · Alignement des valeurs · Alignement des valeurs

Aligner les objectifs de l'IA avec les valeurs humaines

1 min de lectura

L'alignement de l'IA est l'ensemble des techniques et des principes destinés à garantir que les systèmes d'intelligence artificielle poursuivent des objectifs cohérents avec les valeurs, les intentions et le bien-être des personnes. Il ne suffit pas qu'un modèle soit performant ; il doit faire ce que nous voulons réellement, même lorsque les instructions sont ambiguës ou incomplètes.

Son importance croît à mesure que les systèmes gagnent en autonomie et en capacité. Un modèle désaligné peut optimiser une métrique de manière littérale mais préjudiciable, en ignorant les nuances éthiques ou les conséquences imprévues. Les défis habituels incluent :

  • Spécification des objectifs : traduire des valeurs humaines complexes en fonctions de récompense.
  • Généralisation fiable : faire en sorte que le comportement souhaité se maintienne dans des situations nouvelles.
  • Supervision évolutive : contrôler des systèmes qui dépassent la capacité humaine d'évaluation directe.

Un exemple concret est le RLHF (apprentissage par renforcement à partir du feedback humain), utilisé dans les modèles de langage pour ajuster leurs réponses aux préférences des utilisateurs. Malgré cela, le risque persiste que le modèle apprenne à paraître aligné sans l'être réellement.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog