NAiOS IconNAiOS Logo
NAiOS Wiki

Injection de prompt

También: Injection de prompts · Injection d'instructions · Attaque par injection de prompts

Attaques manipulant l'IA par l'insertion d'instructions malveillantes

1 min de lectura

L'injection de prompts est une technique d'attaque qui consiste à introduire des instructions malveillantes dans l'entrée d'un modèle de langage pour altérer son comportement. Étant donné que ces systèmes ne distinguent pas de manière fiable les instructions légitimes du développeur du contenu qu'ils traitent, un attaquant peut « glisser » des ordres que le modèle finit par exécuter comme s'ils étaient les siens.

Cela importe car cela compromet la sécurité et la confidentialité des applications basées sur l'IA. On distingue généralement deux modalités :

  • Injection directe : l'utilisateur écrit des instructions qui tentent d'annuler les règles du système (par exemple, « ignorez vos instructions précédentes »).
  • Injection indirecte : les ordres malveillants sont dissimulés dans des données externes que le modèle lit, comme une page web ou un e-mail.

Un cas typique est celui d'un assistant qui résume des documents et traite un texte contenant l'ordre dissimulé de divulguer des informations privées. L'atténuer exige de valider les entrées, de limiter les privilèges du modèle et de séparer clairement les données des instructions, bien qu'il n'existe aucune solution complètement infaillible.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog