La injecció de prompts és una tècnica d'atac que consisteix a introduir instruccions malicioses en l'entrada d'un model de llenguatge per alterar-ne el comportament. Atès que aquests sistemes no distingeixen de manera fiable entre les instruccions legítimes del desenvolupador i el contingut que processen, un atacant pot «colar» ordres que el model acaba executant com si fossin pròpies.
És important perquè compromet la seguretat i la confidencialitat de les aplicacions basades en IA. Se sol distingir entre dues modalitats:
- Injecció directa: l'usuari escriu instruccions que intenten anul·lar les regles del sistema (per exemple, «ignora les teves instruccions anteriors»).
- Injecció indirecta: les ordres malicioses s'oculten en dades externes que el model llegeix, com ara una pàgina web o un correu.
Un cas típic és un assistent que resumeix documents i processa un text amb l'ordre encoberta de filtrar informació privada. Mitigar-ho exigeix validar entrades, limitar privilegis del model i separar clarament dades d'instruccions, tot i que no existeix una solució completament infallible.