A inxección de prompts é unha técnica de ataque que consiste en introducir instrucións maliciosas na entrada dun modelo de linguaxe para alterar o seu comportamento. Dado que estes sistemas non distinguen de forma fiable entre as instrucións lexítimas do desenvolvedor e o contido que procesan, un atacante pode «colar» ordes que o modelo acaba executando como se fosen propias.
Importa porque compromete a seguridade e a confidencialidade das aplicacións baseadas en IA. Adoita distinguirse entre dúas modalidades:
- Inxección directa: o usuario escribe instrucións que tentan anular as regras do sistema (por exemplo, «ignora as túas instrucións anteriores»).
- Inxección indirecta: as ordes maliciosas ocúltanse en datos externos que o modelo le, como unha páxina web ou un correo.
Un caso típico é un asistente que resume documentos e procesa un texto coa orde encuberta de filtrar información privada. Mitigalo exige validar entradas, limitar os privilexios do modelo e separar claramente datos de instrucións, aínda que non existe unha solución completamente infalible.