NAiOS Wiki

Inxección de prompts

También: Inxección de prompts · Inxección de instrucións · Ataque de inxección de prompts

Ataques que manipulan a IA inserindo instrucións maliciosas

1 min de lectura

A inxección de prompts é unha técnica de ataque que consiste en introducir instrucións maliciosas na entrada dun modelo de linguaxe para alterar o seu comportamento. Dado que estes sistemas non distinguen de forma fiable entre as instrucións lexítimas do desenvolvedor e o contido que procesan, un atacante pode «colar» ordes que o modelo acaba executando como se fosen propias.

Importa porque compromete a seguridade e a confidencialidade das aplicacións baseadas en IA. Adoita distinguirse entre dúas modalidades:

  • Inxección directa: o usuario escribe instrucións que tentan anular as regras do sistema (por exemplo, «ignora as túas instrucións anteriores»).
  • Inxección indirecta: as ordes maliciosas ocúltanse en datos externos que o modelo le, como unha páxina web ou un correo.

Un caso típico é un asistente que resume documentos e procesa un texto coa orde encuberta de filtrar información privada. Mitigalo exige validar entradas, limitar os privilexios do modelo e separar claramente datos de instrucións, aínda que non existe unha solución completamente infalible.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog