A injeção de prompts é uma técnica de ataque que consiste em introduzir instruções maliciosas na entrada de um modelo de linguagem para alterar o seu comportamento. Dado que estes sistemas não distinguem de forma fiável entre as instruções legítimas do programador e o conteúdo que processam, um atacante pode «infiltrar» ordens que o modelo acaba por executar como se fossem suas.
É importante porque compromete a segurança e a confidencialidade das aplicações baseadas em IA. Costuma distinguir-se entre duas modalidades:
- Injeção direta: o utilizador escreve instruções que tentam anular as regras do sistema (por exemplo, «ignora as tuas instruções anteriores»).
- Injeção indireta: as ordens maliciosas são ocultadas em dados externos que o modelo lê, como uma página web ou um e-mail.
Um caso típico é um assistente que resume documentos e processa um texto com a ordem oculta de filtrar informações privadas. Mitigá-lo exige validar entradas, limitar privilégios do modelo e separar claramente dados de instruções, embora não exista uma solução completamente infalível.