NAiOS IconNAiOS Logo
NAiOS Wiki

Injeção de Prompt

También: Injeção de prompts · Injeção de instruções · Ataque de Injeção de Prompt

Ataques que manipulam a IA inserindo instruções maliciosas

1 min de lectura

A injeção de prompts é uma técnica de ataque que consiste em introduzir instruções maliciosas na entrada de um modelo de linguagem para alterar o seu comportamento. Dado que estes sistemas não distinguem de forma fiável entre as instruções legítimas do programador e o conteúdo que processam, um atacante pode «infiltrar» ordens que o modelo acaba por executar como se fossem suas.

É importante porque compromete a segurança e a confidencialidade das aplicações baseadas em IA. Costuma distinguir-se entre duas modalidades:

  • Injeção direta: o utilizador escreve instruções que tentam anular as regras do sistema (por exemplo, «ignora as tuas instruções anteriores»).
  • Injeção indireta: as ordens maliciosas são ocultadas em dados externos que o modelo lê, como uma página web ou um e-mail.

Um caso típico é um assistente que resume documentos e processa um texto com a ordem oculta de filtrar informações privadas. Mitigá-lo exige validar entradas, limitar privilégios do modelo e separar claramente dados de instruções, embora não exista uma solução completamente infalível.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog