O jailbreaking engloba o conjunto de técnicas através das quais um utilizador tenta contornar as salvaguardas e políticas de utilização de um modelo de linguagem para obter respostas que normalmente estariam bloqueadas, como instruções perigosas, conteúdo proibido ou informação que o sistema foi concebido para não fornecer. Ao contrário de uma simples má utilização, procura explorar deliberadamente as limitações do alinhamento do modelo.
Las estratégias mais habituais incluem:
- Jogos de papéis, nos quais se pede ao modelo que atue como uma personagem sem restrições.
- Injeção de instruções que contradizem ou anulam as diretrizes do sistema.
- Ofuscação, codificando o pedido noutro idioma, em código ou de forma fragmentada.
Compreender estas técnicas é fundamental na segurança, porque revela as debilidades da filtragem e motiva defesas mais robustas (treino adversarial, filtros de saída, supervisão humana). Convém distingui-lo do prompt injection, focado em manipular aplicações que integram um modelo. Na prática, nenhum sistema é totalmente imune, pelo que o jailbreaking é considerado um risco permanente que exige vigilância e atualização contínuas.