El jailbreaking engloba el conjunto de técnicas mediante las cuales un usuario intenta sortear las salvagardas e políticas de uso dun modelo de linguaxe para obter respostas que normalmente estarían bloqueadas, como instrucións perigosas, contido prohibido ou información que o sistema foi deseñado para non proporcionar. A diferenza dun simple mal uso, busca explotar deliberadamente as limitacións do aliñamento do modelo.
As estratexias máis habituais inclúen:
- Xogos de rol, nos que se lle pide ao modelo que actúe como un personaxe sen restricións.
- Inxección de instrucións que contradín ou anulan as directrices do sistema.
- Ofuscación, codificando a petición noutro idioma, en clave ou de forma fragmentada.
Comprender estas técnicas é clave en seguridade, porque revela as debilidades do filtrado e motiva defensas máis robustas (adestramento adversarial, filtros de saída, supervisión humana). Convén distinguilo do prompt injection, centrado en manipular aplicacións que integran un modelo. Na práctica, ningún sistema é totalmente inmune, polo que o jailbreaking considérase un risco permanente que exixe vixilancia e actualización continuas.