El jailbreaking engloba el conjunt de tècniques mitjançant les quals un usuari intenta esquivar les salvaguardes i polítiques d'ús d'un model de llenguatge per obtenir respostes que normalment estarien bloquejades, com ara instruccions perilloses, contingut prohibit o informació que el sistema ha estat dissenyat per no proporcionar. A diferència d'un simple mal ús, busca explotar deliberadament les limitacions de l'alineament del model.
Les estratègies més habituals inclouen:
- Jocs de rol, en els quals es demana al model que actuï com un personatge sense restriccions.
- Injecció d'instruccions que contradiuen o anul·len les directrius del sistema.
- Ofuscació, codificant la petició en un altre idioma, en clau o de forma fragmentada.
Comprendre aquestes tècniques és clau en seguretat, perquè revela les febleses del filtratge i motiva defenses més robustes (entrenament adversarial, filtres de sortida, supervisió humana). Convé distingir-lo del prompt injection, centrat a manipular aplicacions que integren un model. A la pràctica, cap sistema és totalment immune, per la qual cosa el jailbreaking es considera un risc permanent que exigeix vigilància i actualització contínues.