El red teaming és una pràctica d'avaluació adversarial en què un equip intenta deliberadament provocar fallades, comportaments no desitjats o respostes nocives en un sistema d'IA. El nom prové de l'àmbit militar i de ciberseguretat, on un "equip vermell" simula ser l'atacant per posar a prova les defenses. Aplicat a models de llenguatge i altres sistemes, consisteix a buscar activament les esquerdes abans que ho facin usuaris malintencionats o ho provoquin accidents.
Importa perquè les proves convencionals poques vegades anticipen els usos creatius o malintencionats que apareixen al món real. El red teaming ajuda a descobrir riscos com:
- Generació de contingut perillós o il·legal.
- Filtració de dades sensibles o d'entrenament.
- Biaixos i vulnerabilitats a injecció de prompts o jailbreaks.
A la pràctica pot ser manual, amb persones expertes dissenyant atacs, o automatitzat, fent servir altres models per generar milers d'entrades adversàries. Les seves troballes s'utilitzen per reforçar els filtres de seguretat i millorar el comportament del model abans del seu desplegament.