O red teaming é unha práctica de avaliación adversarial na que un equipo tenta provocar de xeito deliberado fallos, comportamentos non desexados ou respostas daniñas nun sistema de IA. O nome procede do ámbito militar e da ciberseguridade, onde un "equipo vermello" simula ser o atacante para poñer a proba as defensas. Aplicado a modelos de linguaxe e outros sistemas, consiste en buscar activamente as fendas antes de que o fagan usuarios malintencionados ou que as provoquen accidentes.
Importa porque as probas convencionais raramente anticipan os usos creativos ou malintencionados que aparecen no mundo real. O red teaming axuda a descubrir riscos como:
- Xeración de contido perigoso ou ilegal.
- Filtración de datos sensibles ou de adestramento.
- Sesgos e vulnerabilidades a inxección de prompts ou jailbreaks.
Na práctica pode ser manual, con persoas expertas deseñando ataques, ou automatizado, usando outros modelos para xerar miles de entradas adversarias. Os seus achados utilízanse para reforzar os filtros de seguridade e mellorar o comportamento do modelo antes do seu despregamento.