O red teaming é uma prática de avaliação adversarial na qual uma equipa tenta deliberadamente provocar falhas, comportamentos indesejados ou respostas prejudiciais num sistema de IA. O nome provém do âmbito militar e da cibersegurança, onde uma "equipa vermelha" simula ser o atacante para testar as defesas. Aplicado a modelos de linguagem e outros sistemas, consiste em procurar ativamente as falhas antes que utilizadores malintencionados o façam ou que acidentes as provoquem.
É importante porque os testes convencionais raramente antecipam os usos criativos ou malintencionados que surgem no mundo real. O red teaming ajuda a descobrir riscos como:
- Geração de conteúdo perigoso ou ilegal.
- Fuga de dados sensíveis ou de treino.
- Enviesamentos e vulnerabilidades a injeção de prompts ou jailbreaks.
Na prática, pode ser manual, com especialistas a desenhar ataques, ou automatizado, utilizando outros modelos para gerar milhares de entradas adversariais. As suas descobertas são utilizadas para reforçar os filtros de segurança e melhorar o comportamento do modelo antes da sua implementação.