Le red teaming est une pratique d'évaluation adverse dans laquelle une équipe tente délibérément de provoquer des défaillances, des comportements indésirables ou des réponses préjudiciables dans un système d'IA. Le nom provient du domaine militaire et de la cybersécurité, où une « équipe rouge » simule l'attaquant pour mettre les défenses à l'épreuve. Appliqué aux modèles de langage et à d'autres systèmes, il consiste à rechercher activement les failles avant que des utilisateurs malveillants ne le fassent ou que des accidents ne les provoquent.
Cela est important car les tests conventionnels anticipent rarement les usages créatifs ou malveillants qui apparaissent dans le monde réel. Le red teaming aide à découvrir des risques tels que :
- Génération de contenus dangereux ou illégaux.
- Fuite de données sensibles ou d'entraînement.
- Biais et vulnérabilités aux injections de prompts ou jailbreaks.
En pratique, il peut être manuel, avec des experts concevant des attaques, ou automatisé, en utilisant d'autres modèles pour générer des milliers d'entrées adverses. Ses conclusions sont utilisées pour renforcer les filtres de sécurité et améliorer le comportement du modèle avant son déploiement.