NAiOS IconNAiOS Logo
NAiOS Wiki

Red Teaming

También: Equip Vermell · Red Team · Proves adversàries · Adversarial Testing

Provar una IA intentant trencar-la per trobar vulnerabilitats

1 min de lectura

El red teaming és una pràctica d'avaluació adversarial en què un equip intenta deliberadament provocar fallades, comportaments no desitjats o respostes nocives en un sistema d'IA. El nom prové de l'àmbit militar i de ciberseguretat, on un "equip vermell" simula ser l'atacant per posar a prova les defenses. Aplicat a models de llenguatge i altres sistemes, consisteix a buscar activament les esquerdes abans que ho facin usuaris malintencionats o ho provoquin accidents.

Importa perquè les proves convencionals poques vegades anticipen els usos creatius o malintencionats que apareixen al món real. El red teaming ajuda a descobrir riscos com:

  • Generació de contingut perillós o il·legal.
  • Filtració de dades sensibles o d'entrenament.
  • Biaixos i vulnerabilitats a injecció de prompts o jailbreaks.

A la pràctica pot ser manual, amb persones expertes dissenyant atacs, o automatitzat, fent servir altres models per generar milers d'entrades adversàries. Les seves troballes s'utilitzen per reforçar els filtres de seguretat i millorar el comportament del model abans del seu desplegament.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog