NAiOS Wiki

Red Teaming

También: Equipo Vermello · Red Team · Probas adversariais · Adversarial Testing

Probar unha IA intentando rompela para atopar vulnerabilidades

1 min de lectura

O red teaming é unha práctica de avaliación adversarial na que un equipo tenta provocar de xeito deliberado fallos, comportamentos non desexados ou respostas daniñas nun sistema de IA. O nome procede do ámbito militar e da ciberseguridade, onde un "equipo vermello" simula ser o atacante para poñer a proba as defensas. Aplicado a modelos de linguaxe e outros sistemas, consiste en buscar activamente as fendas antes de que o fagan usuarios malintencionados ou que as provoquen accidentes.

Importa porque as probas convencionais raramente anticipan os usos creativos ou malintencionados que aparecen no mundo real. O red teaming axuda a descubrir riscos como:

  • Xeración de contido perigoso ou ilegal.
  • Filtración de datos sensibles ou de adestramento.
  • Sesgos e vulnerabilidades a inxección de prompts ou jailbreaks.

Na práctica pode ser manual, con persoas expertas deseñando ataques, ou automatizado, usando outros modelos para xerar miles de entradas adversarias. Os seus achados utilízanse para reforzar os filtros de seguridade e mellorar o comportamento do modelo antes do seu despregamento.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog