NAiOS IconNAiOS Logo
NAiOS Wiki

Red Teaming

También: Equipa Vermelha · Red Team · Testes adversariais · Adversarial Testing

Testar uma IA tentando quebrá-la para encontrar vulnerabilidades

1 min de lectura

O red teaming é uma prática de avaliação adversarial na qual uma equipa tenta deliberadamente provocar falhas, comportamentos indesejados ou respostas prejudiciais num sistema de IA. O nome provém do âmbito militar e da cibersegurança, onde uma "equipa vermelha" simula ser o atacante para testar as defesas. Aplicado a modelos de linguagem e outros sistemas, consiste em procurar ativamente as falhas antes que utilizadores malintencionados o façam ou que acidentes as provoquem.

É importante porque os testes convencionais raramente antecipam os usos criativos ou malintencionados que surgem no mundo real. O red teaming ajuda a descobrir riscos como:

  • Geração de conteúdo perigoso ou ilegal.
  • Fuga de dados sensíveis ou de treino.
  • Enviesamentos e vulnerabilidades a injeção de prompts ou jailbreaks.

Na prática, pode ser manual, com especialistas a desenhar ataques, ou automatizado, utilizando outros modelos para gerar milhares de entradas adversariais. As suas descobertas são utilizadas para reforçar os filtros de segurança e melhorar o comportamento do modelo antes da sua implementação.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog