NAiOS IconNAiOS Logo
NAiOS Wiki

Red Teaming

También: Red Team · Red Team · Adversariales Testen · Adversarial Testing

Testen einer KI durch den Versuch, sie zu manipulieren, um Schwachstellen zu finden

1 min de lectura

Red Teaming ist eine Praxis der adversarialen Bewertung, bei der ein Team gezielt versucht, Fehler, unerwünschte Verhaltensweisen oder schädliche Antworten in einem KI-System hervorzurufen. Der Name stammt aus dem Militär- und Cybersicherheitsbereich, wo ein „rotes Team“ einen Angreifer simuliert, um die Verteidigungsmaßnahmen auf die Probe zu stellen. Auf Sprachmodelle und andere Systeme angewandt, besteht es darin, aktiv nach Schwachstellen zu suchen, bevor böswillige Anwendende dies tun oder Unfälle diese verursachen.

Es ist wichtig, da herkömmliche Tests selten kreative oder böswillige Nutzungen vorwegnehmen, die in der realen Welt auftreten. Red Teaming hilft dabei, Risiken zu entdecken wie:

  • Erzeugung gefährlicher oder illegaler Inhalte.
  • Abfluss sensibler Daten oder von Trainingsdaten.
  • Voreingenommenheit und Anfälligkeiten für Prompt-Injections oder Jailbreaks.

In der Praxis kann es manuell erfolgen, wobei Fachkräfte Angriffe entwerfen, oder automatisiert, indem andere Modelle genutzt werden, um Tausende von adversarialen Eingaben zu generieren. Die Ergebnisse werden genutzt, um Sicherheitsfilter zu verstärken und das Verhalten des Modells vor dessen Bereitstellung zu verbessern.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog