NAiOS IconNAiOS Logo
NAiOS Wiki

Leitplanken

También: Sicherheitsleitplanken · KI-Grenzwerte · KI-Restriktionen · Sicherheitskontrollen

Beschränkungen und Grenzen, die der KI zur Vermeidung von Schäden auferlegt werden

1 min de lectura

Guardrails (oder Schutzbarrieren) sind die Gesamtheit der Einschränkungen, Filter und Regeln, die auf ein System der künstlichen Intelligenz angewendet werden, um dessen Verhalten einzugrenzen und zu verhindern, dass es schädliche, illegale oder unangemessene Antworten generiert. Sie fungieren als eine Kontrollschicht, die abgrenzt, was das Modell tun kann und was nicht, sowohl bei den Eingaben als auch bei den erzeugten Ausgaben.

Ihre Bedeutung liegt darin, dass generative Modelle von sich aus nicht zwischen einer legitimen und einer gefährlichen Nutzung unterscheiden. Guardrails helfen dabei, Risiken zu mindern, wie zum Beispiel:

  • Die Erzeugung von gewalttätigen, diskriminierenden oder illegalen Inhalten.
  • Das Abfließen von sensiblen oder personenbezogenen Daten.
  • Manipulationsversuche durch prompt injection oder jailbreaking.

In der Praxis werden sie auf verschiedenen Ebenen implementiert: Anpassungen beim Training des Modells, Filter für Nutzeranfragen und Validierungen der Ausgaben vor deren Anzeige. Es ist wichtig zu bedenken, dass kein Guardrail unfehlbar ist: Sie sind eine Maßnahme zur Risikominderung, keine absolute Garantie, und müssen kontinuierlich überprüft und aktualisiert werden.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog