AI Safety (Sicherheit künstlicher Intelligenz) ist die Disziplin, die Methoden erforscht und entwickelt, um sicherzustellen, dass sich KI-Systeme zuverlässig, vorhersehbar und im Einklang mit menschlichen Zielen verhalten, wobei sowohl beabsichtigte als auch versehentliche Schäden vermieden werden. Sie reicht von konkreten technischen Problemen bis hin zu langfristigen Risiken, die mit immer leistungsfähigeren Systemen verbunden sind.
Ihre Bedeutung nimmt zu, während KI in kritische Bereiche wie das Gesundheitswesen, autonome Fahrzeuge oder Infrastrukturen integriert wird. Ein Modell, das unerwartet versagt, anfällig für Manipulationen ist oder falsch spezifizierte Ziele verfolgt, kann schwere Schäden verursachen. Einige gängige Arbeitsbereiche sind:
- Alignment: Sicherstellen, dass das System das verfolgt, was wir wirklich wollen, und nicht eine wörtliche Interpretation des Ziels.
- Robustheit: Ein stabiles Verhalten bei unerwarteten Eingaben oder Angriffen beibehalten.
- Interpretierbarkeit: Verstehen, warum ein Modell eine Entscheidung trifft.
Ein praktisches Beispiel ist Reward Hacking, wenn ein Agent Fehler in seiner Belohnungsfunktion ausnutzt, um eine hohe Punktzahl zu erreichen, ohne den beabsichtigten Zweck zu erfüllen.