Im Kontext von KI-Agenten ist ein Harness die Software-Infrastruktur, die ein Sprachmodell umgibt und es ihm ermöglicht, als funktionaler Agent zu agieren. Es handelt sich dabei nicht um das Modell selbst, sondern um die Gesamtheit der Komponenten, die den Workflow verwalten: die Erstellung der Prompts, den Zugriff auf externe Werkzeuge, den Speicher, die Steuerung der Ausführungsschritte und die Erfassung der Ergebnisse.
Seine Bedeutung liegt darin, dass die Leistung eines Agenten sowohl vom zugrunde liegenden Modell als auch von dem Harness abhängt, der ihn orchestriert. Dasselbe Modell kann sehr unterschiedliche Ergebnisse liefern, je nachdem, wie der Kontext bereitgestellt wird oder wie die Werkzeugaufrufe verwaltet werden. Daher ist es beim Vergleich von Agenten in Benchmarks wie SWE-bench unerlässlich, anzugeben, welcher Harness verwendet wurde.
Ein typischer Harness ist zuständig für:
- Iterieren über die Aktionen des Agenten, bis das Ziel erreicht ist.
- Verbinden des Modells mit Werkzeugen (Terminal, Browser, APIs).
- Protokollieren von Traces zur Bewertung und Fehlerbehebung des Verhaltens.