NAiOS IconNAiOS Logo
NAiOS Wiki

Harness

También: agent harness · evaluation harness · test harness · scaffold

Die Infrastruktur um das Modell, die es zum Agenten macht: Schleife, Werkzeuge, Kontext, Berechtigungen und Protokolle

5 min de lectura

Im Kontext von KI-Agenten ist ein harness (Gurtzeug) die Software-Infrastruktur, die ein Sprachmodell umgibt und es ihm ermöglicht, als funktionaler Agent zu agieren. Es ist nicht das Modell: Es ist alles, was es umgibt. Die Schleife, die entscheidet, wann es erneut aufgerufen wird, die Werkzeuge, die es verwenden kann, der Kontext, den es bei jedem Schritt erhält, die Berechtigungen, die es einschränken, und die Traces, die protokollieren, was es getan hat.

Die Formel, die 2026 populär wurde, fasst es gut zusammen: Agent = Modell + harness. Ein reines Modell ist kein Agent; es wird zu einem, wenn ein harness ihm Status, Werkzeugausführung, Feedback und durchsetzbare Grenzen verleiht. Oder mit der üblichen Analogie: Das Modell ist der Motor und das harness ist der Rest des Autos.

Zwei Bedeutungen, die man nicht verwechseln sollte

  • Ausführungs-harness (agent harness): Die Umgebung, die den Agenten in der Produktion betreibt. Dies ist die vorherrschende Bedeutung, die sowohl von Modellherstellern als auch in der Produktdokumentation von Microsoft verwendet wird, wo es als „das scaffold der Ausführung, das ein Sprachmodell in einen arbeitsfähigen Agenten verwandelt“ definiert wird.
  • Evaluierungs-harness (evaluation harness, test harness): Das scaffold, das eine Testreihe gegen ein Modell ausführt, um es reproduzierbar zu messen. Es ist der Erbe des klassischen test harness aus der Softwareentwicklung.

Beide teilen die gleiche Idee: eine externe Struktur, die das Modell hält, es speist und beobachtet, was es tut.

Woher der Name kommt

harness bedeutet Gurtzeug: die Riemen, die ein Zugtier halten, oder die Ausrüstung, die jemanden, der in der Höhe arbeitet, vor dem Absturz bewahrt. Das Ingenieurwesen hatte das Wort bereits zweimal übernommen, bevor es in der KI Einzug hielt.

  • In der Automobilindustrie und Luftfahrt ist ein wiring harness der Kabelbaum, der alle Komponenten eines Fahrzeugs verbindet. Er wurde in der Automobilindustrie in den 1920er Jahren populär. Er tut von sich aus nichts: Er verbindet, ordnet und schützt.
  • In der Softwareentwicklung ist ein test harness die Gesamtheit von stubs und drivers, die ein Programmteil umgeben, um es kontrolliert auszuführen: Es speist Eingaben ein, erfasst Ausgaben und vergleicht sie mit den Erwartungen.

Was jedoch 2026 entstand, ist die Disziplin: Das Vokabular des harness engineering festigte sich Anfang jenes Jahres, wobei die Urheberschaft zwischen einem Artikel von Mitchell Hashimoto (Februar 2026) und einem weiteren von LangChain (März 2026) umstritten ist.

Anatomie eines harness

  • Kontrollschleife. Das Modell aufrufen, ausführen, was es verlangt, das Ergebnis zurückgeben und wiederholen, bis der Vorgang abgeschlossen ist oder das Schrittlimit erreicht wurde.
  • Tools. Die tatsächlichen Fähigkeiten des Agenten: Terminal, Browser, Dateien, APIs, Datenbanken. Wie diese beschrieben und benannt werden, beeinflusst die Leistung ebenso stark wie das gewählte Modell.
  • Kontextmanagement. Was in jedem Schritt in das Kontextfenster gelangt und was zusammengefasst, verworfen oder extern gespeichert wird. Es ist der übliche Flaschenhals bei langwierigen Aufgaben.
  • Berechtigungen und Genehmigungen. Was der Agent ohne Rückfrage tun darf und was eine menschliche Bestätigung (HITL) erfordert.
  • Speicher und Status. Was zwischen den Schritten und Ausführungen erhalten bleibt, sowie die Fähigkeit, eine unterbrochene Aufgabe wieder aufzunehmen. Es ist das zentrale Problem von langlebigen Agenten: Jede neue Sitzung beginnt ohne Erinnerung an die vorherige.
  • Observability. Traces, Logs und Schritt-für-Schritt-Wiedergabe: Ohne diese Elemente lässt sich ein Agent weder debuggen noch verbessern.

Warum das harness über das Ergebnis entscheidet

Dasselbe Modell kann eine Aufgabe lösen oder daran scheitern, je nach dem harness, das es umgibt, und im Jahr 2026 gibt es Daten, die dies belegen:

  • LangChain verbesserte sein Ergebnis in Terminal-Bench 2.0 von 52,8 % auf 66,5 %, ohne das Modell zu ändern, allein durch die Arbeit am harness.
  • Eine Prüfung von 254 Einreichungen für das leaderboard von SWE-bench ergab, dass bei demselben Modell ein Wechsel des scaffold das Ergebnis um bis zu 29,8 Prozentpunkte verschiebt, während die gesamten Top 30 innerhalb von 8,8 Punkten liegen.

Daraus ergibt sich die immer häufiger ausgesprochene Empfehlung, stets das Paar Modell-harness anzugeben: Zwei Zahlen, die mit demselben Modell, aber unterschiedlichem harness erzielt wurden, sind nicht vergleichbar. Für ein Unternehmen ist die Konsequenz direkt: Beim Vergleich zweier KI-Produkte liegt ein Großteil des Unterschieds nicht im Modell – oft ist es dasselbe –, sondern in dem harness, das darum herum konstruiert wurde.

Beziehung zu anderen Begriffen

  • Scaffold wird fast als Synonym verwendet; es bezieht sich meist auf die Codestruktur, die den Agenten orchestriert, während harness den Schwerpunkt auf die Ausführungs- und Messumgebung legt.
  • Loop engineering ist die Disziplin, diesen Loop optimal zu gestalten.
  • Guardrails sind die Einschränkungen, die das harness auferlegt.
  • Agentic workflows und multi-agent orchestration sind das, was darauf aufgebaut wird.

In der Praxis ist die relevante Frage nicht, welches Modell eine KI-Plattform verwendet, sondern welches harness sie implementiert hat: wie sie den Loop steuert, welche Tools sie bereitstellt, wo sie um Erlaubnis bittet und was sie protokolliert. Wir erläutern dies ausführlicher in harness, der Trend-Tipp, den es schon seit Jahren gibt.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog