NAiOS IconNAiOS Logo
Zurück zum BlogDigitale Transformation

Harness: das Modewort der Stunde, das es seit Jahren gibt

Das Harness ist alles, was das Modell umgibt, damit es handeln kann: die Schleife, die Werkzeuge, der Kontext, die Berechtigungen und die Protokolle. Der Name stammt vom Kabelbaum eines Autos und vom test harness der klassischen Softwareentwicklung; was 2026 entstand, ist die Disziplin. Warum es das Ergebnis stärker bestimmt als das Modell und wie NAiOS es verwaltet.

N
NAiOS.net Team
26 de septiembre de 202613 Min. Lesedauer
Compartir:
Un motor aislado junto al mismo motor montado dentro del chasis transparente de un coche, con transmisión, frenos, mazo de cables y cuadro de mandos visibles
In diesem Artikel
  1. Was ein Harness ist, in einem Satz
  2. Woher der Name stammt
  3. Zwei Bedeutungen, die man nicht verwechseln sollte
  4. Warum der Harness über das Ergebnis entscheidet
  5. Anatomie eines Harness
  6. Warum dies rechtfertigt, um Erlaubnis zu bitten
  7. Wie NAiOS den Harness verwaltet
  8. Vier reale Anwendungsfälle
  9. Wie Sie erkennen, ob Ihre Plattform ein gutes Harness hat
  10. Zusammenfassung
  11. Quellen

Im Jahr 2026 hat sich das Wort HarnessHarnessDie Infrastruktur um das Modell, die es zum Agenten macht: Schleife, Werkzeuge, Kontext, Berechtigungen und Protokolle in alle Gespräche über KI-AgentenKI-AgentenSysteme, die mehrstufige Aufgaben ohne ständige Überwachung ausführen. eingeschlichen. Man spricht vom «Harness von Claude Code», davon, «das Harness zu wechseln» oder davon, dass «das Harness wichtiger ist als das Modell». Es ist sogar eine eigenständige Disziplin entstanden, das Harness Engineering, dessen Urheberschaft sich ein Artikel von Mitchell Hashimoto vom Februar 2026 und ein weiterer von LangChain vom März streitig machen. Der Begriff klingt frisch erfunden, ist es aber nicht: Die Kfz-Elektriker montieren seit einem Jahrhundert Harnesses, und die Programmiererinnen und Programmierer schreiben sie seit Jahrzehnten. Neu ist nur, worauf wir es anwenden.

Was ein Harness ist, in einem Satz

Die klarste Definition ist die, die Anthropic in seinem Leitfaden zur Bewertung von Agenten verwendet: «Ein Agenten-Harness (oder Scaffold) ist das System, das es einem Modell ermöglicht, als Agent zu handeln: Es verarbeitet die Eingaben, orchestriert die Aufrufe von Werkzeugen und gibt die Ergebnisse zurück». Kurz gesagt: Es ist alles, was das Modell umgibt, damit es arbeiten kann. Die Schleife, die entscheidet, wann es erneut aufgerufen wird, die Werkzeuge, die es verwenden kann, der Kontext, der bei jedem Schritt bei ihm ankommt, die Berechtigungen, die es begrenzen, und die Traces, die aufzeichnen, was es getan hat.

LangChain fasst es mit einer Gleichung zusammen, die dieses Jahr populär geworden ist: Agent = Modell + Harness. Ein rohes Modell ist kein Agent; es wird erst zu einem, wenn ein Harness ihm Zustand, Werkzeugausführung, Rückkopplungsschleifen und durchsetzbare Grenzen gibt.

Das Bild, das es am besten erklärt: Das Modell ist der Motor und das Harness ist der Rest des Autos. Fahrgestell, Getriebe, Bremsen, Lenkung, Armaturenbrett. Ein exzellenter Motor auf einem Tisch bringt Sie nirgendwohin, und derselbe Motor leistet je nach Fahrzeug, in das Sie ihn einbauen, sehr unterschiedlich viel.

Ein einzelner Motor neben demselben Motor, eingebaut in das transparente Fahrgestell eines Autos, mit sichtbarem Getriebe, Bremsen, Kabelbaum und Armaturenbrett
Das Modell ist der Motor; das Harness ist das ganze Auto. Was Sie beim Fahren spüren, ist fast nie nur der Motor.

Woher der Name stammt

Harness bedeutet Geschirr: die Riemen, die ein Zugtier halten, oder die Ausrüstung, die verhindert, dass jemand abstürzt, der in der Höhe arbeitet. Die Technik hatte sich das Wort bereits zweimal zu eigen gemacht, bevor es zur künstlichen Intelligenz gelangte.

Der Kabelbaum

In der Automobilindustrie und Luftfahrt ist ein wiring harness der Kabelbaum, der das Fahrzeug durchzieht und den Motor mit dem Armaturenbrett, den Lichtern, den Sensoren und dem Steuergerät verbindet: Kabel, die gebündelt und mit einer widerstandsfähigen Hülle ummantelt sowie mit Steckern versehen sind. Er verbreitete sich in der Automobilindustrie in den zwanziger Jahren, als klar wurde, dass lose Kabel Vibrationen, Abrieb und Feuchtigkeit nicht standhielten. Ein modernes Flugzeug enthält im Inneren Kabelbäume, die auseinandergezogen Kilometer ergeben würden.

Das Interessante für unsere Analogie ist, dass der Harness selbst nichts leistet: Er verbindet, ordnet und schützt das Bestehende. Ohne ihn kommuniziert kein Teil mit den anderen.

Geflochtener Fahrzeug-Kabelbaum mit Steckern und Kabelbindern auf einer dunklen Werkbank
Der wiring harness eines Fahrzeugs: Er leistet selbst nichts, aber ohne ihn kommuniziert kein Teil mit den anderen.

Der Test-Harness

In der Softwareentwicklung ist ein test harness die Gesamtheit von stubs und drivers, die eine Programmkomponente umgeben, um sie kontrolliert ausführen zu können: Er speist Eingaben ein, erfasst Ausgaben, vergleicht sie mit den Erwartungen und erstellt einen Bericht. Es handelt sich um eine Simulationsinfrastruktur, die die Automatisierung von Tests ermöglicht und seit Jahrzehnten zum Standardvokabular im Software Engineering gehört.

Es ist genau dieselbe Idee, die heute auf Agenten angewendet wird: eine externe Struktur, die das Bauteil hält, es speist und beobachtet, was es tut. Als Sprachmodelle begannen, Werkzeuge zu nutzen und Schritte aneinanderzureihen, wurde ein Name für den Code benötigt, der sie umhüllt. Der Begriff lag bereits bereit.

Zwei Bedeutungen, die man nicht verwechseln sollte

  • Ausführungs-Harness (agent harness): Die Umgebung, in der der Agent in der Produktion betrieben wird. Dies ist die vorherrschende Bedeutung und wird verwendet, wenn jemand vom „Harness von Claude Code“ spricht. Microsoft hat dies sogar zur offiziellen Produktnomenklatur gemacht: In der Dokumentation vom September 2026 wird der Harness als „das Ausführungsgerüst, das ein SprachmodellLLM (Großes Sprachmodell)Großes Sprachmodell, die Basis der aktuellen Chatbots in einen arbeitsfähigen Agenten verwandelt“, definiert.
  • Evaluierungs-Harness (evaluation harness): Das GerüstGerüstDie Codestruktur, die einen KI-Agenten verbindet und orchestriert., das eine Testreihe gegen ein Modell ausführt, um es reproduzierbar zu messen. Er ist der direkte Erbe des klassischen test harness.

Sie sind eng verwandt: In beiden Fällen gibt es eine externe Struktur, die das Modell hält und sein Verhalten beobachtet. Und in beiden Fällen gilt: Wer den Harness konstruiert, beeinflusst das Ergebnis.

Warum der Harness über das Ergebnis entscheidet

Das ist der Teil, der für ein Unternehmen von Interesse ist, und im Jahr 2026 ist dies keine bloße Meinung mehr, sondern eine Tatsache.

Gleiches Modell, anderes Harness, anderes Ergebnis. Im Februar 2026 veröffentlichte LangChain ein sauberes Experiment: Sie froren das Modell (GPT-5.2-Codex) ein und arbeiteten ausschließlich am Harness. Die Punktzahl in Terminal-Bench 2.0 stieg von 52,8 % auf 66,5 % – fast vierzehn Punkte –, was einen Sprung von außerhalb der Top 30 in die Top 5 der Rangliste bedeutete. Die eigene Zusammenfassung: „Wir haben nur das Harness geändert“. Was angepasst wurde, waren Selbstverifizierungsschleifen, die Injektion von Umgebungskontext, die Erkennung von Endlosschleifen und die automatische Trace-Analyse. Nichts davon ist das Modell.

Ranglisten messen Paare, keine Modelle. Eine Studie vom September 2026 prüfte 254 Einreichungen für das Leaderboard von SWE-bench und lieferte die aussagekräftigste Erkenntnis des Jahres: Bei ein und demselben Modell verändert der Wechsel des Scaffolds das Ergebnis um bis zu 29,8 Prozentpunkte, während die gesamten Top 30 innerhalb von 8,8 Punkten liegen. Anders ausgedrückt: Der Unterschied zwischen den Harness-Strukturen ist mehr als dreimal so groß wie der Abstand zwischen den dreißig besten Systemen der Welt. Die Verfassenden fordern, dass stets das Paar aus Modell und Harness angegeben wird.

Ein Positionspapier vom Mai 2026 bringt es auf den Punkt: Das Ausführungs-Harness „ist oft ein stärkerer Bestimmungsfaktor für die Leistung des Agenten als das Modell, das es umschließt“. Solange nicht veröffentlicht wird, welches Harness verwendet wurde, sollten Leaderboard-Vergleiche als unvollständig und potenziell irreführend betrachtet werden. Anthropic selbst formuliert es einfacher: „Wenn wir ‚einen Agenten‘ bewerten, bewerten wir das Zusammenspiel von Harness und Modell“.

Und es kostet Geld. In einem Experiment von Anthropic vom März 2026 zur Entwicklung langlebiger Anwendungen wurde derselbe Auftrag ohne Harness in 20 Minuten für 9 Dollar erledigt, während er mit dem vollständigen Harness fast sechs Stunden dauerte und etwa 200 Dollar kostete. Der entscheidende Unterschied ist nicht der Preis: Das Erste war ein Entwurf, das Zweite eine fertige Anwendung. Das Harness ist das, was eine Demo in echte Arbeit verwandelt.

Die praktische Konsequenz ist unangenehm für das Marketing der Branche: Wenn Sie zwei KI-Produkte vergleichen, liegt ein Großteil des Unterschieds nicht im Modell, das oft buchstäblich dasselbe ist. Das Modell wird gekauft; das Harness wird gebaut.

Anatomie eines Harness

Dreidimensionales Diagramm einer Agentenschleife: vier im Kreis angeordnete Felder (planen, Werkzeuge, beobachten und menschliche Freigabe), die durch Pfeile um eine Kugel verbunden sind, die das Modell darstellt
Die Schleife: planen, Werkzeuge nutzen, das Ergebnis beobachten und bei Bedarf um Erlaubnis bitten. Das Modell steht im Zentrum, ist aber nicht der Kreislauf.

Ein Harness, das diesen Namen verdient, löst sechs Dinge:

  • Die Schleife. Das Modell aufrufen, ausführen, was es verlangt, ihm das Ergebnis zurückgeben und wiederholen, bis die Aufgabe erledigt ist oder das Limit erschöpft ist. Leicht zu beschreiben, schwer richtig zu machen: Hier entscheiden sich die Kosten und die Blockaden.
  • Die Werkzeuge. Was der Agent wirklich tun kann: E-Mails lesen, das ERP abfragen, einen Termin erstellen, ein Ticket eröffnen. Wie sie beschrieben und benannt werden, verändert die Leistung genauso stark wie ein Modellwechsel.
  • Der Kontext. Was bei jedem Schritt in das Kontextfenster gelangt und was zusammengefasst, verworfen oder ausserhalb gespeichert wird. Das ist der Engpass aller langen Aufgaben.
  • Die Berechtigungen. Was er ohne Nachfrage tun darf und was eine menschliche Bestätigung erfordert. Das ist der Unterschied zwischen einem nützlichen Assistenten und einem Zwischenfall.
  • Das Gedächtnis und der Zustand. Was zwischen Schritten und zwischen Ausführungen überlebt und ob eine unterbrochene Aufgabe dort fortgesetzt wird, wo sie stehen geblieben ist. Anthropic identifiziert genau hier das Kernproblem langlaufender Agenten: Sie arbeiten in getrennten Sitzungen und jede neue Sitzung beginnt ohne Erinnerung an das Vorherige.
  • Die Beobachtbarkeit. Traces, Protokolle und schrittweise Wiedergabe. Ohne dies lässt sich ein Agent nicht debuggen: Man rät nur.

Es gibt ein siebtes, wenig intuitives Detail, das Erwähnung verdient: Agenten sind schlechte Richter ihrer eigenen Arbeit. Wenn man sie bittet, das gerade Produzierte zu bewerten, neigen sie dazu, es zu loben, selbst wenn die Qualität mittelmässig ist. Deshalb trennen gute Harnesses den arbeitenden Agenten vom urteilenden Agenten.

Wenn Sie die kurze und mit dem übrigen Vokabular verlinkte Version möchten, finden Sie sie im Eintrag Harness der NAiOS Wiki, neben Scaffold, Loop engineering und Guardrails.

Warum dies rechtfertigt, um Erlaubnis zu bitten

Es gibt einen harten Grund für die Marotte ernsthafter Harnesse, um Bestätigung zu bitten. Der Benchmark τ-bench, der Agenten misst, die mit Kundinnen und Kunden sprechen und Geschäftsregeln anwenden, stellte fest, dass Spitzenagenten weniger als 50 % der Aufgaben lösten und beim achtmaligen Wiederholen derselben Aufgabe in weniger als 25 % der Fälle alle acht Male richtig lagen. Die Schlussfolgerung ist nicht, dass Agenten nutzlos sind: Es ist die, dass die Konsistenz nicht selbstverständlich ist, und deshalb sollten Aktionen mit Konsequenzen nicht ausgeführt werden, ohne dass jemand zuschaut.

Wie NAiOS den Harness verwaltet

Bei NAiOS verwenden wir nicht ein Modell: Wir verwenden das jeweils beste verfügbare und wechseln es, wenn ein besseres erscheint. Was sich nicht ändert, ist der Harness. Dies sind die Module, die ihn bilden.

NAiOS Agents: die Schleife

NAiOS Agents ist die Schicht, die den reaktiven Chat in Agenten verwandelt, die selbstständig arbeiten. Sie führt eine dauerhafte Schleife plan→act→observe mit einem Hintergrund-Worker aus, sodass eine lange Aufgabe einen Neustart überlebt und dort wieder aufgenommen wird, wo sie war: genau das Problem des Gedächtnisses zwischen Sitzungen, von dem wir sprachen. Sie umfasst manuelle oder geplante Ausführung (per Cron oder per Ereignis), Gedächtnis und Wissensbasis pro Agent, Delegation an andere Agenten, einen isolierten Workspace und eine reproduzierbare Timeline, um Schritt für Schritt zu sehen, was er dachte und was er tat. Letzteres ist die Beobachtbarkeit: Wenn etwas seltsam läuft, schaut man nach, man rät nicht.

Connectors und MCP: die Werkzeuge

Ein Agent ohne Werkzeuge ist ein Chat mit Allüren. NAiOS Connectors verbindet per OAuth mehr als tausend Dienste – Gmail, Slack, GitHub, Calendar, Notion und Konsorten – und stellt sie als Werkzeuge deny-by-default bereit: Zum Modell gelangen nur die der Konnektoren, die Sie aktiviert haben, isoliert pro Benutzerin und Benutzer. NAiOS MCP macht das Gleiche mit jedem MCP-Server, den Sie registrieren, und klassifiziert jedes Werkzeug als lesend oder sensibel.

Knowledge Base: der Kontext

Die RAG Knowledge Base speist das KontextfensterKontextfensterTextmenge, die ein Modell in einer Konversation behalten kann mit dem, was Ihr Unternehmen weiß: Dokumente, Tabellenkalkulationen, Kataloge, Audio und Video, mit semantischer Suche und KI-generierten SQL-Abfragen. Ein Agent, der Ihr Wissen nicht abfragen kann, improvisiert; einer, der es kann, antwortet mit Ihren Daten.

HITL: die Berechtigungen

Die Regel gilt einheitlich auf der gesamten Plattform: Lesen ist frei, Handeln erfordert eine Genehmigung. Aktionen mit Auswirkungen – eine E-Mail senden, veröffentlichen, in einen externen Dienst schreiben, eine Rechnung ausstellen – werden an einer Bestätigungskarte angehalten, die anzeigt, was getan wird und mit welchem Konto. Werkzeuge mit hohem Risiko behalten diese Bestätigung selbst bei automatisch genehmigten Agenten bei. Woher diese Arbeitsweise stammt, erklären wir in Der Ursprung von HITL.

Vier reale Anwendungsfälle

  • Der Morgenabschluss. Ein um 7:00 Uhr geplanter Agent prüft die E-Mails der Nacht mit NAiOS Mail, klassifiziert das Dringende, gleicht jeden Absender mit dem CRM ab und hinterlässt Ihnen eine Zusammenfassung mit vorbereiteten Antwortentwürfen. Keiner wird ohne Ihren Klick gesendet.
  • Kundenservice, der sich zurückzunehmen weiß. In NAiOSOmni antwortet ein Agent über WhatsApp oder Telegram mit dem Wissen Ihrer KB und pausiert automatisch, sobald eine Person aus dem Team in das Gespräch eintritt. Das Harness entscheidet, wann der Agent schweigt.
  • Meetings, die Aufgaben hinterlassen, keine Notizen. Meeting Agent tritt dem Videoanruf bei, transkribiert mit Diarisierung und erstellt Zusammenfassung und Action Items; der Agent verwandelt sie in zugewiesene Aufgaben. Die gesamte langweilige Arbeit nach dem Meeting: erledigt.
  • Kontinuierliche Überwachung des Geschäfts. Ein wiederkehrender Agent prüft jede Nacht Treasury, Bestand oder aktive Kampagnen und meldet sich nur, wenn etwas vom Normalen abweicht. Er überwacht, handelt nicht: Die Entscheidung bleibt bei Ihnen.

Wie Sie erkennen, ob Ihre Plattform ein gutes Harness hat

Vier Fragen für jede Demo, unbequem zu beantworten, wenn das Harness schwach ist:

  • Wenn die Aufgabe auf halbem Weg unterbrochen wird, wird sie von selbst wieder aufgenommen oder muss man von vorne beginnen?
  • Kann ich Schritt für Schritt sehen, was der Agent letzte Woche getan hat und mit welchen Daten?
  • Welche Aktionen kann er ausführen, ohne mich zu fragen, und wer entscheidet über diese Liste?
  • Wenn morgen ein besseres Modell erscheint, kann ich es wechseln, ohne meine Automatisierungen neu zu erstellen?

Wenn Sie das Modell wechseln und alles weiter funktioniert, dann hatten Sie ein Harness. Wenn Sie das Modell wechseln und das halbe System zusammenbricht, dann hatten Sie einen Prompt mit Glück.

Zusammenfassung

  • Das Harness ist die Umgebung, die das Modell umgibt: Loop, Tools, Kontext, Berechtigungen, Speicher und Traces. Agent = Modell + Harness.
  • Der Name leitet sich vom Harness ab: dem Kabelbaum eines Fahrzeugs und dem Test-Harness der klassischen Software. Was im Jahr 2026 entstand, ist die Disziplin, nicht das Wort.
  • Die diesjährigen Daten sind eindeutig: Dasselbe Modell und ein unterschiedlicher Harness verändern das Ergebnis stärker als die Wahl eines anderen Modells.
  • Das Modell wird gekauft und ausgetauscht; der Harness wird konstruiert, und darin liegt die tatsächliche Differenzierung zwischen Produkten.
  • Bei NAiOS hat dieser Harness einen Namen und Module: Agents für den Loop, Connectors und MCPModel Context Protocol (MCP)Standardprotokoll für die Anbindung von Modellen an externe Tools für die Tools, Knowledge Base für den Kontext und HITL für die Berechtigungen.

Quellen

Hashtags zum Teilen:

#NAiOS #IA #DigitaleTransformation #CRM #Marketing #AIAgents #ClaudeCode #Anthropic #Connectors

Compartir:

Ähnliche Artikel

Documentos formales en blanco con un sello en relieve y un código cuadrado junto a un portátil cerrado, con una marca de verificación luminosa encima
Praktische Leitfäden

Ihr Team nutzt bereits KI. Können Sie nachweisen, dass Sie es geschult haben?

Artikel 4 der KI-Verordnung gilt seit Februar 2025 für alle, die künstliche Intelligenz NUTZEN, nicht nur für die, die sie bauen. Der Digital Omnibus vom Juli 2026 hat daraus eine Bemühenspflicht gemacht: Sie müssen nicht garantieren, dass Ihre Leute Bescheid wissen, Sie müssen nachweisen, dass Sie gehandelt haben. Was als Nachweis zählt, was nicht, und der Kurs, den wir dafür gebaut haben.

27 de septiembre de 2026
Mehr lesen
Verifactu en NAiOS, probado de verdad: la AEAT ya ha aceptado nuestras facturas
Naios-funktionen

Verifactu in NAiOS, wirklich getestet: Die spanische AEAT hat unsere Rechnungen bereits akzeptiert

Am 22. September hat sich das ERP von NAiOS mit einem echten Zertifikat mit der Testumgebung der spanischen Agencia Tributaria verbunden, eine Rechnung ausgestellt und die AEAT hat diese in 33 Sekunden akzeptiert; die Stornierung ebenfalls. Was getestet wurde, wie die Aktivierung in drei Schritten erfolgt, die PDF-Vorschau und warum das ERP nicht allein steht: CRM, Kassensystem, Lagermodul und Chat mit Ihrer Freigabe vorab.

23 de septiembre de 2026
Mehr lesen