Durant el 2026 la paraula harnessHarnessLa infraestructura que envolta el model i el converteix en agent: bucle, eines, context, permisos i traces s'ha colat en totes les converses sobre agents d'IAAgents d'IASistemes que executen tasques multipàs sense supervisió constant. Es parla del «harness de Claude Code», de «canviar de harness» o que «el harness importa més que el model». Fins i tot ha nascut una disciplina amb nom propi, harness engineering, la paternitat de la qual es disputen un article de Mitchell Hashimoto de febrer de 2026 i un altre de LangChain de març. Sona a terme acabat d'inventar, però no ho és: els electricistes d'automoció fa un segle que munten harnesses i els programadors fa dècades que els escriuen. L'única cosa nova és a què l'apliquem.
Què és un harness, en una frase
La definició més clara és la que utilitza Anthropic a la seva guia d'avaluació d'agents: «un harness d'agent (o scaffold) és el sistema que permet a un model actuar com a agent: processa les entrades, orquestra les crides a eines i retorna els resultats». Dit en curt: és tot el que envolta el model perquè pugui treballar. El bucle que decideix quan tornar a cridar-lo, les eines que pot utilitzar, el context que li arriba a cada pas, els permisos que el limiten i les traces que registren el que ha fet.
LangChain ho resumeix amb una equació que s'ha fet popular aquest any: agent = model + harness. Un model en cru no és un agent; es converteix en un quan un arnès li dona estat, execució d'eines, bucles de retroalimentació i límits que es poden fer complir.
La imatge que millor ho explica: el model és el motor i el harness és la resta del cotxe. Xassís, transmissió, frens, direcció, quadre de comandament. Un motor excel·lent sobre una taula no et porta enlloc, i el mateix motor rendeix de forma molt diferent segons el vehicle on el muntis.

D'on ve el nom
Harness significa arnès: les corretges que subjecten un animal de tir, o l'equip que impedeix caure a qui treballa en altura. L'enginyeria ja s'havia quedat amb la paraula dues vegades abans que arribés a la intel·ligència artificial.
L'arnès de cables
En automoció i aviació, un wiring harness és el feix de cables que recorre el vehicle i connecta el motor amb el quadre, els llums, els sensors i la centraleta: cables agrupats i lligats amb una funda resistent, rematats amb connectors. Es va popularitzar en la indústria de l'automòbil als anys vint, quan va quedar clar que els cables solts no sobrevivien a la vibració, l'abrasió i la humitat. Un avió modern porta a dins feixos que, estirats, sumarien quilòmetres.
El que és interessant per a la nostra analogia és que l'arnès no fa res per si mateix: connecta, ordena i protegeix el que ja existeix. Sense ell, cap peça parla amb les altres.

L'arnès de proves
En programari, un test harness és el conjunt de stubs i drivers que envolta una peça de programa per poder executar-la de forma controlada: li injecta entrades, recull sortides, les compara amb el que s'esperava i deixa un informe. És infraestructura d'imitació que permet automatitzar les proves, i és vocabulari corrent en enginyeria de programari des de fa dècades.
És exactament la mateixa idea que avui s'aplica als agents: una estructura externa que subjecta la peça, l'alimenta i observa què fa. Quan els models de llenguatge van començar a fer servir eines i a encadenar passos, calia un nom per al codi que els envolta. El terme estava esperant a l'armari.
Dos sentits que convé no barrejar
- Harness d'execució (agent harness): l'entorn que fa funcionar l'agent en producció. És el sentit dominant i el que s'usa quan algú diu «el harness de Claude Code». Microsoft l'ha convertit fins i tot en nomenclatura oficial de producte: en la seva documentació de setembre de 2026 defineix el harness com «l'andamiatge d'execució que converteix un model de llenguatgeLLM (Model de llenguatge gran)Model de llenguatge gran, la base dels xatbots actuals en un agent capaç de treballar».
- Harness d'avaluació (evaluation harness): l'andamiatgeAndamiatgeL'estructura de codi que connecta i orquestra un agent d'IA que executa una bateria de proves contra un model per mesurar-lo de forma reproduïble. És l'hereu directe del test harness clàssic.
Són cosins germans: en tots dos casos hi ha una estructura externa que subjecta el model i observa el seu comportament. I en tots dos casos, qui construeix l'arnès condiciona el resultat.
Per què el harness decideix el resultat
Aquesta és la part que li interessa a una empresa, i el 2026 ha deixat de ser una opinió per convertir-se en una dada.
Mateix model, diferent arnès, un altre resultat. Al febrer de 2026, LangChain va publicar un experiment net: van congelar el model (GPT-5.2-Codex) i van treballar només el harness. La seva puntuació a Terminal-Bench 2.0 va passar del 52,8 % al 66,5 %, gairebé catorze punts, saltant de fora del top 30 al top 5 de la classificació. El seu propi resum: «només vam canviar el harness». El que van tocar van ser bucles d'autoverificació, injecció de context de l'entorn, detecció de bucles infinits i anàlisi automàtica de traces. Res d'això és el model.
Les taules de classificació mesuren parelles, no models. Un estudi de setembre de 2026 va auditar 254 enviaments al leaderboard de SWE-bench i va trobar la dada més eloqüent de l'any: per a un mateix model, canviar de scaffold mou el resultat fins a 29,8 punts percentuals, mentre que tot el top 30 cap en 8,8 punts. Dit d'una altra manera: la diferència entre arnesos és més de tres vegades superior a la distància entre els trenta millors sistemes del món. Els seus autors demanen que es declari sempre la parella model-arnès.
Un article de posició de maig de 2026 ho diu sense embuts: el harness d'execució «és sovint un determinant més fort del rendiment de l'agent que el model al qual envolta», i mentre no es publiqui quin arnès es va utilitzar, les comparacions de leaderboard s'haurien de tractar com a incompletes i potencialment enganyoses. La mateixa Anthropic ho formula de forma més senzilla: «quan avaluem "un agent", estem avaluant el harness i el model treballant junts».
I costa diners. En un experiment d'Anthropic de març de 2026 sobre desenvolupament d'aplicacions de llarga durada, el mateix encàrrec llançat sense arnès es va resoldre en 20 minuts i 9 dòlars, mentre que amb l'arnès complet va trigar gairebé sis hores i va costar uns 200 dòlars. La diferència no és el preu: és que el primer era un esborrany i el segon, una aplicació acabada. L'arnès és el que converteix una demo en feina.
La conseqüència pràctica és incòmoda per al màrqueting del sector: quan compares dos productes d'IA, bona part de la diferència no està en el model, que moltes vegades és literalment el mateix. El model es compra; l'arnès es construeix.
Anatomia d'un harness

Un arnès digne d'aquest nom resol sis coses:
- El bucle. Cridar el model, executar el que demani, retornar-li el resultat i repetir fins a acabar o fins a esgotar el límit. Fàcil de descriure, difícil de fer bé: aquí es decideixen els costos i els bloquejos.
- Les eines. El que l'agent pot fer de debò: llegir correu, consultar l'ERP, crear un esdeveniment, obrir una incidència. Com es descriuen i s'anomenen canvia el rendiment tant com canviar de model.
- El context. Què entra a la finestra de context a cada pas i què es resumeix, es descarta o es guarda fora. És el coll d'ampolla de totes les tasques llargues.
- Els permisos. Què pot fer sense preguntar i què exigeix confirmació humana. És la diferència entre un assistent útil i un incident.
- La memòria i l'estat. Què sobreviu entre passos i entre execucions, i si una tasca interrompuda es reprèn on es va quedar. Anthropic identifica just aquí el problema central dels agents de llarga durada: treballen en sessions separades i cada sessió nova comença sense record de l'anterior.
- L'observabilitat. Traces, registres i reproducció pas a pas. Sense això no es depura un agent: s'endevina.
Hi ha un setè detall poc intuïtiu que mereix menció: els agents són mals jutges del seu propi treball. Quan se'ls demana avaluar el que acaben de produir, tendeixen a elogiar-ho encara que la qualitat sigui mediocre. Per això els bons arnesos separen l'agent que treballa de l'agent que jutja.
Si vols la versió curta i enllaçada amb la resta del vocabulari, la tens a la fitxa Harness de la NAiOS Wiki, juntament amb Scaffold, Loop engineering i Guardrails.
Per què això justifica demanar permís
Hi ha una raó de pes darrere de la mania dels arnesos seriosos per demanar confirmació. El benchmark τ-bench, que mesura agents conversant amb clients i aplicant regles de negoci, va trobar que agents capdavanters resolien menys del 50 % de les tasques, i que en repetir la mateixa tasca vuit vegades encertaven les vuit en menys del 25 % dels casos. La conclusió no és que els agents no serveixin: és que la consistència no es dona per suposada, i per això les accions amb conseqüències no s'haurien d'executar sense algú mirant.
Com gestiona NAiOS el harness
A NAiOS no fem servir un model: fem servir el millor disponible a cada moment i el canviem quan en surt un de millor. El que no canvia és l'arnès. Aquests són els mòduls que el formen.
NAiOS Agents: el bucle
NAiOS Agents és la capa que converteix el xat reactiu en agents que treballen sols. Executa un bucle durable plan→act→observe amb un worker de fons, de manera que una tasca llarga sobreviu a un reinici i es reprèn on era: just el problema de memòria entre sessions del qual parlàvem. Inclou execució manual o programada (per cron o per esdeveniment), memòria i base de coneixement per agent, delegació a altres agents, workspace aïllat i un timeline reproduïble per veure, pas a pas, què va pensar i què va fer. Això últim és l'observabilitat: quan alguna cosa surt estranya, es mira, no s'endevina.
Connectors i MCP: les eines
Un agent sense eines és un xat amb ínfules. NAiOS Connectors connecta per OAuth més de mil serveis —Gmail, Slack, GitHub, Calendar, Notion i companyia— i els exposa com a eines deny-by-default: només arriben al model les dels connectors que tu has habilitat, aïllades per usuari. NAiOS MCP fa el mateix amb qualsevol servidor MCP que registris, classificant cada eina en lectura o sensible.
Knowledge Base: el context
La RAG Knowledge Base alimenta la finestra de contextFinestra de contextQuantitat de text que un model pot recordar en una conversa amb el que sap la teva empresa: documents, fulls de càlcul, catàlegs, àudio i vídeo, amb cerca semàntica i consultes SQL generades per IA. Un agent que no pot consultar el teu coneixement improvisa; un que sí, respon amb les teves dades.
HITL: els permisos
La regla es fixa a tota la plataforma: llegir és lliure, actuar demana permís. Les accions amb efectes —enviar un correu, publicar, escriure en un servei extern, emetre una factura— s'aturen en una targeta de confirmació que mostra què es farà i amb quin compte. Les eines d'alt risc mantenen aquesta confirmació fins i tot en agents autoaprovats. D'on ve aquesta manera de treballar ho expliquem a L'origen de HITL.
Quatre casos d'ús reals
- El tancament del matí. Un agent programat a les 7:00 revisa el correu de la nit amb NAiOS Mail, classifica l'urgent, creua cada remitent amb el CRM i et deixa un resum amb esborranys de resposta preparats. Cap no s'envia sense el teu clic.
- Atenció al client que sap apartar-se. A NAiOSOmni, un agent respon per WhatsApp o Telegram amb el coneixement de la teva KB i es pausa automàticament tan aviat com una persona de l'equip entra a la conversa. El harness decideix quan l'agent calla.
- Reunions que deixen tasques, no notes. Meeting Agent entra a la videotrucada, transcriu amb diarització i treu resum i action items; l'agent els converteix en tasques assignades. Tota la feina avorrida de després de la reunió, feta.
- Vigilància contínua del negoci. Un agent recurrent revisa cada nit tresoreria, estoc o campanyes actives i avisa només quan alguna cosa se surt del que és normal. Vigila, no actua: la decisió continua sent teva.
Com saber si la teva plataforma té un bon harness
Quatre preguntes per a qualsevol demo, incòmodes de respondre si l'arnès és fluix:
- Si la tasca s'interromp a mitges, es reprèn sola o cal començar de zero?
- Puc veure, pas a pas, què va fer l'agent la setmana passada i amb quines dades?
- Quines accions pot executar sense preguntar-me, i qui decideix aquesta llista?
- Si demà surt un model millor, puc canviar-lo sense refer les meves automatitzacions?
Quan canvies de model i tot continua funcionant, és que tenies un harness. Quan canvies de model i es trenca mig sistema, és que tenies un prompt amb sort.
En resum
- L'harness és l'entorn que envolta el model: bucle, eines, context, permisos, memòria i traces. Agent = model + harness.
- El nom ve de l'arnès: el feix de cables d'un vehicle i el test harness del programari clàssic. El que va néixer el 2026 és la disciplina, no la paraula.
- Les dades d'aquest any són contundents: mateix model i diferent arnès canvien el resultat més que triar un altre model.
- El model es compra i es canvia; l'arnès es construeix, i aquí hi ha la diferència real entre productes.
- A NAiOS aquest arnès té nom i mòduls: Agents per al bucle, Connectors i MCPModel Context Protocol (MCP)Protocol estàndard perquè els models es connectin amb eines externes per a les eines, Knowledge Base per al context i HITL per als permisos.
Fonts
- Anthropic, Demystifying evals for AI agents — 9 de gener de 2026. Definició d'agent harness i per què una avaluació mesura sempre el model i l'arnès junts.
- LangChain, Improving Deep Agents with harness engineering — 17 de febrer de 2026. Del 52,8 % al 66,5 % a Terminal-Bench 2.0 sense tocar el model.
- Anthropic, Harness design for long-running application development — 24 de març de 2026. Cost i durada amb i sense arnès, i per què convé separar qui treballa de qui jutja.
- LangChain, The Anatomy of an Agent Harness — 10 de març de 2026. «Agent = model + harness» i les peces que el componen.
- Zhang et al., Stop Comparing LLM Agents Without Disclosing the Harness — arXiv, 7 de maig de 2026. L'arnès com a determinant del rendiment per sobre del model.
- Liu et al., Coding Agents Have Converged — arXiv, 15 de setembre de 2026. Auditoria de 254 enviaments a SWE-bench: 29,8 punts de variació per arnès en comparació amb els 8,8 punts de tot el top 30.
- Microsoft, Agent Harness (Microsoft Agent Framework) — actualitzat al setembre de 2026. El harness com a concepte de producte documentat.
- Yao et al., τ-bench — arXiv, 2024. Fiabilitat dels agents en repetir la mateixa tasca.





