NAiOS IconNAiOS Logo
Tornar al blogTransformació Digital

Harness, el terme del moment que fa anys que existeix

El harness és tot allò que envolta el model perquè pugui actuar: el bucle, les eines, el context, els permisos i les traces. El nom ve del feix de cables d'un cotxe i del test harness del programari clàssic; el que va néixer el 2026 és la disciplina. Per què decideix el resultat més que el model, i com ho gestiona NAiOS.

N
NAiOS.net Team
26 de septiembre de 202613 min de lectura
Compartir:
Un motor aislado junto al mismo motor montado dentro del chasis transparente de un coche, con transmisión, frenos, mazo de cables y cuadro de mandos visibles
En aquest article
  1. Què és un harness, en una frase
  2. D'on ve el nom
  3. Dos sentits que convé no barrejar
  4. Per què el harness decideix el resultat
  5. Anatomia d'un harness
  6. Per què això justifica demanar permís
  7. Com gestiona NAiOS el harness
  8. Quatre casos d'ús reals
  9. Com saber si la teva plataforma té un bon harness
  10. En resum
  11. Fonts

Durant el 2026 la paraula harnessHarnessLa infraestructura que envolta el model i el converteix en agent: bucle, eines, context, permisos i traces s'ha colat en totes les converses sobre agents d'IAAgents d'IASistemes que executen tasques multipàs sense supervisió constant. Es parla del «harness de Claude Code», de «canviar de harness» o que «el harness importa més que el model». Fins i tot ha nascut una disciplina amb nom propi, harness engineering, la paternitat de la qual es disputen un article de Mitchell Hashimoto de febrer de 2026 i un altre de LangChain de març. Sona a terme acabat d'inventar, però no ho és: els electricistes d'automoció fa un segle que munten harnesses i els programadors fa dècades que els escriuen. L'única cosa nova és a què l'apliquem.

Què és un harness, en una frase

La definició més clara és la que utilitza Anthropic a la seva guia d'avaluació d'agents: «un harness d'agent (o scaffold) és el sistema que permet a un model actuar com a agent: processa les entrades, orquestra les crides a eines i retorna els resultats». Dit en curt: és tot el que envolta el model perquè pugui treballar. El bucle que decideix quan tornar a cridar-lo, les eines que pot utilitzar, el context que li arriba a cada pas, els permisos que el limiten i les traces que registren el que ha fet.

LangChain ho resumeix amb una equació que s'ha fet popular aquest any: agent = model + harness. Un model en cru no és un agent; es converteix en un quan un arnès li dona estat, execució d'eines, bucles de retroalimentació i límits que es poden fer complir.

La imatge que millor ho explica: el model és el motor i el harness és la resta del cotxe. Xassís, transmissió, frens, direcció, quadre de comandament. Un motor excel·lent sobre una taula no et porta enlloc, i el mateix motor rendeix de forma molt diferent segons el vehicle on el muntis.

Un motor aïllat al costat del mateix motor muntat dins del xassís transparent d'un cotxe, amb transmissió, frens, feix de cables i quadre de comandament visibles
El model és el motor; el harness és el cotxe sencer. El que notes en conduir gairebé mai és només el motor.

D'on ve el nom

Harness significa arnès: les corretges que subjecten un animal de tir, o l'equip que impedeix caure a qui treballa en altura. L'enginyeria ja s'havia quedat amb la paraula dues vegades abans que arribés a la intel·ligència artificial.

L'arnès de cables

En automoció i aviació, un wiring harness és el feix de cables que recorre el vehicle i connecta el motor amb el quadre, els llums, els sensors i la centraleta: cables agrupats i lligats amb una funda resistent, rematats amb connectors. Es va popularitzar en la indústria de l'automòbil als anys vint, quan va quedar clar que els cables solts no sobrevivien a la vibració, l'abrasió i la humitat. Un avió modern porta a dins feixos que, estirats, sumarien quilòmetres.

El que és interessant per a la nostra analogia és que l'arnès no fa res per si mateix: connecta, ordena i protegeix el que ja existeix. Sense ell, cap peça parla amb les altres.

Feix de cables d'automoció trenat, amb connectors i brides, sobre un banc de treball fosc
El wiring harness d'un vehicle: no fa res per si mateix, però sense ell cap peça parla amb les altres.

L'arnès de proves

En programari, un test harness és el conjunt de stubs i drivers que envolta una peça de programa per poder executar-la de forma controlada: li injecta entrades, recull sortides, les compara amb el que s'esperava i deixa un informe. És infraestructura d'imitació que permet automatitzar les proves, i és vocabulari corrent en enginyeria de programari des de fa dècades.

És exactament la mateixa idea que avui s'aplica als agents: una estructura externa que subjecta la peça, l'alimenta i observa què fa. Quan els models de llenguatge van començar a fer servir eines i a encadenar passos, calia un nom per al codi que els envolta. El terme estava esperant a l'armari.

Dos sentits que convé no barrejar

  • Harness d'execució (agent harness): l'entorn que fa funcionar l'agent en producció. És el sentit dominant i el que s'usa quan algú diu «el harness de Claude Code». Microsoft l'ha convertit fins i tot en nomenclatura oficial de producte: en la seva documentació de setembre de 2026 defineix el harness com «l'andamiatge d'execució que converteix un model de llenguatgeLLM (Model de llenguatge gran)Model de llenguatge gran, la base dels xatbots actuals en un agent capaç de treballar».
  • Harness d'avaluació (evaluation harness): l'andamiatgeAndamiatgeL'estructura de codi que connecta i orquestra un agent d'IA que executa una bateria de proves contra un model per mesurar-lo de forma reproduïble. És l'hereu directe del test harness clàssic.

Són cosins germans: en tots dos casos hi ha una estructura externa que subjecta el model i observa el seu comportament. I en tots dos casos, qui construeix l'arnès condiciona el resultat.

Per què el harness decideix el resultat

Aquesta és la part que li interessa a una empresa, i el 2026 ha deixat de ser una opinió per convertir-se en una dada.

Mateix model, diferent arnès, un altre resultat. Al febrer de 2026, LangChain va publicar un experiment net: van congelar el model (GPT-5.2-Codex) i van treballar només el harness. La seva puntuació a Terminal-Bench 2.0 va passar del 52,8 % al 66,5 %, gairebé catorze punts, saltant de fora del top 30 al top 5 de la classificació. El seu propi resum: «només vam canviar el harness». El que van tocar van ser bucles d'autoverificació, injecció de context de l'entorn, detecció de bucles infinits i anàlisi automàtica de traces. Res d'això és el model.

Les taules de classificació mesuren parelles, no models. Un estudi de setembre de 2026 va auditar 254 enviaments al leaderboard de SWE-bench i va trobar la dada més eloqüent de l'any: per a un mateix model, canviar de scaffold mou el resultat fins a 29,8 punts percentuals, mentre que tot el top 30 cap en 8,8 punts. Dit d'una altra manera: la diferència entre arnesos és més de tres vegades superior a la distància entre els trenta millors sistemes del món. Els seus autors demanen que es declari sempre la parella model-arnès.

Un article de posició de maig de 2026 ho diu sense embuts: el harness d'execució «és sovint un determinant més fort del rendiment de l'agent que el model al qual envolta», i mentre no es publiqui quin arnès es va utilitzar, les comparacions de leaderboard s'haurien de tractar com a incompletes i potencialment enganyoses. La mateixa Anthropic ho formula de forma més senzilla: «quan avaluem "un agent", estem avaluant el harness i el model treballant junts».

I costa diners. En un experiment d'Anthropic de març de 2026 sobre desenvolupament d'aplicacions de llarga durada, el mateix encàrrec llançat sense arnès es va resoldre en 20 minuts i 9 dòlars, mentre que amb l'arnès complet va trigar gairebé sis hores i va costar uns 200 dòlars. La diferència no és el preu: és que el primer era un esborrany i el segon, una aplicació acabada. L'arnès és el que converteix una demo en feina.

La conseqüència pràctica és incòmoda per al màrqueting del sector: quan compares dos productes d'IA, bona part de la diferència no està en el model, que moltes vegades és literalment el mateix. El model es compra; l'arnès es construeix.

Anatomia d'un harness

Diagrama tridimensional d'un bucle d'agent: quatre panells en cercle (planificar, eines, observar i aprovació humana) connectats per fletxes al voltant d'una esfera que representa el model
El bucle: planificar, usar eines, observar el resultat i demanar permís quan toca. El model està al centre, però no és el circuit.

Un arnès digne d'aquest nom resol sis coses:

  • El bucle. Cridar el model, executar el que demani, retornar-li el resultat i repetir fins a acabar o fins a esgotar el límit. Fàcil de descriure, difícil de fer bé: aquí es decideixen els costos i els bloquejos.
  • Les eines. El que l'agent pot fer de debò: llegir correu, consultar l'ERP, crear un esdeveniment, obrir una incidència. Com es descriuen i s'anomenen canvia el rendiment tant com canviar de model.
  • El context. Què entra a la finestra de context a cada pas i què es resumeix, es descarta o es guarda fora. És el coll d'ampolla de totes les tasques llargues.
  • Els permisos. Què pot fer sense preguntar i què exigeix confirmació humana. És la diferència entre un assistent útil i un incident.
  • La memòria i l'estat. Què sobreviu entre passos i entre execucions, i si una tasca interrompuda es reprèn on es va quedar. Anthropic identifica just aquí el problema central dels agents de llarga durada: treballen en sessions separades i cada sessió nova comença sense record de l'anterior.
  • L'observabilitat. Traces, registres i reproducció pas a pas. Sense això no es depura un agent: s'endevina.

Hi ha un setè detall poc intuïtiu que mereix menció: els agents són mals jutges del seu propi treball. Quan se'ls demana avaluar el que acaben de produir, tendeixen a elogiar-ho encara que la qualitat sigui mediocre. Per això els bons arnesos separen l'agent que treballa de l'agent que jutja.

Si vols la versió curta i enllaçada amb la resta del vocabulari, la tens a la fitxa Harness de la NAiOS Wiki, juntament amb Scaffold, Loop engineering i Guardrails.

Per què això justifica demanar permís

Hi ha una raó de pes darrere de la mania dels arnesos seriosos per demanar confirmació. El benchmark τ-bench, que mesura agents conversant amb clients i aplicant regles de negoci, va trobar que agents capdavanters resolien menys del 50 % de les tasques, i que en repetir la mateixa tasca vuit vegades encertaven les vuit en menys del 25 % dels casos. La conclusió no és que els agents no serveixin: és que la consistència no es dona per suposada, i per això les accions amb conseqüències no s'haurien d'executar sense algú mirant.

Com gestiona NAiOS el harness

A NAiOS no fem servir un model: fem servir el millor disponible a cada moment i el canviem quan en surt un de millor. El que no canvia és l'arnès. Aquests són els mòduls que el formen.

NAiOS Agents: el bucle

NAiOS Agents és la capa que converteix el xat reactiu en agents que treballen sols. Executa un bucle durable plan→act→observe amb un worker de fons, de manera que una tasca llarga sobreviu a un reinici i es reprèn on era: just el problema de memòria entre sessions del qual parlàvem. Inclou execució manual o programada (per cron o per esdeveniment), memòria i base de coneixement per agent, delegació a altres agents, workspace aïllat i un timeline reproduïble per veure, pas a pas, què va pensar i què va fer. Això últim és l'observabilitat: quan alguna cosa surt estranya, es mira, no s'endevina.

Connectors i MCP: les eines

Un agent sense eines és un xat amb ínfules. NAiOS Connectors connecta per OAuth més de mil serveis —Gmail, Slack, GitHub, Calendar, Notion i companyia— i els exposa com a eines deny-by-default: només arriben al model les dels connectors que tu has habilitat, aïllades per usuari. NAiOS MCP fa el mateix amb qualsevol servidor MCP que registris, classificant cada eina en lectura o sensible.

Knowledge Base: el context

La RAG Knowledge Base alimenta la finestra de contextFinestra de contextQuantitat de text que un model pot recordar en una conversa amb el que sap la teva empresa: documents, fulls de càlcul, catàlegs, àudio i vídeo, amb cerca semàntica i consultes SQL generades per IA. Un agent que no pot consultar el teu coneixement improvisa; un que sí, respon amb les teves dades.

HITL: els permisos

La regla es fixa a tota la plataforma: llegir és lliure, actuar demana permís. Les accions amb efectes —enviar un correu, publicar, escriure en un servei extern, emetre una factura— s'aturen en una targeta de confirmació que mostra què es farà i amb quin compte. Les eines d'alt risc mantenen aquesta confirmació fins i tot en agents autoaprovats. D'on ve aquesta manera de treballar ho expliquem a L'origen de HITL.

Quatre casos d'ús reals

  • El tancament del matí. Un agent programat a les 7:00 revisa el correu de la nit amb NAiOS Mail, classifica l'urgent, creua cada remitent amb el CRM i et deixa un resum amb esborranys de resposta preparats. Cap no s'envia sense el teu clic.
  • Atenció al client que sap apartar-se. A NAiOSOmni, un agent respon per WhatsApp o Telegram amb el coneixement de la teva KB i es pausa automàticament tan aviat com una persona de l'equip entra a la conversa. El harness decideix quan l'agent calla.
  • Reunions que deixen tasques, no notes. Meeting Agent entra a la videotrucada, transcriu amb diarització i treu resum i action items; l'agent els converteix en tasques assignades. Tota la feina avorrida de després de la reunió, feta.
  • Vigilància contínua del negoci. Un agent recurrent revisa cada nit tresoreria, estoc o campanyes actives i avisa només quan alguna cosa se surt del que és normal. Vigila, no actua: la decisió continua sent teva.

Com saber si la teva plataforma té un bon harness

Quatre preguntes per a qualsevol demo, incòmodes de respondre si l'arnès és fluix:

  • Si la tasca s'interromp a mitges, es reprèn sola o cal començar de zero?
  • Puc veure, pas a pas, què va fer l'agent la setmana passada i amb quines dades?
  • Quines accions pot executar sense preguntar-me, i qui decideix aquesta llista?
  • Si demà surt un model millor, puc canviar-lo sense refer les meves automatitzacions?

Quan canvies de model i tot continua funcionant, és que tenies un harness. Quan canvies de model i es trenca mig sistema, és que tenies un prompt amb sort.

En resum

  • L'harness és l'entorn que envolta el model: bucle, eines, context, permisos, memòria i traces. Agent = model + harness.
  • El nom ve de l'arnès: el feix de cables d'un vehicle i el test harness del programari clàssic. El que va néixer el 2026 és la disciplina, no la paraula.
  • Les dades d'aquest any són contundents: mateix model i diferent arnès canvien el resultat més que triar un altre model.
  • El model es compra i es canvia; l'arnès es construeix, i aquí hi ha la diferència real entre productes.
  • A NAiOS aquest arnès té nom i mòduls: Agents per al bucle, Connectors i MCPModel Context Protocol (MCP)Protocol estàndard perquè els models es connectin amb eines externes per a les eines, Knowledge Base per al context i HITL per als permisos.

Fonts

Hashtags per compartir:

#NAiOS #IA #TransformacióDigital #CRM #AIAgents #ClaudeCode #Anthropic #Connectors

Compartir:

Articles relacionats

Documentos formales en blanco con un sello en relieve y un código cuadrado junto a un portátil cerrado, con una marca de verificación luminosa encima
Guies Pràctiques

La teva plantilla ja fa servir IA: pots demostrar que l'has format?

L'article 4 de l'AI Act obliga des del febrer del 2025 qui FA SERVIR intel·ligència artificial, no només qui la fabrica. L'Òmnibus digital del juliol del 2026 el va convertir en obligació de mitjans: no has de garantir que la teva gent sàpiga, has de demostrar que vas actuar. Què val com a evidència, què no, i el curs amb què ho resolem.

27 de septiembre de 2026
Llegir més
Verifactu en NAiOS, probado de verdad: la AEAT ya ha aceptado nuestras facturas
Funcions Naios

Verifactu a NAiOS, provat de veritat: l'AEAT espanyola ja ha acceptat les nostres factures

El 22 de setembre, amb un certificat real, l'ERP de NAiOS es va connectar a l'entorn de proves de l'Agencia Tributaria, va emetre una factura i l'AEAT la va acceptar en 33 segons; l'anul·lació, també. Què es va provar, com s'activa en tres passos, la vista prèvia del PDF i per què l'ERP no està sol: CRM, TPV, magatzem i xat amb la teva aprovació al davant.

23 de septiembre de 2026
Llegir més