En el context dels agents d'IA, un harness (arnès) és la infraestructura de programari que envolta un model de llenguatge i li permet actuar com un agent funcional. No és el model: és tot el que hi ha al seu voltant. El bucle que decideix quan tornar a cridar-lo, les eines que pot fer servir, el context que rep a cada pas, els permisos que el limiten i les traces que deixen constància del que va fer.
La fórmula que es va popularitzar el 2026 ho resumeix bé: agent = model + harness. Un model en cru no és un agent; es converteix en un quan un arnès li dona estat, execució d'eines, retroalimentació i límits que es poden fer complir. O amb l'analogia habitual: el model és el motor i el harness és la resta del cotxe.
Dos sentits que convé no barrejar
- Harness d'execució (agent harness): l'entorn que fa funcionar l'agent en producció. És el sentit dominant, i el que fan servir tant els fabricants de models com la documentació de producte de Microsoft, que el defineix com «la bastida d'execució que converteix un model de llenguatge en un agent capaç de treballar».
- Harness d'avaluació (evaluation harness, test harness): la bastida que executa una bateria de proves contra un model per mesurar-lo de manera reproduïble. És l'hereu del test harness clàssic del programari.
Tots dos comparteixen la mateixa idea: una estructura externa que subjecta el model, l'alimenta i observa el que fa.
D'on ve el nom
Harness significa arnès: les corretges que subjecten un animal de tir, o l'equip que impedeix caure a qui treballa en alçada. L'enginyeria ja s'havia quedat amb la paraula dues vegades abans que arribés a la IA.
- En automoció i aviació, un wiring harness és el ramal de cables que uneix tots els components d'un vehicle. Es va popularitzar a la indústria de l'automòbil als anys vint. No fa res per si mateix: connecta, ordena i protegeix.
- En programari, un test harness és el conjunt d'stubs i drivers que envolta una peça de programa per executar-la de manera controlada: li injecta entrades, recull sortides i les compara amb l'esperat.
El que sí que va néixer el 2026 és la disciplina: el vocabulari de harness engineering es va consolidar a principis d'aquell any, amb la paternitat disputada entre un article de Mitchell Hashimoto (febrer de 2026) i un altre de LangChain (març de 2026).
Anatomia d'un harness
- Bucle de control. Cridar el model, executar el que demani, retornar-li el resultat i repetir fins a acabar o fins a esgotar el límit de passos.
- Eines. Les capacitats reals de l'agent: terminal, navegador, fitxers, APIs, bases de dades. Com es descriuen i s'anomenen canvia el rendiment tant com el model triat.
- Gestió del context. Què entra a la finestra de context a cada pas i què es resumeix, es descarta o es desa fora. És el coll d'ampolla habitual de les tasques llargues.
- Permisos i aprovacions. Què pot fer l'agent sense preguntar i què requereix confirmació humana (HITL).
- Memòria i estat. El que sobreviu entre passos i entre execucions, i la capacitat de reprendre una tasca interrompuda. És el problema central dels agents de llarga durada: cada sessió nova comença sense record de l'anterior.
- Observabilitat. Traces, registres i reproducció pas a pas: sense això no es pot depurar ni millorar un agent.
Per què el harness decideix el resultat
Un mateix model pot resoldre una tasca o fracassar-hi segons l'arnès que l'envolti, i el 2026 hi ha dades que ho respalden:
- LangChain va millorar el seu resultat a Terminal-Bench 2.0 del 52,8 % al 66,5 % sense canviar de model, treballant només el harness.
- Una auditoria de 254 trameses al leaderboard de SWE-bench va trobar que, per a un mateix model, canviar de scaffold mou el resultat fins a 29,8 punts percentuals, mentre que tot el top 30 cap en 8,8 punts.
D'aquí la recomanació, cada cop més estesa, de declarar sempre la parella model-arnès: dues xifres obtingudes amb el mateix model i diferent bastida no són comparables. Per a una empresa la conseqüència és directa: en comparar dos productes d'IA, bona part de la diferència no és al model —sovint és el mateix—, sinó al harness que algú ha construït al seu voltant.
Relació amb altres termes
- Scaffold s'utilitza gairebé com a sinònim; sol referir-se a l'estructura de codi que orquestra l'agent, mentre que harness posa l'accent en l'entorn d'execució i mesura.
- Loop engineering és la disciplina de dissenyar bé aquest bucle.
- Guardrails són les restriccions que el harness imposa.
- Agentic workflows i multi-agent orchestration són el que es construeix a sobre.
A la pràctica, la pregunta rellevant no és quin model fa servir una plataforma d'IA, sinó quin harness li ha posat: com controla el bucle, quines eines exposa, on demana permís i què deixa registrat. Ho expliquem amb més detall a Harness, el tip del moment que fa anys que existeix.