En el contexto de los agentes de IA, un harness (arnés) é a infraestrutura de software que rodea un modelo de linguaxe e lle permite actuar como un axente funcional. Non é o modelo: é todo o que hai ao seu redor. O bucle que decide cando volver a chamalo, as ferramentas que pode usar, o contexto que recibe en cada paso, os permisos que o limitan e as trazas que deixan constancia do que fixo.
A fórmula que se popularizou en 2026 resúmeo ben: axente = modelo + harness. Un modelo en cru non é un axente; convértese nun cando un arnés lle dá estado, execución de ferramentas, realimentación e límites que se poden facer cumprir. Ou coa analoxía habitual: o modelo é o motor e o harness é o resto do coche.
Dous sentidos que convén non mesturar
- Harness de execución (agent harness): o contorno que fai funcionar ao axente en produción. É o sentido dominante, e o que usan tanto os fabricantes de modelos como a documentación de produto de Microsoft, que o define como «o andamiaxe de execución que converte un modelo de linguaxe nun axente capaz de traballar».
- Harness de avaliación (evaluation harness, test harness): o andamiaxe que executa unha batería de probas contra un modelo para medilo de forma reproducible. É o herdeiro do test harness clásico do software.
Ambos comparten a mesma idea: unha estrutura externa que suxeita ao modelo, o alimenta e observa o que fai.
De onde vén o nome
Harness significa arnés: as correas que suxeitan a un animal de tiro, ou o equipo que impide caer a quen traballa en altura. A enxeñaría xa se quedara coa palabra dúas veces antes de que chegase á IA.
- En automoción e aviación, un wiring harness é o feixe de cables que une todos os compoñentes dun vehículo. Popularizouse na industria do automóbil nos anos vinte. Non fai nada por si mesmo: conecta, ordena e protexe.
- En software, un test harness é o conxunto de stubs e drivers que rodea unha peza de programa para executala de forma controlada: inxectalle entradas, recoller saídas e compáralas co esperado.
O que si naceu en 2026 é a disciplina: o vocabulario de harness engineering consolidouse a principios dese ano, coa paternidade disputada entre un artigo de Mitchell Hashimoto (febreiro de 2026) e outro de LangChain (marzo de 2026).
Anatomía dun harness
- Bucle de control. Chamar ao modelo, executar o que pida, devolverlle o resultado e repetir ata terminar ou ata esgotar o límite de pasos.
- Ferramentas. As capacidades reais do axente: terminal, navegador, ficheiros, APIs, bases de datos. Como se describen e se nomean cambia o rendemento tanto como o modelo escollido.
- Xestión do contexto. Que entra na ventá de contexto en cada paso e que se resume, se descarta ou se garda fóra. É o colo de botella habitual das tarefas longas.
- Permisos e aprobacións. Que pode facer o axente sen preguntar e que require confirmación humana (HITL).
- Memoria e estado. O que sobrevive entre pasos e entre execucións, e a capacidade de retomar unha tarefa interrompida. É o problema central dos axentes de longa duración: cada sesión nova comeza sen lembranza da anterior.
- Observabilidade. Trazas, rexistros e reprodución paso a paso: sen isto non se pode depurar nin mellorar un axente.
Por que o harness decide o resultado
Un mesmo modelo pode resolver unha tarefa ou fracasar nela segundo o arnés que o envolva, e en 2026 hai datos que o respaldan:
- LangChain mellorou o seu resultado en Terminal-Bench 2.0 do 52,8 % ao 66,5 % sen cambiar de modelo, traballando só o harness.
- Unha auditoría de 254 envíos ao leaderboard de SWE-bench atopou que, para un mesmo modelo, cambiar de scaffold move o resultado ata 29,8 puntos porcentuais, mentres que todo o top 30 cabe en 8,8 puntos.
De aí a recomendación, cada vez máis estendida, de declarar sempre a parella modelo-arnés: dúas cifras obtidas co mesmo modelo e distinto andamiaxe non son comparables. Para unha empresa a consecuencia é directa: ao comparar dous produtos de IA, boa parte da diferenza non está no modelo —a miúdo é o mesmo—, senón no harness que alguén construíu ao seu redor.
Relación con outros termos
- Scaffold úsase case como sinónimo; adoita referirse á estrutura de código que orquestra ao axente, mentres que harness pon o acento no contorno de execución e medición.
- Loop engineering é a disciplina de deseñar ben ese bucle.
- Guardrails son as restricións que o harness impón.
- Agentic workflows e multi-agent orchestration son o que se constrúe enriba.
Na práctica, a pregunta relevante non é que modelo usa unha plataforma de IA, senón que harness lle puxo: como controla o bucle, que ferramentas expón, onde pide permiso e que deixa rexistrado. Contámolo con máis detalle en Harness, o tip do momento que hai anos que existe.