NAiOS Wiki

Arnés

También: arnés · agent harness · evaluation harness · test harness · arnés de avaliación · marco de avaliación

La infraestrutura que rodea o modelo e o converte en axente: bucle, ferramentas, contexto, permisos e trazas

5 min de lectura

En el contexto de los agentes de IA, un harness (arnés) é a infraestrutura de software que rodea un modelo de linguaxe e lle permite actuar como un axente funcional. Non é o modelo: é todo o que hai ao seu redor. O bucle que decide cando volver a chamalo, as ferramentas que pode usar, o contexto que recibe en cada paso, os permisos que o limitan e as trazas que deixan constancia do que fixo.

A fórmula que se popularizou en 2026 resúmeo ben: axente = modelo + harness. Un modelo en cru non é un axente; convértese nun cando un arnés lle dá estado, execución de ferramentas, realimentación e límites que se poden facer cumprir. Ou coa analoxía habitual: o modelo é o motor e o harness é o resto do coche.

Dous sentidos que convén non mesturar

  • Harness de execución (agent harness): o contorno que fai funcionar ao axente en produción. É o sentido dominante, e o que usan tanto os fabricantes de modelos como a documentación de produto de Microsoft, que o define como «o andamiaxe de execución que converte un modelo de linguaxe nun axente capaz de traballar».
  • Harness de avaliación (evaluation harness, test harness): o andamiaxe que executa unha batería de probas contra un modelo para medilo de forma reproducible. É o herdeiro do test harness clásico do software.

Ambos comparten a mesma idea: unha estrutura externa que suxeita ao modelo, o alimenta e observa o que fai.

De onde vén o nome

Harness significa arnés: as correas que suxeitan a un animal de tiro, ou o equipo que impide caer a quen traballa en altura. A enxeñaría xa se quedara coa palabra dúas veces antes de que chegase á IA.

  • En automoción e aviación, un wiring harness é o feixe de cables que une todos os compoñentes dun vehículo. Popularizouse na industria do automóbil nos anos vinte. Non fai nada por si mesmo: conecta, ordena e protexe.
  • En software, un test harness é o conxunto de stubs e drivers que rodea unha peza de programa para executala de forma controlada: inxectalle entradas, recoller saídas e compáralas co esperado.

O que si naceu en 2026 é a disciplina: o vocabulario de harness engineering consolidouse a principios dese ano, coa paternidade disputada entre un artigo de Mitchell Hashimoto (febreiro de 2026) e outro de LangChain (marzo de 2026).

Anatomía dun harness

  • Bucle de control. Chamar ao modelo, executar o que pida, devolverlle o resultado e repetir ata terminar ou ata esgotar o límite de pasos.
  • Ferramentas. As capacidades reais do axente: terminal, navegador, ficheiros, APIs, bases de datos. Como se describen e se nomean cambia o rendemento tanto como o modelo escollido.
  • Xestión do contexto. Que entra na ventá de contexto en cada paso e que se resume, se descarta ou se garda fóra. É o colo de botella habitual das tarefas longas.
  • Permisos e aprobacións. Que pode facer o axente sen preguntar e que require confirmación humana (HITL).
  • Memoria e estado. O que sobrevive entre pasos e entre execucións, e a capacidade de retomar unha tarefa interrompida. É o problema central dos axentes de longa duración: cada sesión nova comeza sen lembranza da anterior.
  • Observabilidade. Trazas, rexistros e reprodución paso a paso: sen isto non se pode depurar nin mellorar un axente.

Por que o harness decide o resultado

Un mesmo modelo pode resolver unha tarefa ou fracasar nela segundo o arnés que o envolva, e en 2026 hai datos que o respaldan:

  • LangChain mellorou o seu resultado en Terminal-Bench 2.0 do 52,8 % ao 66,5 % sen cambiar de modelo, traballando só o harness.
  • Unha auditoría de 254 envíos ao leaderboard de SWE-bench atopou que, para un mesmo modelo, cambiar de scaffold move o resultado ata 29,8 puntos porcentuais, mentres que todo o top 30 cabe en 8,8 puntos.

De aí a recomendación, cada vez máis estendida, de declarar sempre a parella modelo-arnés: dúas cifras obtidas co mesmo modelo e distinto andamiaxe non son comparables. Para unha empresa a consecuencia é directa: ao comparar dous produtos de IA, boa parte da diferenza non está no modelo —a miúdo é o mesmo—, senón no harness que alguén construíu ao seu redor.

Relación con outros termos

Na práctica, a pregunta relevante non é que modelo usa unha plataforma de IA, senón que harness lle puxo: como controla o bucle, que ferramentas expón, onde pide permiso e que deixa rexistrado. Contámolo con máis detalle en Harness, o tip do momento que hai anos que existe.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog