En el contexto de los agentes de IA, un harness (arnés) es la infraestructura de software que rodea a un modelo de lenguaje y le permite actuar como un agente funcional. No es el modelo: es todo lo que hay a su alrededor. El bucle que decide cuándo volver a llamarlo, las herramientas que puede usar, el contexto que recibe en cada paso, los permisos que lo limitan y las trazas que dejan constancia de lo que hizo.
La fórmula que se popularizó en 2026 lo resume bien: agente = modelo + harness. Un modelo en crudo no es un agente; se convierte en uno cuando un arnés le da estado, ejecución de herramientas, realimentación y límites que se pueden hacer cumplir. O con la analogía habitual: el modelo es el motor y el harness es el resto del coche.
Dos sentidos que conviene no mezclar
- Harness de ejecución (agent harness): el entorno que hace funcionar al agente en producción. Es el sentido dominante, y el que usan tanto los fabricantes de modelos como la documentación de producto de Microsoft, que lo define como «el andamiaje de ejecución que convierte un modelo de lenguaje en un agente capaz de trabajar».
- Harness de evaluación (evaluation harness, test harness): el andamiaje que ejecuta una batería de pruebas contra un modelo para medirlo de forma reproducible. Es el heredero del test harness clásico del software.
Ambos comparten la misma idea: una estructura externa que sujeta al modelo, lo alimenta y observa lo que hace.
De dónde viene el nombre
Harness significa arnés: las correas que sujetan a un animal de tiro, o el equipo que impide caer a quien trabaja en altura. La ingeniería ya se había quedado con la palabra dos veces antes de que llegara a la IA.
- En automoción y aviación, un wiring harness es el mazo de cables que une todos los componentes de un vehículo. Se popularizó en la industria del automóvil en los años veinte. No hace nada por sí mismo: conecta, ordena y protege.
- En software, un test harness es el conjunto de stubs y drivers que rodea a una pieza de programa para ejecutarla de forma controlada: le inyecta entradas, recoge salidas y las compara con lo esperado.
Lo que sí nació en 2026 es la disciplina: el vocabulario de harness engineering se consolidó a principios de ese año, con la paternidad disputada entre un artículo de Mitchell Hashimoto (febrero de 2026) y otro de LangChain (marzo de 2026).
Anatomía de un harness
- Bucle de control. Llamar al modelo, ejecutar lo que pida, devolverle el resultado y repetir hasta terminar o hasta agotar el límite de pasos.
- Herramientas. Las capacidades reales del agente: terminal, navegador, ficheros, APIs, bases de datos. Cómo se describen y se nombran cambia el rendimiento tanto como el modelo elegido.
- Gestión del contexto. Qué entra en la ventana de contexto en cada paso y qué se resume, se descarta o se guarda fuera. Es el cuello de botella habitual de las tareas largas.
- Permisos y aprobaciones. Qué puede hacer el agente sin preguntar y qué requiere confirmación humana (HITL).
- Memoria y estado. Lo que sobrevive entre pasos y entre ejecuciones, y la capacidad de retomar una tarea interrumpida. Es el problema central de los agentes de larga duración: cada sesión nueva empieza sin recuerdo de la anterior.
- Observabilidad. Trazas, registros y reproducción paso a paso: sin esto no se puede depurar ni mejorar un agente.
Por qué el harness decide el resultado
Un mismo modelo puede resolver una tarea o fracasar en ella según el arnés que lo envuelva, y en 2026 hay datos que lo respaldan:
- LangChain mejoró su resultado en Terminal-Bench 2.0 del 52,8 % al 66,5 % sin cambiar de modelo, trabajando solo el harness.
- Una auditoría de 254 envíos al leaderboard de SWE-bench encontró que, para un mismo modelo, cambiar de scaffold mueve el resultado hasta 29,8 puntos porcentuales, mientras que todo el top 30 cabe en 8,8 puntos.
De ahí la recomendación, cada vez más extendida, de declarar siempre la pareja modelo-arnés: dos cifras obtenidas con el mismo modelo y distinto andamiaje no son comparables. Para una empresa la consecuencia es directa: al comparar dos productos de IA, buena parte de la diferencia no está en el modelo —a menudo es el mismo—, sino en el harness que alguien ha construido a su alrededor.
Relación con otros términos
- Scaffold se usa casi como sinónimo; suele referirse a la estructura de código que orquesta al agente, mientras que harness pone el acento en el entorno de ejecución y medición.
- Loop engineering es la disciplina de diseñar bien ese bucle.
- Guardrails son las restricciones que el harness impone.
- Agentic workflows y multi-agent orchestration son lo que se construye encima.
En la práctica, la pregunta relevante no es qué modelo usa una plataforma de IA, sino qué harness le ha puesto: cómo controla el bucle, qué herramientas expone, dónde pide permiso y qué deja registrado. Lo contamos con más detalle en Harness, el tip del momento que hace años que existe.