Dans le contexte des agents d'IA, un harness (arnais) est l'infrastructure logicielle qui entoure un modèle de langage et lui permet d'agir comme un agent fonctionnel. Ce n'est pas le modèle : c'est tout ce qu'il y a autour. La boucle qui décide quand le rappeler, les outils qu'il peut utiliser, le contexte qu'il reçoit à chaque étape, les permissions qui le limitent et les traces qui conservent l'historique de ce qu'il a fait.
La formule qui s'est popularisée en 2026 le résume bien : agent = modèle + harness. Un modèle brut n'est pas un agent ; il le devient lorsqu'un harness lui donne un état, l'exécution d'outils, du feedback et des limites applicables. Ou selon l'analogie habituelle : le modèle est le moteur et le harness est le reste de la voiture.
Deux sens qu'il convient de ne pas confondre
- Harness d'exécution (agent harness) : l'environnement qui fait fonctionner l'agent en production. C'est le sens dominant, et celui qu'utilisent aussi bien les fabricants de modèles que la documentation produit de Microsoft, qui le définit comme « le scaffold d'exécution qui transforme un modèle de langage en un agent capable de travailler ».
- Harness d'évaluation (evaluation harness, test harness) : le scaffold qui exécute une batterie de tests sur un modèle pour le mesurer de manière reproductible. C'est l'héritier du test harness classique du logiciel.
Les deux partagent la même idée : une structure externe qui maintient le modèle, l'alimente et observe ce qu'il fait.
D'où vient le nom
Harness signifie arnais : les sangles qui maintiennent un animal de trait, ou l'équipement qui empêche de tomber celui qui travaille en hauteur. L'ingénierie s'était déjà approprié le mot à deux reprises avant qu'il n'arrive à l'IA.
- Dans l'automobile et l'aviation, un wiring harness est le faisceau de câbles qui relie tous les composants d'un véhicule. Il s'est popularisé dans l'industrie automobile dans les années vingt. Il ne fait rien par lui-même : il connecte, ordonne et protège.
- En logiciel, un test harness est l'ensemble de stubs et de drivers qui entoure un morceau de programme pour l'exécuter de manière contrôlée : il lui injecte des entrées, recueille les sorties et les compare aux résultats attendus.
Ce qui est né en 2026, c'est la discipline : le vocabulaire de harness engineering s'est consolidé au début de cette année-là, avec une paternité disputée entre un article de Mitchell Hashimoto (février 2026) et un autre de LangChain (mars 2026).
Anatomía de un harness
- Boucle de contrôle. Appeler le modèle, exécuter ce qu'il demande, lui renvoyer le résultat et répéter jusqu'à la fin ou jusqu'à épuisement de la limite d'étapes.
- Outils. Les capacités réelles de l'agent : terminal, navigateur, fichiers, APIs, bases de données. La manière dont ils sont décrits et nommés modifie les performances autant que le modèle choisi.
- Gestion du contexte. Ce qui entre dans la fenêtre de contexte à chaque étape et ce qui est résumé, écarté ou stocké à l'extérieur. C'est le goulot d'étranglement habituel des tâches longues.
- Permissions et approbations. Ce que l'agent peut faire sans demander et ce qui nécessite une confirmation humaine (HITL).
- Mémoire et état. Ce qui survit entre les étapes et entre les exécutions, et la capacité à reprendre une tâche interrompue. C'est le problème central des agents de longue durée : chaque nouvelle session commence sans souvenir de la précédente.
- Observabilité. Traces, journaux et reproduction étape par étape : sans cela, on ne peut ni déboguer ni améliorer un agent.
Pourquoi le harness décide du résultat
Un même modèle peut résoudre une tâche ou y échouer selon le harness qui l'entoure, et en 2026, des données le confirment :
- LangChain a amélioré son résultat dans Terminal-Bench 2.0 de 52,8 % à 66,5 % sans changer de modèle, en travaillant uniquement le harness.
- Un audit de 254 soumissions au leaderboard de SWE-bench a révélé que, pour un même modèle, changer de scaffold déplace le résultat jusqu'à 29,8 points de pourcentage, alors que l'ensemble du top 30 tient dans 8,8 points.
D'où la recommandation, de plus en plus répandue, de toujours déclarer le couple modèle-harness : deux chiffres obtenus avec le même modèle et un scaffold différent ne sont pas comparables. Pour une entreprise, la conséquence est directe : en comparant deux produits d'IA, une grande partie de la différence ne réside pas dans le modèle —souvent le même—, mais dans le harness que quelqu'un a construit autour.
Relation avec d'autres termes
- Scaffold est utilisé presque comme un synonyme ; il se réfère généralement à la structure de code qui orchestre l'agent, tandis que harness met l'accent sur l'environnement d'exécution et de mesure.
- Loop engineering est la discipline consistant à bien concevoir cette boucle.
- Guardrails sont les restrictions que le harness impose.
- Agentic workflows et multi-agent orchestration sont ce qui se construit par-dessus.
En pratique, la question pertinente n'est pas de savoir quel modèle une plateforme d'IA utilise, mais quel harness elle lui a associé : comment elle contrôle la boucle, quels outils elle expose, où elle demande la permission et ce qu'elle laisse consigné. Nous l'expliquons plus en détail dans Harness, le concept du moment qui existe depuis des années.