NAiOS IconNAiOS Logo
NAiOS Wiki

Harness

También: agent harness · evaluation harness · test harness · scaffold

A infraestrutura que rodeia o modelo e o torna um agente: ciclo, ferramentas, contexto, permissões e registos

5 min de lectura

No contexto dos agentes de IA, um harness (arnês) é a infraestrutura de software que envolve um modelo de linguagem e lhe permite atuar como um agente funcional. Não é o modelo: é tudo o que existe à sua volta. O laço que decide quando voltar a chamá-lo, as ferramentas que pode usar, o contexto que recebe em cada passo, as permissões que o limitam e os rastros que registam o que fez.

A fórmula que se popularizou em 2026 resume-o bem: agente = modelo + harness. Um modelo em bruto não é um agente; torna-se um quando um arnês lhe dá estado, execução de ferramentas, realimentação e limites que se podem fazer cumprir. Ou com a analogia habitual: o modelo é o motor e o harness é o resto do carro.

Dois sentidos que convém não misturar

  • Harness de execução (agent harness): o ambiente que faz funcionar o agente em produção. É o sentido dominante, e o que usam tanto os fabricantes de modelos como a documentação de produto da Microsoft, que o define como «o andaime de execução que converte um modelo de linguagem num agente capaz de trabalhar».
  • Harness de avaliação (evaluation harness, test harness): o andaime que executa uma bateria de testes contra um modelo para medi-lo de forma reprodutível. É o herdeiro do test harness clássico do software.

Ambos partilham a mesma ideia: uma estrutura externa que segura o modelo, o alimenta e observa o que faz.

De onde vem o nome

Harness significa arnês: as correias que seguram um animal de tiro, ou o equipamento que impede a queda de quem trabalha em altura. A engenharia já se tinha apropriado da palavra duas vezes antes de esta chegar à IA.

  • Na indústria automóvel e na aviação, um wiring harness é o feixe de cabos que une todos os componentes de um veículo. Popularizou-se na indústria automóvel nos anos vinte. Não faz nada por si só: liga, ordena e protege.
  • No software, um test harness é o conjunto de stubs e drivers que envolve uma peça de programa para executá-la de forma controlada: injeta-lhe entradas, recolhe saídas e compara-as com o esperado.

O que sim nasceu em 2026 foi a disciplina: o vocabulário de harness engineering consolidou-se no início desse ano, com a paternidade disputada entre um artigo de Mitchell Hashimoto (fevereiro de 2026) e outro da LangChain (março de 2026).

Anatomia de um harness

  • Laço de controlo. Chamar o modelo, executar o que pedir, devolver-lhe o resultado e repetir até terminar ou até esgotar o limite de passos.
  • Ferramentas. As capacidades reais do agente: terminal, navegador, ficheiros, APIs, bases de dados. Como se descrevem e nomeiam altera o desempenho tanto como o modelo escolhido.
  • Gestão do contexto. O que entra na janela de contexto em cada passo e o que se resume, descarta ou guarda fora. É o gargalo habitual das tarefas longas.
  • Permissões e aprovações. O que o agente pode fazer sem perguntar e o que requer confirmação humana (HITL).
  • Memória e estado. O que sobrevive entre passos e entre execuções, e a capacidade de retomar uma tarefa interrompida. É o problema central dos agentes de longa duração: cada nova sessão começa sem memória da anterior.
  • Observabilidade. Rastros, registos e reprodução passo a passo: sem isto não se pode depurar nem melhorar um agente.

Por que o harness decide o resultado

Um mesmo modelo pode resolver uma tarefa ou falhar nela consoante o arnês que o envolva, e em 2026 há dados que o sustentam:

  • A LangChain melhorou o seu resultado no Terminal-Bench 2.0 de 52,8 % para 66,5 % sem mudar de modelo, trabalhando apenas o harness.
  • Uma auditoria de 254 submissões ao leaderboard do SWE-bench verificou que, para um mesmo modelo, mudar de scaffold move o resultado até 29,8 pontos percentuais, enquanto todo o top 30 cabe em 8,8 pontos.

Daí a recomendação, cada vez mais difundida, de declarar sempre o par modelo-arnês: duas cifras obtidas com o mesmo modelo e andaime diferente não são comparáveis. Para uma empresa a consequência é direta: ao comparar dois produtos de IA, boa parte da diferença não está no modelo —muitas vezes é o mesmo—, mas no harness que alguém construiu à sua volta.

Relação com outros termos

Na prática, a pergunta relevante não é que modelo usa uma plataforma de IA, mas que harness lhe puseram: como controla o laço, que ferramentas expõe, onde pede permissão e o que deixa registado. Contamo-lo com mais detalhe em Harness, o tip do momento que existe há anos.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog