Durante 2026 a palavra harnessHarnessA infraestrutura que rodeia o modelo e o torna um agente: ciclo, ferramentas, contexto, permissões e registos infiltrou-se em todas as conversas sobre agentes de IAAgentes de IASistemas que executam tarefas multi-passo sem supervisão constante. Fala-se do «harness do Claude Code», de «mudar de harness» ou de que «o harness importa mais do que o modelo». Até nasceu uma disciplina com nome próprio, harness engineering, cuja paternidade é disputada entre um artigo de Mitchell Hashimoto de fevereiro de 2026 e outro da LangChain de março. Soa a termo acabado de inventar, mas não é: os eletricistas de automóvel já montam harnesses há um século e os programadores escrevem-nos há décadas. A única novidade é aquilo a que os aplicamos.
O que é um harness, numa frase
A definição mais clara é a que a Anthropic usa no seu guia de avaliação de agentes: «um harness de agente (ou scaffoldScaffoldA estrutura de código que conecta e orquestra um agente de IA) é o sistema que permite a um modelo atuar como agente: processa as entradas, orquestra as chamadas às ferramentas e devolve os resultados». Dito de forma breve: é tudo o que rodeia o modelo para que possa trabalhar. O ciclo que decide quando voltar a chamá-lo, as ferramentas que pode usar, o contexto que lhe chega em cada passo, as permissões que o limitam e os registos que documentam o que fez.
A LangChain resume-o com uma equação que se tornou popular este ano: agente = modelo + harness. Um modelo em bruto não é um agente; torna-se um quando um arnês lhe dá estado, execução de ferramentas, ciclos de retroalimentação e limites que se podem fazer cumprir.
A imagem que melhor o explica: o modelo é o motor e o harness é o resto do carro. Chassis, transmissão, travões, direção, painel de instrumentos. Um motor excelente sobre uma mesa não te leva a lado nenhum, e o mesmo motor rende de forma muito diferente consoante o veículo onde o montas.

De onde vem o nome
Harness significa arnês: as correias que seguram um animal de tração, ou o equipamento que impede a queda de quem trabalha em altura. A engenharia já se tinha apropriado da palavra duas vezes antes de esta chegar à inteligência artificial.
A cablagem de fios
Na indústria automóvel e na aviação, um wiring harness é a cablagem que percorre o veículo e liga o motor ao painel, às luzes, aos sensores e à unidade de controlo: cabos agrupados e atados com uma bainha resistente, terminados com conectores. Popularizou-se na indústria automóvel nos anos vinte, quando ficou claro que os cabos soltos não sobreviviam à vibração, à abrasão e à humidade. Um avião moderno transporta no seu interior cablagens que, esticadas, somariam quilómetros.
O aspeto interessante para a nossa analogia é que o arnês não faz nada por si só: liga, ordena e protege o que já existe. Sem ele, nenhuma peça comunica com as outras.

O arnês de testes
Em software, um test harness é el conjunto de stubs e drivers que envolve uma parte do programa para poder executá-la de forma controlada: injeta entradas, recolhe saídas, compara-as com o esperado e gera um relatório. É infraestrutura de simulação que permite automatizar os testes, e é vocabulário corrente na engenharia de software há décadas.
É exatamente a mesma ideia que hoje se aplica aos agentes: uma estrutura externa que segura a peça, a alimenta e observa o que esta faz. Quando os modelos de linguagem começaram a usar ferramentas e a encadear passos, era necessário um nome para o código que os envolve. O termo estava à espera no armário.
Dois sentidos que convém não misturar
- Harness de execução (agent harness): o ambiente que faz o agente funcionar em produção. É o sentido dominante e aquele que se usa quando alguém diz «o harness do Claude Code». A Microsoft converteu-o inclusivamente em nomenclatura oficial de produto: na sua documentação de setembro de 2026 define o harness como «a estrutura de execução que converte um modelo de linguagemLLM (Modelo de Linguagem de Grande Escala)Modelo de linguagem grande, a base dos chatbots atuais num agente capaz de trabalhar».
- Harness de avaliação (evaluation harness): a estrutura que executa uma bateria de testes contra um modelo para o medir de forma reproduzível. É o herdeiro direto do test harness clássico.
São primos direitos: em ambos os casos existe uma estrutura externa que segura o modelo e observa o seu comportamento. E em ambos os casos, quem constrói o arnês condiciona o resultado.
Por que razão o harness decide el resultado
Esta é a parte que interessa a uma empresa e, em 2026, deixou de ser uma opinião para se tornar um dado.
Mesmo modelo, arnês diferente, resultado diferente. Em fevereiro de 2026, a LangChain publicou uma experiência limpa: congelaram o modelo (GPT-5.2-Codex) e trabalharam apenas o harness. A sua pontuação no Terminal-Bench 2.0 passou dos 52,8 % para os 66,5 %, quase catorze pontos, saltando de fora do top 30 para o top 5 da classificação. O seu próprio resumo: «só mudámos o harness». O que tocaram foram ciclos de autoverificação, injeção de contexto do ambiente, deteção de ciclos infinitos e análise automática de rastreios. Nada disso é o modelo.
As tabelas de classificação medem pares, não modelos. Um estudo de setembro de 2026 auditou 254 submissões ao leaderboard do SWE-bench e encontrou o dado mais eloquente do ano: para um mesmo modelo, mudar de scaffold move o resultado até 29,8 pontos percentuais, enquanto todo o top 30 cabe em 8,8 pontos. Por outras palavras: a diferença entre arneses é mais de três vezes maior do que a distância entre os trinta melhores sistemas do mundo. Os seus autores pedem que se declare sempre o par modelo-arnês.
Um artigo de posição de maio de 2026 di-lo sem rodeios: o harness de execução «é muitas vezes um determinante mais forte do desempenho do agente do que o modelo que envolve», e enquanto não se publicar que arnês se usou, as comparações de leaderboard deveriam ser tratadas como incompletas e potencialmente enganadoras. A própria Anthropic formula-o de forma mais simples: «quando avaliamos "um agente", estamos a avaliar o harness e o modelo a trabalharem juntos».
E custa dinheiro. Numa experiência da Anthropic de março de 2026 sobre desenvolvimento de aplicações de longa duração, o mesmo encargo lançado sem arnês foi resolvido em 20 minutos e 9 dólares, enquanto que com o arnês completo demorou quase seis horas e custou cerca de 200 dólares. A diferença não é o preço: é que o primeiro era um rascunho e o segundo, uma aplicação terminada. O arnês é o que transforma uma demo em trabalho.
A consequência prática é incómoda para o marketing do setor: quando comparamos dois produtos de IA, boa parte da diferença não está no modelo, que muitas vezes é literalmente o mesmo. O modelo compra-se; o arnês constrói-se.
Anatomia de um harness

Um harness digno desse nome resolve seis coisas:
- O ciclo. Chamar o modelo, executar o que pedir, devolver-lhe o resultado e repetir até terminar ou até esgotar o limite. Fácil de descrever, difícil de fazer bem: é aqui que se decidem os custos e os bloqueios.
- As ferramentas. Aquilo que o agente pode fazer de verdade: ler correio, consultar o ERP, criar um evento, abrir uma ocorrência. A forma como se descrevem e se nomeiam muda o desempenho tanto como mudar de modelo.
- O contexto. O que entra na janela de contexto em cada passo e o que se resume, se descarta ou se guarda fora. É o gargalo de todas as tarefas longas.
- As permissões. O que pode fazer sem perguntar e o que exige confirmação humana. É a diferença entre um assistente útil e um incidente.
- A memória e o estado. O que sobrevive entre passos e entre execuções, e se uma tarefa interrompida é retomada onde ficou. A Anthropic identifica precisamente aqui o problema central dos agentes de longa duração: trabalham em sessões separadas e cada sessão nova começa sem recordação do anterior.
- A observabilidade. Rastreios, registos e reprodução passo a passo. Sem isto não se depura um agente: adivinha-se.
Há um sétimo detalhe pouco intuitivo que merece menção: os agentes são maus juízes do seu próprio trabalho. Quando se lhes pede que avaliem o que acabaram de produzir, tendem a elogiá-lo mesmo que a qualidade seja medíocre. Por isso os bons harnesses separam o agente que trabalha do agente que julga.
Se quiseres a versão curta e ligada ao resto do vocabulário, tem-la na ficha Harness da NAiOS Wiki, junto de Scaffold, Loop engineering e Guardrails.
Porque é que isto justifica pedir permissão
Há uma razão forte por trás da mania dos arneses sérios de pedir confirmação. O benchmark τ-bench, que mede agentes a conversar com clientes e a aplicar regras de negócio, descobriu que agentes de topo resolviam menos de 50 % das tarefas, e que ao repetir a mesma tarefa oito vezes acertavam as oito em menos de 25 % dos casos. A conclusão não é que os agentes não sirvam: é que a consistência não é garantida, e por isso as ações com consequências não deveriam ser executadas sem alguém a supervisionar.
Como a NAiOS gere o harness
Na NAiOS não usamos um modelo: usamos o melhor disponível em cada momento e mudamo-lo quando aparece um melhor. O que não muda é o arnês. Estes são os módulos que o compõem.
NAiOS Agents: o loop
NAiOS Agents é a camada que converte o chat reativo em agentes que trabalham sozinhos. Executa um loop durável plan→act→observe com um worker de fundo, de modo que uma tarefa longa sobrevive a um reinício e é retomada onde estava: precisamente o problema de memória entre sessões de que falávamos. Inclui execução manual ou agendada (por cron ou por evento), memória e base de conhecimento por agente, delegação a outros agentes, workspace isolado e uma timeline reproduzível para ver, passo a passo, o que pensou e o que fez. Isso último é a observabilidade: quando algo corre de forma estranha, observa-se, não se adivinha.
Connectors e MCP: as ferramentas
Um agente sem ferramentas é um chat com pretensões. NAiOS Connectors liga por OAuth mais de mil serviços — Gmail, Slack, GitHub, Calendar, Notion e companhia — e expõe-nos como ferramentas deny-by-default: apenas chegam ao modelo as dos conectores que ativou, isoladas por utilizador. NAiOS MCP faz o mesmo com qualquer servidor MCP que registe, classificando cada ferramenta como de leitura ou sensível.
Knowledge Base: o contexto
A RAG Knowledge Base alimenta a janela de contextoJanela de ContextoQuantidade de texto que um modelo pode recordar numa conversa com o que a sua empresa sabe: documentos, folhas de cálculo, catálogos, áudio e vídeo, com pesquisa semântica e consultas SQL geradas por IA. Um agente que não pode consultar o seu conhecimento improvisa; um que pode, responde com os seus dados.
HITL: as permissões
A regra é fixa em toda a plataforma: ler é livre, agir pede permissão. As ações com efeitos —enviar um e-mail, publicar, escrever num serviço externo, emitir uma fatura— param num cartão de confirmação que mostra o que vai ser feito e com que conta. As ferramentas de alto risco mantêm essa confirmação mesmo em agentes auto-aprovados. De onde vem essa forma de trabalhar contamos em El origen de HITL.
Quatro casos de uso reais
- O fecho da manhã. Um agente programado às 7:00 revê o e-mail da noite com NAiOS Mail, classifica o urgente, cruza cada remetente com o CRM e deixa-te um resumo com rascunhos de resposta preparados. Nenhum é enviado sem o teu clique.
- Atendimento ao cliente que sabe afastar-se. Em NAiOSOmni, um agente responde por WhatsApp ou Telegram com o conhecimento da tua KB e pausa-se automaticamente assim que uma pessoa da equipa entra na conversa. O harness decide quando o agente se cala.
- Reuniões que deixam tarefas, não notas. Meeting Agent entra na videochamada, transcreve com diarização e extrai resumo e action items; o agente converte-os em tarefas atribuídas. Todo o trabalho aborrecido de depois da reunião, feito.
- Vigilância contínua do negócio. Um agente recorrente revê todas as noites a tesouraria, stock ou campanhas ativas e avisa apenas quando algo sai do normal. Vigia, não age: a decisão continua a ser tua.
Como saber se a tua plataforma tem um bom harness
Quatro perguntas para qualquer demo, incómodas de responder se o harness for fraco:
- Se a tarefa for interrompida a meio, é retomada sozinha ou é preciso começar do zero?
- Posso ver, passo a passo, o que o agente fez na semana passada e com que dados?
- Que ações pode executar sem me perguntar, e quem decide essa lista?
- Se amanhã sair um modelo melhor, posso mudá-lo sem refazer as minhas automatizações?
Quando mudas de modelo e tudo continua a funcionar, é porque tinhas um harness. Quando mudas de modelo e metade do sistema se parte, é porque tinhas um prompt com sorte.
Em resumo
- O harness é o ambiente que rodeia o modelo: ciclo, ferramentas, contexto, permissões, memória e rastreios. Agente = modelo + harness.
- O nome vem do arnês: a cablagem de um veículo e o test harness do software clássico. O que nasceu em 2026 é a disciplina, não a palavra.
- Os dados deste ano são contundentes: mesmo modelo e diferente arnês alteram o resultado mais do que escolher outro modelo.
- O modelo compra-se e muda-se; o arnês constrói-se, e aí está a diferença real entre produtos.
- Na NAiOS esse arnês tem nome e módulos: Agents para o ciclo, Connectors e MCPModel Context Protocol (MCP)Protocolo padrão para que os modelos se conectem com ferramentas externas para as ferramentas, Knowledge Base para o contexto e HITL para as permissões.
Fontes
- Anthropic, Demystifying evals for AI agents — 9 de janeiro de 2026. Definição de agent harness e por que razão uma avaliação mede sempre o modelo e o arnês em conjunto.
- LangChain, Improving Deep Agents with harness engineering — 17 de fevereiro de 2026. De 52,8 % para 66,5 % no Terminal-Bench 2.0 sem alterar o modelo.
- Anthropic, Harness design for long-running application development — 24 de março de 2026. Custo e duração com e sem arnês, e por que razão convém separar quem trabalha de quem julga.
- LangChain, The Anatomy of an Agent Harness — 10 de março de 2026. «Agente = modelo + harness» e as peças que o compõem.
- Zhang et al., Stop Comparing LLM Agents Without Disclosing the Harness — arXiv, 7 de maio de 2026. O arnês como determinante do desempenho acima do modelo.
- Liu et al., Coding Agents Have Converged — arXiv, 15 de setembro de 2026. Auditoria de 254 submissões ao SWE-bench: 29,8 pontos de variação por arnês face a 8,8 pontos de todo o top 30.
- Microsoft, Agent Harness (Microsoft Agent Framework) — atualizado em setembro de 2026. O harness como conceito de produto documentado.
- Yao et al., τ-bench — arXiv, 2024. Fiabilidade dos agentes ao repetir a mesma tarefa.





