NAiOS IconNAiOS Logo
Voltar ao blogTransformação Digital

Harness, o termo do momento que já existe há anos

O harness é tudo o que rodeia o modelo para que possa agir: o ciclo, as ferramentas, o contexto, as permissões e os registos. O nome vem do chicote de cabos de um carro e do test harness do software clássico; o que nasceu em 2026 foi a disciplina. Porque decide o resultado mais do que o modelo, e como a NAiOS o gere.

N
NAiOS.net Team
26 de septiembre de 202613 min de leitura
Compartir:
Un motor aislado junto al mismo motor montado dentro del chasis transparente de un coche, con transmisión, frenos, mazo de cables y cuadro de mandos visibles
Neste artigo
  1. O que é um harness, numa frase
  2. De onde vem o nome
  3. Dois sentidos que convém não misturar
  4. Por que razão o harness decide el resultado
  5. Anatomia de um harness
  6. Porque é que isto justifica pedir permissão
  7. Como a NAiOS gere o harness
  8. Quatro casos de uso reais
  9. Como saber se a tua plataforma tem um bom harness
  10. Em resumo
  11. Fontes

Durante 2026 a palavra harnessHarnessA infraestrutura que rodeia o modelo e o torna um agente: ciclo, ferramentas, contexto, permissões e registos infiltrou-se em todas as conversas sobre agentes de IAAgentes de IASistemas que executam tarefas multi-passo sem supervisão constante. Fala-se do «harness do Claude Code», de «mudar de harness» ou de que «o harness importa mais do que o modelo». Até nasceu uma disciplina com nome próprio, harness engineering, cuja paternidade é disputada entre um artigo de Mitchell Hashimoto de fevereiro de 2026 e outro da LangChain de março. Soa a termo acabado de inventar, mas não é: os eletricistas de automóvel já montam harnesses há um século e os programadores escrevem-nos há décadas. A única novidade é aquilo a que os aplicamos.

O que é um harness, numa frase

A definição mais clara é a que a Anthropic usa no seu guia de avaliação de agentes: «um harness de agente (ou scaffoldScaffoldA estrutura de código que conecta e orquestra um agente de IA) é o sistema que permite a um modelo atuar como agente: processa as entradas, orquestra as chamadas às ferramentas e devolve os resultados». Dito de forma breve: é tudo o que rodeia o modelo para que possa trabalhar. O ciclo que decide quando voltar a chamá-lo, as ferramentas que pode usar, o contexto que lhe chega em cada passo, as permissões que o limitam e os registos que documentam o que fez.

A LangChain resume-o com uma equação que se tornou popular este ano: agente = modelo + harness. Um modelo em bruto não é um agente; torna-se um quando um arnês lhe dá estado, execução de ferramentas, ciclos de retroalimentação e limites que se podem fazer cumprir.

A imagem que melhor o explica: o modelo é o motor e o harness é o resto do carro. Chassis, transmissão, travões, direção, painel de instrumentos. Um motor excelente sobre uma mesa não te leva a lado nenhum, e o mesmo motor rende de forma muito diferente consoante o veículo onde o montas.

Um motor isolado junto ao mesmo motor montado dentro do chassis transparente de um carro, com transmissão, travões, cablagem e painel de instrumentos visíveis
O modelo é o motor; o harness é o carro inteiro. O que notas ao conduzir quase nunca é só o motor.

De onde vem o nome

Harness significa arnês: as correias que seguram um animal de tração, ou o equipamento que impede a queda de quem trabalha em altura. A engenharia já se tinha apropriado da palavra duas vezes antes de esta chegar à inteligência artificial.

A cablagem de fios

Na indústria automóvel e na aviação, um wiring harness é a cablagem que percorre o veículo e liga o motor ao painel, às luzes, aos sensores e à unidade de controlo: cabos agrupados e atados com uma bainha resistente, terminados com conectores. Popularizou-se na indústria automóvel nos anos vinte, quando ficou claro que os cabos soltos não sobreviviam à vibração, à abrasão e à humidade. Um avião moderno transporta no seu interior cablagens que, esticadas, somariam quilómetros.

O aspeto interessante para a nossa analogia é que o arnês não faz nada por si só: liga, ordena e protege o que já existe. Sem ele, nenhuma peça comunica com as outras.

Cablagem automóvel entrançada, com conectores e abraçadeiras, sobre uma bancada de trabalho escura
O wiring harness de um veículo: não faz nada por si só, mas sem ele nenhuma peça comunica com as outras.

O arnês de testes

Em software, um test harness é el conjunto de stubs e drivers que envolve uma parte do programa para poder executá-la de forma controlada: injeta entradas, recolhe saídas, compara-as com o esperado e gera um relatório. É infraestrutura de simulação que permite automatizar os testes, e é vocabulário corrente na engenharia de software há décadas.

É exatamente a mesma ideia que hoje se aplica aos agentes: uma estrutura externa que segura a peça, a alimenta e observa o que esta faz. Quando os modelos de linguagem começaram a usar ferramentas e a encadear passos, era necessário um nome para o código que os envolve. O termo estava à espera no armário.

Dois sentidos que convém não misturar

  • Harness de execução (agent harness): o ambiente que faz o agente funcionar em produção. É o sentido dominante e aquele que se usa quando alguém diz «o harness do Claude Code». A Microsoft converteu-o inclusivamente em nomenclatura oficial de produto: na sua documentação de setembro de 2026 define o harness como «a estrutura de execução que converte um modelo de linguagemLLM (Modelo de Linguagem de Grande Escala)Modelo de linguagem grande, a base dos chatbots atuais num agente capaz de trabalhar».
  • Harness de avaliação (evaluation harness): a estrutura que executa uma bateria de testes contra um modelo para o medir de forma reproduzível. É o herdeiro direto do test harness clássico.

São primos direitos: em ambos os casos existe uma estrutura externa que segura o modelo e observa o seu comportamento. E em ambos os casos, quem constrói o arnês condiciona o resultado.

Por que razão o harness decide el resultado

Esta é a parte que interessa a uma empresa e, em 2026, deixou de ser uma opinião para se tornar um dado.

Mesmo modelo, arnês diferente, resultado diferente. Em fevereiro de 2026, a LangChain publicou uma experiência limpa: congelaram o modelo (GPT-5.2-Codex) e trabalharam apenas o harness. A sua pontuação no Terminal-Bench 2.0 passou dos 52,8 % para os 66,5 %, quase catorze pontos, saltando de fora do top 30 para o top 5 da classificação. O seu próprio resumo: «só mudámos o harness». O que tocaram foram ciclos de autoverificação, injeção de contexto do ambiente, deteção de ciclos infinitos e análise automática de rastreios. Nada disso é o modelo.

As tabelas de classificação medem pares, não modelos. Um estudo de setembro de 2026 auditou 254 submissões ao leaderboard do SWE-bench e encontrou o dado mais eloquente do ano: para um mesmo modelo, mudar de scaffold move o resultado até 29,8 pontos percentuais, enquanto todo o top 30 cabe em 8,8 pontos. Por outras palavras: a diferença entre arneses é mais de três vezes maior do que a distância entre os trinta melhores sistemas do mundo. Os seus autores pedem que se declare sempre o par modelo-arnês.

Um artigo de posição de maio de 2026 di-lo sem rodeios: o harness de execução «é muitas vezes um determinante mais forte do desempenho do agente do que o modelo que envolve», e enquanto não se publicar que arnês se usou, as comparações de leaderboard deveriam ser tratadas como incompletas e potencialmente enganadoras. A própria Anthropic formula-o de forma mais simples: «quando avaliamos "um agente", estamos a avaliar o harness e o modelo a trabalharem juntos».

E custa dinheiro. Numa experiência da Anthropic de março de 2026 sobre desenvolvimento de aplicações de longa duração, o mesmo encargo lançado sem arnês foi resolvido em 20 minutos e 9 dólares, enquanto que com o arnês completo demorou quase seis horas e custou cerca de 200 dólares. A diferença não é o preço: é que o primeiro era um rascunho e o segundo, uma aplicação terminada. O arnês é o que transforma uma demo em trabalho.

A consequência prática é incómoda para o marketing do setor: quando comparamos dois produtos de IA, boa parte da diferença não está no modelo, que muitas vezes é literalmente o mesmo. O modelo compra-se; o arnês constrói-se.

Anatomia de um harness

Diagrama tridimensional de um ciclo de agente: quatro painéis em círculo (planear, ferramentas, observar e aprovação humana) ligados por setas em redor de uma esfera que representa o modelo
O ciclo: planear, usar ferramentas, observar o resultado e pedir permissão quando é preciso. O modelo está no centro, mas não é o circuito.

Um harness digno desse nome resolve seis coisas:

  • O ciclo. Chamar o modelo, executar o que pedir, devolver-lhe o resultado e repetir até terminar ou até esgotar o limite. Fácil de descrever, difícil de fazer bem: é aqui que se decidem os custos e os bloqueios.
  • As ferramentas. Aquilo que o agente pode fazer de verdade: ler correio, consultar o ERP, criar um evento, abrir uma ocorrência. A forma como se descrevem e se nomeiam muda o desempenho tanto como mudar de modelo.
  • O contexto. O que entra na janela de contexto em cada passo e o que se resume, se descarta ou se guarda fora. É o gargalo de todas as tarefas longas.
  • As permissões. O que pode fazer sem perguntar e o que exige confirmação humana. É a diferença entre um assistente útil e um incidente.
  • A memória e o estado. O que sobrevive entre passos e entre execuções, e se uma tarefa interrompida é retomada onde ficou. A Anthropic identifica precisamente aqui o problema central dos agentes de longa duração: trabalham em sessões separadas e cada sessão nova começa sem recordação do anterior.
  • A observabilidade. Rastreios, registos e reprodução passo a passo. Sem isto não se depura um agente: adivinha-se.

Há um sétimo detalhe pouco intuitivo que merece menção: os agentes são maus juízes do seu próprio trabalho. Quando se lhes pede que avaliem o que acabaram de produzir, tendem a elogiá-lo mesmo que a qualidade seja medíocre. Por isso os bons harnesses separam o agente que trabalha do agente que julga.

Se quiseres a versão curta e ligada ao resto do vocabulário, tem-la na ficha Harness da NAiOS Wiki, junto de Scaffold, Loop engineering e Guardrails.

Porque é que isto justifica pedir permissão

Há uma razão forte por trás da mania dos arneses sérios de pedir confirmação. O benchmark τ-bench, que mede agentes a conversar com clientes e a aplicar regras de negócio, descobriu que agentes de topo resolviam menos de 50 % das tarefas, e que ao repetir a mesma tarefa oito vezes acertavam as oito em menos de 25 % dos casos. A conclusão não é que os agentes não sirvam: é que a consistência não é garantida, e por isso as ações com consequências não deveriam ser executadas sem alguém a supervisionar.

Como a NAiOS gere o harness

Na NAiOS não usamos um modelo: usamos o melhor disponível em cada momento e mudamo-lo quando aparece um melhor. O que não muda é o arnês. Estes são os módulos que o compõem.

NAiOS Agents: o loop

NAiOS Agents é a camada que converte o chat reativo em agentes que trabalham sozinhos. Executa um loop durável plan→act→observe com um worker de fundo, de modo que uma tarefa longa sobrevive a um reinício e é retomada onde estava: precisamente o problema de memória entre sessões de que falávamos. Inclui execução manual ou agendada (por cron ou por evento), memória e base de conhecimento por agente, delegação a outros agentes, workspace isolado e uma timeline reproduzível para ver, passo a passo, o que pensou e o que fez. Isso último é a observabilidade: quando algo corre de forma estranha, observa-se, não se adivinha.

Connectors e MCP: as ferramentas

Um agente sem ferramentas é um chat com pretensões. NAiOS Connectors liga por OAuth mais de mil serviços — Gmail, Slack, GitHub, Calendar, Notion e companhia — e expõe-nos como ferramentas deny-by-default: apenas chegam ao modelo as dos conectores que ativou, isoladas por utilizador. NAiOS MCP faz o mesmo com qualquer servidor MCP que registe, classificando cada ferramenta como de leitura ou sensível.

Knowledge Base: o contexto

A RAG Knowledge Base alimenta a janela de contextoJanela de ContextoQuantidade de texto que um modelo pode recordar numa conversa com o que a sua empresa sabe: documentos, folhas de cálculo, catálogos, áudio e vídeo, com pesquisa semântica e consultas SQL geradas por IA. Um agente que não pode consultar o seu conhecimento improvisa; um que pode, responde com os seus dados.

HITL: as permissões

A regra é fixa em toda a plataforma: ler é livre, agir pede permissão. As ações com efeitos —enviar um e-mail, publicar, escrever num serviço externo, emitir uma fatura— param num cartão de confirmação que mostra o que vai ser feito e com que conta. As ferramentas de alto risco mantêm essa confirmação mesmo em agentes auto-aprovados. De onde vem essa forma de trabalhar contamos em El origen de HITL.

Quatro casos de uso reais

  • O fecho da manhã. Um agente programado às 7:00 revê o e-mail da noite com NAiOS Mail, classifica o urgente, cruza cada remetente com o CRM e deixa-te um resumo com rascunhos de resposta preparados. Nenhum é enviado sem o teu clique.
  • Atendimento ao cliente que sabe afastar-se. Em NAiOSOmni, um agente responde por WhatsApp ou Telegram com o conhecimento da tua KB e pausa-se automaticamente assim que uma pessoa da equipa entra na conversa. O harness decide quando o agente se cala.
  • Reuniões que deixam tarefas, não notas. Meeting Agent entra na videochamada, transcreve com diarização e extrai resumo e action items; o agente converte-os em tarefas atribuídas. Todo o trabalho aborrecido de depois da reunião, feito.
  • Vigilância contínua do negócio. Um agente recorrente revê todas as noites a tesouraria, stock ou campanhas ativas e avisa apenas quando algo sai do normal. Vigia, não age: a decisão continua a ser tua.

Como saber se a tua plataforma tem um bom harness

Quatro perguntas para qualquer demo, incómodas de responder se o harness for fraco:

  • Se a tarefa for interrompida a meio, é retomada sozinha ou é preciso começar do zero?
  • Posso ver, passo a passo, o que o agente fez na semana passada e com que dados?
  • Que ações pode executar sem me perguntar, e quem decide essa lista?
  • Se amanhã sair um modelo melhor, posso mudá-lo sem refazer as minhas automatizações?

Quando mudas de modelo e tudo continua a funcionar, é porque tinhas um harness. Quando mudas de modelo e metade do sistema se parte, é porque tinhas um prompt com sorte.

Em resumo

  • O harness é o ambiente que rodeia o modelo: ciclo, ferramentas, contexto, permissões, memória e rastreios. Agente = modelo + harness.
  • O nome vem do arnês: a cablagem de um veículo e o test harness do software clássico. O que nasceu em 2026 é a disciplina, não a palavra.
  • Os dados deste ano são contundentes: mesmo modelo e diferente arnês alteram o resultado mais do que escolher outro modelo.
  • O modelo compra-se e muda-se; o arnês constrói-se, e aí está a diferença real entre produtos.
  • Na NAiOS esse arnês tem nome e módulos: Agents para o ciclo, Connectors e MCPModel Context Protocol (MCP)Protocolo padrão para que os modelos se conectem com ferramentas externas para as ferramentas, Knowledge Base para o contexto e HITL para as permissões.

Fontes

Hashtags para partilhar:

#NAiOS #IA #TransformaçãoDigital #CRM #Meta #Marketing #AgentesIA #AIAgents #ClaudeCode #Anthropic #Conectores #Connectors

Compartir:

Artigos relacionados

Documentos formales en blanco con un sello en relieve y un código cuadrado junto a un portátil cerrado, con una marca de verificación luminosa encima
Guias Práticas

A sua equipa já usa IA. Consegue provar que a formou?

O artigo 4.º do AI Act aplica-se desde fevereiro de 2025 a quem USA inteligência artificial, não apenas a quem a constrói. O Omnibus digital de julho de 2026 transformou-o numa obrigação de meios: não tem de garantir que a sua equipa sabe, tem de provar que agiu. O que serve como prova, o que não serve, e o curso que criámos para isso.

27 de septiembre de 2026
Ler mais
Verifactu en NAiOS, probado de verdad: la AEAT ya ha aceptado nuestras facturas
Funções Naios

Verifactu no NAiOS, testado de verdade: a AEAT (Agência Tributária espanhola) já aceitou as nossas faturas

No dia 22 de setembro, com um certificado real, o ERP do NAiOS ligou-se ao ambiente de testes da Agencia Tributaria, emitiu uma fatura e a AEAT aceitou-a em 33 segundos; a anulação também. O que foi testado, como se ativa em três passos, a pré-visualização do PDF e por que razão o ERP não está sozinho: CRM, TPV, armazém e chat com a sua aprovação em primeiro lugar.

23 de septiembre de 2026
Ler mais