Todas as notícias
Pesquisa

Harness de IA: o segredo da Nvidia para performance e custo em sistemas agentivos

Estudo da Nvidia demonstra que a estrutura de software que gerencia um modelo de IA, o 'harness', é o principal fator de desempenho e custo para sistemas agentivos complexos.

Por Análise IA NewsAnálise própria IA News22 de agosto de 20265 min de leitura
Harness de IA: o segredo da Nvidia para performance e custo em sistemas agentivos
Foto: TechCrunch

Uma pesquisa da Nvidia demonstrou que a estrutura de software que envolve um modelo de IA, conhecida como 'harness', pode elevar o desempenho de uma tarefa de 30% para 100% de acerto. Ao utilizar um harness customizado, pesquisadores da companhia fizeram com que o modelo Claude Opus 5 atingisse a pontuação máxima no benchmark de raciocínio interativo ARC-AGI-3. Sem essa estrutura, o mesmo modelo obteve apenas 30% de sucesso, que já era o melhor resultado entre todos os modelos testados isoladamente.

O achado evidencia que, para tarefas de longo horizonte, a engenharia em torno do modelo é mais determinante para o sucesso do que a escolha do modelo em si. Essa descoberta tem implicações diretas para empresas que buscam implementar sistemas de IA agentivos, capazes de realizar processos complexos de forma autônoma.

O que é um 'harness' de IA?

Um 'harness' é a camada de software que transforma um modelo de linguagem bruto em um agente funcional, gerenciando memória, contexto, feedback e as ferramentas que o modelo pode utilizar. Adel El Hallak, vice-presidente de produto da unidade de IA da Nvidia, aponta que há uma interpretação comum de que um agente é "quase como uma API do modelo". Ele contrapõe essa visão, afirmando que um agente é um sistema mais completo: "É o modelo. É o andaime em torno do modelo, que chamamos de harness, ou seja, o conjunto de ferramentas que ele utiliza. É o tempo de execução e as habilidades e bibliotecas associadas às quais damos acesso".

Tarefas de longo horizonte são aquelas que exigem uma sequência de decisões para serem concluídas, ao contrário de uma simples resposta a um comando. Um dos maiores desafios da pesquisa em IA agentiva é fazer com que os sistemas executem essas tarefas sem se desviarem ou cometerem erros. Pesquisas anteriores, como uma da Microsoft publicada em abril, mostraram que até mesmo os modelos mais avançados preenchiam documentos com erros ao tentar executar tarefas de edição de forma autônoma. Em outros casos, agentes de IA foram observados deletando arquivos de usuários e até bancos de dados inteiros.

O experimento da Nvidia: 100% de acerto com um 'supervisor'

Gostou desta análise? Receba a próxima primeiro.

Edição diária da IA News com impacto real para empresas — grátis no seu e-mail.

Contexto visual da matéria: Harness de IA: o segredo da Nvidia para performance e custo em sistemas agentivos
Estudo da Nvidia demonstra que a estrutura de software que gerencia um modelo de IA, o 'harness', é o principal fator de desempenho e custo para sistemas agentivos complexos. · Imagem ilustrativa — IA News

Para o seu estudo, a Nvidia desenvolveu um harness próprio, chamado Agentic Variation Operators (AVO). A inovação central foi a introdução de um componente 'supervisor' que atua em conjunto com o agente principal. Esse supervisor tem a função de monitorar o agente que executa o trabalho e intervir caso ele se desvie do objetivo, entre em um caminho sem saída ou comece a repetir ações já tentadas.

“A parte mais interessante foi introduzir um agente supervisor além do seu agente principal que está fazendo o trabalho”, disse El Hallak. Segundo ele, o supervisor “age quase como um CEO para cutucar o agente quando ele se desvia da direção”.

A escolha do benchmark ARC-AGI-3 foi estratégica. Ele consiste em uma série de jogos 2D sem instruções, onde a IA precisa descobrir as regras e como vencer, de forma análoga ao raciocínio humano. Atingir 100% significa que o sistema pode superar os jogos tão bem quanto um humano. O resultado é notável quando comparado ao histórico de outros players. A OpenAI, por exemplo, ficou tão frustrada com os placares de seus modelos no mesmo benchmark (abaixo de 10%) que conduziu uma pesquisa própria no mês anterior. Com ajustes no harness, a OpenAI conseguiu triplicar a pontuação de seus modelos, mas nenhum chegou perto dos 100% alcançados pela Nvidia.

Implicações além do desempenho: custos e controle

A importância do harness não se limita à performance. Uma pesquisa da Databricks, publicada em julho, já havia apontado o impacto dramático dessa estrutura nos custos de operação. Ali Ghodsi, CEO da Databricks, afirmou que a escolha do harness pode até duplicar o custo de utilização de um mesmo modelo. “Você pode escolher o mesmo modelo, mas harnesses diferentes, e obtém um custo significativamente maior se usar o harness errado”, disse ele.

Os principais achados das pesquisas recentes reforçam a importância da arquitetura do sistema:

  • Desempenho com harness: O Claude Opus 5 saltou de 30% para 100% no ARC-AGI-3 com o harness AVO da Nvidia.
  • Desempenho sem harness: Os melhores modelos, incluindo os da OpenAI, registraram pontuações abaixo de 10% no mesmo benchmark antes de otimizações.
  • Impacto no custo: O uso de um harness inadequado pode dobrar (2x) os custos de inferência para um mesmo modelo, segundo a Databricks.
  • Confiabilidade: Sem um harness robusto, modelos de fronteira cometem erros em tarefas de longo horizonte, como edição de documentos, conforme apontado pela Microsoft.

A Nvidia utiliza esses resultados para defender a adoção de harnesses abertos, como os componentes que disponibiliza sob a marca Nemo. A empresa argumenta que um ecossistema aberto oferece mais controle às empresas. “Acreditamos, e estamos demonstrando com o ecossistema, como os harnesses abertos permitem que você gire muito mais botões para aumentar essa precisão”, disse El Hallak. Ele conecta essa abordagem à segurança, afirmando que ter controle sobre o harness, a infraestrutura e o tempo de execução é necessário para fazer o ecossistema avançar de forma segura, em contraste com abordagens mais fechadas.

Análise IA News

A leitura da nossa redação

A pesquisa da Nvidia não é apenas sobre uma nova técnica de engenharia de software; ela sinaliza um ponto de inflexão na maturidade do mercado de IA. O foco está se deslocando da corrida por modelos cada vez maiores e mais potentes para a arte de construir sistemas coesos e eficientes em torno deles. O modelo, que antes era visto como o 'cérebro' e o principal ativo, está se tornando uma commodity substituível. O verdadeiro diferencial competitivo reside na camada de orquestração — o 'harness' —, que dita a confiabilidade, a eficiência de custo e a capacidade de um agente realizar trabalho útil no mundo real.

Esta mudança abre um cenário provável onde surgirá um novo mercado para 'Harness-as-a-Service' (HaaS) e consultorias especializadas em arquitetura agentiva. A competição entre provedores de IA não será mais apenas sobre a acurácia de seus modelos em benchmarks isolados, mas sobre a robustez e flexibilidade de seus frameworks de harness. As empresas que desenvolverem competência interna para projetar ou customizar seus próprios harnesses terão uma vantagem estratégica, pois poderão otimizar a pilha de tecnologia para suas necessidades específicas, combinando diferentes modelos — inclusive de código aberto — para maximizar a relação custo-benefício.

No entanto, existe o risco de um aumento na complexidade de implementação. Construir e gerenciar um harness sofisticado exige conhecimento de engenharia de software que muitas empresas ainda não possuem. Isso pode criar uma nova forma de dependência: em vez de ficarem presas a um modelo, as empresas podem se tornar reféns de plataformas de harness proprietárias e de caixa-preta. A defesa de um ecossistema aberto pela Nvidia é uma tentativa de mitigar esse risco, mas a adoção de padrões abertos dependerá do movimento de todo o setor.

Nos próximos meses, será crucial observar como os grandes laboratórios de IA, como OpenAI e Google, reagirão. Eles irão abrir mais seus próprios sistemas de orquestração para permitir a customização que a Nvidia demonstrou ser tão eficaz, ou irão dobrar a aposta em seus ecossistemas integrados e fechados? A evolução e a adoção de frameworks de harness de código aberto, como o Nemo da Nvidia, serão um termômetro importante para medir para onde o mercado está se movendo. A capacidade de controlar o 'andaime' está se tornando tão ou mais importante do que a qualidade do 'cérebro' que ele suporta.

Contexto para empresários e decisores

No Brasil, o mercado de IA corporativa ainda está em uma fase de maturação onde a discussão predominante gira em torno da escolha do melhor modelo (LLM) para tarefas específicas. O conceito de 'harness' como um componente estratégico distinto ainda é pouco difundido entre os decisores B2B, com a maioria dos projetos dependendo de 'andaimes' customizados e não padronizados criados por consultorias. Embora a otimização de custos seja uma prioridade, a conexão direta entre a arquitetura do sistema agentivo e a fatura final da nuvem não é amplamente compreendida, resultando em potenciais perdas de eficiência. A falta de foco na camada de orquestração pode limitar a escalabilidade e a confiabilidade de automações mais complexas, mantendo muitas iniciativas em estágios de prova de conceito.

Impactos para empresas

  • 1Redução de custos operacionais com IA ao permitir o uso de modelos menos potentes e mais baratos, já que a eficiência advém do harness e não da força bruta do modelo.
  • 2Aumento da confiabilidade de automações de ponta a ponta, o que resulta em menor necessidade de supervisão humana e viabiliza a aplicação de IA em processos de negócio mais críticos.
  • 3Maior controle e segurança sobre as operações de IA, pois um harness aberto e customizável permite auditoria, implementação de regras de negócio específicas e evita o aprisionamento tecnológico (vendor lock-in).
  • 4Aceleração do desenvolvimento de soluções de IA agentiva através do uso de frameworks de harness abertos, permitindo que as equipes de tecnologia foquem na lógica de negócio em vez de reinventar a infraestrutura de base.

Conclusão editorial

A pesquisa da Nvidia materializa uma transição fundamental no desenvolvimento de IA: o sucesso não está no modelo, mas no sistema. Ignorar a engenharia do 'harness' é arriscar a construção de soluções de IA caras, inconfiáveis e frágeis. Líderes de tecnologia devem, portanto, reavaliar suas estratégias e priorizar a arquitetura de orquestração como um pilar central, exigindo de seus parceiros e equipes um foco explícito na flexibilidade, controle e eficiência do harness.

— Redação IA News

Fontes utilizadas

Apuração, análise e conclusão editorial produzidas pela redação do IA News a partir das fontes acima. O conteúdo não reproduz o texto original.