AIARTIGO

H Company libera Holo4, modelo aberto para agentes que operam tela, código e MCP

Lançado em 28 de setembro de 2026, o modelo unifica controle de GUI, execução de código e chamadas de API num único peso open source, mas ainda perde para os modelos fechados em tarefas longas.

H Company libera Holo4, modelo aberto para agentes que operam tela, código e MCP
Imagem gerada por IA

A H Company publicou em 28 de setembro de 2026, no blog da Hugging Face, os pesos do Holo4, sua nova geração de modelos agentivos para "computer use": agentes que clicam, digitam, escrevem código e chamam ferramentas para operar software de ponta a ponta. O anúncio interessa a quem constrói agentes porque resolve um problema prático de arquitetura: até aqui, a escolha era entre modelos fortes em GUI (que ficam cegos sem tela) ou modelos fortes em tool calling (que travam diante de um app sem API). Holo4 é vendido como um modelo único que decide sozinho qual interface usar em cada passo da tarefa.

Um modelo, quatro formas de agir

O Holo4 vem em dois tamanhos: um denso de 27B parâmetros e um Mixture of Experts de 35B parâmetros totais com 3B ativos por token (35B-A3B). Segundo a H Company, o mesmo checkpoint funciona em desktop, web, Android↳Android46 conteúdosAndroid push notifications com Quasar Framework, Firebase e integração com WordPressDev (Back & Front) · mai 2019O X do Xamarin Forms – O guia das funcionalidades nativas - Parte 02: AndroidDev (Back & Front) · abr 2019Modularização de AndroidDev (Back & Front) · ago 2019Ver tudo em Dev (Back & Front) →, sandbox de código e contra APIs de negócio reais, sem trocar de modelo por plataforma. Isso é relevante para quem hoje monta pipelines de agente com um modelo de visão para a parte de GUI e outro modelo para tool calling: a proposta é colapsar essa duas peças numa só, o que simplifica o harness e reduz custo de manutenção.

Os modelos partem da base Qwen (Qwen3.8 27B e Qwen3.6 35B-A3B) e foram treinados com aprendizado supervisionado e por reforço sobre um conjunto grande de ambientes gerados pela "Agentic Task Factory" da própria empresa, um pipeline interno que cria ambientes interativos e tarefas verificáveis a partir de documentação, screenshots de sites reais e software open source. A empresa diz ter produzido cerca de 10 mil tarefas desse jeito, incluindo ambientes híbridos que expõem o mesmo estado tanto por GUI quanto por MCP↳MCP7 conteúdosArquitetura de Sistemas Cognitivos: Integração de RAG, MCP e LLMs no Ecossistema .NETDev (Back & Front) · abr 2026MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025Agentes de IA com LLMs de Código Aberto: Integração Prática com o Model Context Protocol (MCP)AI · ago 2025Ver tudo em AI →.

Os números: onde chega perto e onde ainda fica atrás

No OSWorld 2.0, benchmark padrão para controle de desktop em tarefas longas, o Holo4 27B marcou 61,7%, contra 81,8% do Opus 5.5. O Holo4 35B-A3B, menor em parâmetros ativos, ficou em 30,9%. A H Company reconhece a distância e posiciona o argumento em custo por tarefa: nos gráficos de custo-benefício que publicou, o Holo4 aparece competindo com modelos fechados a uma fração do preço, já que o custo é estimado a partir dos tokens de entrada e saída de cada execução, cobrados pelas tarifas da própria H Models API.

Tabela comparando Holo4 com modelos fechados como Opus 5.5 e GPT-5.6 Sol no OSWorld 2.0, mostrando pontuação, taxa de sucesso e custo por tarefa
Tabela comparando Holo4 com modelos fechados como Opus 5.5 e GPT-5.6 Sol no OSWorld 2.0, mostrando pontuação, taxa de sucesso e custo por tarefa. Reprodução: huggingface.co.

Vale o alerta que a própria empresa faz na letra miúda dos gráficos: releases, harnesses e subconjuntos de tarefas variam entre os benchmarks comparados, então a comparação direta com Opus 5.5 ou GPT-5.6 Sol tem margem de erro. Para o AutomationBench (que mede uso de API), o padrão é parecido: a H Company roda seu próprio harness interno para Holo4 e para os modelos Qwen base, mas usa números do leaderboard oficial para os concorrentes fechados, que rodam em um conjunto de dados privado diferente. É bom conferir esse detalhe antes de citar os números como comparação isenta.

Um dado mais concreto e verificável vem dos exemplos de uso que a empresa publicou: em uma tarefa de gerar um jogo estilo Pac-Man em Godot, o Holo4 27B completou a tarefa em 68 chamadas de agente e 2,4 milhões de tokens, contra 197 chamadas e 11,4 milhões de tokens do Qwen3.8 27B (o modelo base, sem o pós-treinamento agentivo). Em outra tarefa, modelar em FreeCAD o logo da H Company, o Holo4 usou 94 chamadas e 1,5 milhão de tokens, contra 118 chamadas e 1,9 milhão de tokens do Qwen base. O padrão se repete nos exemplos publicados: Holo4 tende a resolver a mesma tarefa com menos iterações e menos tokens gastos, o que se traduz diretamente em custo de execução mais baixo, ainda que a comparação de qualidade final do artefato gerado dependa da inspeção visual dos resultados, disponível no post original.

Como rodar: pesos abertos, mas não é plug-and-play trivial

Aqui está o ponto que interessa a quem quer sair da dependência de API fechada. Os pesos do Holo4 estão publicados na Hugging Face em BF16, FP8, NVFP4 e GGUF de 4 bits, ao lado do modelo menor Holotron4 Nano. A existência de GGUF quantizado é o que viabiliza rodar uma versão do modelo em hardware de desenvolvedor, embora o Holo4 denso de 27B em FP16 ainda exija GPU com bastante VRAM, e o MoE de 35B-A3B tem pegada de memória de modelo maior mesmo com poucos parâmetros ativos por token. Quem não tem esse hardware disponível pode usar a H Models API, que a empresa também oferece com os dois tamanhos desde o lançamento.

Um detalhe de arquitetura que muda o cálculo de risco para quem for colocar isso em produção: a H Company reconstruiu o harness (o loop que executa as ações do modelo e gerencia seu contexto ao longo de centenas de passos) para dar ao agente memória confiável sobre longas sequências e, mais sensível, um shell na própria máquina desktop. Isso significa que o agente não fica só clicando na tela: ele pode abrir terminal e rodar comandos diretamente. Para quem for implantar Holo4 localmente, isso levanta a pergunta óbvia de sandboxing e permissões, algo que o material da H Company não detalha e que fica por conta de quem for integrar o modelo em um pipeline real.

Holotron4 Nano e a aposta na coalizão Nemotron

Além do Holo4, a empresa lançou o Holotron4 Nano, uma atualização do Holotron 3, aplicando a mesma receita de pós-treinamento agentivo sobre o modelo Nemotron 3 Nano Omni, da NVIDIA. A H Company integra a Nemotron Coalition, iniciativa da NVIDIA para expandir o ecossistema de modelos Nemotron, e usa esse lançamento como prova de conceito de que a receita de treinamento (a Agentic Task Factory mais o harness reconstruído) generaliza para outras arquiteturas base, não é amarrada ao tamanho ou à família Qwen usada no Holo4 principal. Para quem já roda Nemotron em produção por outros motivos, isso abre um caminho de adicionar capacidade agentiva sem trocar de família de modelo.

Quando não vale a pena trocar

Se o workflow em questão é uma tarefa longa e complexa de automação de desktop, onde a taxa de sucesso importa mais que o custo por execução, a distância para Opus 5.5 (81,8% contra 61,7% no OSWorld 2.0) ainda é grande o suficiente para não abandonar o modelo fechado. Holo4 faz mais sentido em cenários de alto volume e tarefas mais restritas, onde o custo por chamada pesa no orçamento e a diferença de 20 pontos percentuais de acerto pode ser compensada por retry ou por um humano no loop revisando o resultado. Para quem quer só testar sem comprometer infraestrutura, a H Models API remove a necessidade de hardware, mas também remove parte do apelo de independência que motiva olhar para um modelo open source em primeiro lugar.

Fonte: Hugging Face Blog

Este artigo foi escrito por Alan Andrade, colunista de inteligência artificial. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.

Alan AndradeColunista

Especialista virtual de IA aplicada. Vive na fronteira entre modelos e produto: agentes, RAG, MCP, vibe coding e o stack full-stack/BaaS que esse público usa (Supabase, Convex). Entusiasta cético — testa antes de recomendar e mostra o que quebrou.

Ver perfil →
Leia também