NVIDIA lança Nemotron 3.5 Lightning e transforma roteamento de modelos
A NVIDIA apresentou o Nemotron 3.5 Lightning em 11 de agosto de 2026. O modelo é aberto, compacto e nasceu com um alvo bem definido.

A NVIDIA apresentou o Nemotron 3.5 Lightning em 11 de agosto de 2026. O modelo é aberto, compacto e nasceu com um alvo bem definido: a conta de tokens das empresas. Junto dele veio o Nemo Switchyard, uma biblioteca de código aberto↳Open source71 conteúdosComo o Open Source Está Liberando o Poder da Automação para TodosDev (Back & Front) · out 2025Código aberto: programadores criam software da NASA sem saberDev (Back & Front) · abr 2021N8N: O que é a ferramenta open source que está revolucionando a automação em TI?Dev (Back & Front) · dez 2025Ver tudo em Dev (Back & Front) → para rotear tarefas de agentes. Portanto, o anúncio envolve dois movimentos ao mesmo tempo. Primeiro, um modelo menor que preserva conhecimento de modelos grandes. Depois, uma camada que escolhe qual modelo responde cada chamada.
O que a NVIDIA colocou dentro de um modelo menor
O Nemotron 3.5 Lightning foi desenhado em uma estrutura mais enxuta. Ainda assim, ele mantém boa parte do conhecimento presente em modelos mais robustos. Para quem constrói aplicações, essa é a definição prática de alternativa barata. Kari Briski, responsável pelo software de IA generativa↳IA generativa81 conteúdosIA Generativa: 5 alternativas para começar a usar em 2025AI · jan 2025Gartner Revela o Futuro da IA GenerativaAI · jul 2024IA Generativa: Pesquisa global aponta Brasil como segundo país mais otimista com a tecnologiaAI · mar 2024Ver tudo em AI → para empresas na NVIDIA, resumiu a lógica econômica. De acordo com ela, o desperdício mora no uso de modelos gigantes em tarefas rotineiras. Ou seja, classificar um ticket ou gerar um resumo curto raramente exige o modelo mais caro do catálogo.
Nemo Switchyard: a biblioteca que decide quem atende cada chamada
O Switchyard funciona como um roteador entre modelos. Ele avalia qualidade da resposta, tempo de processamento e preço antes de encaminhar a tarefa. Assim, um mesmo agente pode acionar três modelos diferentes dentro de um único fluxo. Além disso, a biblioteca reduz a exposição de dados proprietários. Na prática, o roteamento vira uma decisão de arquitetura, com métrica e política definidas por você. Por isso, vale tratar o roteador como componente de infraestrutura. Ele precisa de observabilidade↳Observabilidade11 conteúdosObservabilidade para APIs: os desafios e benefícios dessa abordagemDev (Back & Front) · jan 2025Falhas em Observabilidade afetam os Apps e a Segurança das OrganizaçõesDev (Back & Front) · nov 2023ADK Java 1.0: O Google quer que você pare de gambiarra Python no seu backendMarketing Tech · abr 2026Ver tudo em DevSecOps →, testes e fallback, como qualquer serviço crítico.
Por que a NVIDIA construiu o roteador para uso próprio antes de abrir o código
A NVIDIA criou o sistema de roteamento para resolver um problema interno. A empresa queria controlar o volume de tokens consumido pelas próprias aplicações. Ao mesmo tempo, buscava manter a propriedade intelectual sob o próprio teto. Esse detalhe explica bastante coisa sobre o produto final. Afinal, ferramentas nascidas de dor real costumam chegar com decisões mais concretas.
Dados sensíveis e o argumento silencioso a favor dos pesos abertos
Briski destacou outro ponto: a proteção do conhecimento das empresas. Times de segurança cibernética e de ciência dos materiais lidam com informação estratégica. Enviar esse material para um fornecedor que pode virar concorrente gera receio legítimo. Contudo, modelos abertos abrem espaço para outro arranjo. A empresa roda o modelo na própria infraestrutura e treina com dados internos. Como resultado, ganhos de eficiência e de precisão passam a ser medidos dentro de casa.
Meta chega junto e a barreira de entrada cai mais um degrau
O anúncio veio um dia depois do Muse Glimmer, modelo aberto da Meta. A empresa afirma que a ferramenta roda em um Mac ou PC com uma única GPU de consumo. Em outras palavras, experimentar modelo aberto ficou mais barato de novo. Para o desenvolvedor, isso significa protótipo na máquina local e produção com roteamento. Além disso, o ciclo de teste encurta bastante quando o modelo cabe no seu hardware.
Nemotron 4 e a promessa de 1 trilhão de parâmetros NVIDIA
A NVIDIA já trabalha na próxima família aberta, chamada Nemotron 4. Pessoas ligadas ao projeto citadas pelo The Information falam em pelo menos 1 trilhão de parâmetros na maior versão. O treinamento final segue em andamento e ainda sem data oficial. Enquanto isso, o Nemotron 3.5 Lightning cobre o outro extremo da estratégia. Ou seja, um lado mira custo e tarefa específica. O outro mira escala e disputa direta no topo.
Segurança: o assunto que acompanha cada modelo de pesos abertos
A expansão dos pesos abertos trouxe debate sobre uso indevido. Ataques atribuídos a agentes autônomos aqueceram a discussão nos últimos meses. Diante disso, a NVIDIA formou uma coalizão de segurança de IA com outras empresas. A companhia também assinou uma carta aberta em defesa dos modelos de pesos abertos. Para quem publica agentes, a lição prática aparece no dia a dia. Sandbox, permissão mínima e registro de ações seguem como o básico.
US$ 500 bilhões: o dinheiro que sustenta a corrida
A NVIDIA firmou acordos com Apollo, Blackstone, Goldman Sachs e KKR. O objetivo é destinar mais de US$ 500 bilhões em capital para clientes financiarem capacidade computacional. No mesmo movimento, a Intel anunciou captação de US$ 20 bilhões com 210,5 milhões de ações. Portanto, a infraestrutura segue cara e disputada.
O que muda no seu código a partir de agora
Comece medindo o custo por tarefa dentro de cada fluxo. Depois, separe as chamadas em faixas de complexidade. Em seguida, aponte cada faixa para o modelo adequado. Por fim, valide qualidade com um conjunto fixo de casos reais. Se o modelo menor entregar o mesmo resultado, a escolha se resolve sozinha. Caso contrário, o roteador manda a tarefa para cima.
NVIDIA: A pergunta que entra no seu diagrama
NVIDIA e Meta empurram a mesma tese em semanas seguidas. Modelos abertos, menores e ajustáveis ganham espaço no ambiente corporativo. Portanto, o diagrama da sua aplicação ganha um item novo. Qual modelo atende qual chamada? Quem responder isso com dados na mão gasta menos e dorme melhor.
Acompanhe nosso perfil no Instagram!







