NOTÍCIA

Tokens fora de controle: custo que sobe enquanto o time celebra o deploy

Tokens viraram a linha de custo que ninguém provisionou no orçamento. A fatura da nuvem chega alta e ninguém sabe explicar por quê.

Tokens fora de controle: custo que sobe enquanto o time celebra o deploy
Imagem: Redação iMasters

Tokens viraram a linha de custo que ninguém provisionou no orçamento. A fatura da nuvem chega alta e ninguém sabe explicar por quê. Esse roteiro se repete em times que subiram IAInteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI para produção neste ano. Um relatório da Accenture divulgado em 29 de julho de 2026 mostra o tamanho do problema. Segundo o estudo, muitas empresas ampliam o uso de modelos sem projetar o consumo de tokens. Por isso, o assunto saiu da engenharia e caiu no colo do financeiro.

Tokens são a unidade de custo que o seu código emite

Cada chamada ao modelo consome tokens na entrada e na saída. Portanto, cada retry, cada prompt inflado e cada log verboso viram dinheiro. Quando o produto usa agentes, o volume cresce em outra escala. Afinal, um agente encadeia várias chamadas para resolver uma única tarefa. A Accenture estima saltos de milhares para milhões e até trilhões de unidades conforme a aplicação amadurece. Internamente, a consultoria processa cerca de 8,7 trilhões de tokens por semana.

A fatura consolidada esconde quem realmente gasta

Lan Guan, diretora de IA e Dados da Accenture, contou à Fortune que essa conversa aparece toda semana. Muitos executivos recebem apenas o total da nuvem, sem quebra por área, produto ou equipe. Ou seja, existe consumo sem observabilidadeObservabilidade11 conteúdosObservabilidade para APIs: os desafios e benefícios dessa abordagemDev (Back & Front) · jan 2025Falhas em Observabilidade afetam os Apps e a Segurança das OrganizaçõesDev (Back & Front) · nov 2023ADK Java 1.0: O Google quer que você pare de gambiarra Python no seu backendMarketing Tech · abr 2026Ver tudo em DevSecOps . Um caso citado no estudo envolve uma varejista com recomendação por IA em lojas piloto. As vendas subiram, no entanto a conta mensal chegou à casa dos milhões de dólares. Ninguém tinha projetado esse número antes do rollout.

19% dos usuários responderam por 80% da conta

Uma análise interna da própria Accenture escancarou o efeito cauda longa. O uso de uma ferramenta de IA cresceu 113 vezes em dez semanas. Além disso, 19% dos usuários concentraram cerca de 80% dos custos. Segundo Guan, o comportamento individual multiplicado por toda a força de trabalho empurra a conta para cima em silêncio. Para o time de engenharia, o recado é prático. Sem atribuição por usuário e por feature, a otimização vira chute.

Roteamento de modelos derruba o gasto de Tokens para um sexto

A Accenture desenvolveu um sistema que direciona cada tarefa ao modelo mais adequado. Como resultado, o custo cai para cerca de um sexto do valor gasto apenas com os modelos mais avançados. Na prática, isso significa hierarquia de modelos dentro da sua arquitetura. Classificação simples e extração de campos rodam em modelos pequenos. Raciocínio longo e geração de código complexo ficam para os modelos grandes. Assim, o modelo caro atende só o que exige capacidade extra.

Tokenomics: o vocabulário que liga consumo a valor

A consultoria chama de tokenomics a disciplina que liga uso de IA à geração de valor. O contexto ajuda a explicar a urgência. O Goldman Sachs projeta mais de US$ 800 bilhões em investimentos globais ligados à IA em 2026. Ainda assim, apenas 23% dos executivos entrevistados afirmam obter valor amplo e sustentável com a tecnologia. Enquanto a fatura escala rápido, o retorno demora. Logo, medir custo por tarefa entregue vale mais do que medir custo por mês.

Tokens: As três etapas que a Accenture recomenda ao time técnico

O relatório propõe um caminho em três movimentos. Primeiro, identificar onde ocorre o consumo de tokens. Depois, otimizar a arquitetura tecnológica. Por fim, manter monitoramento contínuo do gasto. Guan lembra que finanças, tecnologia e segurança precisam atuar juntas nesse controle.

O que instrumentar no seu código ainda nesta sprint

Comece pela telemetria. Registre tokens de entrada e saída em cada chamada, com identificador de usuário, feature e ambiente. Em seguida, marque o custo estimado no mesmo evento. Cache de prompts e de respostas semelhantes reduz chamada repetida. Além disso, respostas estruturadas cortam tokens de saída desperdiçados. Limite o histórico enviado no contexto e resuma conversas longas. Também vale criar teto de gasto por usuário e alerta por variação diária. Testes automatizadosTestes automatizados4 conteúdosComo migrei meus testes automatizados de Java para Ruby… Será que fiz bem?Dev (Back & Front) · jun 2019TDD em Nodejs: conhecendo o JestDev (Back & Front) · mar 2019Arquitetura Hexagonal na prática com exemplos em PythonDev (Back & Front) · mai 2025Ver tudo em Dev (Back & Front) em ambiente de desenvolvimento merecem modelos baratos. Assim, o gasto de laboratório para de competir com o gasto de produção.

Previsibilidade na IA começa no dado por chamada

Guan afirma que escalabilidade de IA cabe no orçamento quando existe infraestrutura para isso. A leitura para quem escreve código é objetiva. Token é recurso mensurável, então precisa de métrica, painel e limite. Quanto mais cedo essa instrumentação entra no projeto, menor a surpresa na fatura. E quando o CFO perguntar de onde veio o valor, o time terá a resposta pronta.

Acompanhe nosso perfil no Instagram! 

Matérias especiais e reportagens conduzidas internamente pela Redação iMasters. Acompanhe no Twitter @imasters e no Instagram/Threads @portalimasters

Ver perfil