NOTÍCIA

Tokens fora de controle: custo que sobe enquanto o time celebra o deploy

Tokens viraram a linha de custo que ninguém provisionou no orçamento. A fatura da nuvem chega alta e ninguém sabe explicar por quê.

Tokens fora de controle: custo que sobe enquanto o time celebra o deploy
Imagem: Redação iMasters

Tokens viraram a linha de custo que ninguém provisionou no orçamento. A fatura da nuvem chega alta e ninguém sabe explicar por quê. Esse roteiro se repete em times que subiram IA para produção neste ano. Um relatório da Accenture divulgado em 29 de julho de 2026 mostra o tamanho do problema. Segundo o estudo, muitas empresas ampliam o uso de modelos sem projetar o consumo de tokens. Por isso, o assunto saiu da engenharia e caiu no colo do financeiro.

Tokens são a unidade de custo que o seu código emite

Cada chamada ao modelo consome tokens na entrada e na saída. Portanto, cada retry, cada prompt inflado e cada log verboso viram dinheiro. Quando o produto usa agentes, o volume cresce em outra escala. Afinal, um agente encadeia várias chamadas para resolver uma única tarefa. A Accenture estima saltos de milhares para milhões e até trilhões de unidades conforme a aplicação amadurece. Internamente, a consultoria processa cerca de 8,7 trilhões de tokens por semana.

A fatura consolidada esconde quem realmente gasta

Lan Guan, diretora de IA e Dados da Accenture, contou à Fortune que essa conversa aparece toda semana. Muitos executivos recebem apenas o total da nuvem, sem quebra por área, produto ou equipe. Ou seja, existe consumo sem observabilidade. Um caso citado no estudo envolve uma varejista com recomendação por IA em lojas piloto. As vendas subiram, no entanto a conta mensal chegou à casa dos milhões de dólares. Ninguém tinha projetado esse número antes do rollout.

19% dos usuários responderam por 80% da conta

Uma análise interna da própria Accenture escancarou o efeito cauda longa. O uso de uma ferramenta de IA cresceu 113 vezes em dez semanas. Além disso, 19% dos usuários concentraram cerca de 80% dos custos. Segundo Guan, o comportamento individual multiplicado por toda a força de trabalho empurra a conta para cima em silêncio. Para o time de engenharia, o recado é prático. Sem atribuição por usuário e por feature, a otimização vira chute.

Roteamento de modelos derruba o gasto de Tokens para um sexto

A Accenture desenvolveu um sistema que direciona cada tarefa ao modelo mais adequado. Como resultado, o custo cai para cerca de um sexto do valor gasto apenas com os modelos mais avançados. Na prática, isso significa hierarquia de modelos dentro da sua arquitetura. Classificação simples e extração de campos rodam em modelos pequenos. Raciocínio longo e geração de código complexo ficam para os modelos grandes. Assim, o modelo caro atende só o que exige capacidade extra.

Tokenomics: o vocabulário que liga consumo a valor

A consultoria chama de tokenomics a disciplina que liga uso de IA à geração de valor. O contexto ajuda a explicar a urgência. O Goldman Sachs projeta mais de US$ 800 bilhões em investimentos globais ligados à IA em 2026. Ainda assim, apenas 23% dos executivos entrevistados afirmam obter valor amplo e sustentável com a tecnologia. Enquanto a fatura escala rápido, o retorno demora. Logo, medir custo por tarefa entregue vale mais do que medir custo por mês.

Tokens: As três etapas que a Accenture recomenda ao time técnico

O relatório propõe um caminho em três movimentos. Primeiro, identificar onde ocorre o consumo de tokens. Depois, otimizar a arquitetura tecnológica. Por fim, manter monitoramento contínuo do gasto. Guan lembra que finanças, tecnologia e segurança precisam atuar juntas nesse controle.

O que instrumentar no seu código ainda nesta sprint

Comece pela telemetria. Registre tokens de entrada e saída em cada chamada, com identificador de usuário, feature e ambiente. Em seguida, marque o custo estimado no mesmo evento. Cache de prompts e de respostas semelhantes reduz chamada repetida. Além disso, respostas estruturadas cortam tokens de saída desperdiçados. Limite o histórico enviado no contexto e resuma conversas longas. Também vale criar teto de gasto por usuário e alerta por variação diária. Testes automatizados em ambiente de desenvolvimento merecem modelos baratos. Assim, o gasto de laboratório para de competir com o gasto de produção.

Previsibilidade na IA começa no dado por chamada

Guan afirma que escalabilidade de IA cabe no orçamento quando existe infraestrutura para isso. A leitura para quem escreve código é objetiva. Token é recurso mensurável, então precisa de métrica, painel e limite. Quanto mais cedo essa instrumentação entra no projeto, menor a surpresa na fatura. E quando o CFO perguntar de onde veio o valor, o time terá a resposta pronta.

Acompanhe nosso perfil no Instagram! 

Matérias especiais e reportagens conduzidas internamente pela Redação iMasters. Acompanhe no Twitter @imasters e no Instagram/Threads @portalimasters

Ver perfil