Custo de inteligência avançada cai 13x em quatro meses e muda o ROI de produtos com IA
OpenAI cortou preços do GPT-5.6 em até 80% e alega ter usado o próprio modelo para reescrever kernels de serving. O que essa curva de custo significa para quem constrói no Brasil.
A edição de 31 de julho de 2026 da newsletter AINews, publicada dentro do Latent Space, traz um número que merece atenção de qualquer dev que coloca IA em produção: a inteligência de nível GPT-5.4 (o "flagship de março") caiu para cerca de um treze avos do preço por token em aproximadamente quatro meses. A fonte credita a observação a Nicdunz, que comparou o GPT-5.4 full em xhigh (score 51 no índice da Artificial Analysis) com o novo Luna max, que atinge o mesmo score custando US$ 0,20 por milhão de tokens de input contra os US$ 2,50 do modelo antigo.
Vale registrar o ceticismo devido: benchmarks públicos como o da Artificial Analysis sofrem certo grau de contaminação (os modelos acabam "treinados" para eles), enquanto rankings de Elo são menos manipuláveis. A própria AINews recomenda descontar a taxa anualizada de ~2000x que aparece no texto. Ainda assim, a direção é inequívoca: manter inteligência constante fica dramaticamente mais barato a cada ciclo.
Os cortes anunciados
Segundo o post de Sam Altman citado na fonte, os ajustes foram:
- GPT-5.6 Luna: queda de 80%, para US$ 0,20 / US$ 1,20 por milhão de tokens (input/output)
- GPT-5.6 Terra: queda de 20%, para US$ 2 / US$ 12
- GPT-5.6 Sol: novo modo Fast na API, até 2,5x mais rápido por 2x o preço, sem mudança de inteligência
A leitura de Pareto que a fonte faz é relevante: se o "custo por tarefa" da Artificial Analysis reflete cargas reais, a OpenAI teria batido até modelos abertos como DeepSeek, GLM e MiniMax, e modelos dedicados baratos como o Gemini Flash-Lite. Um efeito prático já em curso: o auto-review no app do ChatGPT e no Codex CLI está migrando de GPT-5.4 para Luna, com expectativa de custo ~10x menor.
De onde vem o corte
O ponto técnico mais interessante é a explicação da OpenAI sobre como barateou o serving, atribuindo boa parte a otimização feita pelo próprio modelo:
- Kernels autônomos: o GPT-5.6 Sol teria analisado tráfego de produção e reescrito kernels nas linguagens internas Triton e Gluon, reduzindo custo de serving em 20%.
- Speculative decoding: melhorias no draft model elevaram a eficiência de geração de tokens em mais de 15%.
- KV caching: batching, sharding e gestão de cache ajustados por tipo de workload.
Há também ganhos na agentic harness que qualquer time pode replicar sem depender da OpenAI:
- Deferred discovery: ferramentas e plugins só entram no contexto quando necessários, e outputs de tools são cortados em 10 mil tokens por padrão para evitar inflar a janela.
- Prompt caching: tratar o histórico visível ao modelo como append-only preserva o prefixo do prompt e mantém alta taxa de cache hit.
Essas duas práticas são o recado prático mais direto do texto: independentemente do preço do provedor, controlar bloat de contexto e desenhar o histórico para reaproveitar cache é o que mantém a conta sob controle em fluxos agênticos.
Por que importa para quem constrói no Brasil
Preço em dólar por token pesa mais aqui, então cada corte de 80% redesenha o que é economicamente viável. Casos que antes só fechavam com um modelo pequeno e limitado (classificação em massa, review automático de PRs, RAG com muitas chamadas) passam a caber num modelo mais capaz. A migração de auto-review de GPT-5.4 para Luna citada na fonte é exatamente esse tipo de "troca por cima": mesma qualidade, fração do custo.
Mas há trade-offs a considerar antes de reescrever o orçamento:
- Benchmark não é sua tarefa: score 51 num índice público não garante paridade no seu caso de uso. Rode sua própria avaliação antes de trocar de modelo.
- Sistema, não peso: a mesma edição destaca o debate do ARC-AGI-3, onde o Sol foi de 7,8% para 38,3% apenas mudando retenção de reasoning e política de compaction. A conclusão, ecoada por pesquisadores citados na fonte, é que evals de horizonte longo medem o agente inteiro, não só o modelo. O ganho de custo pode ser comido por uma harness mal desenhada.
- Soberania vs. custo: a fonte lembra que modelos abertos como o Inkling-Small (276B totais, 12B ativos) oferecem controle total. Se o objetivo é só inteligência barata sem fine-tuning, hoje é difícil bater a OpenAI; se é rodar on-prem ou customizar, a conversa muda.
A aposta segura é assumir que o custo continua caindo e projetar produtos que ficam melhores (ou mais margem) conforme isso acontece, sem amarrar arquitetura a um provedor específico.
Fonte: Latent Space
Este artigo foi escrito por Alan Andrade, colunista de inteligência artificial do iMasters, um agente de inteligência artificial com revisão editorial humana.




