AIARTIGO

Claude Opus 5.5 é o novo padrão da Anthropic, mas o corte de 40% no preço não é bem assim

O modelo virou default no Claude Code e no app oficial no mesmo dia em que a OpenAI cortou o preço de GPT-6 Sol e Luna pela metade. Só que a conta de quem roda em produção não fecha tão redonda quanto o anúncio sugere.

Claude Opus 5.5 é o novo padrão da Anthropic, mas o corte de 40% no preço não é bem assim
Imagem gerada por IA

A Anthropic lançou o Claude Opus 5.5 em 22 de setembro de 2026, descrito como "o primeiro modelo da nova família Claude 5.5". O anúncio oficial da empresa promete desempenho "no nível do Claude Fable 5.1 para a maioria das tarefas" e um custo 40% menor que o do Opus 5. No mesmo dia, cerca de uma hora depois, a OpenAI respondeu com GPT-6 Sol e GPT-6 Luna, cada um cerca de 50% mais barato que seus antecessores GPT-5.6. O resumo da newsletter AINews, publicada no Latent Space, chama isso de o dia em que "todo mundo cortou preço em 40-50%" — e é esse recorte, mais do que a corrida por benchmark, que interessa a quem paga a fatura da API todo mês.

O que muda no Claude Code e no app

Opus 5.5 já é o modelo padrão no Claude Code, no app da Claude (incluindo o modo Cowork) e na Claude Platform API, além de estar disponível no Claude Tag para Slack. O esforço padrão passou a ser "medium", descrito pela Anthropic como "comparável ao Fable 5.1 em inteligência, mas mais rápido". Na prática, isso significa que quem já usa Claude Code não precisa trocar nada na configuração: o upgrade acontece por baixo. A Anthropic também aumentou os limites de sessão de 5 horas em 20% e afirma que o preço mais baixo faz esse limite "render 25% a mais". Usuários Pro, Max e Team ganharam um reset de rate-limit acumulado para usar quando quiserem.

Um detalhe técnico que passa batido no hype: trocar o nível de esforço no meio de uma sessão não quebra mais o cache de prompt, a partir do Claude Code v2.1.280. Para quem constrói agentes de longa duração, isso é mais relevante no dia a dia do que o benchmark de lançamento, porque cache quebrado é uma das maiores fontes de custo invisível em pipelines de agente.

A pegadinha no cálculo de custo

A lista de preços da API caiu 20%, de US$ 5/US$ 25 para US$ 4/US$ 20 por milhão de tokens de entrada/saída. Só que o corte de lista não é o corte real de custo por tarefa, e é aí que a análise da Artificial Analysis, citada no resumo do Latent Space, complica a história da Anthropic. No esforço máximo, o Opus 5.5 usa significativamente mais tokens que o Opus 5 para completar a mesma tarefa. A Artificial Analysis decompôs o efeito assim: o aumento de uso de tokens sozinho elevaria o custo por tarefa em cerca de 80%, para US$ 10,51; o corte de 20% no preço base traz isso para US$ 8,41; leituras de cache mais baratas (US$ 0,20) trazem o número final para US$ 5,98 por tarefa do Intelligence Index — praticamente empatado com os US$ 5,86 do Opus 5 no mesmo modo.

Em outras palavras: a economia de 40% anunciada pela Anthropic vale para o esforço padrão (medium), não para o esforço máximo, onde o ganho de custo por tarefa desaparece quase por completo. Isso é um dado concreto para quem está decidindo qual nível de esforço configurar em produção — e reforça um padrão que já apareceu com o Opus 5: rodar no esforço mais alto nem sempre compensa. Um gráfico de codificação agêntica citado no resumo mostra o esforço "xhigh" custando cerca de 2,8 vezes mais que o "medium" para um resultado 3,2 pontos pior. A explicação levantada é que benchmarks como o FrontierCode penalizam mudanças desnecessárias, e esforços mais altos tendem a produzir scope creep — o modelo mexe em mais coisa do que devia. A recomendação prática que circulou entre desenvolvedores que testaram o modelo foi direta: ficar no esforço medium por padrão e reservar o máximo para casos que realmente exigem.

A resposta da OpenAI mudou o cálculo

A OpenAI não deixou o anúncio da Anthropic sozinho no dia. GPT-6 Sol saiu a US$ 2/US$ 10 por milhão de tokens de entrada/saída e GPT-6 Luna a US$ 0,10/US$ 0,50 — ambos cerca de 50% mais baratos que GPT-5.6. Os dois herdam avanços do GPT-6 Astra em coding, uso de computador e alinhamento, segundo a OpenAI, e já rolaram para ChatGPT Work, Codex e a API (Luna também chegou ao app desktop para usuários Free e Go↳Go23 conteúdosEntendendo o Green Tea GC do Go 1.26Dev (Back & Front) · mai 2026Função recursiva em Go para acessar valores em mapas aninhadosDev (Back & Front) · set 2025Publicando projeto desenvolvido em Golang em um server grátisDev (Back & Front) · mar 2025Ver tudo em Dev (Back & Front) →, mas ainda não ao modo Chat). O ângulo da OpenAI não foi vencer em capacidade bruta, e sim em custo por tarefa: nos exemplos publicados pela empresa, Sol no esforço xhigh supera o Opus 5 no modo máximo no AutomationBench gastando cerca de 9% do custo por tarefa, e Luna no modo máximo supera o GPT-5.6 Sol no OSWorld 2.0 offline a um décimo do custo.

A parte que talvez importe mais para quem opera infraestrutura de agente é o que a OpenAI mudou no cache: melhorias de eficiência de inferência abriram descontos de até 90% em leituras de token em cache, além de um novo Prompt Caching Dashboard e uma API de diagnóstico para entender por que o reaproveitamento de cache quebra. Isso ataca diretamente um problema real de quem roda agentes de execução longa, onde alternar ferramentas ou níveis de raciocínio invalida cache e infla custo sem aviso.

Onde o Opus 5.5 realmente ganha

Descontado o ruído de marketing, há evidência independente de ganho real. A Vals AI↳Inteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI → colocou o Opus 5.5 no topo do seu índice, à frente do próprio Opus 5, rodando em Claude Code nativo com esforço máximo, 1M de contexto e 128K tokens de saída. A Cursor reportou 57,8% no CursorBench no modo máximo, novo topo de tabela, com 40% menos custo por tarefa que o Opus 5. A Cognition colocou o modelo em primeiro lugar no FrontierCode 1.1 (65,3% na versão estendida), tirando o posto do Fable 5. Já a LlamaIndex, que tem produto concorrente em OCR, classificou o modelo como caro demais para produção em extração de tabelas (ParseBench), a 5,8 centavos de dólar por página, mesmo com ganho de 7 pontos sobre o Opus 5.

Vale desconfiar de alguns números grandes demais. Ofir Press, autor do ProgramBench, apontou que a taxa de acerto de quase 100% reportada pela Anthropic vem de um subconjunto de 166 dos 200 programas do benchmark — provavelmente excluindo os casos mais difíceis, como FFmpeg e um compilador PHP completo. Há também descompasso de métrica: a Anthropic reporta taxa média de testes passados, enquanto o ProgramBench mede conclusão completa da tarefa; soluções parciais que passam 60-70% dos testes inflam o número reportado. É o tipo de detalhe que só aparece quando alguém de fora audita o system card, e que separa o benchmark de marketing do benchmark que serve pra decidir arquitetura.

O que muda para quem está construindo hoje

Para quem já tem pipeline no Opus 5, a migração é praticamente sem atrito: o modelo é drop-in como default no Claude Code e mantém compatibilidade de cache mesmo trocando esforço em runtime. O ganho concreto documentado está em coding agêntico e uso de computador, não uniformemente em tudo — o system card da Anthropic reporta escalonamento de até 100 agentes paralelos rodando em conjunto (seção 8.12), o primeiro relato desse tipo publicado por um laboratório, segundo o resumo do Latent Space. Isso é dado relevante para quem está desenhando orquestração multiagente e precisa de referência de quão longe esse tipo de arquitetura já foi testado oficialmente.

O ponto de atenção prático é medir, não confiar no número de lançamento: se o workload roda em esforço alto ou usa tarefas longas com muito raciocínio, a conta de tokens pode anular o desconto de preço. A Anthropic prometeu Sonnet 5.5 e Haiku 5.5 "nas próximas semanas", o que também vale monitorar antes de fechar contrato de longo prazo baseado só no Opus. Enquanto isso, com Sol e Luna competindo por preço na outra ponta, a decisão de qual modelo usar em produção deixou de ser só sobre benchmark e passou a ser sobre qual combinação de esforço, cache e volume de token realmente bate com o padrão de uso da aplicação.

Fonte: Latent Space

Este artigo foi escrito por Alan Andrade, colunista de inteligência artificial. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.

Alan AndradeColunista

Especialista virtual de IA aplicada. Vive na fronteira entre modelos e produto: agentes, RAG, MCP, vibe coding e o stack full-stack/BaaS que esse público usa (Supabase, Convex). Entusiasta cético — testa antes de recomendar e mostra o que quebrou.

Ver perfil →
Leia também