Claude Haiku 5.5 iguala preço do GPT-6 Luna, mas esconde aumento de custo no tokenizer
A Anthropic lançou em 7 de outubro o Claude Haiku 5.5, cobrando o mesmo preço do GPT-6 Luna da OpenAI até 100 mil tokens. Só que um tokenizer menos generoso e um salto de preço acima desse limite mudam a conta de quem roda agentes em produção.

A Anthropic lançou em 7 de outubro de 2026 o Claude Haiku 5.5, a nova geração do seu modelo rápido e barato, segundo relato do desenvolvedor Simon Willison em seu blog. O anúncio já era esperado: Willison havia comentado dias antes que a família Haiku estava defasada, e o Haiku 4.5 (lançado quase um ano atrás, a $1 por milhão de tokens de entrada e $5 por milhão de saída) ficou caro demais diante da concorrência mais recente.
O comparativo direto é com o GPT-6 Luna, modelo da OpenAI lançado no mês anterior. Até 100 mil tokens, o Haiku 5.5 cobra exatamente o mesmo preço do Luna: $0,10 por milhão de tokens de entrada e $0,50 por milhão de saída. É uma queda de 10 vezes em relação ao Haiku 4.5, e segundo Willison o novo modelo também reporta benchmarks mais altos nessa faixa de uso.
O detalhe que muda a conta acima de 100 mil tokens
A igualdade de preço dura pouco. Passado o limite de 100 mil tokens, o Haiku 5.5 sobe 5 vezes de preço, para $0,50/$2,50 por milhão de tokens. O Luna também tem um reajuste acima de um certo volume, mas o patamar é mais alto (272 mil tokens) e o aumento é bem menor, para $0,20/$0,75.
Na prática, isso separa dois perfis de uso bem definidos para quem constrói com IA↳Inteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI →:
| Modelo | Preço até o limite (entrada/saída por milhão) | Limite de tokens | Preço acima do limite |
|---|---|---|---|
| Claude Haiku 4.5 | $1 / $5 | não se aplica | preço único |
| Claude Haiku 5.5 | $0,10 / $0,50 | 100 mil tokens | $0,50 / $2,50 |
| GPT-6 Luna | $0,10 / $0,50 | 272 mil tokens | $0,20 / $0,75 |
Se o contexto do agente cabe em 100 mil tokens, o Haiku 5.5 empata em preço com o Luna e ainda leva vantagem em benchmark. Acima disso, especialmente em agentes com histórico de conversa longo ou RAG com muito contexto recuperado, o Luna sai mais barato por uma boa margem.
O tokenizer que encolhe o orçamento por baixo dos panos
Há uma segunda pegadinha que Willison aponta e que não aparece na tabela de preços da Anthropic: o Haiku 5.5 usa um tokenizer novo, menos generoso. Testando o mesmo prompt longo na sua ferramenta própria de contagem de tokens (o Claude Token Counter), ele mediu que o Haiku 5.5 consome cerca de 1,25 vez mais tokens que o Haiku 4.5 para o mesmo texto.
Isso é um aumento de custo escondido: o preço por token caiu 10 vezes, mas cada requisição real passa a usar mais tokens para representar o mesmo conteúdo. Para quem está migrando de Haiku 4.5 para Haiku 5.5 e projetando economia com base só na tabela de preços, vale rodar a própria contagem antes de bater o martelo no orçamento.
Reasoning como botão de custo, testado com o pelicano de bicicleta
O Haiku 5.5 chega com níveis de esforço de raciocínio configuráveis: low, medium, high, xhigh e max. Diferente de versões anteriores, o novo modelo não permite desligar o raciocínio por completo, e o padrão é medium. Isso importa porque cada token de raciocínio é cobrado como token de saída, então o nível de esforço é, na prática, um controle direto de custo e latência.
Willison testou isso com seu benchmark informal, o pelicano andando de bicicleta em SVG, rodando o modelo via o plugin llm-anthropic:
llm install -U llm-anthropic
llm anthropic refresh
llm -m claude-haiku-5.5 "Generate an SVG of a pelican riding a bicycle" -o thinking_effort lowOs resultados mostram o trade-off na prática: o pelicano gerado com esforço low saiu ruim, mas custou 0,0936 centavo de dólar e levou 7 segundos. Do esforço low para cima o resultado melhorou e o quadro da bicicleta ficou correto. No extremo oposto, o esforço max levou 5 minutos e 9 segundos e custou 3,3826 centavos, ainda assim uma fração do que custava o Haiku 4.5: o mesmo teste, um ano atrás, saiu por 0,7583 centavo num modelo que sequer suportava níveis de raciocínio e desenhava pelicanos ruins mesmo assim.

Créditos de API que pagam a própria assinatura
No mesmo anúncio, a Anthropic cortou pela metade o preço de leitura de cache do Sonnet 5.5 e criou um esquema de créditos de API para assinantes dos planos Max e Team. O texto oficial, citado por Willison, descreve assim o benefício:
Em segundo lugar, esta semana vamos liberar um novo crédito mensal de API para todos os assinantes Max e Team, para uso na Claude Platform. Usuários do Max 5x vão receber $100 em créditos por mês, usuários do Max 20x vão receber $200, e assinantes Team vão receber até $500, compartilhados entre os usuários.
Second, this week, we'll roll out a new monthly API credit to all Max and Team subscribers for use on the Claude Platform. Max 5x users will get $100 in credits per month, Max 20x users will get $200, and Team subscribers will receive up to $500, pooled across their users.Anthropic, comunicado oficial
O valor do crédito bate exatamente com o custo da assinatura, o que na prática permite usar a API sem pagar nada a mais além do plano que já se tem. Para ativar, basta ir em Settings -> Billing e escolher qual organização de API deve receber o crédito. É possível ainda desligar o recarregamento automático, de forma que as chamadas de API simplesmente parem quando o saldo zerar, em vez de gerar uma fatura surpresa.
Um detalhe que pega quem não lê a letra miúda: os créditos não acumulam de um mês para o outro. O que não for usado se perde, então times que pagam Max ou Team e não usam a API regularmente estão deixando dinheiro na mesa.
O que muda pra quem roda agente em produção
O recado prático para quem desenvolve é de calculadora na mão, não de adoção automática. Vale considerar:
- Agentes com contexto curto (abaixo de 100 mil tokens por chamada): o Haiku 5.5 empata em preço com o Luna e, segundo os benchmarks citados por Willison, entrega mais qualidade. É candidato natural para substituir o Haiku 4.5.
- Agentes com contexto longo (RAG pesado, histórico extenso, janelas acima de 100 mil tokens): o Luna segue mais barato, porque o salto de preço do Haiku 5.5 é mais agressivo e chega mais cedo.
- Projetos que já têm prompts medidos em tokens: remedir com o tokenizer novo antes de comparar custo é obrigatório, já que o mesmo texto consome cerca de 25% mais tokens no Haiku 5.5.
- Times com assinatura Max ou Team da Anthropic: vale configurar os créditos de API e usar o recarregamento automático desligado como trava de segurança orçamentária.
Willison também nota, de passagem, que a OpenAI ainda permite usar a assinatura do Codex para uso pessoal de API, o que continua sendo um negócio melhor para quem consome muita API de forma pesada. O esquema de créditos da Anthropic reduz essa distância, mas não a elimina: quem decide entre as duas plataformas por custo de uso intenso ainda tem contas a fazer além do preço por token anunciado na manchete.
Fonte: Simon Willison
Este artigo foi escrito por Alan Andrade, colunista de inteligência artificial. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
EmbeddingGemma 2 traz busca semântica multimodal para rodar no celular sem GPU pesada
O Google DeepMind lançou o EmbeddingGemma 2, modelo aberto de 740 milhões de parâmetros que junta texto, imagem, vídeo e áudio num único espaço vetorial e roda com menos de 600MB de RAM, sem depender de nuvem.













