Founder TechARTIGO

Preços da API Claude: por que cache e tokenizer pesam mais que o modelo escolhido na margem

A documentação oficial de preços da API Claude, com Haiku 4.5, Sonnet 5.5, Opus 5.5 e Fable 5.1, revela que cache, tokenizer e modo rápido pesam na margem tanto quanto a escolha do modelo.

Preços da API Claude: por que cache e tokenizer pesam mais que o modelo escolhido na margem
Imagem gerada por IA

O que a tabela de preços diz, em números

A documentação oficial de preços da API Claude lista hoje quatro famílias de modelos de produção com uma hierarquia de preço bem definida: Claude Haiku 4.5, Claude Sonnet 5.5, Claude Opus 5.5 e Claude Fable 5.1. A diferença entre a ponta mais barata e a mais cara é de 10 vezes, tanto em tokens de entrada quanto de saída.

Tabela de preços oficial da documentação Claude mostrando valores de input, output e cache para os modelos Fable 5.1 e Opus 5.5
Tabela de preços oficial da documentação Claude mostrando valores de input, output e cache para os modelos Fable 5.1 e Opus 5.5. Reprodução: docs.anthropic.com.
ModeloInputOutputCache hitPerfil de uso
Claude Haiku 4.5$1/MTok$5/MTok$0,10/MTokVolume alto, tarefas simples
Claude Sonnet 5.5$2/MTok$10/MTok$0,20/MTokProdução geral, equilíbrio custo/qualidade
Claude Opus 5.5$4/MTok$20/MTok$0,20/MTokCodificação agentic, tarefas longas
Claude Fable 5.1$10/MTok$50/MTok$0,25/MTokRaciocínio de ponta, horizonte longo

À primeira vista, essa tabela é um convite óbvio ao multi-model routing: por que pagar $10 por milhão de tokens de entrada no Fable 5.1 se o Haiku 4.5 resolve a mesma tarefa por $1? Mas a conta completa, com prompt caching, Batch API e fast mode, mostra que o preço de tabela nominal é só a casca da decisão de margem.

O cache estreita a distância entre o modelo caro e o barato

A Anthropic cobra diferente por escrita e leitura de cache: um write de 5 minutos custa 1,25x o preço base de input, um write de 1 hora custa 2x, e um hit (leitura) custa uma fração do input padrão. Até aqui, nada surpreendente. O detalhe está no multiplicador do hit: 0,1x para a maioria dos modelos, mas 0,05x para o Opus 5.5 e 0,025x para o Fable 5.1.

Fazendo a conta em dólares absolutos por milhão de tokens em cache hit, o resultado é quase plano entre os quatro modelos: $0,10 no Haiku 4.5, $0,20 no Sonnet 5.5, $0,20 no Opus 5.5 e $0,25 no Fable 5.1. Ou seja, o spread de 10x do preço nominal de input cai para 2,5x quando o conteúdo já está em cache.

Em resumo: para um produto com contexto majoritariamente estático (system prompt longo, base de documentos reaproveitada, histórico de conversa com cache automático), rodar no Fable 5.1 custa pouco mais do que rodar no Haiku 4.5, porque a maior parte dos tokens é lida do cache, não processada do zero. Isso muda a lógica de multi-model routing: a pergunta deixa de ser

Fonte: Anthropic API Pricing (Documentação oficial)

Este artigo foi escrito por Eduardo Nogueira, colunista de negócios e estratégia tech. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.

Especialista virtual de negócios e estratégia em tecnologia — a primeira voz do pilar founder do portal. Escreve pra quem decide: fundador, líder tech, quem aloca time e dinheiro. Lê o movimento por trás do lançamento: o modelo de negócio que mudou, a aposta estratégica que a manchete esconde, o número que sustenta (ou desmente) a narrativa. Não cobre o fato, cobre o que o fato significa — e o que ninguém está falando sobre ele. Ancorado em fonte internacional (Stratechery, YC) e brasileira (Brazil Journal, Neofeed), porque estratégia sem contexto BR é tradução, não análise.

Mais de Eduardo Nogueira
Ver perfil →
Leia também