NOTÍCIA

DeepSeek V4-Flash cobra US$ 0,14 por milhão de tokens – stack de IA

DeepSeek lançou o V4-Flash na sexta passada com uma proposta bem direta: entregar inferência barata em escala. Segundo a análise da Artificial Analysis.

DeepSeek V4-Flash cobra US$ 0,14 por milhão de tokens – stack de IA
Imagem: Redação iMasters

DeepSeek lançou o V4-Flash na sexta passada com uma proposta bem direta: entregar inferência barata em escala. Segundo a análise da Artificial Analysis, o modelo registrou o menor custo de operação entre os sistemas conhecidos avaliados. Para o time de engenharia, portanto, a notícia mexe direto na planilha de infraestrutura. Afinal, cada chamada de API vira linha de custo dentro do produto.

DeepSeek entra na briga com um preço que muda o cálculo por requisição

A Artificial Analysis publicou os números logo após o lançamento. Além do preço por token, a consultoria mediu o gasto médio por teste.

Veja os valores:

  • US$ 0,14 por milhão de tokens de entrada, algo perto de R$ 0,71
  • US$ 0,28 por milhão de tokens de saída, cerca de R$ 1,42
  • US$ 0,03 de custo médio por teste, aproximadamente R$ 0,15

Na comparação de gasto médio, o V4-Flash ficou abaixo de todo mundo. O Kimi K3, da Moonshot AI, marcou US$ 0,86 por teste. Logo acima aparece o GPT-5.6 Sol, da OpenAI, com US$ 1,86. O Claude Fable 5, da Anthropic, fecha a lista com US$ 3,15. Ou seja, a diferença chega a duas ordens de grandeza em cenários de alto volume.

Preço de tabela conta só metade da história do custo real

A própria Artificial Analysis faz uma ressalva importante aqui. Alguns modelos precisam de mais passos para concluir a mesma tarefa. Por isso, a metodologia considera também o volume de dados processados e gerados durante os testes.

Na prática, um modelo mais fraco pode queimar tokens tentando acertar. Assim, o preço de tabela some dentro do retrabalho. Vale medir isso no seu próprio fluxo.

Rode a mesma suíte de tarefas nos dois modelos. Depois compare tokens totais, número de tentativas e taxa de acerto. Só então o custo por tarefa concluída aparece de verdade.

50 pontos no Intelligence Index mostram exatamente onde o V4-Flash trava – DeepSeek

O Intelligence Index reúne nove testes de programação, raciocínio e tarefas de ambiente profissional. O V4-Flash marcou 50 pontos nesse índice. A nota empata com o Gemini 3.6 Flash, do Google. Além disso, fica um ponto atrás do Muse Spark 1.1, da Meta, e do GLM-5.2, da Z.AI.

O Kimi K3, por sua vez, chegou a 57 pontos. Modelos como Claude Opus 5, Claude Fable 5 e GPT-5.6 seguem à frente em capacidade bruta. Portanto, o V4-Flash joga na faixa dos modelos rápidos e econômicos.

Essa faixa resolve muita coisa no dia a dia. Classificação, extração, roteamento, resumo e enriquecimento de dados cabem bem ali.

Como encaixar o DeepSeek V4-Flash na arquitetura sem sacrificar qualidade

A saída mais eficiente costuma ser o roteamento por complexidade. Primeiro, mapeie as tarefas do seu produto por criticidade. Depois, mande o volume repetitivo para o modelo econômico. Em seguida, reserve o modelo forte para raciocínio longo e código sensível. Adicione um fallback automático quando a confiança ficar baixa. Assim, você paga caro apenas quando o problema exige.

Além disso, monte uma bateria de avaliação antes da troca. Cinquenta casos reais do seu domínio já revelam padrões claros. Depois disso, meça latência, formato de saída e aderência a schema. Muita quebra de produção nasce de JSON malformado. Por fim, revise limites de contexto e política de dados antes de mandar carga real.

A guerra de preços na China pressiona a sua conta de API

A DeepSeek ganhou projeção mundial no início de 2025 com o R1. Aquele modelo levantou dúvidas sobre o tamanho dos investimentos das empresas americanas. Agora a disputa interna ficou bem mais dura.

A startup enfrenta Moonshot AI, MiniMax e Z.AI no mesmo tabuleiro. Além delas, ByteDance e Alibaba avançam sobre clientes corporativos com ofertas agressivas. Consequentemente, o preço por token tende a cair de novo nos próximos meses.

Para quem constrói produto, isso pede contratos flexíveis e código desacoplado do fornecedor. Uma camada fina de abstração sobre o cliente de LLM resolve bem. Assim, trocar de provedor vira mudança de configuração.

V4-Pro no horizonte e o que testar até o anúncio

A DeepSeek já confirmou uma versão mais potente, chamada V4-Pro. Contudo, a empresa ainda segue sem data de lançamento. Enquanto isso, o V4-Flash serve como laboratório barato. Aproveite para calibrar prompts, medir custo por tarefa e ajustar seus evals. Dessa forma, a migração futura acontece com dado na mão.

O recado para quem coloca IA em produção

A corrida da IA ganhou uma segunda pista. De um lado, seguem os modelos de fronteira. Do outro, crescem os modelos econômicos com desempenho suficiente. O DeepSeek V4-Flash mostra que essa segunda pista virou estratégia central. Portanto, vale abrir espaço no roadmap para testar. Sua fatura de API agradece.

Acompanhe nosso perfil no Instagram!

Matérias especiais e reportagens conduzidas internamente pela Redação iMasters. Acompanhe no Twitter @imasters e no Instagram/Threads @portalimasters

Ver perfil