DeepSeek V4-Flash cobra US$ 0,14 por milhão de tokens – stack de IA
DeepSeek lançou o V4-Flash na sexta passada com uma proposta bem direta: entregar inferência barata em escala. Segundo a análise da Artificial Analysis.

DeepSeek lançou o V4-Flash na sexta passada com uma proposta bem direta: entregar inferência barata em escala. Segundo a análise da Artificial Analysis, o modelo registrou o menor custo de operação entre os sistemas conhecidos avaliados. Para o time de engenharia, portanto, a notícia mexe direto na planilha de infraestrutura. Afinal, cada chamada de API vira linha de custo dentro do produto.
DeepSeek entra na briga com um preço que muda o cálculo por requisição
A Artificial Analysis publicou os números logo após o lançamento. Além do preço por token, a consultoria mediu o gasto médio por teste.
Veja os valores:
- US$ 0,14 por milhão de tokens de entrada, algo perto de R$ 0,71
- US$ 0,28 por milhão de tokens de saída, cerca de R$ 1,42
- US$ 0,03 de custo médio por teste, aproximadamente R$ 0,15
Na comparação de gasto médio, o V4-Flash ficou abaixo de todo mundo. O Kimi K3, da Moonshot AI, marcou US$ 0,86 por teste. Logo acima aparece o GPT-5.6 Sol, da OpenAI, com US$ 1,86. O Claude Fable 5, da Anthropic, fecha a lista com US$ 3,15. Ou seja, a diferença chega a duas ordens de grandeza em cenários de alto volume.
Preço de tabela conta só metade da história do custo real
A própria Artificial Analysis faz uma ressalva importante aqui. Alguns modelos precisam de mais passos para concluir a mesma tarefa. Por isso, a metodologia considera também o volume de dados processados e gerados durante os testes.
Na prática, um modelo mais fraco pode queimar tokens tentando acertar. Assim, o preço de tabela some dentro do retrabalho. Vale medir isso no seu próprio fluxo.
Rode a mesma suíte de tarefas nos dois modelos. Depois compare tokens totais, número de tentativas e taxa de acerto. Só então o custo por tarefa concluída aparece de verdade.
50 pontos no Intelligence Index mostram exatamente onde o V4-Flash trava – DeepSeek
O Intelligence Index reúne nove testes de programação, raciocínio e tarefas de ambiente profissional. O V4-Flash marcou 50 pontos nesse índice. A nota empata com o Gemini 3.6 Flash, do Google. Além disso, fica um ponto atrás do Muse Spark 1.1, da Meta, e do GLM-5.2, da Z.AI.
O Kimi K3, por sua vez, chegou a 57 pontos. Modelos como Claude Opus 5, Claude Fable 5 e GPT-5.6 seguem à frente em capacidade bruta. Portanto, o V4-Flash joga na faixa dos modelos rápidos e econômicos.
Essa faixa resolve muita coisa no dia a dia. Classificação, extração, roteamento, resumo e enriquecimento de dados cabem bem ali.
Como encaixar o DeepSeek V4-Flash na arquitetura sem sacrificar qualidade
A saída mais eficiente costuma ser o roteamento por complexidade. Primeiro, mapeie as tarefas do seu produto por criticidade. Depois, mande o volume repetitivo para o modelo econômico. Em seguida, reserve o modelo forte para raciocínio longo e código sensível. Adicione um fallback automático quando a confiança ficar baixa. Assim, você paga caro apenas quando o problema exige.
Além disso, monte uma bateria de avaliação antes da troca. Cinquenta casos reais do seu domínio já revelam padrões claros. Depois disso, meça latência, formato de saída e aderência a schema. Muita quebra de produção nasce de JSON malformado. Por fim, revise limites de contexto e política de dados antes de mandar carga real.
A guerra de preços na China pressiona a sua conta de API
A DeepSeek ganhou projeção mundial no início de 2025 com o R1. Aquele modelo levantou dúvidas sobre o tamanho dos investimentos das empresas americanas. Agora a disputa interna ficou bem mais dura.
A startup enfrenta Moonshot AI, MiniMax e Z.AI no mesmo tabuleiro. Além delas, ByteDance e Alibaba avançam sobre clientes corporativos com ofertas agressivas. Consequentemente, o preço por token tende a cair de novo nos próximos meses.
Para quem constrói produto, isso pede contratos flexíveis e código desacoplado do fornecedor. Uma camada fina de abstração sobre o cliente de LLM resolve bem. Assim, trocar de provedor vira mudança de configuração.
V4-Pro no horizonte e o que testar até o anúncio
A DeepSeek já confirmou uma versão mais potente, chamada V4-Pro. Contudo, a empresa ainda segue sem data de lançamento. Enquanto isso, o V4-Flash serve como laboratório barato. Aproveite para calibrar prompts, medir custo por tarefa e ajustar seus evals. Dessa forma, a migração futura acontece com dado na mão.
O recado para quem coloca IA em produção
A corrida da IA ganhou uma segunda pista. De um lado, seguem os modelos de fronteira. Do outro, crescem os modelos econômicos com desempenho suficiente. O DeepSeek V4-Flash mostra que essa segunda pista virou estratégia central. Portanto, vale abrir espaço no roadmap para testar. Sua fatura de API agradece.
Acompanhe nosso perfil no Instagram!







