DeepSeek V4 Flash Vision Exp: quando o agente para de adivinhar
A DeepSeek colocou um modelo multimodal experimental no ar em 21 de agosto de 2026. O DeepSeek V4 Flash Vision Exp chegou à plataforma de API

A DeepSeek colocou um modelo multimodal experimental no ar em 21 de agosto de 2026. O DeepSeek V4 Flash Vision Exp chegou à plataforma de API adicionando compreensão visual e mantendo o desempenho de texto da versão padrão do V4 Flash. Ou seja, você ganha visão sem perder o que já funcionava.
Antes de tudo, vale entender o recorte. Não se trata de mais um modelo que descreve fotos bonitinho. O foco declarado é agente. Portanto, a pergunta certa para o dev é outra: o que muda no seu loop de automação quando o modelo enxerga a interface?
DeepSeek aponta o benchmark para agentes multimodais, e não para descrição de imagem
Primeiro, o básico. Em capacidades puramente textuais, como agente, raciocínio e conhecimento de mundo, o V4 Flash Vision Exp fica no mesmo patamar do V4 Flash oficial. Assim, a troca de modelo não degrada o que você já tinha em produção.
A diferença aparece quando a tarefa exige leitura visual. Nesses benchmarks de agente, o modelo experimental dá um salto significativo sobre o V4 Flash e aproxima suas capacidades multimodais do Opus 4.8. De fato, esse é o número que a empresa escolheu destacar.
Por baixo, a arquitetura segue a linha da casa. Trata-se de um modelo sparse mixture of experts com 13B de parâmetros ativos em um total de 284B, indicado para compreensão de documentos e gráficos, perguntas visuais e fluxos de agente que intercalam texto e imagem. Logo, você paga inferência de modelo pequeno com capacidade de modelo grande.
O que realmente muda no seu loop de automação
Imagine um agente que preenche um sistema legado sem API. Hoje, você provavelmente descreve cada campo por texto. Depois, reza para o seletor não quebrar.
Com entrada visual, o fluxo muda de natureza. O modelo recebe o screenshot, interpreta os elementos e decide a próxima ação. Dessa forma, o agente lida melhor com layouts que mudam sozinhos.
Na prática, três cenários saem do papel rápido:
Leitura de documentos escaneados sem OCR intermediário. Extração de números direto de dashboards em imagem. Automação de telas em ERPs antigos, aqueles sem documentação nenhuma.
Contudo, existe um custo escondido aqui. Screenshot é dado sensível. Portanto, revise o que sai da sua rede antes de plugar isso em produção.
Files API grátis: pare de subir a mesma imagem dez vezes
Esse é o detalhe que passa despercebido na cobertura generalista. A DeepSeek abriu sua Files API sem cobrança, permitindo subir uma imagem uma vez, referenciá la depois por file_id e reutilizar o mesmo arquivo em várias requisições.
Parece pequeno. Ainda assim, muda a conta no fim do mês.
Pense em um agente que analisa a mesma planta baixa em vinte perguntas seguidas. Sem file_id, você paga o upload vinte vezes. Com file_id, você paga uma. Além disso, a latência cai, porque o payload deixa de carregar megabytes a cada chamada.
Como chamar o DeepSeek com imagem em três formatos de requisição
A API multimodal suporta Chat Completions, Messages e Responses, e as imagens podem chegar como base64, URL externa ou referência da Files API. Ou seja, dá para reaproveitar o SDK que você já usa.
O caminho mais curto passa pelo endpoint compatível com OpenAI:
python↳Python56 conteúdosVSCode + Python + Alexa: Desenvolva e teste skills para alexa localmente com pythonDev (Back & Front) · out 2025Dominando decoradores em Python: um guia completo com exemplosDev (Back & Front) · jan 2025Desenvolvimento de software: diferenças entre Python, JavaScript e JavaGestão Dev & TI · nov 2024Ver tudo em Dev (Back & Front) →from openai import OpenAI
client = OpenAI(
api_key="SUA_CHAVE",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Qual erro aparece nesta tela?"},
{"type": "image_url",
"image_url": {"url": "https://exemplo.com/tela.png"}}
]
}]
)
print(response.choices[0].message.content)Quando a mesma imagem se repete, troque a URL pelo file_id:
pythonresponse = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extraia a tabela desta página."},
{"type": "file", "file_id": "file-api-xxxxxxxxxxxxxxxx"}
]
}]
)Se o seu stack já fala Anthropic, o caminho existe também. Basta apontar a base_url para https://api.deepseek.com/anthropic e enviar as imagens pelo endpoint compatível com /messages, mudando apenas o formato do bloco de conteúdo.
Limites que vão te morder em produção
Aqui está a parte que a documentação esconde no rodapé. Vale ler antes de subir qualquer coisa.
Imagens só funcionam em mensagens de usuário, já que imagens em mensagens system ou assistant retornam erro 400. Portanto, revise seu template de prompt agora.
Modelos que não são de visão também devolvem 400 com a mensagem de imagem não suportada. Assim, qualquer fallback automático para outro modelo precisa de tratamento explícito.
Os limites de tamanho merecem atenção redobrada. A URL pode ter no máximo 8192 caracteres, o arquivo de imagem pode chegar a 32 MiB e o download precisa terminar em 60 segundos. Enquanto isso, imagens referenciadas por file_id sobem até 64 MiB e escapam da checagem de 32 MiB por imagem.
Ou seja, arquivo grande pede Files API. Sempre.
Quanto isso custa de verdade
O modelo de cobrança é direto. As imagens são tokenizadas para faturamento, com até 384 tokens por imagem, no mesmo preço do V4 Flash. Logo, um screenshot custa menos que um parágrafo médio de contexto.
Existe uma pegadinha de horário, porém. Os preços de token dobram nas janelas de 01:00 às 04:00 e de 06:00 às 10:00 UTC, e os valores divulgados correspondem à tarifa fora de pico. Em resumo, agendar batch job no horário errado sai caro.
DeepSeek experimental significa exatamente isso
O sufixo Exp no nome não é decorativo. Trata se de versão de testes. Por isso, evite acoplar contrato de produção a esse identificador de modelo.
Ainda assim, a compatibilidade ajuda. O DeepSeek Harness 0.1.1 saiu no mesmo dia com suporte pronto ao novo modelo, que roda bem em diferentes frameworks de agente. Assim, o custo de experimentação fica baixo.
Por onde começar ainda esta semana
Comece pequeno. Pegue um fluxo interno chato, daqueles com screenshot e conferência manual. Depois, meça o baseline atual em tempo e erro.
Em seguida, monte o loop mínimo: captura de tela, chamada ao modelo, decisão, ação. Rode em ambiente isolado por alguns dias. Por fim, compare os números.
A corrida entre laboratórios chineses e americanos segue apertando o preço por token. Enquanto isso, quem constrói ganha uma janela boa para testar arquiteturas de agente visual com orçamento baixo. Aproveite a janela.
Acompanhe nosso perfil no Instagram!







