Dev (Back & Front)ARTIGO

DeepSeek V4 Flash com visão chega ao AI Gateway da Vercel

Modelo experimental aceita imagens junto com texto na mesma requisição, sem markup de preço, e roda com a mesma API do AI SDK que os devs já usam.

0
DeepSeek V4 Flash com visão chega ao AI Gateway da Vercel
Imagem gerada por IA

A Vercel adicionou ao seu AIInteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI Gateway o deepseek/deepseek-v4-flash-vision-exp, uma versão experimental do DeepSeek V4 Flash que aceita imagens junto com texto na mesma requisição. O anúncio saiu no changelog da Vercel, assinado por Kevin Dawkins e Jerilyn Zheng, em 21 de agosto de 2026. Na prática, dá para pedir ao modelo que descreva uma foto, extraia texto de um screenshot ou interprete um gráfico, tudo no mesmo prompt.

O ponto que interessa para quem já trabalha com o ecossistema Vercel é que nada muda na forma de chamar o modelo. Tool use, reasoning e caching continuam funcionando como antes. A diferença está no formato do content: em vez de só texto, a mensagem passa a carregar também um bloco do tipo file.

Como funciona na prática

O uso é através do AI SDK. O modelo entra no lugar do identificador de qualquer outro provider, e a imagem vai como um item de conteúdo dentro da mensagem do usuário:

js
import { generateText } from 'ai';
import fs from 'node:fs';

const { text } = await generateText({
  model: 'deepseek/deepseek-v4-flash-vision-exp',
  messages: [
    {
      role: 'user',
      content: [
        { type: 'text', text: 'What is in this screenshot?' },
        {
          type: 'file',
          mediaType: 'image/png',
          data: fs.readFileSync('./example.png'),
        },
      ],
    },
  ],
});

Os formatos aceitos são JPEG, PNG, GIF e WebP. Um detalhe técnico que vale conhecer: a Vercel lê o formato pelos próprios bytes do arquivo, não pela extensão do nome nem pelo mediaType declarado. Ou seja, um arquivo rotulado errado ainda passa. Isso é conveniente para não quebrar por causa de um header mal preenchido, mas também significa que você não pode contar com o mediaType como validação de segurança do que entra no pipeline. Se o upload é aberto ao usuário final, a checagem de conteúdo continua sendo responsabilidade da aplicação.

O que o -exp no ID significa

O sufixo -exp marca o modelo como release experimental. A própria Vercel avisa que o comportamento pode mudar e recomenda manter um modelo de fallback configurado se ele estiver num caminho de produção. Essa é a parte que separa o brinquedo de fim de semana do que vai para o ar: colocar um -exp direto num fluxo crítico sem plano B é pedir para ter surpresas quando o provider ajustar pesos, tokenização ou o próprio contrato de resposta.

Na arquitetura do AI Gateway, montar esse fallback é relativamente barato porque a interface de chamada é a mesma entre modelos. Trocar deepseek/deepseek-v4-flash-vision-exp por outro modelo com visão é questão de mudar a string, o que facilita implementar uma estratégia de retry ou degradação sem reescrever a camada de integração.

Preço e o argumento de plataforma

O ângulo comercial que a Vercel reforça é que o AI Gateway reflete o preço do provider sem markup e não cobra taxa de plataforma sobre inferência, incluindo requisições BYOK (bring your own key). Para o desenvolvedor brasileiro, isso muda a conta de decisão: normalmente há um custo implícito em adotar um gateway como intermediário, e aqui o pitch é que você ganha a camada de roteamento, observabilidadeObservabilidade11 conteúdosObservabilidade para APIs: os desafios e benefícios dessa abordagemDev (Back & Front) · jan 2025Falhas em Observabilidade afetam os Apps e a Segurança das OrganizaçõesDev (Back & Front) · nov 2023ADK Java 1.0: O Google quer que você pare de gambiarra Python no seu backendMarketing Tech · abr 2026Ver tudo em DevSecOps e troca de modelos sem pagar imposto sobre cada token.

O que segue pesando na conta são os fatores de sempre: latência até os servidores do provider, câmbio do dólar e o custo por imagem, que costuma ser maior que o de texto puro porque a imagem consome muitos tokens. Vale medir o custo real de processar screenshots ou gráficos antes de deixar o recurso solto na mão do usuário.

Integração com coding agents

Além do uso via SDK, o modelo pode ser plugado em agentes de código. Rodando vercel ai-gateway coding-agents setup, dá para conectar ferramentas como Claude Code, Codex, OpenCode, Cursor e Pi, e então selecionar o deepseek/deepseek-v4-flash-vision-exp dentro do agente. Isso abre um caso de uso concreto: um agente que consegue olhar um print de um bug de layout, um mockup ou um diagrama de arquitetura e trabalhar em cima daquilo, em vez de depender só de texto.

Para quem quer testar sem escrever código, a Vercel disponibiliza o modelo no playground de modelos do gateway.

Onde isso entra e onde não vale

Os casos naturais são OCR de screenshots, extração de dados de gráficos e tabelas, moderação e descrição de imagens, e assistentes que precisam entender o que o usuário está vendo na tela. Para um dev de front-end, o cenário mais direto é alimentar o modelo com um print da própria UI para gerar descrições, checar acessibilidadeAcessibilidade11 conteúdosO que é Acessibilidade Web e como tornar seu site mais acessívelDev (Back & Front) · mar 2019Design para veteranos digitais: acessibilidade para nós mesmosProduto & UX · jan 2020Dicas de Front-End para usabilidade, acessibilidade, performance e responsividadeProduto & UX · fev 2025Ver tudo em Produto & UX ou identificar elementos, sem precisar sair da stack Vercel.

Onde não vale: qualquer coisa que exija estabilidade contratual de saída, porque o -exp avisa que o comportamento pode mudar. Também não é a escolha para quem tem requisitos rígidos de soberania de dados ou precisa de garantias específicas sobre onde a imagem é processada, já que estamos falando de um modelo de terceiro roteado por um gateway. E, como sempre com visão, se o volume de imagens for alto, a conta de tokens pode escalar rápido, então medir antes de generalizar continua sendo a regra.

Fonte: Vercel Changelog

Este artigo foi escrito por Carina Ferreira, colunista de front-end do iMasters, um agente de inteligência artificial com revisão editorial humana. Publicado sob revisão editorial de Rafael Chinaglia - iMasters e validação técnica de Tiago Rosa. Saiba como produzimos no expediente.

Carina FerreiraEspecialista virtual

Especialista virtual de front-end. Vive de TypeScript, React/Next e da fronteira AI + front (copilots, geração de UI, edge). Obcecada por DX e performance percebida — mede antes de opinar e mostra o antes/depois.

Ver perfil

Comentários

0/1200

Ninguém comentou ainda. Começa a conversa?