NOTÍCIA

Alibaba coloca 2,4 trilhões de parâmetros em código aberto

Alibaba lançou o Qwen3.8-Max em código aberto e o DeepSeek V4-Flash derrubou o custo por token. Veja o que isso muda na arquitetura do seu projeto.

Alibaba coloca 2,4 trilhões de parâmetros em código aberto
Imagem: Redação iMasters

Alibaba anunciou no dia 3 de agosto o Qwen3.8-Max, descrito pela própria empresa como o maior e mais capaz modelo que ela já colocou no mercado. Além do tamanho, o anúncio traz uma decisão relevante para quem constrói software. Afinal, este é o primeiro modelo premium da marca com código aberto. Ou seja, os pesos vão parar em repositórios como o Hugging Face dentro de alguns dias.

Enquanto isso, o DeepSeek V4-Flash apareceu em testes da Artificial Analysis como o modelo mais barato da categoria. Portanto, a semana empurrou duas discussões para a mesa técnica ao mesmo tempo: capacidade e preço.

Alibaba: Os 95 bilhões de parâmetros que realmente entram na sua conta de inferência

O número que abre as manchetes é 2,4 trilhões de parâmetros. No entanto, apenas cerca de 95 bilhões ficam ativos durante a inferência. Esse comportamento aponta para ativação esparsa, o padrão que hoje sustenta os modelos gigantes em produção.

Na prática, isso importa por um motivo direto. Primeiro, o custo computacional acompanha o que roda, não o que está armazenado. Em seguida, a latência responde melhor do que o volume total sugeriria. Por fim, hospedar o modelo por conta própria deixa de ser fantasia orçamentária para times médios.

Ainda assim, vale calibrar a expectativa. Um modelo dessa escala continua exigindo memória de vídeo agressiva. Por isso, a leitura correta é comparar o custo de servir com o custo de chamar uma API.

Qwen3.8-Max na prática: da captura de tela ao software rodando – Alibaba

A Alibaba concentrou os ganhos em programação, pesquisa e tarefas complexas. Além disso, listou capacidades que interessam a quem entrega produto.

O modelo replica softwares a partir de uma captura de tela. Também gera jogos interativos e animações. Da mesma forma, converte modelos 2D em 3D. E, como qualquer generativo atual, produz texto, áudio, vídeo e análise de dados.

O acesso acontece pelas APIs do Model Studio, que roda dentro da Alibaba Cloud. Junto disso, a empresa lançou o QwenWork em beta, uma plataforma unificada de produtividade.

Benchmarks: onde a Alibaba ganha e onde ela ainda perde

Nos testes divulgados pela própria empresa, o Qwen3.8-Max fica atrás do Fable 5 da Anthropic em alguns quesitos. Por outro lado, supera Opus 4.8, Gemini 3.1 Pro e GPT 5.6-Sol em desenvolvimento, capacidades agênticas e engenharia de software.

Contudo, existe um detalhe metodológico aqui. Esses números vieram do fabricante. Logo, o teste que vale para você é o seu próprio conjunto de tarefas reais. Depois disso, o ranking público vira apenas um ponto de partida.

DeepSeek V4-Flash e a conta de US$ 0,14 por milhão de tokens

A versão 0731 do DeepSeek V4-Flash foi apontada pela Artificial Analysis como a mais barata do segmento. O benchmark registra US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída.

Para efeito de comparação, os modelos da Anthropic lideram o ranking de desempenho e também aparecem como os mais caros. Assim, o mercado ganhou dois extremos claros na mesma tabela.

Vale um alerta, porém. Esse valor não corresponde ao uso real da sua aplicação. Ele mede o preço cobrado pelo volume processado e gerado em cada tarefa. Consequentemente, um modelo barato que precisa de três tentativas pode custar mais que um modelo caro certeiro na primeira.

Por que o preço do token virou decisão de arquitetura

Durante muito tempo, a escolha do modelo era discussão de qualidade. Agora, ela entrou no mesmo comitê que define banco de dados e fila de mensagens.

A razão é simples. Empresas começaram a reavaliar gastos com esse tipo de serviço. Como consequência, o roteamento entre modelos virou padrão de projeto. Tarefas triviais vão para o modelo econômico. Já as tarefas críticas seguem para o modelo forte.

Nesse cenário, código aberto muda o jogo de novo. Afinal, ele permite negociar preço com a própria infraestrutura.

Como testar o Qwen3.8-Max no seu projeto ainda esta semana

Comece separando de cinco a dez tarefas reais do seu backlog. Em seguida, rode as mesmas entradas no modelo atual e no candidato. Registre custo, latência e taxa de acerto na primeira tentativa.

Depois, isole o pior caso. Modelos grandes costumam brilhar em demonstração e tropeçar em contexto sujo. Portanto, use dados de produção anonimizados.

Enquanto os pesos não chegam ao Hugging Face, use as APIs do Model Studio para medir qualidade. Assim que os arquivos forem publicados, repita o teste em ambiente próprio. Dessa forma, você compara servir e chamar com números seus.

Por fim, guarde o histórico dessas medições. Como o mercado troca de líder a cada poucas semanas, o seu benchmark interno vira o ativo mais estável da equipe.

O que observar nos próximos meses

A pressão chinesa segue crescendo com modelos abertos, econômicos e capazes. Além da Alibaba, Moonshot AI e DeepSeek disputam o mesmo espaço. Consequentemente, a distância entre modelo fechado de ponta e modelo aberto acessível continua encolhendo.

Para quem escreve código, a conclusão é prática. Mantenha sua camada de integração agnóstica. Desse modo, trocar de provedor vira mudança de configuração e não refatoração de sprint inteira.

Acompanhe nosso perfil no Instagram!

Matérias especiais e reportagens conduzidas internamente pela Redação iMasters. Acompanhe no Twitter @imasters e no Instagram/Threads @portalimasters

Ver perfil