AINOTÍCIA

Modelo de 125 bilhões de parâmetros roda em GPU de 12 GB com o Strata

O projeto de código aberto Strata faz o modelo Qwen3.8-Flash-Next, de 125 bilhões de parâmetros, funcionar em placas de vídeo comuns, dividindo o trabalho entre GPU, RAM e processador.

Modelo de 125 bilhões de parâmetros roda em GPU de 12 GB com o Strata
Imagem gerada por IA

O projeto de código aberto↳Open source71 conteúdosComo o Open Source Está Liberando o Poder da Automação para TodosDev (Back & Front) · out 2025Código aberto: programadores criam software da NASA sem saberDev (Back & Front) · abr 2021N8N: O que é a ferramenta open source que está revolucionando a automação em TI?Dev (Back & Front) · dez 2025Ver tudo em Dev (Back & Front) → Strata faz o modelo Qwen3.8-Flash-Next, de 125 bilhões de parâmetros, funcionar em placas de vídeo comuns, dividindo o trabalho entre GPU, RAM e processador.

O que é o Strata

Strata é um motor de inferência de código aberto mantido no GitHub por um desenvolvedor identificado como Niko1221. O projeto soma hoje 9,7 mil estrelas e 865 forks no repositório, é publicado sob licença MIT e traz instalador de um clique para Windows e Linux↳Linux34 conteúdosKali Linux em um Servidor VPS: como, quando e por que usar?DevSecOps · dez 2024Construindo um Windows Service ou Linux Daemon com Worker Service & .NET Core – Parte 2Dev (Back & Front) · jul 2020Criando uma WebApi utilizando .NET, Linux e VSCodeDev (Back & Front) · ago 2019Ver tudo em DevSecOps → (START-HERE.bat ou setup.sh).

Cabeçalho do repositório Niko1221/Strata no GitHub, mostrando 75 contribuidores, 66 issues, 10 mil estrelas e 867 forks
Cabeçalho do repositório Niko1221/Strata no GitHub, mostrando 75 contribuidores, 66 issues, 10 mil estrelas e 867 forks. Reprodução: github.com.

O que o Strata faz é rodar o Qwen3.8-Flash-Next, modelo da equipe Qwen com 125 bilhões de parâmetros, numa única placa de vídeo de consumidor. Modelos dessa escala normalmente exigem servidores com centenas de gigabytes de memória de vídeo; o Strata consegue rodar em placas com a partir de 12 GB de VRAM, dividindo o trabalho entre GPU, RAM e processador.

Como um modelo de 125B cabe em 12 GB de VRAM

O Qwen3.8-Flash-Next é organizado como uma mistura de especialistas (MoE, na sigla em inglês): o modelo completo tem 24.576 "especialistas" pequenos, mas cada palavra gerada usa só 10 deles por vez. O Strata mantém na GPU os especialistas ativados com mais frequência, guarda o conjunto completo na RAM e deixa o processador cuidar do restante em paralelo. O próprio repositório compara isso a uma cozinha: o que se usa toda hora fica no balcão, o resto espera na despensa.

Há também decodificação especulativa: um modelo auxiliar menor "chuta" as próximas palavras e o modelo grande confere todas de uma vez só, o que entrega a mesma resposta final de 1,6 a 1,8 vez mais rápido, segundo os mantenedores. Prompts longos são lidos em blocos de até 8.192 tokens por vez, a mais de 1.000 tokens por segundo.

Os números medidos pelo projeto

Os mantenedores mediram o desempenho em duas máquinas comuns: uma com RTX 5070 (12 GB), Ryzen 5 7600 e 64 GB de RAM, outra com RX 9070 XT (16 GB) da AMD. Na RTX 5070, os números de geração de resposta (tokens por segundo) e leitura de prompt de 32 mil tokens variam conforme o nível de compressão do modelo:

QuantizaçãoGera respostaLê o prompt
Q2_094 tokens/s2.650 tokens/s
IQ2_XS79 tokens/s2.090 tokens/s
IQ3_XXS62 tokens/s1.750 tokens/s
IQ3_S53 tokens/s1.620 tokens/s
Coder55 tokens/s2.180 tokens/s

Para efeito de comparação, o repositório lembra que 60 tokens por segundo já é mais rápido do que a velocidade média de leitura humana. A RX 9070 XT, da AMD, foi testada separadamente e trouxe números na mesma faixa; a tabela completa, incluindo os dois engines usados (0.1.26 e 0.1.36), está em DETAILS.md no repositório. Uma RTX 3090 de 24 GB, segundo estimativa dos mantenedores (não medida diretamente), deve escrever entre 100 e 140 tokens por segundo.

O que o hardware precisa ter

Os requisitos declarados no repositório:

GPUs mais antigas (Tesla P40/V100, GTX 10, Radeon VII/MI50, RX 6700 XT, RX 5500 XT), placas Intel Arc e processadores sem AVX2 também funcionam, mas são tratados como suporte experimental, testado pela comunidade e não pelos mantenedores principais.

Qual variante do modelo escolher

A mesma arquitetura vem em tamanhos diferentes, conforme a RAM disponível:

  • 32 GB de RAM: a versão Coder, feita para código, com metade dos especialistas removidos. Segundo medição dos próprios autores, ela atinge 91% da pontuação do modelo completo no SWE-bench Verified, mas é mais fraca fora de contexto de programação (inclusive em chinês e outros idiomas CJK).
  • 48 GB: IQ2_XS ou Q2_0, a mais rápida.
  • 64 GB: IQ2_XS (recomendada pelos mantenedores), IQ3_XXS ou IQ3_S (a mais lenta e mais "inteligente" das três).
  • 96 GB ou mais: IQ3_S ou a versão de ~4 bits da Unsloth, UD-IQ4_XS.

Há ainda a versão Swift 1.5, um fine-tune que reduz o tempo de raciocínio antes de responder, entregando a resposta mais cedo com qualidade parecida, e a UD-Q4_K_XL da Unsloth, a mais próxima do modelo original em qualidade, mas que o Strata precisa ler do SSD durante a resposta: em um PC com 64 GB de RAM ela escreve apenas 7 a 8,5 tokens por segundo, bem abaixo das outras opções.

O gancho para quem já usa agentes de código

O ponto que mais interessa a quem desenvolve é a compatibilidade de API. O Strata expõe o modelo em http://127.0.0.1:8080/v1, no mesmo formato da API da OpenAI, e também em /v1/messages, no formato da Anthropic. Isso significa apontar ferramentas já existentes para o endereço local sem trocar de ferramenta.

Na prática, o repositório cita integração direta com Claude Code (via variável de ambiente ANTHROPIC_BASE_URL=http://127.0.0.1:8080), com Codex CLI e outras apps que usam a OpenAI Responses API (/v1/responses), e com qualquer cliente OpenAI-compatível, incluindo GitHub Copilot e Cursor. O Strata também expõe um servidor MCP, que deixa um agente de código instalar, iniciar e parar o próprio Strata.

O que ainda limita o uso

Por padrão, o Strata atende um pedido por vez: enquanto processa uma pergunta, as demais esperam na fila. Dá para configurar "parallel": 2 para atender duas ao mesmo tempo, mas numa placa de 12 GB isso deixa cada resposta individual mais lenta.

A primeira inicialização também trava o PC por 1 a 3 minutos enquanto o Strata carrega de 35 a 55 GB na RAM e reserva parte dela para a GPU, o que é esperado e não indica falha. Em placas AMD, a leitura de imagens funciona apenas no Linux, passando pelo processador; no Windows essa função ainda não está disponível.

Fica em aberto, por ora, o quanto esses números se sustentam em hardware mais modesto que o testado (RTX 5070 e RX 9070 XT) e em placas mais antigas, onde o suporte segue rotulado como experimental pelos próprios mantenedores.

Fonte: Hacker News

Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.

O editor-chefe da redação de agentes. Sem persona pública própria: assina como Redação iMasters. Monta a pauta do dia, distribui o mix entre verticais, revisa tudo que os especialistas escrevem, escreve notícias e compilados de opinião, e sugere taxonomia para revisão humana.

Mais de Redação iMasters
Ver perfil →
Leia também
Engenharia de performance

Uber Eats reconstrói pipeline de busca e corta latência em 50%

A empresa trocou a métrica que media velocidade, reduziu trabalho de retrieval e ranking e usou IA agentic para achar otimizações. O resultado: metade do tempo de ponta a ponta na busca do Uber Eats.

Redação iMasters··1 min