O projeto de código aberto Strata faz o modelo Qwen3.8-Flash-Next, de 125 bilhões de parâmetros, funcionar em placas de vídeo comuns, dividindo o trabalho entre GPU, RAM e processador.

O projeto de código aberto↳Open source71 conteúdosComo o Open Source Está Liberando o Poder da Automação para TodosDev (Back & Front) · out 2025Código aberto: programadores criam software da NASA sem saberDev (Back & Front) · abr 2021N8N: O que é a ferramenta open source que está revolucionando a automação em TI?Dev (Back & Front) · dez 2025Ver tudo em Dev (Back & Front) → Strata faz o modelo Qwen3.8-Flash-Next, de 125 bilhões de parâmetros, funcionar em placas de vídeo comuns, dividindo o trabalho entre GPU, RAM e processador.
O que é o Strata
Strata é um motor de inferência de código aberto mantido no GitHub por um desenvolvedor identificado como Niko1221. O projeto soma hoje 9,7 mil estrelas e 865 forks no repositório, é publicado sob licença MIT e traz instalador de um clique para Windows e Linux↳Linux34 conteúdosKali Linux em um Servidor VPS: como, quando e por que usar?DevSecOps · dez 2024Construindo um Windows Service ou Linux Daemon com Worker Service & .NET Core – Parte 2Dev (Back & Front) · jul 2020Criando uma WebApi utilizando .NET, Linux e VSCodeDev (Back & Front) · ago 2019Ver tudo em DevSecOps → (START-HERE.bat ou setup.sh).

O que o Strata faz é rodar o Qwen3.8-Flash-Next, modelo da equipe Qwen com 125 bilhões de parâmetros, numa única placa de vídeo de consumidor. Modelos dessa escala normalmente exigem servidores com centenas de gigabytes de memória de vídeo; o Strata consegue rodar em placas com a partir de 12 GB de VRAM, dividindo o trabalho entre GPU, RAM e processador.
Como um modelo de 125B cabe em 12 GB de VRAM
O Qwen3.8-Flash-Next é organizado como uma mistura de especialistas (MoE, na sigla em inglês): o modelo completo tem 24.576 "especialistas" pequenos, mas cada palavra gerada usa só 10 deles por vez. O Strata mantém na GPU os especialistas ativados com mais frequência, guarda o conjunto completo na RAM e deixa o processador cuidar do restante em paralelo. O próprio repositório compara isso a uma cozinha: o que se usa toda hora fica no balcão, o resto espera na despensa.
Há também decodificação especulativa: um modelo auxiliar menor "chuta" as próximas palavras e o modelo grande confere todas de uma vez só, o que entrega a mesma resposta final de 1,6 a 1,8 vez mais rápido, segundo os mantenedores. Prompts longos são lidos em blocos de até 8.192 tokens por vez, a mais de 1.000 tokens por segundo.
Os números medidos pelo projeto
Os mantenedores mediram o desempenho em duas máquinas comuns: uma com RTX 5070 (12 GB), Ryzen 5 7600 e 64 GB de RAM, outra com RX 9070 XT (16 GB) da AMD. Na RTX 5070, os números de geração de resposta (tokens por segundo) e leitura de prompt de 32 mil tokens variam conforme o nível de compressão do modelo:
| Quantização | Gera resposta | Lê o prompt |
|---|---|---|
| Q2_0 | 94 tokens/s | 2.650 tokens/s |
| IQ2_XS | 79 tokens/s | 2.090 tokens/s |
| IQ3_XXS | 62 tokens/s | 1.750 tokens/s |
| IQ3_S | 53 tokens/s | 1.620 tokens/s |
| Coder | 55 tokens/s | 2.180 tokens/s |
Para efeito de comparação, o repositório lembra que 60 tokens por segundo já é mais rápido do que a velocidade média de leitura humana. A RX 9070 XT, da AMD, foi testada separadamente e trouxe números na mesma faixa; a tabela completa, incluindo os dois engines usados (0.1.26 e 0.1.36), está em DETAILS.md no repositório. Uma RTX 3090 de 24 GB, segundo estimativa dos mantenedores (não medida diretamente), deve escrever entre 100 e 140 tokens por segundo.
O que o hardware precisa ter
Os requisitos declarados no repositório:
- GPU: NVIDIA GeForce RTX série 20, 30, 40 ou 50, ou AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI↳Inteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI → PRO R9700 ou RX 6800/6900, com 12 GB de VRAM ou mais.
- RAM: 32 GB ou mais; a quantidade de RAM é o que decide qual tamanho de modelo cabe, e 64 GB roda qualquer tamanho.
- Disco: cerca de 80 GB livres, de preferência em SSD (o download do modelo gira em torno de 70 GB).
- Sistema: Windows 10/11 ou Linux, com driver de GPU atualizado.
GPUs mais antigas (Tesla P40/V100, GTX 10, Radeon VII/MI50, RX 6700 XT, RX 5500 XT), placas Intel Arc e processadores sem AVX2 também funcionam, mas são tratados como suporte experimental, testado pela comunidade e não pelos mantenedores principais.
Qual variante do modelo escolher
A mesma arquitetura vem em tamanhos diferentes, conforme a RAM disponível:
- 32 GB de RAM: a versão Coder, feita para código, com metade dos especialistas removidos. Segundo medição dos próprios autores, ela atinge 91% da pontuação do modelo completo no SWE-bench Verified, mas é mais fraca fora de contexto de programação (inclusive em chinês e outros idiomas CJK).
- 48 GB:
IQ2_XSouQ2_0, a mais rápida. - 64 GB:
IQ2_XS(recomendada pelos mantenedores),IQ3_XXSouIQ3_S(a mais lenta e mais "inteligente" das três). - 96 GB ou mais:
IQ3_Sou a versão de ~4 bits da Unsloth, UD-IQ4_XS.
Há ainda a versão Swift 1.5, um fine-tune que reduz o tempo de raciocínio antes de responder, entregando a resposta mais cedo com qualidade parecida, e a UD-Q4_K_XL da Unsloth, a mais próxima do modelo original em qualidade, mas que o Strata precisa ler do SSD durante a resposta: em um PC com 64 GB de RAM ela escreve apenas 7 a 8,5 tokens por segundo, bem abaixo das outras opções.
O gancho para quem já usa agentes de código
O ponto que mais interessa a quem desenvolve é a compatibilidade de API. O Strata expõe o modelo em http://127.0.0.1:8080/v1, no mesmo formato da API da OpenAI, e também em /v1/messages, no formato da Anthropic. Isso significa apontar ferramentas já existentes para o endereço local sem trocar de ferramenta.
Na prática, o repositório cita integração direta com Claude Code (via variável de ambiente ANTHROPIC_BASE_URL=http://127.0.0.1:8080), com Codex CLI e outras apps que usam a OpenAI Responses API (/v1/responses), e com qualquer cliente OpenAI-compatível, incluindo GitHub Copilot e Cursor. O Strata também expõe um servidor MCP, que deixa um agente de código instalar, iniciar e parar o próprio Strata.
O que ainda limita o uso
Por padrão, o Strata atende um pedido por vez: enquanto processa uma pergunta, as demais esperam na fila. Dá para configurar "parallel": 2 para atender duas ao mesmo tempo, mas numa placa de 12 GB isso deixa cada resposta individual mais lenta.
A primeira inicialização também trava o PC por 1 a 3 minutos enquanto o Strata carrega de 35 a 55 GB na RAM e reserva parte dela para a GPU, o que é esperado e não indica falha. Em placas AMD, a leitura de imagens funciona apenas no Linux, passando pelo processador; no Windows essa função ainda não está disponível.
Fica em aberto, por ora, o quanto esses números se sustentam em hardware mais modesto que o testado (RTX 5070 e RX 9070 XT) e em placas mais antigas, onde o suporte segue rotulado como experimental pelos próprios mantenedores.
Fonte: Hacker News
Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
Uber Eats reconstrói pipeline de busca e corta latência em 50%
A empresa trocou a métrica que media velocidade, reduziu trabalho de retrieval e ranking e usou IA agentic para achar otimizações. O resultado: metade do tempo de ponta a ponta na busca do Uber Eats.













