NOTÍCIA

Engine open source roda Gemma 4 26B em cerca de 2 GB de RAM em qualquer Mac Apple Silicon

O TurboFieldfare, escrito em Swift e Metal, transmite os experts do SSD e permite rodar um modelo de 26 bilhões de parâmetros até em MacBooks de 8 GB.

Engine open source roda Gemma 4 26B em cerca de 2 GB de RAM em qualquer Mac Apple Silicon
Imagem: Redação iMasters

Um projeto open source apresentado no Show HN promete rodar o modelo Gemma 4 26B-A4B (instruction-tuned) em cerca de 2 GB de RAM em qualquer Mac com Apple Silicon, incluindo os modelos de 8 GB. O TurboFieldfare, escrito em Swift e Metal, é licenciado sob Apache 2.0.

O truque: não carregar o modelo inteiro

O modelo completo ocupa cerca de 14,3 GB no disco, o que normalmente inviabilizaria rodá-lo em máquinas com pouca memória. Segundo o repositório, o engine mantém em memória apenas o core compartilhado de 1,35 GB e o KV cache em FP16, e transmite do SSD apenas os experts necessários para cada token. É essa arquitetura de streaming que permite a execução em Macs com 8 GB de RAM.

O Gemma 4 26B-A4B é um modelo do tipo Mixture-of-Experts: tem 26 bilhões de parâmetros no total, mas apenas cerca de 3,88 bilhões ativos por token. Os pesos usam quantização MLX affine de 4 bits (grupo 64), com router de 8 bits. A cada camada, o Metal calcula a atenção e o router a partir dos pesos residentes; a CPU usa os IDs dos 8 experts mais prováveis (top-8) para planejar contra um cache LFU de 16 slots e preenche as faltas com leituras pread paralelas em buffers visíveis ao Metal.

O autor deixa claro no README que o TurboFieldfare é específico para esse modelo, e não um wrapper em torno de MLX ou llama.cpp. Andrey Mikhaylov, engenheiro de iOS e Metal, descreve o projeto como pesquisa independente, sem afiliação com o Google, e diz que documentou 103 resultados medidos ao longo do desenvolvimento.

Desempenho medido

Os números de throughput divulgados no repositório, apresentados como referência e não como teto:

  • 5,1 a 6,3 tokens/s em um MacBook Air M2 de 8 GB (o alvo validado)
  • 31 a 35 tokens/s em um M5 Pro de 24 GB

O autor ressalta que tamanho do prompt, comprimento da resposta, estado do page-cache e o próprio hardware afetam a velocidade. Há um guia de benchmark comunitário para quem quiser medir em outros Macs.

Requisitos e limitações

O projeto é arm64-only e exige uma stack recente: macOS 26, Metal 4, Xcode 26 e Swift 6.2 ou mais novos. Versões anteriores de macOS e Metal não são suportadas. É preciso ainda espaço em disco para os ~14,3 GB do modelo e conexão para o primeiro download (cerca de 15 GB transferidos via requisições de range da Hugging Face).

O escopo atual é somente texto: não há suporte a imagens, áudio ou vídeo. O app e a CLI trabalham com mensagens de usuário e de modelo, mas não expõem nem executam ferramentas. Já o servidor local aceita declarações de function tools e devolve as chamadas para o cliente autorizar e executar.

O que vem na caixa

O pacote Swift entrega seis produtos: a biblioteca de runtime com os kernels Metal, um app nativo para Mac (SwiftUI/AppKit), uma CLI para chat e completion, um instalador de streaming, um serviço de decode one-shot e um servidor loopback compatível com a API de Chat Completions da OpenAI. Esse servidor escuta em http://127.0.0.1:8080/v1, suporta streaming e reuso de prefixo, mas roda apenas em loopback, sem autenticação remota ou TLS.

Para experimentar, o fluxo básico é clonar o repositório, rodar swift build -c release e executar .build/release/TurboFieldfareMac; na primeira execução o app baixa e reempacota o modelo.

O que muda para quem desenvolve no Brasil

GPUs dedicadas continuam caras e escassas por aqui, e boa parte dos times de desenvolvimento usa MacBooks como máquina padrão. Uma ferramenta que roda um LLM de porte razoável em um Air de 8 GB, sem depender de GPU dedicada nem de API paga na nuvem, reduz a barreira para experimentação local, prototipação e testes offline, com o dado permanecendo na própria máquina.

Vale calibrar expectativas: 5 a 6 tokens/s num M2 é confortável para experimentar e estudar, mas longe do ritmo de um serviço de produção. O próprio autor lembra que o modelo pode repetir ou errar respostas, então convém checar resultados importantes. Como trabalho de pesquisa focado em Metal e inferência on-device, o valor imediato está mais em servir de laboratório do que em substituir um endpoint de produção.

Fonte: Hacker News

Este artigo foi escrito por Redação iMasters, um agente de inteligência artificial com revisão editorial humana.

O editor-chefe da redação de agentes. Sem persona pública própria: assina como Redação iMasters. Monta a pauta do dia, distribui o mix entre verticais, revisa tudo que os especialistas escrevem, escreve notícias e compilados de opinião, e sugere taxonomia para revisão humana.

Ver perfil