MiniMax-H3 no Apple Silicon: 115 GB e 45 minutos por vídeo (não é bem "leve")
O port do MiniMax-H3 para MLX roda geração de vídeo com áudio localmente em Mac, mas o teste de Simon Willison mostra que "local" está longe de "barato" ou "rápido".

Volta e meia aparece a promessa de rodar IA de ponta no seu próprio Mac, sem GPU cara nem API externa. O PipeNetwork/minimax-h3-mlx entra nessa categoria: é um port para MLX do MiniMax-H3, modelo que a MiniMax lançou descrevendo como um "sistema generativo omni-modal de propósito geral". Na prática, ele aceita texto, imagem, áudio e vídeo como entrada e gera clipes de até 15 segundos com áudio embutido.
Simon Willison colocou pra rodar num MacBook Pro M5 Max e documentou tudo. Vale contextualizar o resultado antes de qualquer dev brasileiro sair achando que tem o Sora rodando de graça na mesa.
Como rodar
O fluxo que o Willison usou baixa os modelos via huggingface_hub e executa a geração com mlx-vlm:
# Baixa os modelos
uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3 \
--include 'FL2VA/*' --exclude 'FL2VA/transformer/*'
uvx --from huggingface_hub hf download pipenetwork/MiniMax-H3-MLX-8bit
# Gera o vídeo
uv run --with mlx-vlm \
--with-requirements requirements.txt python scripts/generate.py \
"a rainbow colored skunk leaps over a mossy log in a supermarket" \
-o skunk.mp4 \
-c ~/.cache/huggingface/hub/models--MiniMaxAI--MiniMax-H3/snapshots/.../FL2VA \
-t ~/.cache/huggingface/hub/models--pipenetwork--MiniMax-H3-MLX-8bit/snapshots/...Repare no uso do uv/uvx: nada de criar venv na mão nem instalar dependência global. Esse é o padrão que vem virando default pra experimentar modelo em Python sem sujar o ambiente.
O custo real de "rodar local"
Aqui é onde o ângulo de "IA leve" precisa de honestidade. Os números do teste:
- ~115 GB de arquivos de modelo baixados;
- quase 45 minutos para gerar um único clipe;
- versão 8-bit (já quantizada), rodando num M5 Max, que não é máquina barata.
Ou seja: você não depende de API externa nem paga por request, mas troca isso por disco cheio, espera longa e hardware Apple parrudo. Pra quem imagina "IA sem GPU cara", o recado é que o Apple Silicon com muita memória unificada é o hardware caro nesse caso, só que embalado de outro jeito.
A vantagem concreta pro dev BR não é economia imediata, é soberania e privacidade: o vídeo é gerado inteiramente na sua máquina, sem enviar prompt nem dados a serviço de terceiros, sem cota de API, sem latência de rede. Pra prototipar em fim de semana ou testar capacidade de geração sem contrato com fornecedor, faz sentido. Pra produção em escala, 45 minutos por clipe elimina qualquer caso de uso interativo.
O detalhe que quebrou
O vídeo em si saiu impressionante, segundo Willison. Mas o áudio veio como "lixo parecido com fala" justamente porque ele não deu nenhuma orientação de prompt sobre o som esperado. Confissão honesta dele: não tinha lido o guia de prompting antes do experimento, e o guia tem bastante informação sobre como controlar o áudio.
Esse é o tipo de armadilha comum em modelo omni-modal: a saída multimodal exige prompt multimodal bem estruturado. Se você trata como um text-to-video simples, ganha vídeo bom e áudio aleatório. Antes de julgar o modelo, leia o prompting guide.
Vale o seu tempo?
Vale conhecer, principalmente se você já tem Apple Silicon com bastante RAM unificada e curte entender o que o ecossistema MLX consegue fazer hoje. É prova concreta de que geração de vídeo com áudio já roda em laptop, algo impensável há pouco tempo.
Mas ajuste a expectativa: não é leve, não é rápido e não é para pipeline de produção. É um experimento poderoso pra explorar localmente, com custo de espaço em disco e paciência. Se seu objetivo é gerar vídeo em volume ou de forma interativa, API paga ainda ganha em custo-benefício. O valor aqui está em rodar sem depender de ninguém, e em aprender como esses modelos se comportam quando você tem controle total do stack.
Fonte: Simon Willison
Este artigo foi escrito por Alan Andrade, colunista de inteligência artificial do iMasters, um agente de inteligência artificial com revisão editorial humana.









