Aleph Alpha lança Kolibri, modelo aberto de 78B parâmetros para rodar on-premise
Empresa alemã libera pesos completos sob Apache 2.0, com foco em soberania de dados, mas ainda sem suporte a português

A empresa alemã Aleph Alpha liberou os pesos completos do Kolibri sob licença Apache 2.0, uma alternativa de código aberto↳Open source71 conteúdosComo o Open Source Está Liberando o Poder da Automação para TodosDev (Back & Front) · out 2025Código aberto: programadores criam software da NASA sem saberDev (Back & Front) · abr 2021N8N: O que é a ferramenta open source que está revolucionando a automação em TI?Dev (Back & Front) · dez 2025Ver tudo em Dev (Back & Front) → pensada para quem precisa rodar modelos de linguagem↳LLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI → localmente, sem mandar dados para APIs de terceiros. O modelo ainda não tem foco em português, mas o desenho técnico interessa a quem pensa em soberania de dados no Brasil.
A empresa alemã Aleph Alpha liberou os pesos completos do Kolibri sob licença Apache 2.0, uma alternativa de código aberto pensada para quem precisa rodar modelos de linguagem localmente, sem mandar dados para APIs de terceiros. O modelo ainda não tem foco em português, mas o desenho técnico interessa a quem pensa em soberania de dados no Brasil.
A Aleph Alpha, empresa alemã de IA, liberou em 3 de outubro de 2026 os pesos completos do Kolibri, um modelo de linguagem Mixture-of-Experts bilíngue inglês-alemão, sob licença Apache 2.0. O download está disponível no Hugging Face, conforme o blog oficial da empresa. A data não foi escolhida à toa: 3 de outubro é o Dia da Reunificação Alemã, e a empresa fez questão de marcar o lançamento no feriado nacional.
O que é o Kolibri
O Kolibri tem 78,1 bilhões de parâmetros totais, mas ativa apenas 3,46 bilhões por token graças à arquitetura MoE (Mixture of Experts), com 384 experts dos quais 6 são ativados a cada passagem. Segundo a Aleph Alpha, o modelo suporta contextos de até 1 milhão de tokens, embora a tabela técnica publicada no mesmo post mostre que o treinamento efetivo chegou a 256 mil tokens (262.144), com extensão adicional via adaptação de contexto longo.
O modelo foi desenhado para setores regulados como administração pública, indústria e aeroespacial, com ênfase em raciocínio, matemática e comportamento agêntico. A proposta central, segundo a empresa, é permitir que clientes rodem o modelo on-premise, sem enviar dados internos para serviços de inferência de terceiros.
Da Origin ao Kolibri em três meses
O Kolibri é a segunda geração de um pipeline de treinamento construído pela Aleph Alpha ao longo de 2026. A primeira, batizada Kolibri Origin, terminou o pré-treinamento em 11 de junho e nunca teve lançamento público; serviu para validar a esteira de treinamento. O Kolibri terminou o pré-treinamento em 11 de setembro, apenas três meses depois.
| Característica | Kolibri Origin | Kolibri |
|---|---|---|
| Parâmetros totais | 30,6B | 78,1B |
| Parâmetros ativos/token | 3,27B | 3,46B |
| Tokens de pré-treinamento | 7,51T | 20T |
| Contexto máximo treinado | 65.536 | 262.144 |
| Modos de raciocínio | 1 | 4 (nenhum, baixo, médio, alto) |
Nesse intervalo, a equipe triplicou o número de experts, trocou o algoritmo de roteamento, mudou o design de atenção e mais que dobrou as tarefas de ambiente usadas no pós-treinamento por reforço. Para quem lida com infraestrutura de ML, o dado mais relevante é operacional: ao longo de 21 dias de pré-treinamento, a Aleph Alpha registrou 38 interrupções não planejadas (cerca de uma a cada 10 mil horas de GPU), todas recuperadas automaticamente pelo pipeline, que reinicia o job em outro conjunto de nós a partir de um checkpoint no máximo 250 passos atrás.
O treinamento rodou em 768 GPUs B200, somando quase 24 trilhões de tokens entre pré-treinamento (20T), treinamento intermediário em 64k de contexto (3,44T) e adaptação a contexto longo em 256k (200B). A empresa também introduziu uma técnica própria de balanceamento de experts por quantil exato, evoluindo uma ideia que o Kimi K3 havia implementado de forma aproximada.
Eficiência antes de tamanho
A Aleph Alpha testou escalar o modelo até 123B de parâmetros totais e viu ganhos de qualidade, mas o custo de servir inviabilizou a escolha: segundo a empresa, um modelo de 123B processa só 3 requisições simultâneas de 256k tokens em duas GPUs H100, contra 18 requisições simultâneas do Kolibri de 78B, que ainda decodifica 28% mais rápido. Essa troca (menos parâmetros ativos, mais throughput) é o argumento central de eficiência do lançamento.
Nos benchmarks públicos divulgados, o Kolibri aparece equiparado a modelos com até quatro vezes mais parâmetros ativos, como o Nemotron 3 Super (120B total, 12B ativos):
| Benchmark | Kolibri | Kolibri Origin | Nemotron 3 Super |
|---|---|---|---|
| AIME 2025 | 96,9 | 81,9 | 91,7 |
| GPQA (diamond) | 84,3 | 68,1 | 78,0 |
| HumanEval+ | 92,7 | 76,8 | 94,7 |
| LiveCodeBench v6 | 85,9 | 59,2 | 82,0 |
Os números mostram um salto grande sobre o Kolibri Origin, mas resultado misto contra concorrentes maiores: o Kolibri perde em HumanEval+ para o Nemotron (92,7 vs 94,7), mas vence em LiveCodeBench v6 (85,9 vs 82,0), mesmo usando uma fração dos parâmetros ativos.
Soberania por design
A Aleph Alpha descreve o Kolibri como construído desde a concepção para atender ao AI Act europeu, ao Code of Practice para IA de propósito geral e ao GDPR, com atenção específica a direitos autorais.
Nossas equipes construíram o modelo na Alemanha, treinaram-no em infraestrutura na Alemanha e na Finlândia, sob lei europeia e alemã, sem controle estrangeiro.
Our teams built the model in Germany, trained it on infrastructure in Germany and Finland, under European and German law, with no foreign control.Aleph Alpha, blog oficial
O modelo também foi treinado para admitir desconhecimento: por meio do que a empresa chama de protocolo Merlin-Arthur, o Kolibri é incentivado a responder "não sei" quando o contexto fornecido não sustenta uma resposta, em vez de alucinar. É um recurso pensado para aplicações de busca em documentos corporativos, em que uma resposta inventada custa caro.
O que isso significa pra quem desenvolve no Brasil
O Kolibri não é um modelo para português: o tokenizer e os dados de treinamento priorizam inglês (62%) e alemão (cerca de 21%, ou 4,3 trilhões de tokens), com apenas 6% de tradução usada de forma deliberadamente limitada. Quem quiser usar o modelo em produtos para o público brasileiro vai precisar de fine-tuning próprio, e a licença Apache 2.0 permite exatamente isso: baixar os pesos completos e adaptar.
O ponto que interessa a times de engenharia por aqui é o desenho de custo. Com apenas 3,46B de parâmetros ativos, o Kolibri foi otimizado para caber em infraestrutura menor do que a de modelos densos equivalentes, o que reduz a barreira para empresas e órgãos públicos que querem parar de depender de APIs como as da OpenAI por motivos de custo, latência ou política de dados. No Brasil, essa discussão já aparece em debates sobre soberania de nuvem e hospedagem de dados sensíveis em órgãos de governo, ainda que nenhum projeto nacional tenha anunciado algo equivalente ao Kolibri.
A diferença prática está em caminhos distintos: pagar por token em uma API fechada versus rodar um modelo aberto na própria infraestrutura, assumindo os custos de GPU e manutenção. O Kolibri entrega essa segunda opção com benchmarks competitivos, mas sem suporte nativo ao idioma do maior mercado de língua portuguesa do mundo.
O que fica em aberto
A Aleph Alpha afirma estar contemplando escalar ainda mais o pipeline usado no Kolibri, mas reconhece que o salto de 30B para 78B parâmetros foi "a direção fácil": mais dados, mais parâmetros, arquitetura já conhecida. Não há, por ora, anúncio de uma versão com cobertura de português ou de outras línguas além de inglês e alemão, nem detalhamento público de custos de hospedagem para quem for rodar o modelo fora do ambiente de testes da própria empresa.
Fonte: Hacker News
Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
Falha no app do ChatGPT para Mac permitia roubo de dados sensíveis dos usuários
Pesquisadores da Objective-See Foundation encontraram uma brecha













