A Moonshot AI acaba de apresentar o Kimi K3, o modelo de código aberto mais volumoso já divulgado. Com 2,8 trilhões de parâmetros, ele entra na chamada classe de 3 trilhões. Além disso, a startup chinesa promete desempenho próximo ao dos sistemas proprietários mais fortes do mercado. Para quem programa, portanto, vale entender o que está por trás desse número.
Primeiro, um recado importante. Os pesos completos chegam apenas no dia 27 de julho. Até lá, cada métrica divulgada segue como uma promessa da própria Moonshot. Ainda assim, os detalhes de arquitetura já revelam decisões técnicas ousadas.
O que muda quando 896 especialistas dividem o trabalho
O Kimi K3 usa uma arquitetura Mixture of Experts. Na prática, o modelo guarda 896 especialistas internos. Porém, a cada token, ele ativa apenas 16 deles. Ou seja, você carrega um conhecimento gigante e paga por uma fração da conta a cada inferência.
Essa esparsidade explica o truque central do projeto. O custo de inferência imita o de um modelo bem menor. Dessa forma, a Moonshot escala a base de conhecimento sem explodir o consumo de computação. Para times de engenharia, esse equilíbrio muda o cálculo de viabilidade.
Kimi Delta Attention: por que o cache de KV encolhe tanto
A segunda peça vem da atenção. A empresa desenvolveu o Kimi Delta Attention, um mecanismo de atenção linear híbrida. Ele intercala camadas de atenção linear com camadas de atenção completa numa proporção de três para um. Assim, três camadas leves tratam a estrutura local da sequência. Em seguida, uma camada completa preserva o fluxo global de informação.
O ganho aparece direto na memória. Segundo a Moonshot, o desenho corta o cache de KV em até 75%. Além disso, a decodificação chega a ser seis vezes mais rápida em contextos de 1 milhão de tokens. Para agentes de longa duração, portanto, esse número pesa muito no orçamento.
Há ainda uma segunda inovação chamada Attention Residuals. Ela funciona como substituição direta das conexões residuais tradicionais. Com isso, o modelo recupera representações ao longo da profundidade de forma seletiva. As duas técnicas já saíram como pesquisa aberta no GitHub da equipe.
1 milhão de tokens de contexto: o que isso libera de verdade
O Kimi K3 trabalha com 1 milhão de tokens de contexto de forma nativa. Além disso, ele traz compreensão visual nativa e um modo de raciocínio sempre ativo. Na prática, você joga um repositório inteiro no prompt e ainda sobra espaço. Depois, pode encadear tarefas longas sem quebrar o histórico.
Esse tipo de janela abre caminhos concretos. Por exemplo, revisões de código em bases enormes ganham fôlego. Da mesma forma, pipelines que trituram documentos extensos rodam em uma passada só. O cache automático de contexto ajuda a segurar a latência da API.
Kimi K3 nos benchmarks: onde ele já mostra força
Os resultados iniciais chamam atenção. No Frontend Code Arena, por exemplo, o Kimi K3 ficou em primeiro lugar em testes cegos de desenvolvedores. Ele passou até o Fable 5 da Anthropic nesse recorte específico. Além disso, subiu ao segundo lugar em um teste da Artificial Analysis que mede trabalho de conhecimento de longo prazo.
Ainda assim, a própria Moonshot reconhece limites. Em desempenho geral, o modelo segue atrás do Fable 5 e do GPT 5.6 Sol. Contudo, ele superou o Claude Opus 4.8 e o GPT 5.5 em várias provas de código e de agentes. Enquanto os pesos ficam guardados, todo número continua como afirmação do fabricante.
Hospedar internamente ou consumir via API: faça a conta
Aqui mora a decisão prática para o seu time. Rodar algo perto de 3 trilhões de parâmetros exige músculo pesado. Segundo estimativas da comunidade, você precisa de oito a dezesseis nós com oito GPUs H100 ou B200 cada. Portanto, hospedar por conta própria só faz sentido em escala.
Para a maioria dos times, então, a API entra como caminho natural. A Moonshot cita cache automático de contexto para cortar latência e custo. Além disso, a licença aberta abre espaço para adaptações de domínio. Assim, empresas fogem do aprisionamento de fornecedor e mantêm o desempenho.
27 de julho: o dia em que a prova real começa
A data marca a virada do jogo. Quando os pesos abertos chegarem, a comunidade poderá reproduzir os benchmarks. Além disso, poderá adaptar o modelo para casos específicos e auditar a arquitetura. Então, cada afirmação de hoje vira teste concreto no seu ambiente.
Enquanto isso, vale preparar terreno. Primeiro, mapeie onde uma janela de 1 milhão de tokens resolve dor real no seu produto. Depois, estime o custo entre API e hospedagem interna. Dessa forma, você chega no dia 27 pronto para medir e comparar dentro do seu próprio ambiente.
Acompanhe nosso perfil no Instagram!



