Mythos 5: o que o placar do GLM 5.3 revela sobre modelos ofensivos
Mythos 5 virou régua de comparação em cibersegurança, e a cobrança veio da China. A Z.ai fez o anúncio na sexta, 14 de agosto.

Mythos 5 virou régua de comparação em cibersegurança↳Segurança171 conteúdosCibersegurança no Brasil: 6 passos para sair da estagnaçãoDevSecOps · jul 2025O papel do CISO para transformar a cibersegurança em uma alavanca de reputação para as empresasDevSecOps · mar 2024Itaipu Parquetec e Exército Brasileiro realizam exercício de cibersegurança em BrasíliaDev (Back & Front) · set 2025Ver tudo em DevSecOps →, e a cobrança veio da China. A Z.ai fez o anúncio na sexta, 14 de agosto. Segundo a empresa, o modelo de código aberto↳Open source71 conteúdosComo o Open Source Está Liberando o Poder da Automação para TodosDev (Back & Front) · out 2025Código aberto: programadores criam software da NASA sem saberDev (Back & Front) · abr 2021N8N: O que é a ferramenta open source que está revolucionando a automação em TI?Dev (Back & Front) · dez 2025Ver tudo em Dev (Back & Front) → GLM 5.3 chegou perto do modelo da Anthropic em testes ofensivos. Para quem escreve código, o detalhe importa mais do que o placar. Afinal, o que esses benchmarks medem tem relação direta com o seu backlog de segurança.
Empate na hora de achar a falha, distância na hora de explorar
No CyberGym, o GLM 5.3 marcou 84,5%. O Mythos 5 ficou logo atrás, com 83,8%. Ou seja, a diferença cabe dentro do ruído de qualquer rodada de testes. Esse teste cobra leitura de código, identificação da falha e prova de que a vulnerabilidade existe.
Porém, o cenário muda no ExploitBench. Ali o GLM 5.3 alcançou 54,4%, enquanto o Mythos 5 chegou a 78%. Portanto, a distância aparece justamente na etapa que gera dano real.
CyberGym mede leitura. ExploitBench mede consequência.
Encontrar um bug pede contexto e paciência. Escrever um exploit funcional pede cadeia completa. Primeiro vem o controle do fluxo de execução. Depois vem o desvio de proteções como ASLR, canários de pilha e sandbox. Por fim vem a estabilidade, porque o ataque precisa funcionar mais de uma vez.
Na prática, um relatório de falha vira item de backlog. Já um exploit funcional vira incidente com hora marcada.
O relógio expõe a diferença que o percentual esconde
A Z.ai também divulgou um teste cronometrado. Em duas horas, o GLM 5.3 concluiu 105 tarefas de desenvolvimento de ataque. Em seis horas, chegou a 130. O Mythos 5 fez 181 e 247 nos mesmos intervalos.
Além disso, o crescimento entre as duas janelas conta uma história própria. O modelo chinês ganhou 25 tarefas nas quatro horas extras. O Mythos 5 ganhou 66. Assim, o gargalo do GLM 5.3 aparece nas tarefas longas.
Para quem opera agentes, isso pesa bastante. Afinal, pipeline automatizado vive de execução contínua, com muitas iterações e pouca supervisão humana.
Por que a Z.ai resolveu segurar os pesos por duas semanas
A empresa pretende liberar o GLM 5.3 em cerca de duas semanas. Antes disso, vai concluir uma revisão de segurança. As funções mais sensíveis ficarão restritas a usuários verificados, dentro de um programa de acesso confiável. Segundo a companhia, o acesso começa com um grupo selecionado de parceiros e cresce depois.
A Z.ai citou ainda três camadas de proteção. São elas: filtros para solicitações de risco, monitoramento do comportamento do modelo e treino para recusar tarefas maliciosas. Também anunciou a iniciativa Open Source Shield, voltada à auditoria de projetos abertos e ao acesso defensivo aos modelos.
Para Gabriel Wagner, pesquisador de governança de IA↳Inteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI → na Concordia AI, o gesto marca uma virada. Ele disse à Reuters que a justificativa pública para o atraso veio pela primeira vez de um laboratório chinês. O motivo declarado foi segurança.
Do outro lado, a Anthropic segue caminho parecido. O Mythos é uma versão do Claude Fable 5 com as salvaguardas de cibersegurança removidas. O acesso vai apenas para organizações verificadas. Ou seja, os dois lados chegaram ao mesmo desenho de distribuição por fila.
Mythos 5 no seu fluxo: onde um modelo ofensivo entra no trabalho de dev
Modelos ofensivos mudam a economia da segurança de software. Antes, um exploit funcional exigia semanas de uma pessoa especialista. Agora, o custo cai para algumas horas de GPU.
Revisão de código e triagem de findings
Um modelo com 84% de acerto em identificação de falhas serve como segunda leitura. Por isso, vale plugar essa checagem no pull request, com escopo limitado ao diff. Depois, o time humano decide o que vira ticket. Contudo, o volume de falso positivo cresce junto. Portanto, defina um limiar de confiança antes de abrir a torneira.
Simulação de ataque no seu próprio ambiente
Confirmar exploitabilidade encurta a fila de correção. Uma falha explorável em homologação sobe de prioridade sozinha. Assim, o time troca a discussão sobre CVSS teórico por impacto observado. Ainda assim, mantenha tudo em ambiente isolado, com autorização escrita e log completo.
Três motivos para desconfiar do placar antes de citar em reunião
Primeiro, nenhuma entidade independente verificou os resultados até agora. Segundo, quem publica o benchmark também vende o modelo. Terceiro, CyberGym e ExploitBench usam alvos conhecidos, o que favorece memorização.
Além disso, teste cronometrado depende de infraestrutura. Hardware, paralelismo e limite de requisição alteram o número final. Por isso, trate esses valores como sinal de direção até a replicação aparecer.
O que fazer nesta semana
- Revise a política de uso de modelos abertos antes do lançamento do GLM 5.3.
- Separe o ambiente de teste ofensivo do ambiente produtivo, com credenciais próprias.
- Registre prompts e saídas de qualquer agente com permissão de execução.
- Priorize as CVEs com prova de conceito pública, porque o custo de exploração caiu.
- Acompanhe o repositório da Z.ai para conferir a licença dos pesos na publicação.
O catálogo agora tem capacidade ofensiva
Mythos 5 e GLM 5.3 apontam para o mesmo lugar. A capacidade ofensiva virou item de catálogo, com fila de acesso e contrato de uso. Enquanto isso, o código que você escreve hoje passa a ser lido por ferramentas cada vez mais rápidas. Então fica a pergunta para o seu time: quanto tempo o backlog de segurança aguenta nesse ritmo?
Acompanhe nosso perfil no instagram!







