Grok 4.7 mira código e mantém o mesmo preço por token do antecessor

Grok 4.7 foi lançado pela SpaceXAI em 21 de setembro, com foco em programação e trabalho de conhecimento. A empresa promete metade do custo operacional de sistemas rivais. O preço por token segue igual ao do Grok 4.6.
Os valores ficaram em US$ 2 por milhão de tokens de entrada. Na saída, a cobrança chega a US$ 6 por milhão.
Além disso, existe uma variante acelerada. No entanto, ela dobra a velocidade de geração e custa o dobro do preço padrão.
Grok 4.7 aposta em treino por reforço e verificação própria
A arquitetura parte de uma base expandida. Contudo, sobre ela, a empresa rodou treinamentos estendidos de aprendizado por reforço.
Além disso, o foco dessa computação chama atenção. Os times concentraram esforço em problemas complexos de várias horas.
Em paralelo, o modelo ganhou mecanismos nativos de autoverificação. O tratamento de contexto também cresceu.
Segundo a empresa, o modelo trabalha mais tempo em tarefas difíceis e confere o próprio trabalho com mais cuidado. A companhia cita ainda as salvaguardas mais bem calibradas que já entregou.
No entanto, os engenheiros também integraram compatibilidade direta com o harness Grok Bot. Portanto, diálogo e processamento de conhecimento não estruturado receberam ajustes.
Os números de código mostram avanço com um teto claro
Contudo, no CursorBench 4.0, que mede tarefas longas de programação, o modelo marcou 46,3% de sucesso. O custo médio ficou em US$ 11,95 por tarefa concluída.
Esse resultado supera dois concorrentes diretos. Contudo, o Grok 4.6 ficou em 40,4% e o GPT 5.6 Sol em 41,7%. Contudo, o Fable 5.1 alcançou 51,8%.
No DeepSWE v1.1, o cenário muda de figura. O modelo chegou a 71% em configuração de alto esforço, à frente do Grok 4.6 com 65,2% e do Fable 5.1 com 70%.
O salto mais visível apareceu no Terminal Bench 4.0. Além disso, a pontuação subiu de 20,3% para 38% entre gerações.
Grok 4.7 se destaca em domínios profissionais específicos
No GDPval, o modelo registrou 1695 pontos de Elo. Ele ficou atrás do Fable 5.1, com 1735, e à frente do Grok 4.6 e do GPT 6 Astra.
Em engenharia elétrica, a diferença ficou grande. O EEBench trouxe 64,0% contra 39,4% do GPT 5.6 Sol.
No Harvey Legal Agent Benchmark, o resultado chegou a 19,6%. Os demais ficaram bem abaixo, com 15,8% do Grok 4.6 e 6,7% do Fable 5.1.
Já na área clínica, o desempenho ficou no meio. O HealthBench Professional registrou 56,7%, acima do antecessor e abaixo de GPT 5.6 Sol e Fable 5.1.
Repare no padrão desses números. Nenhum modelo lidera todas as categorias, e a escolha depende do seu domínio.
A camada de segurança recebeu reconstrução
A empresa refez a arquitetura de filtragem defensiva. O objetivo declarado trata de riscos de uso duplo, preservando pesquisa técnica legítima.
No benchmark de segurança biológica da LatchBio, o modelo lidera com 62,4%. Essa nota combina utilidade em consultas benignas com recusa em temas perigosos.
No HackerBench v0.3, que cobre operações cibernéticas destrutivas, o índice de conclusões indevidas ficou em 3,3%. Ao mesmo tempo, fluxos legítimos de segurança seguem permitidos.
Parceiros selecionados de cibersegurança↳Segurança171 conteúdosCibersegurança no Brasil: 6 passos para sair da estagnaçãoDevSecOps · jul 2025O papel do CISO para transformar a cibersegurança em uma alavanca de reputação para as empresasDevSecOps · mar 2024Itaipu Parquetec e Exército Brasileiro realizam exercício de cibersegurança em BrasíliaDev (Back & Front) · set 2025Ver tudo em DevSecOps → receberam acesso restrito. Eles vão avaliar capacidades de red team para pesquisa defensiva.
Onde acessar o modelo hoje
A distribuição geral já começou nos canais comerciais. O acesso acontece pela API do Grok, por roteadores de modelos de terceiros e por ambientes gerenciados em nuvem.
Cursor e Grok Build liberaram acesso imediato. Além disso, instaladores de terminal chegaram pelos ambientes de shell padrão.
O que avaliar antes de trocar de modelo
Comece pelo custo por tarefa concluída. O preço por token conta pouco quando o modelo precisa de muitas tentativas.
Depois, teste com seu próprio repositório. Benchmarks públicos indicam direção, e o seu código decide a escolha.
Considere também a tarefa dominante do time. Quem vive no terminal deve olhar o salto no Terminal Bench com atenção.
Além disso, meça latência real. A variante rápida dobra o preço, e isso compensa apenas em fluxo sensível a tempo.
Por fim, mantenha a camada de abstração. Trocar de fornecedor continua sendo a decisão mais barata quando preço ou política mudam.
Acompanhe nosso perfil no Instagram!
Astra for Law acerta e chega aos escritórios de advocacia
Astra for Law é a nova plataforma da OpenAI voltada ao trabalho jurídico, lançada na quinta, dia 17. A infraestrutura combina o GPT 6 Astra.





Redação iMasters





