GPT Astra crava 99,9% no teste que derrubou o GPT 5.6
GPT Astra chegou com um número difícil de ignorar. No ARC AGI 3, o novo modelo da OpenAI marcou 99,9%. O GPT 5.6 Sol, da geração anterior, ficou em 7,8%.

GPT Astra chegou com um número difícil de ignorar. No ARC AGI 3, o novo modelo da OpenAI marcou 99,9%. O GPT 5.6 Sol, da geração anterior, ficou em 7,8%. Já o Claude Opus 5 registrou 30,2%. Portanto, a diferença entre gerações apareceu de forma pouco comum em benchmarks.
A OpenAI apresenta o Astra como seu modelo mais avançado. Além disso, a empresa afirma vantagem em uso do computador e em tarefas de terminal. A liberação começou por um grupo restrito de organizações. Depois, o modelo chega a assinantes Plus, Pro, Business e Enterprise, além da API.
GPT Astra salta de 7,8% para 99,9% no ARC AGI 3
O ARC AGI 3 avalia a adaptação a ambientes e problemas inéditos. Ou seja, o teste mede como o modelo se vira diante do que nunca viu. Nesse cenário, o Astra atingiu 99,9%.
Segundo a OpenAI, o modelo superou uma referência humana de eficiência de ações em 96% dos níveis do benchmark. Para quem constrói agentes, esse recorte pesa mais do que a nota final. Afinal, eficiência de ações significa menos passos, menos chamadas e menos tokens queimados por tarefa.
Por que o 99,9% pede leitura cuidadosa
A própria OpenAI registra a ressalva. As avaliações dos modelos GPT rodaram no ambiente de pesquisa da empresa ou pela API. Assim, os resultados podem divergir do que aparece no ChatGPT em produção. Prompts, ferramentas e outras configurações alteram o desempenho.
Na prática, o benchmark descreve condições de laboratório. Logo, vale tratar o número como sinal e confirmar o resto dentro do seu próprio ambiente.
GPT Astra lidera tarefas de terminal e software real
O Agents Last Exam mede a execução de tarefas profissionais em softwares reais. Engenharia, produção de mídia e modelagem financeira entram no escopo. O Astra marcou 59,3%. Em seguida vieram o Claude Opus 5 com 55,5%, o GPT 5.6 Sol com 53,6% e o Claude Fable 5 com 48,7%.
No Terminal Bench 4.0, a disputa ficou mais apertada. O teste cobre engenharia de software, configuração de sistemas e análise de dados↳Engenharia de dados43 conteúdosResolvendo desafios de Big Data com Ciência de Dados na UberData · abr 2019Análise de dados com Python e tabelas dinâmicas com PandasData · mai 2019Ferramentas para análise de dados são cada vez mais fundamentais para auxiliar pessoas desenvolvedorasData · jun 2024Ver tudo em Data →. O Astra registrou 57,9%. Logo atrás, o Claude Fable 5.1 marcou 55,8%. Já o GPT 5.6 Sol ficou em 37,3%.
Esses números apontam avanço em tarefas agênticas. Contudo, cada benchmark mede uma fatia específica do trabalho.
GPT Astra custa 2,5 vezes mais por token
Na API, a entrada sai por US$ 10 por milhão de tokens. A saída custa US$ 50 por milhão. Entradas em cache caem para US$ 1 por milhão. Além disso, a janela de contexto chega a 1,05 milhão de tokens, com até 128 mil na saída.
Para comparação, o GPT 5.6 Sol cobra US$ 4 na entrada e US$ 20 na saída. Ou seja, o Astra custa 2,5 vezes mais por token. A OpenAI argumenta que o custo efetivo pode cair, já que o modelo precisaria de menos tokens para concluir cada tarefa.
Esse argumento depende do seu fluxo. Portanto, vale medir o custo por tarefa concluída em vez do custo por token.
GPT Astra na sua stack: o que testar antes de migrar
Comece por um conjunto pequeno de tarefas reais do seu backlog. Depois, meça três coisas: acerto, número de passos e custo total até a entrega.
O roteamento híbrido ajuda no bolso. Por exemplo, mantenha o Sol nas rotinas simples e reserve o Astra para as cadeias longas de raciocínio.
O cache de prompt merece atenção especial. Com a entrada em cache a US$ 1, prompts de sistema estáveis mudam a conta no fim do mês.
A janela de 1,05 milhão de tokens abre espaço para repositórios inteiros. Ainda assim, contexto grande cobra latência e disciplina de recuperação.
Por fim, o acesso pela Microsoft Azure↳Azure76 conteúdosDeploy de Azure Stream Analytics job com CI/CD usando Azure PipelinesDevSecOps · mai 2019Azure – Como criar uma base de dados SQL no Microsoft Azure pronta para ser utilizadaData · abr 2019Azure Static Web Apps com Vue.js e Visual Studio CodeDevSecOps · out 2023Ver tudo em DevSecOps → e pela AWS Bedrock está previsto. Assim, quem já mantém contrato nessas nuvens ganha um caminho mais curto para o teste.
Acompanhe nosso perfil no Instagram!








