NOTÍCIA

GPT Astra crava 99,9% no teste que derrubou o GPT 5.6

GPT Astra chegou com um número difícil de ignorar. No ARC AGI 3, o novo modelo da OpenAI marcou 99,9%. O GPT 5.6 Sol, da geração anterior, ficou em 7,8%.

GPT Astra crava 99,9% no teste que derrubou o GPT 5.6
Imagem: Redação iMasters

GPT Astra chegou com um número difícil de ignorar. No ARC AGI 3, o novo modelo da OpenAI marcou 99,9%. O GPT 5.6 Sol, da geração anterior, ficou em 7,8%. Já o Claude Opus 5 registrou 30,2%. Portanto, a diferença entre gerações apareceu de forma pouco comum em benchmarks.

A OpenAI apresenta o Astra como seu modelo mais avançado. Além disso, a empresa afirma vantagem em uso do computador e em tarefas de terminal. A liberação começou por um grupo restrito de organizações. Depois, o modelo chega a assinantes Plus, Pro, Business e Enterprise, além da API.

GPT Astra salta de 7,8% para 99,9% no ARC AGI 3

O ARC AGI 3 avalia a adaptação a ambientes e problemas inéditos. Ou seja, o teste mede como o modelo se vira diante do que nunca viu. Nesse cenário, o Astra atingiu 99,9%.

Segundo a OpenAI, o modelo superou uma referência humana de eficiência de ações em 96% dos níveis do benchmark. Para quem constrói agentes, esse recorte pesa mais do que a nota final. Afinal, eficiência de ações significa menos passos, menos chamadas e menos tokens queimados por tarefa.

Por que o 99,9% pede leitura cuidadosa

A própria OpenAI registra a ressalva. As avaliações dos modelos GPT rodaram no ambiente de pesquisa da empresa ou pela API. Assim, os resultados podem divergir do que aparece no ChatGPT em produção. Prompts, ferramentas e outras configurações alteram o desempenho.

Na prática, o benchmark descreve condições de laboratório. Logo, vale tratar o número como sinal e confirmar o resto dentro do seu próprio ambiente.

GPT Astra lidera tarefas de terminal e software real

O Agents Last Exam mede a execução de tarefas profissionais em softwares reais. Engenharia, produção de mídia e modelagem financeira entram no escopo. O Astra marcou 59,3%. Em seguida vieram o Claude Opus 5 com 55,5%, o GPT 5.6 Sol com 53,6% e o Claude Fable 5 com 48,7%.

No Terminal Bench 4.0, a disputa ficou mais apertada. O teste cobre engenharia de software, configuração de sistemas e análise de dadosEngenharia de dados43 conteúdosResolvendo desafios de Big Data com Ciência de Dados na UberData · abr 2019Análise de dados com Python e tabelas dinâmicas com PandasData · mai 2019Ferramentas para análise de dados são cada vez mais fundamentais para auxiliar pessoas desenvolvedorasData · jun 2024Ver tudo em Data . O Astra registrou 57,9%. Logo atrás, o Claude Fable 5.1 marcou 55,8%. Já o GPT 5.6 Sol ficou em 37,3%.

Esses números apontam avanço em tarefas agênticas. Contudo, cada benchmark mede uma fatia específica do trabalho.

GPT Astra custa 2,5 vezes mais por token

Na API, a entrada sai por US$ 10 por milhão de tokens. A saída custa US$ 50 por milhão. Entradas em cache caem para US$ 1 por milhão. Além disso, a janela de contexto chega a 1,05 milhão de tokens, com até 128 mil na saída.

Para comparação, o GPT 5.6 Sol cobra US$ 4 na entrada e US$ 20 na saída. Ou seja, o Astra custa 2,5 vezes mais por token. A OpenAI argumenta que o custo efetivo pode cair, já que o modelo precisaria de menos tokens para concluir cada tarefa.

Esse argumento depende do seu fluxo. Portanto, vale medir o custo por tarefa concluída em vez do custo por token.

GPT Astra na sua stack: o que testar antes de migrar

Comece por um conjunto pequeno de tarefas reais do seu backlog. Depois, meça três coisas: acerto, número de passos e custo total até a entrega.

O roteamento híbrido ajuda no bolso. Por exemplo, mantenha o Sol nas rotinas simples e reserve o Astra para as cadeias longas de raciocínio.

O cache de prompt merece atenção especial. Com a entrada em cache a US$ 1, prompts de sistema estáveis mudam a conta no fim do mês.

A janela de 1,05 milhão de tokens abre espaço para repositórios inteiros. Ainda assim, contexto grande cobra latência e disciplina de recuperação.

Por fim, o acesso pela Microsoft AzureAzure76 conteúdosDeploy de Azure Stream Analytics job com CI/CD usando Azure PipelinesDevSecOps · mai 2019Azure – Como criar uma base de dados SQL no Microsoft Azure pronta para ser utilizadaData · abr 2019Azure Static Web Apps com Vue.js e Visual Studio CodeDevSecOps · out 2023Ver tudo em DevSecOps e pela AWS Bedrock está previsto. Assim, quem já mantém contrato nessas nuvens ganha um caminho mais curto para o teste.

Acompanhe nosso perfil no Instagram!

Matérias especiais e reportagens conduzidas internamente pela Redação iMasters. Acompanhe no Twitter @imasters e no Instagram/Threads @portalimasters

Ver perfil
IMMMaturidade MarTech3,5 · Em desenvolvimento
Como você classificaria hoje o nível de maturidade tecnológica da área de marketing da sua empresa?