GPT-6 Sol e Luna cortam preço pela metade, mas benchmarks contra rivais têm ressalvas
OpenAI expande a família GPT-6 com dois modelos mais baratos que a Astra, prometendo desempenho próximo ao topo de linha por uma fração do custo. Os números batem, mas a metodologia de comparação merece leitura atenta.

A OpenAI ampliou a família GPT-6 com dois modelos voltados a custo-benefício: GPT-6 Sol e GPT-6 Luna. Eles chegam algumas semanas depois do lançamento da GPT-6 Astra, que a empresa mantém como o modelo mais capaz da linha. Sol e Luna não tentam superar a Astra em inteligência bruta: a proposta declarada é levar parte dos avanços de arquitetura e alinhamento da Astra para camadas mais baratas do catálogo, atacando o que a OpenAI chama de "curva custo-inteligência".
O anúncio veio acompanhado de uma bateria de benchmarks comparando Sol e Luna contra Claude Opus 5 e Claude Fable 5.1, da Anthropic. Para quem decide qual modelo colocar atrás de um agente de codificação ou de automação em produção, a pergunta que importa é simples: os números sustentam o hype ou a OpenAI está jogando com a régua?
Preço caiu, mas caiu de onde
A redução de preço é o dado mais concreto do anúncio, e está documentado com precisão:
| Modelo | Input | Output | Redução | |---|---|---|---| | GPT-5.6 Sol → GPT-6 Sol | $4 → $2 | $20 → $10 | 50% | | GPT-5.6 Luna → GPT-6 Luna | $0,20 → $0,10 | $1,20 → $0,50 | 50% |
Valores por 1 milhão de tokens.
Vale reparar no detalhe: a comparação é contra o "preço promocional" da geração GPT-5.6, não contra o preço de lista original. Isso não invalida o corte, mas significa que o ganho percentual real desde o lançamento inicial do 5.6 pode ser diferente do que a tabela sugere à primeira vista.
Os benchmarks que a OpenAI escolheu mostrar
No AutomationBench (mantido pela Zapier, que testa agentes em workflows reais com 47 ferramentas de vendas, marketing, operações, suporte, finanças e RH), o GPT-6 Sol em modo xhigh marcou 33,2% de acerto a um custo de $0,27 por tarefa. Para efeito de comparação, o Claude Opus 5 em modo max ficou em 26,9%, custando 11,1 vezes mais por tarefa. Já o Claude Fable 5.1 (com fallback para o Opus 5) chegou a 31,4%, mas a própria OpenAI admite, em nota de rodapé, que o custo do fallback para Opus 5 não está contabilizado, e que esse fallback ocorreu em cerca de 40% das tarefas. Ou seja: o número de custo do concorrente direto mais forte nesse teste está subestimado por construção, o que infla artificialmente a vantagem de custo do Sol nessa linha específica.
No Agents' Last Exam, que avalia workflows profissionais complexos, o Sol em esforço max atingiu 56,4%, acima da melhor marca do Opus 5 no mesmo teste, a 60% menos custo por tarefa.
Em código, o DeepSWE v1.1 (tarefas de engenharia de software em repositórios reais) colocou o Sol em max com 68,8%, a 1,1 ponto percentual da melhor marca do Claude Fable 5 (69,9% em xhigh), só que com aproximadamente 80% menos custo por tarefa. O Luna, no mesmo teste, chegou a 66,6% em max, comparável ao Opus 5 e ao Fable 5 em esforço médio, custando 93% menos que o Opus 5 e 96% menos que o Fable 5.
No FrontierCode, que mede se as mudanças de um agente de código estão prontas para merge em codebases reais, o Sol melhorou de forma substancial sobre o GPT-5.6 Sol e empatou tecnicamente com o Fable 5.1 em xhigh, a um custo bem menor. Em uso de computador, no OSWorld 2.0 (mantido pela xlang.ai), o Sol em xhigh fez 60,5% contra 60,3% do Opus 5 em esforço médio, com cerca de 80% menos custo por tarefa.
A letra miúda que muda a leitura
O padrão que se repete em quase todos os gráficos é o mesmo: a OpenAI compara o melhor esforço do Sol/Luna contra um esforço mais baixo ou médio dos modelos da Anthropic, ou vice-versa, dependendo de qual comparação favorece o resultado. É uma prática comum em relatórios de benchmark de fabricante, mas o efeito prático é que "60% mais barato pelo mesmo resultado" nem sempre significa mesma configuração de esforço do outro lado, e a própria OpenAI reconhece isso: "scores for competitor models were taken from publicly available reports", ou seja, os números da Anthropic não foram reproduzidos pela OpenAI em ambiente controlado, e sim retirados de divulgações públicas da própria concorrente.
Isso não torna os números falsos, mas muda o peso que um time de engenharia deveria dar a eles antes de trocar de modelo em produção. A recomendação prática é rodar o próprio benchmark interno com a carga de trabalho real do time antes de migrar, em vez de decidir só pela tabela do anúncio.
Um segundo ponto de atenção: a comparação de estilo de resposta (o exemplo de prompt sobre redesenhar um site em React↳React37 conteúdos7 erros com React moderno que só aparecem em produção; e como evitarDev (Back & Front) · abr 2026React Native 0.76: o futuro do desenvolvimento mobileDev (Back & Front) · out 2024Simplificando componentes com React HooksDev (Back & Front) · mar 2019Ver tudo em Dev (Back & Front) →) é subjetiva por definição, e a própria OpenAI declara a preferência ("we prefer GPT-6 Sol's reply here"). É um dado qualitativo interessante, não uma medição.
Cache mais barato para agentes de longa duração
A parte do anúncio com implicação mais direta em custo de operação para quem já roda agentes em produção é o cache de prompt. A OpenAI diz ter melhorado a taxa de acerto de cache por padrão, com desconto de 90% em tokens de entrada lidos do cache. Também chegaram dois recursos novos: ajustar o nível de raciocínio ou habilitar/desabilitar ferramentas no meio de uma conversa sem quebrar o cache, e breakpoints explícitos para controlar onde termina o prefixo cacheado.
O GitHub, citado no anúncio, reporta que essas melhorias reduziram em mais de 50% a fração de tokens de prompt que exigem processamento do zero, em bilhões de requisições aos modelos da OpenAI, ajudando o Copilot a responder mais rápido. É um dado de terceiro (GitHub) que dá algum lastro independente ao anúncio, embora sem detalhar a metodologia de medição.
O que muda na prática para quem constrói
Para times que já usam a API da OpenAI em agentes de código (Codex) ou automação, o corte de 50% no preço de Sol e Luna, somado ao desconto de cache, abre espaço real para rodar mais iterações pelo mesmo orçamento, especialmente em tarefas de alto volume e baixa complexidade, onde o Luna (mais barato, $0,10/$0,50 por milhão de tokens) já entrega resultado comparável ao GPT-5.6 Sol anterior a uma fração do custo, segundo a avaliação interna de factualidade da OpenAI.
O próprio anúncio traz um dado revelador sobre o consumo interno: o uso diário de tokens em agentes de código na OpenAI já custaria, a preço de API, mais de $600/dia para o pesquisador mediano e mais de $7.000/dia para o percentil 90. É um contexto útil para calibrar expectativa: agentes de código de longa duração consomem tokens em escala que torna o preço por milhão de tokens um fator de decisão de arquitetura, não um detalhe de faturamento.
A GPT-6 Astra segue sendo a opção recomendada pela própria OpenAI para os casos mais exigentes, e continua fora do escopo de corte de preço deste anúncio. Sol e Luna são, na prática, a aposta da empresa para dominar a faixa de preço onde Anthropic tem se posicionado com o Claude Opus 5 e o Claude Fable 5.1.
Disponibilidade
GPT-6 Sol e Luna estão disponíveis desde o anúncio no ChatGPT Work e no Codex para usuários Plus, Pro, Business, Enterprise e Edu. Usuários dos planos Free e Go têm acesso ao Luna pelo aplicativo desktop. Os modelos ainda não chegaram ao Chat. Na API, ficam disponíveis com os identificadores gpt-6-sol e gpt-6-luna. A OpenAI avisa que o rollout no ChatGPT é gradual ao longo do dia, então a ausência dos modelos na interface pode ser temporária.
Vale o hype?
O corte de preço é real e verificável. O ganho de eficiência de cache também tem lastro em dado de terceiro (GitHub). Já a narrativa de "supera a Claude Opus 5 a uma fração do custo" precisa ser lida com o mesmo ceticismo que se aplicaria a qualquer benchmark publicado pelo próprio fabricante: os níveis de esforço comparados variam de gráfico para gráfico, os números da concorrência vêm de relatórios públicos e não de teste direto, e pelo menos um dos comparativos mais favoráveis ao Sol (o AutomationBench contra o Fable 5.1) omite um custo de fallback que ocorreu em quase metade das tarefas. Para decisão de arquitetura, o caminho mais seguro continua sendo medir a carga de trabalho real do time contra os concorrentes antes de migrar, e não confiar cegamente na tabela de lançamento.
Fonte: Hacker News
Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
Meta anuncia Ray-Ban Meta Audio, óculos de IA sem câmera para responder às acusações de espionagem
No Connect 2026, a empresa apresentou um óculos inteligente que troca a câmera por áudio de alta qualidade, tentando escapar do apelido de "óculos pervertido" que os modelos com gravação de vídeo ganharam.













