NOTÍCIA

Anthropic lança Sonnet 5.5 e o salto no Terminal Bench impressiona

Anthropic lançou o Claude Sonnet 5.5 em 28 de setembro. Esse é o segundo modelo da família Claude 5.5. A proposta atende tarefas bem definidas.

Anthropic lança Sonnet 5.5 e o salto no Terminal Bench impressiona
Imagem: Redação iMasters

Anthropic lançou o Claude Sonnet 5.5 em 28 de setembro. Esse é o segundo modelo da família Claude 5.5. A proposta atende tarefas bem definidas, como corrigir código, criar documentos, apresentações e planilhas.

Os ganhos aparecem em duas frentes. Além disso, o modelo responde mais de 30% mais rápido e pode custar até 30% menos por tarefa.

Repare que a tabela de preços ficou igual. A economia vem do consumo menor de tokens por trabalho.

Anthropic manteve o preço por token do Sonnet 5

No entanto, os valores seguem os mesmos da geração anterior. São US$ 2 por milhão de tokens de entrada e US$ 10 por milhão na saída.

A leitura de cache custa US$ 0,20 por milhão. Portanto, quem já usava o Sonnet 5 mantém a mesma base de cálculo.

A redução real acontece em outro ponto. Como o modelo precisa de menos tokens para concluir cada tarefa, a conta final cai.

O número do Terminal Bench pede uma segunda leitura

Aqui está o resultado mais chamativo do anúncio. No Terminal Bench 4.0, o Sonnet 5.5 alcançou 70,6%.

Entretanto, o Sonnet 5, para comparação, ficava em 10,3%. Além disso, esse teste mede tarefas complexas executadas em linha de comando.

Os demais números também subiram. No CursorBench 4.0, o novo modelo marcou 55,5% contra 34,1% da versão anterior.

No FrontierCode 1.1, o avanço foi menor. O índice passou de 42,4% para 46,2%.

Além disso, fora do código, dois resultados chamam atenção. O GDPval AA v2.1 saltou de 1.449 para 1.844 pontos, enquanto o OSWorld 2.1 subiu de 57% para 80,1%.

Anthropic mantém o Opus 5.5 para trabalho aberto

A empresa deixou a divisão clara. O Opus 5.5 segue mais forte em trabalhos complexos que exigem julgamento prolongado.

Contudo, existe uma ressalva interessante. Em algumas avaliações, o Sonnet 5.5 chegou perto do modelo superior quando operou no nível máximo de esforço.

Esse detalhe importa na hora de escolher. Nem toda tarefa precisa do modelo mais caro do catálogo.

O que os testadores relataram na prática

A evolução em programação apareceu no uso real. Segundo a empresa, o modelo compreende bases de código rapidamente e resolve tarefas em menos etapas.

A eficiência no uso de ferramentas também foi destacada. Daniel Vogel, diretor de operações da Epic Games, afirmou que o modelo atingiu o nível de qualidade esperado de uma categoria superior.

Do lado do Slack, o relato foi direto. Curtis Allen, engenheiro principal, disse que o modelo superou o Sonnet 5 em quase todas as avaliações internas do Slackbot, sem qualquer mudança de prompt.

Há ainda um teste interno de criação. O modelo recebeu materiais trimestrais, transcrições de uma companhia pública e um template de apresentação. O resultado foi uma revisão operacional de dez slides considerada pronta para envio por dois especialistas.

As salvaguardas chegaram à linha Sonnet

Esta é a primeira vez que um modelo Sonnet sai com esse pacote. Ele traz salvaguardas de cibersegurança↳Segurança171 conteúdosCibersegurança no Brasil: 6 passos para sair da estagnaçãoDevSecOps · jul 2025O papel do CISO para transformar a cibersegurança em uma alavanca de reputação para as empresasDevSecOps · mar 2024Itaipu Parquetec e Exército Brasileiro realizam exercício de cibersegurança em BrasíliaDev (Back & Front) · set 2025Ver tudo em DevSecOps → e mecanismos de fallback parecidos com os do Opus 5.5.

O funcionamento merece atenção de quem trabalha com segurança. Além disso, as tarefas rotineiras de desenvolvimento continuam disponíveis normalmente.

Solicitações consideradas mais arriscadas, por outro lado, podem ser direcionadas ao Sonnet 5. Em biologia, as proteções seguem iguais às da versão anterior.

Onde usar e o que medir antes de migrar: Anthropic

O modelo já está em todas as plataformas. A lista inclui Amazon Web Services, Google Cloud e Microsoft Azure.

Antes de trocar, meça o custo por tarefa concluída. Preço por token conta pouco quando o consumo muda tanto entre versões.

Depois, teste no seu próprio repositório. Benchmarks públicos indicam direção, enquanto o seu código decide a escolha.

Contudo, vale também revisar o roteamento entre modelos. Tarefa simples no Sonnet e trabalho aberto no Opus costuma render melhor que usar um só para tudo.

Por fim, observe o comportamento do fallback. Fluxos de segurança podem cair no Sonnet 5, e isso muda o resultado esperado.

O Claude Haiku 5.5 chega nas próximas semanas para completar a família.

Acompanhe nosso perfil no Instagram!

Matérias especiais e reportagens conduzidas internamente pela Redação iMasters. Acompanhe no Twitter @imasters e no Instagram/Threads @portalimasters

Mais de Redação iMasters
Ver perfil →