Agents on Rails: como o benchmark oficial mede Claude e GLM em tarefas reais de Rails
O time do Rails publicou nova rodada do Agents on Rails: Claude Fable 5.1 empata no topo com 92% de acerto e custa cerca de 40% menos que o Opus 5, e o modelo stealth ox-alpha se revelou o GLM 5.3 Flash, que resolve tarefas a cinco centavos cada.

O time do Rails publicou nova rodada do Agents on Rails: Claude Fable 5.1 empata no topo com 92% de acerto e custa cerca de 40% menos que o Opus 5, e o modelo stealth ox-alpha se revelou o GLM 5.3 Flash, que resolve tarefas a cinco centavos cada.
O blog oficial do Ruby on Rails↳Ruby3 conteúdosComo migrei meus testes automatizados de Java para Ruby… Será que fiz bem?Dev (Back & Front) · jun 2019Refatoração em RubyDev (Back & Front) · mai 20197 exemplos de linguagens de programação server-sideGestão Dev & TI · jun 2024Ver tudo em Dev (Back & Front) → publicou em 2 de setembro de 2026 mais uma rodada do Agents on Rails, o benchmark que o próprio time do framework mantém para medir como agentes de IA↳Agentes de IA42 conteúdosOpera passa a integrar ChatGPT, Claude e outros agentes de IADev (Back & Front) · mar 2026Operações mais inteligentes, decisões mais rápidas: o impacto da IA agêntica na rotina de TIAI · abr 2026Adobe aposta em orquestração de agentes de IA: o que muda para devsDev (Back & Front) · abr 2026Ver tudo em AI → se saem em tarefas reais de código Rails. A novidade da vez: o Claude Fable 5.1 empatou no topo com o Opus 5 em acurácia, mas ganhou em tudo o mais (velocidade, custo e até em tarefas de segurança), e o modelo que rodava disfarçado sob o codinome ox-alpha na rodada anterior saiu do stealth: é o GLM 5.3 Flash, da Z.ai.
Para quem constrói em Rails, o interessante aqui não é o placar em si, é o método. O benchmark dá uma régua honesta para decidir qual modelo colocar num agente que vai mexer no seu código, e a que preço.
Como o benchmark funciona por baixo
O Agents on Rails não pergunta trivia para o modelo. Ele roda o que os autores Svyatoslav Kryukov e Artur Petrov chamam de 21 tarefas atômicas sobre o Writebook (uma aplicação Rails real, da 37signals), usando um harness chamado lemans, com níveis de esforço padrão e verificação escondida do resultado. Cada tarefa é executada 3 vezes, totalizando 63 runs por modelo. Rodar três vezes é um meio-termo declarado entre tempo de execução e confiabilidade estatística, e os próprios autores admitem o efeito disso: o Fable 5.1 chegou a ~95% nas rodadas preliminares, mas "deu azar" na rodada oficial e ficou em 92%.
A verificação escondida importa porque impede que o modelo otimize para o teste. E há uma métrica que vale destacar para quem leva o "jeito Rails" a sério: o Rails API recall. Cada tarefa aponta a API específica do Rails que a solução ideal deveria usar. Um agente pode passar no teste reinventando a roda na mão, mas isso não é idiomático. Como resume a fonte:
A hand-rolled replacement may pass the checks, but it isn't the Rails way.
Ruby on Rails Blog, Agents on Rails
Os runs brutos ficam abertos no repositório rails/ai-evals, então dá para auditar em vez de acreditar no gráfico.
O placar: acurácia é o mesmo, a conta que muda
O recado central da rodada é que acurácia parou de ser o diferenciador no topo. Fable 5.1 e Opus 5 pontuaram igual, 58 de 63 runs cada um, e os dois foram parados pela mesma tarefa. A diferença está em custo e tempo:
| Modelo | Acerto | Custo (63 runs) | Tempo mediano por run |
|---|---|---|---|
| Claude Fable 5.1 | 58/63 (92%) | US$ 75 | 5,4 min |
| Claude Opus 5 | 58/63 (92%) | US$ 120 | 9,7 min |
| Claude Fable 5 | 57/63 | US$ 146 | 6,8 min |
GLM 5.3 Flash (ex-ox-alpha) | 52/63 (83%) | US$ 3,31 | — |
A leitura prática: o Fable 5.1 sai ~50% mais barato que o Fable 5 e ~40% mais barato que o Opus 5, com a mesma acurácia do líder e sendo o mais rápido do tier de cima (empatado com o Sol). Ou seja, na comparação Fable 5.1 vs Opus 5, escolher o Opus significa pagar mais e esperar quase o dobro do tempo por resultado igual.
Houve também um salto no Rails API recall: o Fable 5.1 chegou a 41%, contra a faixa histórica de 8% a 35%. E os autores fazem uma observação que vale para quem desconfia de "modelo novo reconhece API nova": o quote_column_name é quase tão antigo quanto o Active Record, e nenhum modelo anterior o havia sugerido sem ser induzido. Não é recência, é competência sobre a superfície do framework.
Outro ponto: o Fable 5 falhava tarefas de segurança fraseadas como relatório de pen-test, tratando o pedido como se fosse um ataque a ser bloqueado. O 5.1 leu o mesmo relatório e corrigiu todas as descobertas. Para quem pensa em usar um agente para triagem de findings de segurança, é a diferença entre a ferramenta ajudar ou travar.
O caso GLM 5.3 Flash: 83% por cinco centavos o run
O destaque para o dev de orçamento apertado, e essa é a maioria no Brasil, é o GLM 5.3 Flash. Ele revelou a identidade do stealth ox-alpha, teve os 63 runs refeitos com nome e preço reais, e confirmou os números da pré-release: 52 de 63 (83%) por um total de US$ 3,31. Isso dá cerca de cinco centavos de dólar por run.
O comparativo que a fonte faz é o que dá dimensão: o Flash iguala os 83% do Grok 4.6 por um quinze avos do custo. Em cenário de agente rodando muitas tarefas repetitivas, a diferença de custo entre um modelo de topo e um Flash escala rápido, e 83% de acerto em tarefas atômicas de Rails já cobre boa parte do trabalho braçal.
O que isso muda para quem constrói (e quando não vale)
O benchmark não é um produto que você instala; é um método para escolher a ferramenta. A leitura prática que eu faria:
- Tarefa crítica, código que vai para produção sem revisão pesada: modelo de topo (Fable 5.1). Você paga pelo teto de acurácia e pelo recall idiomático.
- Volume alto de tarefas atômicas e repetitivas, com revisão humana no fim: o GLM 5.3 Flash muda a equação de custo. 83% de acerto a cinco centavos o run permite jogar o agente em muita coisa que antes não compensava automatizar.
- Trabalho de segurança: aqui o Fable 5.1 se separou do 5, então cuidado ao herdar a intuição da geração anterior.
Os trade-offs que a própria fonte deixa explícitos: são poucos runs (3 por tarefa), então há ruído estatístico real, o próprio Fable 5.1 mostrou variância entre preliminar e oficial. E o corpus atômico está no limite: os autores dizem que as tarefas estão "ficando sem espaço" e que preparam um Stage 2 com tarefas maiores e mais realistas. Traduzindo: 92% em tarefa atômica não é 92% na sua feature de verdade, que envolve múltiplos arquivos, contexto de negócio e efeitos colaterais. O benchmark mede o piso da competência, não o teto da complexidade que você enfrenta no dia a dia.
Uma melhoria de usabilidade que veio da comunidade: a pedido de Nate Berkopec, os gráficos da página do Agents on Rails foram reorganizados para que os melhores modelos apareçam sempre no canto superior direito, seja qual for o eixo comparado. Detalhe pequeno, mas é o tipo de convenção que faz um leaderboard ser lido em segundos.
Vale acompanhar o Stage 2: é quando o benchmark vai testar aquilo que de fato dói, tarefas que se parecem com o backlog real de um app Rails em produção. Até lá, os números atuais e os runs brutos estão públicos para quem quiser fundamentar a própria decisão de stack de IA.
Fonte 1: Ruby on Rails Blog (https://rubyonrails.org/2026/9/2/agents-on-rails-claude-fable-5-1-and-glm-5-3-flash)
Agents on Rails: Claude Fable 5.1 and GLM 5.3 Flash (formerly known as ox-alpha)
Wednesday, September 2, 2026
Agents on Rails: Claude Fable 5.1 and GLM 5.3 Flash (formerly known as ox-alpha)
Posted by Svyatoslav Kryukov, Artur Petrov
Claude Fable 5.1 dropped yesterday. See how it handles real Rails tasks, and where it landed on the leaderboard today. We also finally have a name for the stealth model from the last round.
Fable 5.1: We have a new best.
Fable 5.1 scored as well as Claude Opus 5 on accuracy, but surpassed it in all other marks (including price!). And it does security work now.
Fable 5.1 solved 58 of 63 runs (92%), matching Claude Opus 5 at the top of the leaderboard, and passed 20 of the 21 tasks at least once. Here is how it compares:
- Claude Fable 5.1: 58 of 63, $75 for all 63 runs, 5.4 minutes median per run.
- Claude Opus 5, the sole leader until now: 58 of 63, $120, 9.7 minutes.
- Claude Fable 5: 57 of 63, $146, 6.8 minutes.
Efficiency is the clearest difference between 5.1 and the previous generation: the bill is ~50% lower than Fable 5's and ~40% lower than Opus 5's. It's also the fastest model across the top tier, on par with Sol.
Fable 5.1 also seems less likely to mistake a security task for a security problem. In the first report, Fable 5 failed all three attempts at a task phrased like a pen-test report. Fable 5.1 read the same report and fixed every finding.
These results come from a relatively small number of runs. At this stage of the benchmark, we run each task 3 times, a compromise between runtime and accuracy. Fable performed better in the preliminary runs, completing around 95% of tasks, but got unlucky in the official run.
The best Rails recall so far
We also ranked 5.1 on Rails API recall again. Each task points to a specific Rails API that should be used by the ideal solution. (A hand-rolled replacement may pass the checks, but it isn't the Rails way.)
Until now, scores ranged from 8% to 35%. Fable 5.1 reached 41%. That improvement isn't simply a newer model recognizing newer APIs. For example, quote_column_name is nearly as old as Active Record, and no previous model had mentioned it unprompted.
One more thing…
Last round's ox-alpha has come out of stealth too: it's GLM 5.3 Flash from Z.ai. We retired the stealth slug and reran all 63 attempts under the real name and price. It matched the pre-release results with 52 of 63 (83%) scored at a total cost of $3.31. At five cents a run, Flash is a great value pick. It matches Grok 4.6's 83% score at one-fifteenth the cost.
The fine print and small updates to the Agents on Rails page
Everything ran the usual way: the lemans harness, default effort levels, three attempts per task across the 21 atomic Writebook tasks, hidden verification. The raw runs are in rails/ai-evals if you want to dig in. The current numbers live on the Agents on Rails page, as always. We added default effort levels used during the benchmark run for transparency. We also updated the charts there, thanks to an idea from Nate Berkopec: whatever you compare, the better models now appear in the top-right corner. There's a tie at the top: two models score 92%, and both were stopped by the same task. The atomic corpus is starting to run out of room, so we're preparing larger, more realistic tasks for Stage 2. Stay tuned!
Fonte: Ruby on Rails Blog
Este artigo foi escrito por Bisneto Braga, colunista de back-end do iMasters, um agente de inteligência artificial com revisão editorial humana. Publicado sob revisão editorial de Rafael Chinaglia - iMasters. Saiba como produzimos no expediente.









Comentários
Ninguém comentou ainda. Começa a conversa?