Bullet, novo coding agent apoiado pela Y Combinator, promete 95,8% no SWE-bench
A ferramenta aposta em roteamento de modelos e execução paralela para reduzir latência, com acesso gratuito via CLI para macOS e Linux.

O Bullet, um coding agent que se apresenta como apoiado pela Y Combinator ("Backed by Y Combinator"), entrou na disputa das ferramentas de código com uma tese específica: o gargalo não são os modelos, é a "máquina" em volta deles. Segundo a página oficial, a ferramenta "roteia, busca e executa com um único propósito: acompanhar seu ritmo". A promessa central é velocidade, e o número que a empresa coloca na vitrine é 95,8% no SWE-bench Verified.
O produto está em beta privado com acesso gratuito, disponível para macOS e Linux↳Linux34 conteúdosKali Linux em um Servidor VPS: como, quando e por que usar?DevSecOps · dez 2024Construindo um Windows Service ou Linux Daemon com Worker Service & .NET Core – Parte 2Dev (Back & Front) · jul 2020Criando uma WebApi utilizando .NET, Linux e VSCodeDev (Back & Front) · ago 2019Ver tudo em DevSecOps →, sem assinatura e sem exigência de chave de API para começar. A versão citada na página é a 1.3.27.
O que o Bullet diz fazer diferente
A fundação do argumento é que o padrão continua o mesmo dos demais agentes (modelo → ferramentas → resultados), mas com um loop mais enxuto ao redor. A empresa descreve três "protocolos":
- Route / Escalate: trabalho simples vai para modelos rápidos; a escalada para modelos mais capazes só acontece quando a tarefa exige. A ideia é não gastar um modelo caro e lento em algo trivial.
- Search / Acquire: busca dirigida e leitura pontual de arquivos para achar o código relevante sem embutir (embedding) o repositório inteiro. Na demonstração da página, uma busca por
auth middlewareretorna arquivos rankeados (src/router.tscom score 94.2,src/auth.tscom 88.7) usando apenas 8% de contexto do repositório. - Parallel Execution: chamadas de ferramenta independentes rodam em paralelo (busca, leitura e verificação ao mesmo tempo), e o sistema intercepta chamadas duplicadas e loops travados antes que consumam tempo.
O lema que resume a proposta aparece cru na landing page: "built for momentum, not magic" (feito para o ritmo, não para a mágica).
De onde veio
A nota dos fundadores dá o contexto de origem. Eles contam que, na própria empresa, estavam "queimando horas esperando os runs do agente". Trabalhavam com Claude Code todos os dias e viam "modelos capazes se movendo através de uma máquina desnecessariamente lenta". O Bullet nasceu como projeto paralelo com quatro objetivos: rotear trabalho simples mais rápido, ler só o que importa, rodar ferramentas independentes juntas e parar loops antes que descontrolem. Segundo a nota, a equipe usa a ferramenta internamente.
Esse enquadramento é relevante: o Bullet não se posiciona como um novo modelo de IA↳Inteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI →, e sim como uma camada de orquestração em cima dos modelos existentes. É a mesma categoria de disputa em que estão Cursor, GitHub Copilot e o próprio Claude Code, onde boa parte da diferença competitiva está no loop do agente (como ele decide o que ler, quando escalar e o que paralelizar), não só no modelo por trás.
Como instalar
Além do app para Mac, a empresa oferece uma CLI que, segundo a página, usa "o mesmo roteador, ferramentas e loop de agente", só que dentro do shell. A instalação é via npm:
npm install -g @trybullet/cli
bulletOs requisitos listados são macOS e Linux, Node 18+, e uso gratuito sem chave para começar. Há ainda um demo em vídeo de 2min14 e um Discord da comunidade divulgados na página.
O que olhar com cautela
Aqui entra o ponto que exige leitura crítica. O número de 95,8% no SWE-bench Verified é apresentado como destaque, mas a página não abre, no material fornecido, a metodologia por trás dele: qual modelo base foi usado, quantas tentativas, qual harness e em que condições. O SWE-bench Verified é um benchmark de correção de issues reais de repositórios, e resultados no topo dessa tabela costumam depender fortemente do modelo subjacente e da configuração do agente. Um score alto de um agente que roteia entre modelos de terceiros não é comparável, sem contexto, a um número de um modelo isolado. Vale acompanhar a página "read the results" antes de tratar o percentual como veredito.
Outro ponto em aberto: a busca dirigida sem embedding do repositório inteiro é a aposta técnica mais interessante e também a mais arriscada. Ela pode ser mais rápida e barata em repositórios grandes, mas o risco é perder contexto relevante que uma indexação completa capturaria. Na prática, o desempenho vai variar conforme o tamanho e a organização do código, e ainda não há dados públicos independentes sobre isso.
O que muda para o dev brasileiro
Para quem desenvolve no Brasil, o atrativo imediato é o acesso gratuito sem chave de API. Boa parte das ferramentas concorrentes cobra em dólar por assinatura ou consome créditos de API que o dev paga por conta própria, um custo que pesa com o câmbio. Um agente que começa de graça e roda via CLI baixa a barreira para testar automação de código em projetos pessoais e provas de conceito sem comprometer orçamento.
Há, porém, duas ressalvas concretas. A primeira: não há suporte a Windows no material divulgado, só macOS e Linux, o que exclui parte relevante da base de desenvolvedores BR ou empurra para WSL. A segunda é a natureza de beta privado: ferramentas nesse estágio mudam, podem introduzir cobrança depois e não têm garantias de estabilidade ou de política de dados clara, o que importa para quem pensa em apontar o agente para código de trabalho.
O veredito honesto é o que o próprio ângulo da pauta sugere: ainda é cedo para dizer se o Bullet sai na frente de Cursor ou Copilot. A proposta de reduzir latência via roteamento e paralelismo é legítima e endereça uma dor real de quem usa agentes no dia a dia. Mas o número de benchmark precisa de contexto, o suporte é limitado a dois sistemas operacionais e não há avaliações independentes. É um lançamento para colocar no radar e testar em projeto de baixo risco, não para migrar o fluxo principal de trabalho ainda.
Fonte: Hacker News
Este artigo foi escrito por Redação iMasters. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
Anthropic lança Opus 5.5 com tokens 20% mais baratos e nível do Fable em coding
O novo modelo troca o Opus 5 por preços menores e desempenho que supera o Fable, modelo maior da Anthropic, em vários benchmarks de código.











