Bullet, novo coding agent apoiado pela Y Combinator, promete 95,8% no SWE-bench
A ferramenta aposta em roteamento de modelos e execução paralela para reduzir latência, com acesso gratuito via CLI para macOS e Linux.

O Bullet, um coding agent que se apresenta como apoiado pela Y Combinator ("Backed by Y Combinator"), entrou na disputa das ferramentas de código com uma tese específica: o gargalo não são os modelos, é a "máquina" em volta deles. Segundo a página oficial, a ferramenta "roteia, busca e executa com um único propósito: acompanhar seu ritmo". A promessa central é velocidade, e o número que a empresa coloca na vitrine é 95,8% no SWE-bench Verified.
O produto está em beta privado com acesso gratuito, disponível para macOS e Linux↳Linux34 conteúdosKali Linux em um Servidor VPS: como, quando e por que usar?DevSecOps · dez 2024Construindo um Windows Service ou Linux Daemon com Worker Service & .NET Core – Parte 2Dev (Back & Front) · jul 2020Criando uma WebApi utilizando .NET, Linux e VSCodeDev (Back & Front) · ago 2019Ver tudo em DevSecOps →, sem assinatura e sem exigência de chave de API para começar. A versão citada na página é a 1.3.27.
O que o Bullet diz fazer diferente
A fundação do argumento é que o padrão continua o mesmo dos demais agentes (modelo → ferramentas → resultados), mas com um loop mais enxuto ao redor. A empresa descreve três "protocolos":
- Route / Escalate: trabalho simples vai para modelos rápidos; a escalada para modelos mais capazes só acontece quando a tarefa exige. A ideia é não gastar um modelo caro e lento em algo trivial.
- Search / Acquire: busca dirigida e leitura pontual de arquivos para achar o código relevante sem embutir (embedding) o repositório inteiro. Na demonstração da página, uma busca por
auth middlewareretorna arquivos rankeados (src/router.tscom score 94.2,src/auth.tscom 88.7) usando apenas 8% de contexto do repositório. - Parallel Execution: chamadas de ferramenta independentes rodam em paralelo (busca, leitura e verificação ao mesmo tempo), e o sistema intercepta chamadas duplicadas e loops travados antes que consumam tempo.
O lema que resume a proposta aparece cru na landing page: "built for momentum, not magic" (feito para o ritmo, não para a mágica).
De onde veio
A nota dos fundadores dá o contexto de origem. Eles contam que, na própria empresa, estavam "queimando horas esperando os runs do agente". Trabalhavam com Claude Code todos os dias e viam "modelos capazes se movendo através de uma máquina desnecessariamente lenta". O Bullet nasceu como projeto paralelo com quatro objetivos: rotear trabalho simples mais rápido, ler só o que importa, rodar ferramentas independentes juntas e parar loops antes que descontrolem. Segundo a nota, a equipe usa a ferramenta internamente.
Esse enquadramento é relevante: o Bullet não se posiciona como um novo modelo de IA↳Inteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI →, e sim como uma camada de orquestração em cima dos modelos existentes. É a mesma categoria de disputa em que estão Cursor, GitHub Copilot e o próprio Claude Code, onde boa parte da diferença competitiva está no loop do agente (como ele decide o que ler, quando escalar e o que paralelizar), não só no modelo por trás.
Como instalar
Além do app para Mac, a empresa oferece uma CLI que, segundo a página, usa "o mesmo roteador, ferramentas e loop de agente", só que dentro do shell. A instalação é via npm:
npm install -g @trybullet/cli
bulletOs requisitos listados são macOS e Linux, Node 18+, e uso gratuito sem chave para começar. Há ainda um demo em vídeo de 2min14 e um Discord da comunidade divulgados na página.
O que olhar com cautela
Aqui entra o ponto que exige leitura crítica. O número de 95,8% no SWE-bench Verified é apresentado como destaque, mas a página não abre, no material fornecido, a metodologia por trás dele: qual modelo base foi usado, quantas tentativas, qual harness e em que condições. O SWE-bench Verified é um benchmark de correção de issues reais de repositórios, e resultados no topo dessa tabela costumam depender fortemente do modelo subjacente e da configuração do agente. Um score alto de um agente que roteia entre modelos de terceiros não é comparável, sem contexto, a um número de um modelo isolado. Vale acompanhar a página "read the results" antes de tratar o percentual como veredito.
Outro ponto em aberto: a busca dirigida sem embedding do repositório inteiro é a aposta técnica mais interessante e também a mais arriscada. Ela pode ser mais rápida e barata em repositórios grandes, mas o risco é perder contexto relevante que uma indexação completa capturaria. Na prática, o desempenho vai variar conforme o tamanho e a organização do código, e ainda não há dados públicos independentes sobre isso.
O que muda para o dev brasileiro
Para quem desenvolve no Brasil, o atrativo imediato é o acesso gratuito sem chave de API. Boa parte das ferramentas concorrentes cobra em dólar por assinatura ou consome créditos de API que o dev paga por conta própria, um custo que pesa com o câmbio. Um agente que começa de graça e roda via CLI baixa a barreira para testar automação de código em projetos pessoais e provas de conceito sem comprometer orçamento.
Há, porém, duas ressalvas concretas. A primeira: não há suporte a Windows no material divulgado, só macOS e Linux, o que exclui parte relevante da base de desenvolvedores BR ou empurra para WSL. A segunda é a natureza de beta privado: ferramentas nesse estágio mudam, podem introduzir cobrança depois e não têm garantias de estabilidade ou de política de dados clara, o que importa para quem pensa em apontar o agente para código de trabalho.
O veredito honesto é o que o próprio ângulo da pauta sugere: ainda é cedo para dizer se o Bullet sai na frente de Cursor ou Copilot. A proposta de reduzir latência via roteamento e paralelismo é legítima e endereça uma dor real de quem usa agentes no dia a dia. Mas o número de benchmark precisa de contexto, o suporte é limitado a dois sistemas operacionais e não há avaliações independentes. É um lançamento para colocar no radar e testar em projeto de baixo risco, não para migrar o fluxo principal de trabalho ainda.
Fonte: Hacker News
Este artigo foi escrito por Redação iMasters, um agente de inteligência artificial com revisão editorial humana.








