UK AISI adota infraestrutura da EvalEval para publicar benchmarks de IA com configuração verificável
Instituto britânico de segurança em IA passou a divulgar resultados de avaliação junto com a configuração completa de cada teste, usando o schema aberto Every Eval Ever da coalizão EvalEval.

Todo mundo que já comparou modelos de linguagem↳LLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI → para decidir qual usar num produto conhece o problema: um vendor anuncia 74% no SWE-Bench, outro anuncia 81%, e não dá pra saber se os dois rodaram o mesmo protocolo de avaliação. Foi exatamente essa lacuna que o UK AI Security Institute (AISI) e a coalizão EvalEval atacaram num post publicado em 22 de setembro de 2026 no blog da Hugging Face, assinado por pesquisadores dos dois lados, incluindo Avijit Ghosh, Jenny Chim e Irene Solaiman pela EvalEval, e Jessica McFadyen e Lynn Tan pelo AISI.
A notícia em si é simples: o AISI passou a usar a infraestrutura da EvalEval para publicar seus resultados de avaliação de forma aberta e reproduzível. Mas o que está por trás disso importa mais do que o anúncio: pela primeira vez, um órgão de governo com peso técnico real está expondo não só o placar de um benchmark, mas a configuração inteira que produziu aquele placar.
De onde vem essa colaboração
AISI e EvalEval já vinham trabalhando juntos desde um workshop conjunto ao lado da NeurIPS 2025, e o feedback do instituto ajudou a moldar o schema Every Eval Ever (EEE) da coalizão. Essa nova fase é a EEE saindo do papel: o AISI está alimentando o Evaluation Cards, plataforma aberta da EvalEval, com dados reais de avaliação de modelos de fronteira.
Isso se soma a outros projetos que o AISI já vinha construindo para tornar avaliação de IA mais rigorosa: o OptStop, focado em tornar avaliação mais eficiente (gastar menos compute testando a mesma coisa), e o HiBayES, que aplica modelagem bayesiana hierárquica para dar rigor estatístico a comparações entre modelos, além de trabalho em análise de transcript e elicitação de capacidade. A ideia comum é diagnosticar onde os relatórios de avaliação de IA hoje falham e construir infraestrutura compartilhada pra fechar essas lacunas.
O que exatamente foi publicado
O release cobre cinco benchmarks usados no experimento principal de um paper do AISI chamado How Inference Compute Shapes Frontier LLM Evaluation: HealthBench, FrontierMath, Humanity's Last Exam (HLE), SWE-Bench Pro e Terminal-Bench 2.0. Os testes rodaram em seis modelos de fronteira: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 e GPT-5.4. Há ainda dois eval de segurança cibernética↳Segurança171 conteúdosCibersegurança no Brasil: 6 passos para sair da estagnaçãoDevSecOps · jul 2025O papel do CISO para transformar a cibersegurança em uma alavanca de reputação para as empresasDevSecOps · mar 2024Itaipu Parquetec e Exército Brasileiro realizam exercício de cibersegurança em BrasíliaDev (Back & Front) · set 2025Ver tudo em DevSecOps → publicados à parte, Cyber CTFs e The Last Ones, com um conjunto de modelos parcialmente diferente.
O ponto central do paper, e o motivo pelo qual essa transparência importa na prática, é que o desempenho relatado em benchmark depende muito de como o protocolo de avaliação foi montado, não só do modelo em si. No caso do Humanity's Last Exam, os pesquisadores mostraram que a fração de tarefas resolvidas muda conforme o protocolo: quando o modelo recebe feedback de correção de um oráculo depois de cada tentativa, ele continua resolvendo mais tarefas conforme o uso de tokens aumenta. Ou seja, o mesmo modelo, testado com um protocolo mais generoso em tentativas e feedback, produz um número de acerto sensivelmente maior, mesmo sem nenhuma mudança no peso do modelo. Isso é o tipo de detalhe que normalmente desaparece quando alguém posta um card de benchmark isolado numa comparação de produto.
Por que isso muda o trabalho de quem avalia modelo aqui
Para quem está no Brasil escolhendo entre GPT-5.x e Claude Opus 4.x para um agente de codificação, por exemplo, o gargalo raramente é falta de benchmark, é falta de contexto sobre o benchmark. Um número de SWE-Bench Pro ou Terminal-Bench 2.0 divulgado por um vendor pode ter sido obtido com orçamento de compute muito maior por tarefa, número de tentativas diferente, ou uso de ferramentas auxiliares que o seu ambiente de produção não vai ter. Sem essa informação, comparar dois modelos vira comparar duas fotos tiradas com câmeras e luzes diferentes.
Com os Evaluation Cards do AISI publicados via schema EEE, dá pra abrir o card de, digamos, Terminal-Bench 2.0 e ver lado a lado como o setup do AISI se compara a outros relatórios do mesmo benchmark para os mesmos modelos, incluindo o quanto de inference compute foi usado e qual protocolo de correção foi aplicado. Isso muda o processo de avaliação de três formas concretas:
- Em vez de confiar num print de leaderboard, dá pra checar a ficha técnica do teste antes de decidir que ele é comparável ao seu caso de uso.
- Times que fazem sua própria bateria de avaliação interna ganham uma referência verificada para calibrar se o protocolo deles está gerando números inflados ou deflacionados em relação ao público.
- Pesquisa de meta-avaliação (comparar benchmarks entre si, não só modelos entre si) fica viável, porque os dados agora têm metadado suficiente para isso, algo que faltava quando cada evaluator publicava só a nota final.
Os limites dessa transparência
Vale ser honesto sobre o que essa mudança não resolve. Primeiro, é adoção voluntária: o EEE só funciona como padrão de fato se outras organizações de avaliação e desenvolvedores de modelo também reportarem nesse formato, e o post da EvalEval é explicitamente um convite nesse sentido, não uma obrigação. A maior parte dos benchmarks que circulam em marketing de produto hoje continua sem esse nível de detalhe.
Segundo, reproduzir uma avaliação continua caro. Ter a configuração documentada não significa que rodar de novo o mesmo teste, com o mesmo orçamento de compute, seja barato ou trivial para um time pequeno. O ganho aqui é auditabilidade e comparabilidade, não gratuidade de reprodução.
Terceiro, os Evaluation Cards por enquanto cobrem um recorte específico: os benchmarks e modelos que entraram no paper do AISI, mais os dois eval de cyber. Não é um catálogo universal ainda, é o começo de um.
Como acessar e contribuir
Quem quiser conferir a configuração por trás desses números pode navegar os Evaluation Cards na Hugging Face, filtrando por benchmark ou por modelo. A EvalEval também deixou aberto o caminho para quem desenvolve modelo reportar resultados verificados e para quem desenvolve avaliação reportar benchmarks usando o schema Every Eval Ever diretamente. Para pesquisador de governança e política de IA, o mesmo repositório serve para examinar o estado geral do reporte de avaliação na indústria, não só olhar caso a caso.
O ganho prático para quem constrói produto com LLM no Brasil não é ter mais um número bonito, é ter menos incerteza sobre o que aquele número realmente significa antes de basear uma decisão de arquitetura nele.
Fonte: Hugging Face Blog
Este artigo foi escrito por Alan Andrade, colunista de inteligência artificial. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
MCP 2025-06-18: o que quebra em agentes já plugados via Model Context Protocol
A revisão mais recente da spec do Model Context Protocol reclassifica servidores como OAuth Resource Servers, adiciona elicitation e structured tool output, e derruba o batching de JSON-RPC. Um guia do que muda pra quem já tem servidor em produção.













