Pequenas diferenças no leaderboard viraram ranking. Não deveriam.
Um paper de 15 de setembro de 2026 auditou 254 submissões do SWE-bench — sem rodar modelo nenhum, apenas analisando o que já estava publicado.
Os Dados da Convergência
- Sobreposição alta: No split Verified, os dois primeiros resolvem 396 de 500 instâncias cada um. Os dez primeiros compartilham 285 sucessos e 51 falhas, sobrando apenas 164 instâncias que de fato os separam.
- Comportamento idêntico: O median nesting é de 0,935 nos conjuntos de solução da fronteira — bem acima do que o score sozinho sugeriria (0,774). Em outras palavras: os líderes acertam quase as mesmas coisas.
O Peso do Scaffold vs. Modelo
O score depende diretamente do par modelo + scaffold.
Dentro do mesmo modelo, a variação de scaffold chega a 29,8 pontos percentuais, enquanto o spread dos trinta primeiros no ranking geral é de apenas 8,8 pontos. Trocar a estrutura de orquestração mexe mais no número do que a diferença "entre os melhores" exibida pelo leaderboard.
O que isso muda na prática?
Quem escolhe ferramenta só pelo lugar no ranking está olhando um indicador que já não ordena bem. O que importa medir passa a ser:
- Estabilidade em instâncias difíceis;
- Custo por resolução;
- Comportamento sob scaffolds diferentes;
- Capacidade de manter o que já funciona no repositório real.
O paper não invalida o SWE-bench, mas mostra seu limite atual quando os sistemas da ponta convergem. Times que tratam o número do leaderboard como verdade absoluta tendem a otimizar para o benchmark — e não para o seu repositório real.
📚 Fonte e Leitura Complementar
- Paper original: Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead (arXiv:2609.17394, setembro/2026).
Leia a análise completa e aprofundada com todos os exemplos de arquitetura clicando no link abaixo:
Artigo completo artigo no Hashnode.
Para quem deseja aprofundar a avaliação e governança de agentes, o tema é tratado de forma estruturada na série Engenharia de Software Assistida por IA, com foco nos Volumes VI (Supervisão e Auditoria de Código Gerado por IA) e VIII (Engenharia de Contexto e Governança de IA).
💡 Destaques:
- 🏷️ Cupom de 30% OFF nos eBooks:
LEIA30 - 📖 Disponível também no Kindle Unlimited!
📖 Livros Físicos (capa comum):
- 📘 Volume I - A Nova Realidade da Engenharia de Software
- 📙 Volume II - Fundamentos que a IA Não Substitui
- 📗 Volume III - Engenharia de Requisitos na Era da IA
- 📕 Volume IV - Arquitetura e Design de Soluções na Era da IA
- 📓 Volume V - Delegação Técnica para IA
- 📔 Volume VI - Supervisão e Auditoria de Código Gerado por IA
- 📒 Volume VII - Aplicações Reais
- 📗 Volume VIII - Engenharia de Contexto e Governança de IA
#EngenhariaDeSoftware #SWEBench #AgentesDeIA #Benchmarks #Avaliacao #GovernancaIA #CodeReview #FuturoDaEngenharia

Top comments (0)