DEV Community

Alex Pimenta
Alex Pimenta

Posted on

Os agentes de código convergiram: por que o ranking do SWE-bench já não ordena os melhores?

Pequenas diferenças no leaderboard viraram ranking. Não deveriam.

Um paper de 15 de setembro de 2026 auditou 254 submissões do SWE-bench — sem rodar modelo nenhum, apenas analisando o que já estava publicado.


Os Dados da Convergência

  • Sobreposição alta: No split Verified, os dois primeiros resolvem 396 de 500 instâncias cada um. Os dez primeiros compartilham 285 sucessos e 51 falhas, sobrando apenas 164 instâncias que de fato os separam.
  • Comportamento idêntico: O median nesting é de 0,935 nos conjuntos de solução da fronteira — bem acima do que o score sozinho sugeriria (0,774). Em outras palavras: os líderes acertam quase as mesmas coisas.

O Peso do Scaffold vs. Modelo

O score depende diretamente do par modelo + scaffold.

Dentro do mesmo modelo, a variação de scaffold chega a 29,8 pontos percentuais, enquanto o spread dos trinta primeiros no ranking geral é de apenas 8,8 pontos. Trocar a estrutura de orquestração mexe mais no número do que a diferença "entre os melhores" exibida pelo leaderboard.


O que isso muda na prática?

Quem escolhe ferramenta só pelo lugar no ranking está olhando um indicador que já não ordena bem. O que importa medir passa a ser:

  • Estabilidade em instâncias difíceis;
  • Custo por resolução;
  • Comportamento sob scaffolds diferentes;
  • Capacidade de manter o que já funciona no repositório real.

O paper não invalida o SWE-bench, mas mostra seu limite atual quando os sistemas da ponta convergem. Times que tratam o número do leaderboard como verdade absoluta tendem a otimizar para o benchmark — e não para o seu repositório real.


📚 Fonte e Leitura Complementar

  • Paper original: Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead (arXiv:2609.17394, setembro/2026).

Leia a análise completa e aprofundada com todos os exemplos de arquitetura clicando no link abaixo:

Artigo completo artigo no Hashnode.


Para quem deseja aprofundar a avaliação e governança de agentes, o tema é tratado de forma estruturada na série Engenharia de Software Assistida por IA, com foco nos Volumes VI (Supervisão e Auditoria de Código Gerado por IA) e VIII (Engenharia de Contexto e Governança de IA).

💡 Destaques:

  • 🏷️ Cupom de 30% OFF nos eBooks: LEIA30
  • 📖 Disponível também no Kindle Unlimited!

👉 Série eBook completa

📖 Livros Físicos (capa comum):

🔗 Página do autor na Amazon


#EngenhariaDeSoftware #SWEBench #AgentesDeIA #Benchmarks #Avaliacao #GovernancaIA #CodeReview #FuturoDaEngenharia

Top comments (0)