DEV Community

Cover image for O agente vai bem no benchmark. Por que falha no seu repositório?
Alex Pimenta
Alex Pimenta

Posted on

O agente vai bem no benchmark. Por que falha no seu repositório?

Leaderboards públicos de agentes de código costumam pintar um cenário generoso. Tarefas derivadas de issues abertos, repositórios conhecidos, enunciados relativamente formais. O Real-SWE, publicado pela Specific Labs em setembro de 2026, corta esse atalho: as tarefas vêm de bases de produção privadas licenciadas por empresas reais cobrança, impostos, migração de dados de clientes, lógica espalhada entre serviços. O melhor arranjo avaliado (Fable 5.1 com Claude Code) resolveu 38,8% das tentativas. GPT-6 Astra ficou em 33,8%; Gemini 3.8 Flash em 31,2%. Seis das dez tarefas públicas do conjunto ficaram abaixo de 15% para todos os modelos. Uma tarefa de reescrita de stream analítico não foi resolvida em nenhuma das 64 execuções.

A mediana do fix de referência toca 11 arquivos. Em benchmarks mais "limpos", esse número costuma ser perto de 6. Trabalho real raramente cabe num único módulo. O enunciado médio do Real-SWE tem cerca de 1.700 caracteres e carrega contexto de negócio - não só "corrija o bug no arquivo X". A avaliação mede modelo e harness juntos, com a suíte de testes da própria empresa como oráculo. Não é o modelo isolado num playground.

A falha recorrente não é só sintaxe. Relatos do próprio benchmark apontam "requisito perdido" como bucket frequente: o agente entrega um patch que passa em parte dos testes e ignora uma regra de negócio que estava implícita no sistema, não no issue. Código privado concentra convenções internas, acoplamentos legados, serviços externos e intenções que nunca entraram no pré-treino. Reconstruir essa intenção a partir do repositório e do pouco que o ticket diz é o trabalho difícil. Programar a alteração, uma vez que a intenção está clara, é a parte em que os modelos já se saem melhor.

Isso desloca a conversa de "qual modelo está no topo do SWE-bench" para "quanto do nosso contexto de negócio o agente consegue recuperar antes de editar". Requisitos incompletos, arquitetura distribuída e regras que só existem no código ou na cabeça de quem manteve o sistema por anos não somem porque o harness melhorou. Continuam sendo o teste que separa demonstração de engenharia no repositório de verdade.

Quem usa agente em produção e só olha o leaderboard público subestima o custo de revisão, de contexto e de correção quando o patch "quase certo" viola uma invariante que ninguém escreveu no ticket. O número de 38,8% no melhor caso do Real-SWE não é um ataque aos modelos. É um lembrete de onde ainda está o trabalho: na reconstrução do que o sistema deveria fazer, não só na geração do diff.


Leia o artigo mais aprofundado, com exemplos e a análise de arquitetura completa.


Autor da série de livros "Engenharia de Software Assistida por IA" (disponível na Amazon). Aprofunde-se no tema de forma estruturada — do contexto à governança de agentes — pode consultar a série "Engenharia de Software Assistida por IA" clicando na imagem abaixo:

  • Cupom de 30% OFF: LEIA30.
  • Disponível também no Kindle Unlimited.


Referências

  • Specific Labs — Real-SWE: Benchmarking AI Coding Models on Real Enterprise Codebases (setembro 2026); melhor resultado 38,8% (Fable 5.1 + Claude Code), 640 rollouts, bases privadas licenciadas
  • Cobertura e tabelas de custo/resolução (análises públicas de set/2026)

Tags

#EngenhariaDeSoftware #IA #InteligenciaArtificial #SoftwareEngineering #AI #CodingAgents #Benchmarks #EngenhariaDeSoftwareAssistidaPorIA

Top comments (0)