Leaderboards públicos de agentes de código costumam pintar um cenário generoso. Tarefas derivadas de issues abertos, repositórios conhecidos, enunciados relativamente formais. O Real-SWE, publicado pela Specific Labs em setembro de 2026, corta esse atalho: as tarefas vêm de bases de produção privadas licenciadas por empresas reais cobrança, impostos, migração de dados de clientes, lógica espalhada entre serviços. O melhor arranjo avaliado (Fable 5.1 com Claude Code) resolveu 38,8% das tentativas. GPT-6 Astra ficou em 33,8%; Gemini 3.8 Flash em 31,2%. Seis das dez tarefas públicas do conjunto ficaram abaixo de 15% para todos os modelos. Uma tarefa de reescrita de stream analítico não foi resolvida em nenhuma das 64 execuções.
A mediana do fix de referência toca 11 arquivos. Em benchmarks mais "limpos", esse número costuma ser perto de 6. Trabalho real raramente cabe num único módulo. O enunciado médio do Real-SWE tem cerca de 1.700 caracteres e carrega contexto de negócio - não só "corrija o bug no arquivo X". A avaliação mede modelo e harness juntos, com a suíte de testes da própria empresa como oráculo. Não é o modelo isolado num playground.
A falha recorrente não é só sintaxe. Relatos do próprio benchmark apontam "requisito perdido" como bucket frequente: o agente entrega um patch que passa em parte dos testes e ignora uma regra de negócio que estava implícita no sistema, não no issue. Código privado concentra convenções internas, acoplamentos legados, serviços externos e intenções que nunca entraram no pré-treino. Reconstruir essa intenção a partir do repositório e do pouco que o ticket diz é o trabalho difícil. Programar a alteração, uma vez que a intenção está clara, é a parte em que os modelos já se saem melhor.
Isso desloca a conversa de "qual modelo está no topo do SWE-bench" para "quanto do nosso contexto de negócio o agente consegue recuperar antes de editar". Requisitos incompletos, arquitetura distribuída e regras que só existem no código ou na cabeça de quem manteve o sistema por anos não somem porque o harness melhorou. Continuam sendo o teste que separa demonstração de engenharia no repositório de verdade.
Quem usa agente em produção e só olha o leaderboard público subestima o custo de revisão, de contexto e de correção quando o patch "quase certo" viola uma invariante que ninguém escreveu no ticket. O número de 38,8% no melhor caso do Real-SWE não é um ataque aos modelos. É um lembrete de onde ainda está o trabalho: na reconstrução do que o sistema deveria fazer, não só na geração do diff.
Leia o artigo mais aprofundado, com exemplos e a análise de arquitetura completa.
Autor da série de livros "Engenharia de Software Assistida por IA" (disponível na Amazon). Aprofunde-se no tema de forma estruturada — do contexto à governança de agentes — pode consultar a série "Engenharia de Software Assistida por IA" clicando na imagem abaixo:
- Cupom de 30% OFF:
LEIA30. - Disponível também no Kindle Unlimited.
Referências
- Specific Labs — Real-SWE: Benchmarking AI Coding Models on Real Enterprise Codebases (setembro 2026); melhor resultado 38,8% (Fable 5.1 + Claude Code), 640 rollouts, bases privadas licenciadas
- Cobertura e tabelas de custo/resolução (análises públicas de set/2026)
Tags
#EngenhariaDeSoftware #IA #InteligenciaArtificial #SoftwareEngineering #AI #CodingAgents #Benchmarks #EngenhariaDeSoftwareAssistidaPorIA


Top comments (0)