DEV Community

Cover image for Nem todo agente é igual: o que 37 mil PRs revelam sobre qualidade depois do merge
Alex Pimenta
Alex Pimenta

Posted on Edited on

Nem todo agente é igual: o que 37 mil PRs revelam sobre qualidade depois do merge

O agente abre o pull request. O time aprova. O que acontece depois?

Um estudo recente analisou 37.623 PRs com proveniência marcada de cinco agentes comerciais — OpenAI Codex, Devin, GitHub Copilot, Cursor e Claude Code —, além de um baseline humano. Os dados cobrem 2.807 repositórios no GitHub entre dezembro de 2024 e julho de 2025.

Três resultados principais se destacam:


1. Taxa de Revert (Diferenças por Fornecedor)

  • OpenAI Codex: Apresentou a menor taxa de reversão, sendo revertido cerca de metade das vezes em comparação ao código humano (6,1% contra 11,5%).
  • Devin: Ficou no outro extremo, registrando uma taxa de revert superior à humana, com 14,5%.

2. Security Smells (Débito de Segurança)

  • No agregado, o código gerado por agentes apresentou menos security smells do que o código escrito por humanos (odds ratio de 0,63).
  • A melhoria foi puxada principalmente por um menor índice de credenciais hardcoded e menos construtos inseguros no estilo eval.

3. Esforço e Tempo de Code Review

  • O esforço de revisão humana não é distribuído de forma uniforme entre as ferramentas.
  • GitHub Copilot: Atraiu mais revisões e pedidos de mudança.
  • Claude Code: Enfrentou maior tempo de espera até o primeiro review humano, com uma mediana de 12,6 horas.

O Que Importa de Verdade

O estudo não conclui que os agentes são simplesmente "melhores" ou "piores". Ele demonstra que o comportamento pós-merge muda drasticamente conforme a ferramenta utilizada — impactando taxa de reversão, segurança e carga de revisão de código.

Quem trata "agente de IA" como uma categoria única perde o detalhe operacional mais importante: qual ferramenta usar, em qual tipo de mudança e com qual custo de manutenção posterior.

Qualidade depois do merge continua sendo o verificador real que nenhum benchmark consegue isolar sozinho.


📚 Fonte e Leitura Aprofundada

  • Paper de referência: Not All Agents Are Equal: Code Quality and Post-Merge Maintenance Across Five Autonomous Coding Agents in the Wild (arXiv:2609.17598).

Leia o artigo mais aprofundado, com exemplos e a análise completa clicando na imagem abaixo:


Para quem deseja se aprofundar na supervisão e auditoria de código gerado por IA, o tema é tratado de forma estruturada na série Engenharia de Software Assistida por IA (disponível na Amazon).

💡 Destaques:

  • 🏷️ Cupom de 30% OFF nos eBooks: LEIA30
  • 📖 Disponível também no Kindle Unlimited!


#EngenhariaDeSoftware #InteligenciaArtificial #IA #SoftwareEngineering #AIAgents #CodeReview

Top comments (0)