A narrativa dominante sobre agentes de código é simples: eles aumentam a produtividade.
Os dados mais recentes e amplos disponíveis mostram que essa afirmação é verdadeira e incompleta.
Um estudo de 2026 (NBER Working Paper 35275), baseado em mais de 100 mil desenvolvedores do GitHub e em telemetria real de uso de ferramentas de IA, mediu o efeito de três gerações sucessivas de ferramentas:
- Autocomplete
- Agentes interativos (síncronos)
- Agentes autônomos (assíncronos)
O resultado central é claro: os ganhos são grandes na escrita de código e diminuem de forma acentuada à medida que se aproxima da entrega.
📊 O que os números mostram
No nível de atividade de código (commits), a adoção cumulativa das três gerações eleva a produção em cerca de 180%. Esse efeito, porém, se atenua ao longo da cadeia de produção:
- 📈 Volume de linhas de código: sobe de forma muito mais acentuada.
- 🗂️ Número de projetos ativos: sobe cerca de 50%.
- 🚀 Número de releases: sobe apenas cerca de 30%.
Em outras palavras: triplicar a atividade de commits não se traduz em triplicar o software entregue.
Para agentes síncronos isoladamente, o padrão é ainda mais marcado: aumento de mais de 7 vezes no volume de linhas de código e de cerca de 65% em pull requests, com alta de apenas cerca de 20% em releases.
🔗 A hipótese do elo fraco (weak-link hypothesis)
Os autores interpretam o padrão como evidência da hipótese do elo fraco. A produção de software não é uma sequência de etapas independentes, mas uma cadeia de atividades complementares.
Quando uma etapa (escrever código) acelera muito e as demais (revisão, integração, testes, decisão de release e operação) não acompanham na mesma proporção, o ganho total fica limitado pelo elo mais lento.
A elasticidade de substituição estimada entre esforço de IA e esforço humano é baixa (cerca de 0,25). Isso indica complementaridade forte: a IA amplifica o que o time já consegue processar e decidir, mas não substitui os pontos em que ainda é necessário julgamento, coordenação e validação humana.
💡 O que isso significa na prática
O estudo ajuda a explicar um fenômeno que muitos times já observam no dia a dia:
- 🟢 Mais código sendo gerado
- 🟢 Mais pull requests abertos
- 🟢 Mais atividade visível no repositório
- 🔴 Entrega e estabilidade que não crescem na mesma proporção
Há também evidências complementares em outras fontes: código frequentemente bem avaliado na revisão surge associado a um aumento de incidentes e retrabalho após o deploy. A velocidade de geração sobe, mas a capacidade de absorver, verificar e estabilizar essa geração nem sempre acompanha.
Isso não invalida o uso de agentes. Mostra onde o retorno se concentra e onde ele se perde.
👔 Implicações para quem lidera engenharia
- Medir o lugar certo: Commits e linhas de código são métricas de atividade, não de entrega. A métrica relevante precisa incluir o que de fato chega ao usuário e com que estabilidade.
- Tratar a cadeia, não só a geração: Acelerar apenas a escrita de código sem reforçar revisão, testes, integração e critérios de release tende a acumular trabalho incompleto.
- Investir nos elos humanos e de processo: Contexto claro, critérios de aceite, supervisão em camadas e governança deixam de ser "boas práticas" e passam a ser condições para converter velocidade de geração em entrega.
- Separar produtividade de tarefa de produtividade de sistema: Um agente pode ser altamente produtivo em uma tarefa local e, ainda assim, gerar pouco ganho no sistema como um todo se o restante da cadeia não absorver o volume.
📌 Conclusão
Os dados disponíveis em 2026 mostram que os agentes aumentam de forma significativa a capacidade de escrever código. Mostram também que esse aumento se comprime à medida que o trabalho se aproxima da entrega.
Escrever mais código não é o mesmo que entregar mais software.
O gargalo de produtividade está se deslocando: de "quanto código conseguimos gerar?" para "quanto desse código conseguimos validar, integrar, estabilizar e colocar em uso de forma confiável?"
- Times que tratam agentes apenas como aceleradores de digitação tendem a ver o funil se estreitar no meio do caminho.
- Times que tratam a cadeia completa — do contexto à supervisão e governança — têm mais chance de converter o aumento de geração em resultado real.
📌 Fonte principal:
- Demirer, M.; Musolff, L.; Yang, L. – Writing Code vs. Shipping Code: Productivity Effects Across Generations of AI Coding Tools (NBER Working Paper 35275, 2026). Divulgado via CEPR/VoxEU.
📚 Quer aprofundar o tema de forma estruturada?
Do contexto à governança de agentes, você pode consultar a série Engenharia de Software Assistida por IA, em especial o Volume VIII — Engenharia de Contexto e Governança de IA.
💡 Destaques:
- 🏷️ Cupom de 30% OFF nos eBooks:
LEIA30 - 📖 Disponível também no Kindle Unlimited!
👉 Série eBook completa:
Acessar Série de eBooks na Amazon (Cupom 30% off: LEIA30)
📖 Livros Físicos (capa comum):
- 📘 Volume I – A Nova Realidade da Engenharia de Software
- 📙 Volume II – Fundamentos que a IA Não Substitui
- 📗 Volume III – Engenharia de Requisitos na Era da IA
- 📕 Volume IV – Arquitetura e Design de Soluções na Era da IA
- 📓 Volume V – Delegação Técnica para IA
- 📔 Volume VI – Supervisão e Auditoria de Código Gerado por IA
- 📒 Volume VII – Aplicações Reais
- 📗 Volume VIII – Engenharia de Contexto e Governança de IA
💬 Na sua equipe, como o aumento na velocidade de geração de código tem impactado o tempo até a entrega (release)? Onde está o gargalo atual? Compartilhe sua experiência nos comentários!

Top comments (0)