DEV Community

Alex Pimenta
Alex Pimenta

Posted on

Escrever código não é entregar software: a produtividade real dos agentes de IA

A narrativa dominante sobre agentes de código é simples: eles aumentam a produtividade.

Os dados mais recentes e amplos disponíveis mostram que essa afirmação é verdadeira e incompleta.

Um estudo de 2026 (NBER Working Paper 35275), baseado em mais de 100 mil desenvolvedores do GitHub e em telemetria real de uso de ferramentas de IA, mediu o efeito de três gerações sucessivas de ferramentas:

  1. Autocomplete
  2. Agentes interativos (síncronos)
  3. Agentes autônomos (assíncronos)

O resultado central é claro: os ganhos são grandes na escrita de código e diminuem de forma acentuada à medida que se aproxima da entrega.


📊 O que os números mostram

No nível de atividade de código (commits), a adoção cumulativa das três gerações eleva a produção em cerca de 180%. Esse efeito, porém, se atenua ao longo da cadeia de produção:

  • 📈 Volume de linhas de código: sobe de forma muito mais acentuada.
  • 🗂️ Número de projetos ativos: sobe cerca de 50%.
  • 🚀 Número de releases: sobe apenas cerca de 30%.

Em outras palavras: triplicar a atividade de commits não se traduz em triplicar o software entregue.

Para agentes síncronos isoladamente, o padrão é ainda mais marcado: aumento de mais de 7 vezes no volume de linhas de código e de cerca de 65% em pull requests, com alta de apenas cerca de 20% em releases.


🔗 A hipótese do elo fraco (weak-link hypothesis)

Os autores interpretam o padrão como evidência da hipótese do elo fraco. A produção de software não é uma sequência de etapas independentes, mas uma cadeia de atividades complementares.

Quando uma etapa (escrever código) acelera muito e as demais (revisão, integração, testes, decisão de release e operação) não acompanham na mesma proporção, o ganho total fica limitado pelo elo mais lento.

A elasticidade de substituição estimada entre esforço de IA e esforço humano é baixa (cerca de 0,25). Isso indica complementaridade forte: a IA amplifica o que o time já consegue processar e decidir, mas não substitui os pontos em que ainda é necessário julgamento, coordenação e validação humana.


💡 O que isso significa na prática

O estudo ajuda a explicar um fenômeno que muitos times já observam no dia a dia:

  • 🟢 Mais código sendo gerado
  • 🟢 Mais pull requests abertos
  • 🟢 Mais atividade visível no repositório
  • 🔴 Entrega e estabilidade que não crescem na mesma proporção

Há também evidências complementares em outras fontes: código frequentemente bem avaliado na revisão surge associado a um aumento de incidentes e retrabalho após o deploy. A velocidade de geração sobe, mas a capacidade de absorver, verificar e estabilizar essa geração nem sempre acompanha.

Isso não invalida o uso de agentes. Mostra onde o retorno se concentra e onde ele se perde.


👔 Implicações para quem lidera engenharia

  1. Medir o lugar certo: Commits e linhas de código são métricas de atividade, não de entrega. A métrica relevante precisa incluir o que de fato chega ao usuário e com que estabilidade.
  2. Tratar a cadeia, não só a geração: Acelerar apenas a escrita de código sem reforçar revisão, testes, integração e critérios de release tende a acumular trabalho incompleto.
  3. Investir nos elos humanos e de processo: Contexto claro, critérios de aceite, supervisão em camadas e governança deixam de ser "boas práticas" e passam a ser condições para converter velocidade de geração em entrega.
  4. Separar produtividade de tarefa de produtividade de sistema: Um agente pode ser altamente produtivo em uma tarefa local e, ainda assim, gerar pouco ganho no sistema como um todo se o restante da cadeia não absorver o volume.

📌 Conclusão

Os dados disponíveis em 2026 mostram que os agentes aumentam de forma significativa a capacidade de escrever código. Mostram também que esse aumento se comprime à medida que o trabalho se aproxima da entrega.

Escrever mais código não é o mesmo que entregar mais software.

O gargalo de produtividade está se deslocando: de "quanto código conseguimos gerar?" para "quanto desse código conseguimos validar, integrar, estabilizar e colocar em uso de forma confiável?"

  • Times que tratam agentes apenas como aceleradores de digitação tendem a ver o funil se estreitar no meio do caminho.
  • Times que tratam a cadeia completa — do contexto à supervisão e governança — têm mais chance de converter o aumento de geração em resultado real.

📌 Fonte principal:

  • Demirer, M.; Musolff, L.; Yang, L. – Writing Code vs. Shipping Code: Productivity Effects Across Generations of AI Coding Tools (NBER Working Paper 35275, 2026). Divulgado via CEPR/VoxEU.

📚 Quer aprofundar o tema de forma estruturada?

Do contexto à governança de agentes, você pode consultar a série Engenharia de Software Assistida por IA, em especial o Volume VIII — Engenharia de Contexto e Governança de IA.

💡 Destaques:

  • 🏷️ Cupom de 30% OFF nos eBooks: LEIA30
  • 📖 Disponível também no Kindle Unlimited!

👉 Série eBook completa:

Acessar Série de eBooks na Amazon (Cupom 30% off: LEIA30)

📖 Livros Físicos (capa comum):

🔗 Página do autor na Amazon


💬 Na sua equipe, como o aumento na velocidade de geração de código tem impactado o tempo até a entrega (release)? Onde está o gargalo atual? Compartilhe sua experiência nos comentários!

Top comments (0)