DEV Community

Cover image for Qwen 3.8 para Codificação: 16 Dias de Execuções Autônomas e a Conexão com o Código Claude
Lucas
Lucas

Posted on Originally published at apidog.com

Qwen 3.8 para Codificação: 16 Dias de Execuções Autônomas e a Conexão com o Código Claude

A maioria dos lançamentos de modelos apresenta capacidade de codificação com uma pontuação no HumanEval ou um trecho gerando busca binária. A Alibaba adotou outra abordagem com o Qwen 3.8-Max: a afirmação é que o modelo pode gerenciar um projeto de software por semanas, abrindo issues, mesclando pull requests e entregando recursos sem intervenção humana.

Experimente o Apidog hoje

Essa é uma proposta audaciosa e merece escrutínio. Este artigo analisa as três demonstrações de codificação publicadas pela Alibaba no lançamento — todas demos do fornecedor, incluindo uma com repositório público auditável —, os benchmarks por trás delas e, principalmente, como usar qwen3.8-max no Claude Code, Codex, Qoder, Qwen Code e OpenClaw. Também mostra como testar as APIs chamadas pelo código gerado.

Se você é novo no modelo, comece pela visão geral de o que é o Qwen 3.8: 2,4T de parâmetros totais, 95B ativos, janela de contexto de 1M de tokens e pesos abertos prometidos para a semana após o lançamento. Aqui, o foco é codificação. Tudo abaixo reflete o estado das coisas em 3 de agosto de 2026.

O que a Alibaba realmente está afirmando

Na publicação oficial de lançamento do Qwen 3.8, a Alibaba enfatiza autonomia, não apenas snippets. O Qwen 3.8-Max é posicionado como um modelo capaz de manter tarefas de engenharia de longo prazo em contexto: planejar, executar por dias, recuperar-se de erros e entregar uma saída revisável.

Demonstração do Qwen 3.8-Max

Três aspectos tornam a afirmação mais interessante do que o marketing usual:

  1. As demos são longas. Dezesseis dias é muito diferente de um benchmark de agente de 20 minutos. Recuperação de erros, gerenciamento de contexto e deriva de objetivo passam a importar muito mais.
  2. Uma demo é pública. É possível navegar pelo repositório, ler commits e avaliar a qualidade do código diretamente.
  3. O harness é de um concorrente. A Alibaba executou a maior parte dos benchmarks de codificação com o harness do Claude Code e publicou uma configuração oficial para reproduzir o uso.

Ressalva: todos os números vêm dos materiais de lançamento da Alibaba. Não havia verificação independente em meados de agosto de 2026. Trate as demonstrações como exemplos, não como auditorias.

As três demonstrações de codificação

oh-my-cli: 16 dias de desenvolvimento autônomo

A principal demonstração deixou o Qwen 3.8-Max construir uma ferramenta de linha de comando sem supervisão. Em 30 de julho, a execução durava 16 dias e havia produzido:

  • 265 commits;
  • 127 pull requests;
  • 151 issues.

Segundo a Alibaba, todos foram abertos, trabalhados e fechados pelo próprio modelo.

O repositório está público em qwen-code-dev-bot/oh-my-cli. Esse é o artefato mais útil da demonstração: em vez de confiar na contagem de commits, você pode revisar PRs, issues e o código resultante.

Ao auditar esse tipo de execução, verifique:

  • se os PRs resolvem os issues que referenciam;
  • se o modelo cria trabalho artificial apenas para fechá-lo;
  • se há testes relevantes para as mudanças;
  • como regressões são detectadas e corrigidas;
  • se os commits mantêm coerência arquitetural ao longo do tempo.

Esses sinais dizem mais sobre confiabilidade de longo prazo do que uma pontuação isolada de benchmark.

Reprodução de artigo: código de pesquisa, não código de aplicativo

A segunda demonstração aborda uma tarefa mais difícil: reproduzir um artigo de pesquisa de machine learning do zero.

Segundo a Alibaba, a execução:

  • levou aproximadamente 125 horas;
  • produziu cerca de 7.600 linhas de código;
  • executou 33 rodadas de treinamento em GPU;
  • reproduziu 6 descobertas do artigo;
  • superou o resultado reportado em 2,7 pontos no AIME24.

Demonstração de reprodução de artigo

Reproduzir pesquisa é um fluxo de trabalho exigente: ambientes quebram, hiperparâmetros podem estar escondidos em notas de rodapé e bugs silenciosos podem invalidar horas de treinamento. A capacidade alegada aqui não é apenas gerar código, mas iterar sobre experimentos e resultados.

Essa demonstração se conecta diretamente ao melhor benchmark do Qwen 3.8-Max: o PaperBench.

Competição Tianchi: 24 horas contra equipes humanas

A terceira demonstração colocou o modelo em uma competição de ciência de dados ao vivo na plataforma Tianchi da Alibaba, com limite de 24 horas.

Segundo os números divulgados, o modelo:

  • enviou 45 submissões;
  • iterou a estratégia com base na pontuação de cada tentativa;
  • terminou com precisão final de 0,853;
  • superou 458 das 526 equipes humanas participantes.

Resultado da competição Tianchi

O modelo não venceu a competição, mas superou 87% do campo. O ponto mais relevante é a capacidade de iterar rapidamente sob prazo, usando o feedback de cada submissão para orientar a próxima.

Também vale a ressalva: Tianchi é uma plataforma da própria Alibaba. A demonstração pode ser real, mas o fornecedor controlou o ambiente.

Os benchmarks de codificação por trás das demonstrações

A Alibaba publicou uma tabela completa de benchmarks. Estas são as linhas mais relevantes para desenvolvimento:

Benchmark Qwen 3.8-Max Melhor rival, conforme a tabela da Alibaba
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

Como interpretar os resultados:

  • Terminal Bench 2.1: 86.6

    Coloca o Qwen 3.8-Max à frente do Claude Opus 4.8 e do Fable 5 — ambos com 84.6 na tabela da Alibaba — em tarefas de agente orientadas por terminal. Esse é o resultado mais alinhado à demo do oh-my-cli.

  • SWE-bench Pro: 67.7

    É o ponto fraco relativo. O Fable 5 marca 80.0 na mesma tabela. Em correção de bugs em escala de repositório, uma tarefa próxima de “corrija este problema no meu codebase”, o Qwen 3.8-Max fica mais de 12 pontos atrás do líder.

  • PaperBench: 93.0

    É o melhor destaque do modelo, superando todos os modelos na comparação publicada. Esse resultado apoia diretamente a demonstração de reprodução de artigo.

A letra miúda importa: a Alibaba executou a maioria dos benchmarks de codificação no harness do Claude Code, inclusive para modelos concorrentes. As notas de rodapé também indicam que resultados do Fable 5 podem envolver fallbacks.

A escolha do harness pode afetar materialmente benchmarks de agentes. Portanto, uma tabela produzida por um fornecedor em um ambiente específico é um ponto de dados, não um veredicto final.

Por outro lado, isso torna a configuração no Claude Code especialmente relevante: é o ambiente no qual a Alibaba mediu boa parte desses resultados.

Como realmente codificar com Qwen 3.8 hoje

O Qwen 3.8-Max está disponível no Alibaba Cloud Model Studio. A Alibaba publicou configurações oficiais para Claude Code, Codex, Qoder, Qwen Code e OpenClaw.

Você precisa de uma chave de API DashScope, disponível em home.qwencloud.com.

Segundo a página oficial de preços do Model Studio, o custo é:

  • US$ 2 por milhão de tokens de entrada;
  • US$ 6 por milhão de tokens de saída;
  • preço fixo em toda a janela de contexto de 1M de tokens.

Claude Code

O Qwen 3.8-Max fornece um endpoint compatível com Anthropic. Para usá-lo com Claude Code, configure estas variáveis de ambiente:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Depois, inicie o Claude Code normalmente.

claude
Enter fullscreen mode Exit fullscreen mode

As requisições serão roteadas para o Qwen 3.8-Max em vez de Claude.

Para validar rapidamente que a configuração está funcionando:

  1. Abra um repositório de teste.
  2. Peça uma mudança pequena e verificável.
  3. Execute os testes locais.
  4. Confira logs, variáveis de ambiente e consumo no painel do provedor antes de iniciar tarefas longas.

Como a Alibaba executou seus benchmarks nesse harness, esta é a opção com menor diferença entre o ambiente medido e o ambiente que você pode reproduzir.

Codex

O Codex precisa de uma entrada de provedor na configuração:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Enter fullscreen mode Exit fullscreen mode

Defina a chave antes de iniciar o Codex:

export DASHSCOPE_API_KEY=your-dashscope-api-key
Enter fullscreen mode Exit fullscreen mode

Essa configuração usa o endpoint compatível com OpenAI, não o endpoint compatível com Anthropic. O modelo e a chave são os mesmos; o protocolo é diferente.

Qoder, Qwen Code e OpenClaw

As outras três opções exigem menos configuração:

  • Qoder CLI: ferramenta de codificação agente da Alibaba. Selecione qwen3.8-max como modelo.
  • Qwen Code: CLI de código aberto da equipe Qwen. Defina DASHSCOPE_API_KEY e selecione o modelo.
  • OpenClaw: a configuração oficial define o ID do modelo e maxTokens como 65.536, que corresponde ao comprimento máximo de saída informado.

Para evitar configurações desatualizadas, consulte a publicação oficial de lançamento antes de fixar valores em scripts de CI, arquivos de configuração compartilhados ou templates internos.

Defina o esforço de raciocínio deliberadamente

O Qwen 3.8-Max suporta o parâmetro reasoning_effort com três níveis:

  • xhigh — padrão;
  • medium;
  • low.

Use cada nível conforme o tipo de tarefa:

Tarefa Configuração recomendada
Refatorações com vários arquivos xhigh
Depuração com investigação de causa raiz xhigh
Planejamento de mudanças arquiteturais xhigh
Renomeações e mudanças mecânicas low
Atualização de docstrings low
Formatação e alterações repetitivas low

Mantenha xhigh para trabalho agente: tarefas em que o modelo precisa planejar, explorar arquivos, executar comandos e revisar consequências das próprias mudanças.

Reduza para low em edições rápidas. Tokens de pensamento são cobrados como tokens de saída, a US$ 6 por milhão, e o modo xhigh pode aumentar o custo de sessões longas sem benefício em tarefas mecânicas.

Se o Qwen 3.8-Max for mais capacidade do que sua tarefa precisa, a linha anterior Qwen3 Coder continua disponível para trabalho de codificação dedicado. O Qwen3 Coder Flash cobre tarefas rápidas e mais baratas. Para outro modelo de código aberto nesse espaço, veja como o Kimi K3 lida com trabalho de codificação.

Testando o que o modelo constrói: a etapa Apidog

Há uma lacuna recorrente em demonstrações de codificação autônoma: o modelo escreve código que chama APIs, mas a validação dessas chamadas raramente recebe a mesma atenção.

Um agente pode gerar 7.600 linhas que compilam sem problemas e ainda assim:

  • chamar o endpoint errado;
  • tratar incorretamente uma resposta 429;
  • enviar um corpo de requisição inválido;
  • ignorar erros de autenticação;
  • assumir campos que não existem na resposta;
  • executar mutações indevidas em produção.

Dois hábitos ajudam a fechar essa lacuna.

1. Teste os endpoints chamados pelo código gerado

Quando o Qwen 3.8-Max cria um serviço ou cliente de API, importe a especificação relevante no Apidog e teste os endpoints diretamente.

Priorize estes cenários:

  • fluxos de autenticação;
  • respostas 401, 403, 404, 409, 422, 429 e 500;
  • payloads com campos ausentes;
  • limites de paginação;
  • uploads e downloads;
  • formatos inválidos;
  • dados de borda;
  • timeouts e retries.

Um fluxo prático:

  1. Peça ao agente para gerar ou atualizar o cliente de API.
  2. Importe a especificação OpenAPI no Apidog.
  3. Execute os endpoints manualmente ou em coleções de teste.
  4. Compare a requisição real com as suposições presentes no código.
  5. Só então integre a mudança ao ambiente compartilhado.

Se você está avaliando a API do modelo, o guia da API do Qwen 3.8 detalha a configuração dos protocolos OpenAI e Anthropic. O Apidog também permite inspecionar os dois formatos lado a lado, incluindo respostas de streaming e deltas de raciocínio.

2. Use mocks para impedir que agentes atinjam produção

Quanto mais longa for uma execução agente, maior a necessidade de isolamento.

Uma sessão autônoma de 16 dias fazendo chamadas reais contra infraestrutura de produção pode causar:

  • limites de taxa inesperados;
  • mutações de dados;
  • custos não planejados;
  • efeitos colaterais difíceis de reverter;
  • poluição de ambientes compartilhados.

Servidores mock no Apidog fornecem respostas realistas sem tocar em sistemas reais.

Use este padrão:

Agente de código
      |
      v
URL mock durante desenvolvimento e testes
      |
      v
Revisão humana + testes automatizados
      |
      v
URL base real em ambiente controlado
Enter fullscreen mode Exit fullscreen mode

Durante a execução do agente, aponte o código gerado para a URL mock. Troque para a URL base real somente após revisão humana e validação dos testes.

Você pode baixar o Apidog gratuitamente para configurar um mock em poucos minutos.

O princípio é simples: quanto mais autonomia você dá a um modelo de codificação, mais a camada de API se torna sua superfície de controle. Você talvez não revise cada commit em tempo real, mas pode controlar com quais sistemas o código tem permissão para se comunicar.

Perguntas frequentes

O Qwen 3.8 é bom para codificação?

Pelos números publicados pela Alibaba, ele é forte em codificação orientada por agentes e pesquisa:

  • Terminal Bench 2.1: 86.6;
  • PaperBench: 93.0.

Ele é mais mediano em correção de bugs em escala de repositório:

  • SWE-bench Pro: 67.7;
  • Fable 5 na mesma tabela: 80.0.

Todos os números são execuções do fornecedor e ainda não tinham verificação independente. A leitura prática é: o modelo parece promissor para trabalho autônomo de longo prazo, mas não lidera a categoria em correção clássica de problemas de repositório.

Posso usar o Qwen 3.8 no Claude Code?

Sim. Configure:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

A Alibaba publicou essa configuração e executou a maior parte dos benchmarks de codificação usando o harness Claude Code.

Quanto custa codificar com o Qwen 3.8?

Segundo a Alibaba, custa:

  • US$ 2 por milhão de tokens de entrada;
  • US$ 6 por milhão de tokens de saída;
  • preço fixo para toda a janela de contexto de 1M.

Tokens de pensamento são cobrados como saída. Como xhigh é o padrão e pode gerar muitos tokens de raciocínio, estime custos acima do preço nominal para sessões agente longas.

Para mais detalhes, consulte a análise dos benchmarks do Qwen 3.8 e a cobertura de preços vinculada nela.

A execução de 16 dias do oh-my-cli foi realmente autônoma?

Essa é a afirmação da Alibaba. Diferentemente da maioria das demos de fornecedores, existe um artefato público para inspeção: o repositório qwen-code-dev-bot/oh-my-cli, com 265 commits, 127 PRs e 151 issues em 30 de julho de 2026.

A qualidade do código e o grau real de autonomia são julgamentos que você pode fazer lendo o repositório. Essa possibilidade de auditoria é justamente o que torna a demonstração mais verificável do que uma captura de tela.

Top comments (0)