DEV Community

Cover image for O Que é Qwen 3.8-Max?
Lucas
Lucas

Posted on Originally published at apidog.com

O Que é Qwen 3.8-Max?

A Alibaba lançou oficialmente o Qwen 3.8-Max no início de agosto de 2026. O modelo combina uma arquitetura Mixture-of-Experts (MoE) de 2,4 trilhões de parâmetros, com apenas 95 bilhões ativados por token, contexto de 1 milhão de tokens e preço fixo de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. A Alibaba também prometeu publicar os pesos no Hugging Face e ModelScope dentro de uma semana — algo inédito para um modelo da classe Qwen-Max.

Experimente o Apidog hoje

O anúncio oficial apresenta o Qwen 3.8-Max como o modelo mais capaz da família Qwen até agora. Para desenvolvedores, os pontos mais relevantes são: endpoints compatíveis com OpenAI e Anthropic, suporte a texto e imagem, controles de raciocínio e uma janela de contexto longa sem aumento de preço. Um cliente de API como o Apidog pode ajudar a testar os dois protocolos usando a mesma chave.

Qwen 3.8-Max em resumo

Especificação Qwen 3.8-Max
Desenvolvedor Alibaba (equipe Qwen)
Lançamento Início de agosto de 2026; disponibilidade geral no Model Studio em 3 de agosto
Arquitetura MoE, construído sobre a base Qwen 3.5
Parâmetros totais 2,4T
Parâmetros ativos 95B, aproximadamente 4% de ativação
Janela de contexto 1.000.000 tokens
Saída máxima 65.536 tokens
Modalidades Entrada de texto e imagem; saída de texto
Controles de raciocínio reasoning_effort: xhigh (padrão), medium, low
ID do modelo qwen3.8-max
Preço US$ 2 de entrada / US$ 6 de saída por 1M de tokens
Pesos abertos Prometidos para a semana seguinte ao lançamento; ainda indisponíveis no início de agosto de 2026
Protocolos da API Compatíveis com OpenAI e Anthropic

As especificações vêm dos materiais de lançamento da Alibaba e da página de preços do Model Studio.

O que é o Qwen 3.8-Max

O Qwen 3.8-Max substitui o Qwen3.7-Max no topo da linha. Segundo a tabela da Alibaba, ele melhora resultados em benchmarks como Terminal Bench 2.1, de 74.5 para 86.6, e PaperBench, de 64.8 para 93.0.

Se você já usa o modelo anterior, consulte a comparação entre Qwen 3.8 e Qwen 3.7 Max antes de migrar.

A característica técnica central é a relação entre parâmetros totais e ativos:

  • 2,4T parâmetros totais representam a capacidade do modelo completo.
  • 95B parâmetros ativos por token reduzem o custo de inferência.
  • A ativação de aproximadamente 4% explica como a Alibaba consegue oferecer o modelo a US$ 2/US$ 6 por milhão de tokens.

Como referência, o Kimi K3 usa 2,8T parâmetros totais e 104B ativos. Portanto, o Qwen 3.8-Max é menor nos dois números, mas também oferece entrada multimodal.

Modalidades e raciocínio

A API aceita texto e imagens como entrada. Embora o blog da Alibaba demonstre compreensão de PDFs longos e vídeos de 100 horas por meio de “gráficos de memória”, as configurações de API publicadas listam apenas texto e imagem como modalidades de entrada.

Para controlar o raciocínio, use:

{
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

Valores disponíveis:

  • xhigh: padrão; prioriza raciocínio mais extenso.
  • medium: reduz o esforço de raciocínio.
  • low: reduz ainda mais o custo e a latência associados ao raciocínio.

Também existem os controles enable_thinking e preserve_thinking. O raciocínio é preservado por padrão.

Os tokens de raciocínio são cobrados como tokens de saída. Mesmo com a mesma tarifa por token, workloads em xhigh podem custar mais do que uma estimativa baseada apenas na resposta final.

O primeiro Qwen de classe Max com pesos abertos

A Alibaba já publicou pesos de outros modelos Qwen, mas não da camada Max. Para o Qwen 3.8-Max, a empresa afirmou que os pesos seriam disponibilizados no Hugging Face e ModelScope “na próxima semana”, aproximadamente em 10 de agosto de 2026.

Antes de planejar uma estratégia baseada nisso, considere duas limitações:

  1. Os pesos ainda não estavam disponíveis para download no início de agosto de 2026. Até a publicação efetiva, trate isso como um anúncio, não como uma opção de implantação.
  2. Executar um modelo de 2,4T localmente exige infraestrutura de múltiplos nós. Mesmo com quantização agressiva, não é um modelo voltado para uma estação de trabalho comum.

Para a maioria das equipes, pesos abertos provavelmente significarão acesso hospedado por provedores terceiros, e não auto-hospedagem local.

Se o objetivo é testar o modelo sem pagar o preço de tabela, use o Qwen Chat ou a cota gratuita do Model Studio. Veja o guia sobre como usar o Qwen 3.8 gratuitamente.

O que os benchmarks mostram

A Alibaba publicou benchmarks comparando o Qwen 3.8-Max com Claude Opus 4.8, Fable 5, GPT-5.6 Sol e Qwen3.7-Max.

Antes de usar esses dados para tomar uma decisão de arquitetura, considere:

  • Os resultados foram executados pelo fornecedor.
  • A maioria dos benchmarks de código usou o framework Claude Code para todos os modelos.
  • Alguns benchmarks, como QwenSWEBench, QwenQoderBench, CoWorkBench e RecreationBench, são internos da Alibaba.
  • Não havia resultados independentes de fontes como Artificial Analysis no momento da escrita.

Onde o Qwen 3.8-Max se destaca

  • PaperBench: 93.0, acima de GPT-5.6 Sol (90.5), Fable 5 (88.8) e Opus 4.8 (80.3).
  • IFBench: 82.8, acima dos 72.7 do Sol.
  • Terminal Bench 2.1: 86.6, acima de Opus 4.8 e Fable 5 (84.6), mas abaixo do Sol (88.8).
  • Multimodal e documentos: MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1 e resultados fortes em OCR.

Onde ele fica atrás

  • SWE-bench Pro: 67.7, abaixo de Fable 5 (80.0) e Opus 4.8 (69.2), mas acima de Sol (64.6).
  • HLE: 43.6, abaixo de Fable 5 (53.3), Sol (47.2) e Opus 4.8 (45.7).

A interpretação prática é:

  • Priorize o Qwen 3.8-Max para fluxos multimodais, análise de documentos, OCR e tarefas de agentes.
  • Avalie Fable 5 se SWE-bench Pro e HLE forem indicadores críticos para seu caso de uso.
  • Faça testes no seu próprio repositório e com seus próprios prompts antes de migrar.

Para ver a tabela e os detalhes metodológicos, consulte a análise dos benchmarks do Qwen 3.8.

A Alibaba também mostrou demonstrações de codificação autônoma, reprodução de artigo e participação em concurso Tianchi. Como são demonstrações do próprio fornecedor, use-as como indícios de capacidade, não como avaliações controladas. Para detalhes sobre a configuração de código, veja Qwen 3.8 para codificação.

Comparação com Kimi K3, Fable 5 e GPT-5.6 Sol

Qwen 3.8-Max vs. Kimi K3

A comparação é natural: ambos são modelos MoE chineses de grande porte e ambos foram anunciados com pesos abertos.

Característica Qwen 3.8-Max Kimi K3
Parâmetros totais 2,4T 2,8T
Parâmetros ativos 95B 104B
Modalidades Texto e imagem Somente texto
Entrada / saída US$ 2 / US$ 6 US$ 3 / US$ 15
Pesos Prometidos Já disponíveis, conforme o artigo original

Ainda não há uma avaliação direta independente entre eles. Compare cada modelo com os mesmos prompts, tamanho de contexto e critérios de qualidade.

Veja a comparação detalhada Qwen 3.8 vs Kimi K3. Se você ainda não conhece o modelo da Moonshot, comece por o que é Kimi K3.

Qwen 3.8-Max vs. Fable 5

O Fable 5 permanece à frente em benchmarks centrais de codificação, segundo a tabela da Alibaba:

  • SWE-bench Pro: 80.0 vs. 67.7.
  • HLE: 53.3 vs. 43.6.

O Qwen oferece outros trade-offs:

  • preço menor;
  • contexto de 1 milhão de tokens;
  • suporte multimodal;
  • pesos abertos prometidos.

Qwen 3.8-Max vs. GPT-5.6 Sol

O GPT-5.6 Sol lidera em:

  • Terminal Bench: 88.8 vs. 86.6;
  • GPQA: 94.1 vs. 92.6;
  • HLE: 47.2 vs. 43.6.

O Qwen 3.8-Max lidera em:

  • PaperBench: 93.0 vs. 90.5;
  • IFBench: 82.8 vs. 72.7.

Em custo, os US$ 2/US$ 6 do Qwen são mais baixos na saída do que os US$ 2/US$ 12 do GPT-5.6 Terra. O acesso à camada Sol custa mais.

Como referência adicional, Claude Opus 5 custa US$ 5/US$ 25. Para workloads de alto volume, essa diferença muda o custo total rapidamente.

Precificação: US$ 2/US$ 6 fixos em 1M de tokens

A estrutura de preços é direta:

Entrada: US$ 2 por 1 milhão de tokens
Saída:   US$ 6 por 1 milhão de tokens
Contexto: até 1 milhão de tokens sem mudança de faixa
Enter fullscreen mode Exit fullscreen mode

O ponto incomum é não haver aumento de preço conforme o prompt se aproxima de 1 milhão de tokens.

O Qwen 3.8-Max também é lançado abaixo do preço de tabela do Qwen3.7-Max, que era US$ 2,5/US$ 7,5. O modelo anterior, porém, estava com promoção de 50%, chegando a US$ 1,25/US$ 3,75.

Para workloads com prefixos repetidos:

  • acertos de cache custam 10% da tarifa de entrada;
  • criação explícita de cache custa 125% da tarifa de entrada.

Também há uma cota gratuita de 1 milhão de tokens, exclusiva para a região de Cingapura e válida por 90 dias.

Para calcular custos por tarefa e entender o impacto de tokens de raciocínio, consulte o guia de preços do Qwen 3.8.

Como acessar o Qwen 3.8-Max

Você pode acessar o modelo por cinco rotas.

1. Qwen Chat

Use o aplicativo Qwen Chat se quiser testar o comportamento do modelo sem criar uma integração de API. É a forma mais rápida de avaliar respostas, compreensão de documentos e estilo de raciocínio.

2. API do Alibaba Cloud Model Studio

Obtenha uma chave em home.qwencloud.com e defina a variável de ambiente:

export DASHSCOPE_API_KEY="sua-chave"
Enter fullscreen mode Exit fullscreen mode

Use o modelo:

qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Os endpoints compatíveis com OpenAI usam chat-completions ou responses. Escolha a região mais próxima da sua aplicação:

Pequim:
https://dashscope.aliyuncs.com/compatible-mode/v1

Cingapura:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1

EUA — Virgínia:
https://dashscope-us.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

O modelo aparece no topo da pilha recomendada na página de modelos do Model Studio.

3. Endpoint compatível com Anthropic

O endpoint abaixo usa o protocolo Anthropic Messages:

https://dashscope-intl.aliyuncs.com/apps/anthropic
Enter fullscreen mode Exit fullscreen mode

Isso permite apontar ferramentas criadas para Claude para o Qwen 3.8-Max ajustando variáveis de ambiente.

Exemplo de configuração:

export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

4. Frameworks de codificação

A Alibaba publicou configurações para:

  • Claude Code;
  • Codex;
  • Qoder;
  • Qwen Code;
  • OpenClaw.

Para Claude Code, a configuração central é:

export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

A Alibaba também informou que executou a maior parte de seus benchmarks de código no framework Claude Code. Portanto, essa configuração é especialmente relevante para reproduzir o ambiente descrito pelo fornecedor.

5. Pesos abertos

Hugging Face e ModelScope foram anunciados como destinos para os pesos, mas eles ainda não estavam disponíveis para download no início de agosto de 2026.

Para exemplos prontos em Python e cURL, consulte o guia da API Qwen 3.8.

Testando os protocolos OpenAI e Anthropic

Como o mesmo modelo pode ser acessado por dois protocolos, teste os dois antes de padronizar sua integração.

Uma abordagem prática:

  1. Crie um ambiente para cada região.
  2. Salve a URL base de Pequim, Cingapura e Virgínia como variáveis.
  3. Envie o mesmo prompt pelos endpoints compatíveis com OpenAI e Anthropic.
  4. Compare conteúdo, latência, uso de tokens e comportamento de streaming.
  5. Teste os níveis xhigh, medium e low com o mesmo conjunto de casos.

No Apidog, você pode alternar entre ambientes sem editar a requisição, comparar os protocolos lado a lado e inspecionar o fluxo SSE. Isso é útil para observar deltas de reasoning_content antes da resposta final e estimar o impacto dos tokens de raciocínio no custo.

Baixe o Apidog gratuitamente para criar um workspace de testes e comparar qwen3.8-max, qwen3.7-max e kimi-k3 usando prompts idênticos.

Onde o Qwen 3.8-Max se encaixa na linha

Na família Qwen, o Qwen 3.8-Max fica acima do Qwen3.7-Max e dos modelos da camada Plus.

Use esta regra prática:

  • Escolha Qwen 3.8-Max para tarefas multimodais, documentos longos e agentes com maior exigência.
  • Considere Qwen 3.7-Max enquanto o desconto de 50% estiver ativo, caso o custo seja mais importante que o teto de desempenho.
  • Use modelos Plus para cargas de trabalho rotineiras e mais baratas.

O guia dos melhores modelos Qwen ajuda a escolher a camada adequada para cada carga de trabalho.

FAQ

O Qwen 3.8 é de código aberto?

Ainda não. A Alibaba prometeu publicar os pesos no Hugging Face e ModelScope na semana seguinte ao lançamento no início de agosto de 2026. Até a publicação efetiva, o acesso é via API ou Qwen Chat.

Veja como usar o Qwen 3.8 gratuitamente para opções sem custo.

Quanto custa o Qwen 3.8-Max?

US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, em uma faixa fixa para todo o contexto de 1 milhão de tokens.

Acertos de cache custam 10% da tarifa de entrada. Tokens de raciocínio contam como saída, então workloads com reasoning_effort: "xhigh" exigem uma margem maior no orçamento.

O Qwen 3.8-Max é melhor que o Kimi K3?

Ainda não existe uma avaliação direta independente. No papel, o Qwen 3.8-Max é menor, aceita imagens e custa menos na saída. O Kimi K3 tem a vantagem de já possuir pesos públicos, conforme o conteúdo original.

Posso usar o Qwen 3.8-Max no Claude Code?

Sim. Configure ANTHROPIC_BASE_URL para o endpoint DashScope compatível com Anthropic e defina:

export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

A Alibaba também publicou configurações para Codex, Qoder, Qwen Code e OpenClaw.

O que fazer a seguir

O Qwen 3.8-Max é um lançamento com disponibilidade geral em três regiões de API, preços publicados, suporte a dois protocolos e benchmarks divulgados pelo fornecedor. Os resultados indicam força em documentos, multimodal e várias tarefas de agentes, mas não uma liderança clara em todos os benchmarks de codificação.

A implementação recomendada é simples:

  1. Solicite ou use a cota gratuita.
  2. Configure o endpoint OpenAI-compatible.
  3. Configure o endpoint Anthropic-compatible.
  4. Execute o mesmo conjunto de prompts reais nos dois formatos.
  5. Meça qualidade, tokens de saída, tokens de raciocínio, latência e custo.
  6. Verifique a publicação dos pesos prometidos por volta de 10 de agosto.

Comece pelo guia de configuração da API e valide o modelo com a sua própria carga de trabalho.

Top comments (0)