A Alibaba lançou oficialmente o Qwen 3.8-Max no início de agosto de 2026. O modelo combina uma arquitetura Mixture-of-Experts (MoE) de 2,4 trilhões de parâmetros, com apenas 95 bilhões ativados por token, contexto de 1 milhão de tokens e preço fixo de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. A Alibaba também prometeu publicar os pesos no Hugging Face e ModelScope dentro de uma semana — algo inédito para um modelo da classe Qwen-Max.
O anúncio oficial apresenta o Qwen 3.8-Max como o modelo mais capaz da família Qwen até agora. Para desenvolvedores, os pontos mais relevantes são: endpoints compatíveis com OpenAI e Anthropic, suporte a texto e imagem, controles de raciocínio e uma janela de contexto longa sem aumento de preço. Um cliente de API como o Apidog pode ajudar a testar os dois protocolos usando a mesma chave.
Qwen 3.8-Max em resumo
| Especificação | Qwen 3.8-Max |
|---|---|
| Desenvolvedor | Alibaba (equipe Qwen) |
| Lançamento | Início de agosto de 2026; disponibilidade geral no Model Studio em 3 de agosto |
| Arquitetura | MoE, construído sobre a base Qwen 3.5 |
| Parâmetros totais | 2,4T |
| Parâmetros ativos | 95B, aproximadamente 4% de ativação |
| Janela de contexto | 1.000.000 tokens |
| Saída máxima | 65.536 tokens |
| Modalidades | Entrada de texto e imagem; saída de texto |
| Controles de raciocínio |
reasoning_effort: xhigh (padrão), medium, low
|
| ID do modelo | qwen3.8-max |
| Preço | US$ 2 de entrada / US$ 6 de saída por 1M de tokens |
| Pesos abertos | Prometidos para a semana seguinte ao lançamento; ainda indisponíveis no início de agosto de 2026 |
| Protocolos da API | Compatíveis com OpenAI e Anthropic |
As especificações vêm dos materiais de lançamento da Alibaba e da página de preços do Model Studio.
O que é o Qwen 3.8-Max
O Qwen 3.8-Max substitui o Qwen3.7-Max no topo da linha. Segundo a tabela da Alibaba, ele melhora resultados em benchmarks como Terminal Bench 2.1, de 74.5 para 86.6, e PaperBench, de 64.8 para 93.0.
Se você já usa o modelo anterior, consulte a comparação entre Qwen 3.8 e Qwen 3.7 Max antes de migrar.
A característica técnica central é a relação entre parâmetros totais e ativos:
- 2,4T parâmetros totais representam a capacidade do modelo completo.
- 95B parâmetros ativos por token reduzem o custo de inferência.
- A ativação de aproximadamente 4% explica como a Alibaba consegue oferecer o modelo a US$ 2/US$ 6 por milhão de tokens.
Como referência, o Kimi K3 usa 2,8T parâmetros totais e 104B ativos. Portanto, o Qwen 3.8-Max é menor nos dois números, mas também oferece entrada multimodal.
Modalidades e raciocínio
A API aceita texto e imagens como entrada. Embora o blog da Alibaba demonstre compreensão de PDFs longos e vídeos de 100 horas por meio de “gráficos de memória”, as configurações de API publicadas listam apenas texto e imagem como modalidades de entrada.
Para controlar o raciocínio, use:
{
"reasoning_effort": "xhigh"
}
Valores disponíveis:
-
xhigh: padrão; prioriza raciocínio mais extenso. -
medium: reduz o esforço de raciocínio. -
low: reduz ainda mais o custo e a latência associados ao raciocínio.
Também existem os controles enable_thinking e preserve_thinking. O raciocínio é preservado por padrão.
Os tokens de raciocínio são cobrados como tokens de saída. Mesmo com a mesma tarifa por token, workloads em
xhighpodem custar mais do que uma estimativa baseada apenas na resposta final.
O primeiro Qwen de classe Max com pesos abertos
A Alibaba já publicou pesos de outros modelos Qwen, mas não da camada Max. Para o Qwen 3.8-Max, a empresa afirmou que os pesos seriam disponibilizados no Hugging Face e ModelScope “na próxima semana”, aproximadamente em 10 de agosto de 2026.
Antes de planejar uma estratégia baseada nisso, considere duas limitações:
- Os pesos ainda não estavam disponíveis para download no início de agosto de 2026. Até a publicação efetiva, trate isso como um anúncio, não como uma opção de implantação.
- Executar um modelo de 2,4T localmente exige infraestrutura de múltiplos nós. Mesmo com quantização agressiva, não é um modelo voltado para uma estação de trabalho comum.
Para a maioria das equipes, pesos abertos provavelmente significarão acesso hospedado por provedores terceiros, e não auto-hospedagem local.
Se o objetivo é testar o modelo sem pagar o preço de tabela, use o Qwen Chat ou a cota gratuita do Model Studio. Veja o guia sobre como usar o Qwen 3.8 gratuitamente.
O que os benchmarks mostram
A Alibaba publicou benchmarks comparando o Qwen 3.8-Max com Claude Opus 4.8, Fable 5, GPT-5.6 Sol e Qwen3.7-Max.
Antes de usar esses dados para tomar uma decisão de arquitetura, considere:
- Os resultados foram executados pelo fornecedor.
- A maioria dos benchmarks de código usou o framework Claude Code para todos os modelos.
- Alguns benchmarks, como QwenSWEBench, QwenQoderBench, CoWorkBench e RecreationBench, são internos da Alibaba.
- Não havia resultados independentes de fontes como Artificial Analysis no momento da escrita.
Onde o Qwen 3.8-Max se destaca
- PaperBench: 93.0, acima de GPT-5.6 Sol (90.5), Fable 5 (88.8) e Opus 4.8 (80.3).
- IFBench: 82.8, acima dos 72.7 do Sol.
- Terminal Bench 2.1: 86.6, acima de Opus 4.8 e Fable 5 (84.6), mas abaixo do Sol (88.8).
- Multimodal e documentos: MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1 e resultados fortes em OCR.
Onde ele fica atrás
- SWE-bench Pro: 67.7, abaixo de Fable 5 (80.0) e Opus 4.8 (69.2), mas acima de Sol (64.6).
- HLE: 43.6, abaixo de Fable 5 (53.3), Sol (47.2) e Opus 4.8 (45.7).
A interpretação prática é:
- Priorize o Qwen 3.8-Max para fluxos multimodais, análise de documentos, OCR e tarefas de agentes.
- Avalie Fable 5 se SWE-bench Pro e HLE forem indicadores críticos para seu caso de uso.
- Faça testes no seu próprio repositório e com seus próprios prompts antes de migrar.
Para ver a tabela e os detalhes metodológicos, consulte a análise dos benchmarks do Qwen 3.8.
A Alibaba também mostrou demonstrações de codificação autônoma, reprodução de artigo e participação em concurso Tianchi. Como são demonstrações do próprio fornecedor, use-as como indícios de capacidade, não como avaliações controladas. Para detalhes sobre a configuração de código, veja Qwen 3.8 para codificação.
Comparação com Kimi K3, Fable 5 e GPT-5.6 Sol
Qwen 3.8-Max vs. Kimi K3
A comparação é natural: ambos são modelos MoE chineses de grande porte e ambos foram anunciados com pesos abertos.
| Característica | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Parâmetros totais | 2,4T | 2,8T |
| Parâmetros ativos | 95B | 104B |
| Modalidades | Texto e imagem | Somente texto |
| Entrada / saída | US$ 2 / US$ 6 | US$ 3 / US$ 15 |
| Pesos | Prometidos | Já disponíveis, conforme o artigo original |
Ainda não há uma avaliação direta independente entre eles. Compare cada modelo com os mesmos prompts, tamanho de contexto e critérios de qualidade.
Veja a comparação detalhada Qwen 3.8 vs Kimi K3. Se você ainda não conhece o modelo da Moonshot, comece por o que é Kimi K3.
Qwen 3.8-Max vs. Fable 5
O Fable 5 permanece à frente em benchmarks centrais de codificação, segundo a tabela da Alibaba:
- SWE-bench Pro: 80.0 vs. 67.7.
- HLE: 53.3 vs. 43.6.
O Qwen oferece outros trade-offs:
- preço menor;
- contexto de 1 milhão de tokens;
- suporte multimodal;
- pesos abertos prometidos.
Qwen 3.8-Max vs. GPT-5.6 Sol
O GPT-5.6 Sol lidera em:
- Terminal Bench: 88.8 vs. 86.6;
- GPQA: 94.1 vs. 92.6;
- HLE: 47.2 vs. 43.6.
O Qwen 3.8-Max lidera em:
- PaperBench: 93.0 vs. 90.5;
- IFBench: 82.8 vs. 72.7.
Em custo, os US$ 2/US$ 6 do Qwen são mais baixos na saída do que os US$ 2/US$ 12 do GPT-5.6 Terra. O acesso à camada Sol custa mais.
Como referência adicional, Claude Opus 5 custa US$ 5/US$ 25. Para workloads de alto volume, essa diferença muda o custo total rapidamente.
Precificação: US$ 2/US$ 6 fixos em 1M de tokens
A estrutura de preços é direta:
Entrada: US$ 2 por 1 milhão de tokens
Saída: US$ 6 por 1 milhão de tokens
Contexto: até 1 milhão de tokens sem mudança de faixa
O ponto incomum é não haver aumento de preço conforme o prompt se aproxima de 1 milhão de tokens.
O Qwen 3.8-Max também é lançado abaixo do preço de tabela do Qwen3.7-Max, que era US$ 2,5/US$ 7,5. O modelo anterior, porém, estava com promoção de 50%, chegando a US$ 1,25/US$ 3,75.
Para workloads com prefixos repetidos:
- acertos de cache custam 10% da tarifa de entrada;
- criação explícita de cache custa 125% da tarifa de entrada.
Também há uma cota gratuita de 1 milhão de tokens, exclusiva para a região de Cingapura e válida por 90 dias.
Para calcular custos por tarefa e entender o impacto de tokens de raciocínio, consulte o guia de preços do Qwen 3.8.
Como acessar o Qwen 3.8-Max
Você pode acessar o modelo por cinco rotas.
1. Qwen Chat
Use o aplicativo Qwen Chat se quiser testar o comportamento do modelo sem criar uma integração de API. É a forma mais rápida de avaliar respostas, compreensão de documentos e estilo de raciocínio.
2. API do Alibaba Cloud Model Studio
Obtenha uma chave em home.qwencloud.com e defina a variável de ambiente:
export DASHSCOPE_API_KEY="sua-chave"
Use o modelo:
qwen3.8-max
Os endpoints compatíveis com OpenAI usam chat-completions ou responses. Escolha a região mais próxima da sua aplicação:
Pequim:
https://dashscope.aliyuncs.com/compatible-mode/v1
Cingapura:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
EUA — Virgínia:
https://dashscope-us.aliyuncs.com/compatible-mode/v1
O modelo aparece no topo da pilha recomendada na página de modelos do Model Studio.
3. Endpoint compatível com Anthropic
O endpoint abaixo usa o protocolo Anthropic Messages:
https://dashscope-intl.aliyuncs.com/apps/anthropic
Isso permite apontar ferramentas criadas para Claude para o Qwen 3.8-Max ajustando variáveis de ambiente.
Exemplo de configuração:
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
4. Frameworks de codificação
A Alibaba publicou configurações para:
- Claude Code;
- Codex;
- Qoder;
- Qwen Code;
- OpenClaw.
Para Claude Code, a configuração central é:
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
A Alibaba também informou que executou a maior parte de seus benchmarks de código no framework Claude Code. Portanto, essa configuração é especialmente relevante para reproduzir o ambiente descrito pelo fornecedor.
5. Pesos abertos
Hugging Face e ModelScope foram anunciados como destinos para os pesos, mas eles ainda não estavam disponíveis para download no início de agosto de 2026.
Para exemplos prontos em Python e cURL, consulte o guia da API Qwen 3.8.
Testando os protocolos OpenAI e Anthropic
Como o mesmo modelo pode ser acessado por dois protocolos, teste os dois antes de padronizar sua integração.
Uma abordagem prática:
- Crie um ambiente para cada região.
- Salve a URL base de Pequim, Cingapura e Virgínia como variáveis.
- Envie o mesmo prompt pelos endpoints compatíveis com OpenAI e Anthropic.
- Compare conteúdo, latência, uso de tokens e comportamento de streaming.
- Teste os níveis
xhigh,mediumelowcom o mesmo conjunto de casos.
No Apidog, você pode alternar entre ambientes sem editar a requisição, comparar os protocolos lado a lado e inspecionar o fluxo SSE. Isso é útil para observar deltas de reasoning_content antes da resposta final e estimar o impacto dos tokens de raciocínio no custo.
Baixe o Apidog gratuitamente para criar um workspace de testes e comparar qwen3.8-max, qwen3.7-max e kimi-k3 usando prompts idênticos.
Onde o Qwen 3.8-Max se encaixa na linha
Na família Qwen, o Qwen 3.8-Max fica acima do Qwen3.7-Max e dos modelos da camada Plus.
Use esta regra prática:
- Escolha Qwen 3.8-Max para tarefas multimodais, documentos longos e agentes com maior exigência.
- Considere Qwen 3.7-Max enquanto o desconto de 50% estiver ativo, caso o custo seja mais importante que o teto de desempenho.
- Use modelos Plus para cargas de trabalho rotineiras e mais baratas.
O guia dos melhores modelos Qwen ajuda a escolher a camada adequada para cada carga de trabalho.
FAQ
O Qwen 3.8 é de código aberto?
Ainda não. A Alibaba prometeu publicar os pesos no Hugging Face e ModelScope na semana seguinte ao lançamento no início de agosto de 2026. Até a publicação efetiva, o acesso é via API ou Qwen Chat.
Veja como usar o Qwen 3.8 gratuitamente para opções sem custo.
Quanto custa o Qwen 3.8-Max?
US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, em uma faixa fixa para todo o contexto de 1 milhão de tokens.
Acertos de cache custam 10% da tarifa de entrada. Tokens de raciocínio contam como saída, então workloads com reasoning_effort: "xhigh" exigem uma margem maior no orçamento.
O Qwen 3.8-Max é melhor que o Kimi K3?
Ainda não existe uma avaliação direta independente. No papel, o Qwen 3.8-Max é menor, aceita imagens e custa menos na saída. O Kimi K3 tem a vantagem de já possuir pesos públicos, conforme o conteúdo original.
Posso usar o Qwen 3.8-Max no Claude Code?
Sim. Configure ANTHROPIC_BASE_URL para o endpoint DashScope compatível com Anthropic e defina:
export ANTHROPIC_MODEL="qwen3.8-max"
A Alibaba também publicou configurações para Codex, Qoder, Qwen Code e OpenClaw.
O que fazer a seguir
O Qwen 3.8-Max é um lançamento com disponibilidade geral em três regiões de API, preços publicados, suporte a dois protocolos e benchmarks divulgados pelo fornecedor. Os resultados indicam força em documentos, multimodal e várias tarefas de agentes, mas não uma liderança clara em todos os benchmarks de codificação.
A implementação recomendada é simples:
- Solicite ou use a cota gratuita.
- Configure o endpoint OpenAI-compatible.
- Configure o endpoint Anthropic-compatible.
- Execute o mesmo conjunto de prompts reais nos dois formatos.
- Meça qualidade, tokens de saída, tokens de raciocínio, latência e custo.
- Verifique a publicação dos pesos prometidos por volta de 10 de agosto.
Comece pelo guia de configuração da API e valide o modelo com a sua própria carga de trabalho.

Top comments (0)