A Alibaba lançou o Qwen 3.8-Max no início de agosto de 2026. Se você já usa o qwen3.7-max em produção, precisa decidir entre manter o desconto atual do modelo anterior ou migrar para ganhos em tarefas de agência, pesquisa e entrada de imagens. O Qwen 3.8-Max também chega com preço de tabela menor e uma promessa inédita para a linha Max: pesos abertos.
A decisão não é simplesmente “o modelo novo vence”. O qwen3.7-max está com um desconto limitado de 50%, tornando-o mais barato em custo absoluto. Além disso, alguns benchmarks avançaram muito, enquanto outros praticamente não mudaram.
Para conhecer o novo modelo em mais detalhes, leia o explicativo do Qwen 3.8-Max. Para revisar o carro-chefe anterior, veja o que o Qwen 3.7 trouxe de novo.
Metodologia: todos os números abaixo vêm da tabela da Alibaba na postagem oficial de lançamento do Qwen 3.8. Como os dois modelos foram avaliados na mesma execução do fornecedor, as diferenças são internamente consistentes. Ainda assim, validações independentes continuam pendentes. A maioria dos testes de código usou o harness Claude Code, e alguns benchmarks são internos da Qwen.
A versão resumida
| O que mudou | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
| IFBench | 79.1 | 82.8 |
| GPQA Diamond | 92.4 | 92.6 |
| HLE | 41.4 | 43.6 |
| Preço de tabela por 1M de tokens | $2.5 entrada / $7.5 saída | $2 entrada / $6 saída |
| Preço atual em promoção | $1.25 entrada / $3.75 saída | $2 entrada / $6 saída |
| Entrada de imagem | Não | Sim |
| Arquitetura divulgada | Não divulgada | 2.4T total, 95B MoE ativo |
| Pesos abertos | Nunca lançado | Prometido para a “próxima semana” (~10 de agosto) |
| Janela de contexto | 1M tokens | 1M tokens |
Diferenças de benchmark: onde o salto é real
Os avanços mais relevantes estão em tarefas de agência: fluxos longos nos quais o modelo precisa planejar, executar ações, verificar resultados e se corrigir.
Terminal Bench 2.1: 74.5 → 86.6
O ganho de 12 pontos em tarefas de terminal é expressivo. Na tabela da Alibaba, o Qwen 3.8-Max fica acima de Claude Opus 4.8 e Fable 5, ambos com 84.6 nessa linha. O GPT-5.6 Sol continua à frente, com 88.8.
Quando isso importa: agentes que executam comandos, investigam ambientes, corrigem arquivos e iteram em tarefas de desenvolvimento.
SWE-bench Pro: 60.6 → 67.7
O ganho de 7 pontos indica uma melhora real em tarefas de engenharia de software. Ainda assim, o Fable 5 registra 80.0 na mesma tabela.
Quando isso importa: correção de bugs, mudanças em repositórios e tarefas que exigem compreender uma base de código existente.
PaperBench: 64.8 → 93.0
Este é o maior salto da tabela: 28 pontos em reprodução de artigos de pesquisa de IA. O Qwen 3.8-Max lidera essa linha na comparação da Alibaba.
Quando isso importa: reprodução de pesquisas, análise de documentos técnicos extensos e raciocínio científico com múltiplas etapas.
IFBench: 79.1 → 82.8
A capacidade de seguir instruções sobe quase 4 pontos. O qwen3.7-max já era forte nesse benchmark, portanto o 3.8-Max amplia uma vantagem existente.
GPQA Diamond: 92.4 → 92.6
Na prática, não há mudança. Para perguntas científicas de nível de pós-graduação, o desempenho do 3.7-Max já estava próximo da saturação nessa avaliação.
HLE: 41.4 → 43.6
O Humanity’s Last Exam sobe 2 pontos, mas o Qwen 3.8-Max continua atrás da fronteira indicada pela tabela: Fable 5 tem 53.3 e GPT-5.6 Sol tem 47.2.
Resumo do padrão:
- Ganhos grandes em agência e pesquisa.
- Ganhos incrementais em seguir instruções.
- Quase nenhuma mudança em conhecimento científico no estilo GPQA.
- Lacuna persistente em avaliações de raciocínio extremamente difíceis.
Para ver a tabela completa, incluindo observações sobre harnesses e benchmarks internos, leia a análise dos benchmarks do Qwen 3.8.
Arquitetura: Alibaba finalmente mostra seus números
O Qwen 3.8-Max usa uma arquitetura de mistura de especialistas (MoE) com:
- 2.4 trilhões de parâmetros totais
- 95 bilhões de parâmetros ativos por passagem de inferência
- Fundação arquitetônica do Qwen 3.5
Isso representa uma taxa de ativação aproximada de 4%. Para planejamento de capacidade, a distinção é importante: o processamento ativo é associado aos 95B de parâmetros, não aos 2.4T totais.
No qwen3.7-max, a Alibaba não divulgou números comparáveis de parâmetros, especialistas ou taxa de ativação. Já no 3.8-Max, a documentação do Model Studio e a postagem de lançamento trazem detalhes suficientes para reduzir incertezas em estimativas de capacidade e custo.
Como referência na corrida de pesos abertos, o Kimi K3 opera com 2.8T de parâmetros totais e 104B ativos. O Qwen 3.8-Max é menor nos dois eixos.
Multimodal: a capacidade que o 3.7-Max não tinha
O qwen3.7-max é um modelo de texto. O qwen3.8-max aceita imagens nativamente.
Na tabela multimodal da Alibaba, o modelo lidera a maior parte das linhas contra Gemini 3.1 Pro e GPT-5.6 Sol. Entre os resultados destacados:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
Não existe uma coluna para o 3.7-Max nessa comparação porque o modelo anterior não aceita imagens.
Na prática, isso permite consolidar fluxos que antes exigiam um modelo visual separado, por exemplo:
- Análise de capturas de tela.
- Leitura de documentos em imagem.
- Extração de informações de gráficos.
- Automação de interfaces.
- Fluxos de agentes que interpretam estados visuais.
A postagem de lançamento também demonstra entendimento de documentos longos e vídeos. Porém, essas capacidades aparecem como demonstrações em blog, e não necessariamente como tipos de entrada de API independentes. Consulte a documentação da API antes de implementá-las em produção.
Preços: o novo modelo é mais barato, exceto agora
O qwen3.8-max é lançado a:
- $2 por 1M de tokens de entrada
- $6 por 1M de tokens de saída
O qwen3.7-max, no preço de tabela, custa:
- $2.5 por 1M de tokens de entrada
- $7.5 por 1M de tokens de saída
Ou seja, o modelo mais novo e mais capaz tem um preço de tabela 20% menor.
Mas há uma exceção importante: a promoção temporária de 50% do 3.7-Max reduz o valor efetivo para:
- $1.25 entrada
- $3.75 saída
Aos preços atuais, o modelo anterior custa 38% menos que o 3.8-Max.
As taxas estão na página oficial de preços do Model Studio.
O que considerar no orçamento
A promoção pode terminar sem data publicada.
Não projete custos de longo prazo assumindo que a tarifa de $1.25 / $3.75 continuará disponível. Pelo preço de tabela, o 3.8-Max é a opção mais barata.Tokens de pensamento aumentam o custo real.
O Qwen 3.8-Max usareasoning_effort: xhighpor padrão. Os tokens de pensamento são cobrados como tokens de saída, então o custo por requisição pode ficar acima do preço nominal.
Para calcular custo por tarefa, cache e consumo de saída, consulte o guia de preços do Qwen 3.8.
Se nenhum modelo Max se encaixa no orçamento, o qwen3.7-plus, a $0.4 / $1.6 e atualmente com 20% de desconto, continua sendo a alternativa de melhor custo-benefício. Veja a comparação Plus vs Max.
Pesos abertos: uma novidade para a classe Max
Nenhum modelo Qwen-Max anterior foi lançado com pesos abertos. O qwen3.7-max não teve pesos publicados, e a Alibaba não indicou que isso aconteceria.
O Qwen 3.8-Max muda esse cenário: a postagem de lançamento promete pesos no Hugging Face e no ModelScope “na próxima semana”, apontando para aproximadamente 10 de agosto.
Até 3 de agosto de 2026, os pesos ainda não estavam disponíveis para download. Portanto, trate isso como uma promessa até que os artefatos sejam publicados.
Mesmo quando disponíveis, hospedar um modelo de 2.4T de parâmetros é uma operação multi-nó, inclusive com quantização. Para muitas equipes, o efeito prático deve ser:
- Mais opções de provedores hospedados.
- Pressão competitiva sobre preços.
- Possibilidades adicionais para requisitos de aquisição e conformidade.
Se pesos abertos são obrigatórios para sua organização, essa característica pode encerrar a comparação: o 3.8-Max provavelmente os terá; o 3.7-Max não terá.
O que não mudou
Janela de contexto: 1M tokens em ambos
Não houve expansão de contexto. Se você escolheu o 3.7-Max por suportar cargas longas, o 3.8-Max mantém o mesmo limite de 1M de tokens, com preço fixo em toda a janela.
Caminho de acesso: praticamente o mesmo
Os dois modelos são servidos pelo Alibaba Cloud Model Studio em endpoints compatíveis com OpenAI.
Para migrar o uso básico, altere o ID do modelo:
{
"model": "qwen3.7-max"
}
Para:
{
"model": "qwen3.8-max"
}
O 3.8-Max também adiciona uma superfície de API compatível com Anthropic. Se sua ferramenta suporta esse protocolo, vale testar o fluxo em um cliente como o Apidog.
Controles de raciocínio: agora documentados
No Qwen 3.8-Max, você pode controlar o comportamento de raciocínio explicitamente com:
reasoning_effortenable_thinkingpreserve_thinking
O parâmetro reasoning_effort oferece três níveis:
-
xhigh— padrão mediumlow
Exemplo de configuração:
{
"model": "qwen3.8-max",
"reasoning_effort": "medium",
"enable_thinking": true,
"messages": [
{
"role": "user",
"content": "Analise este problema e proponha uma implementação."
}
]
}
Defina esse valor explicitamente durante seus testes. Isso ajuda a comparar custo, latência e qualidade sem depender do comportamento padrão.
Você deve fazer o upgrade? Três caminhos práticos
Faça o upgrade agora se sua carga é de agência ou pesquisa
Migre para o 3.8-Max se você trabalha com:
- Agentes de terminal.
- Reprodução de pesquisas.
- Raciocínio técnico em várias etapas.
- Processamento de capturas de tela.
- Análise visual de documentos.
- Automação de UI.
Os ganhos no Terminal Bench, de 74.5 para 86.6, e no PaperBench, de 64.8 para 93.0, são grandes o bastante para justificar testes imediatos em produção.
Mantenha o 3.7-Max enquanto a promoção durar se seu tráfego é estável
Se sua carga principal é:
- Perguntas e respostas.
- Sumarização.
- Chat geral.
- Tarefas de conhecimento próximas ao GPQA.
...e o 3.7-Max já atende aos seus requisitos de qualidade, o preço atual de $1.25 / $3.75 é muito competitivo.
Ação recomendada:
- Defina um lembrete mensal para revisar a promoção.
- Monitore custo real por tarefa, não apenas preço por token.
- Mantenha o 3.8-Max como plano de contingência quando o desconto terminar.
Use o qwen3.7-plus se preço é a prioridade
Para classificação, extração, transformação de dados e geração de templates, o qwen3.7-plus pode ser suficiente.
A $0.4 / $1.6, ele custa cinco vezes menos na entrada do que o 3.8-Max. Para tarefas rotineiras, usar a classe Max pode ser um gasto desnecessário.
Teste a mudança antes de alterar produção
Benchmarks do fornecedor não substituem uma avaliação com seus prompts, schemas, dados e critérios de aceitação.
A forma mais direta de comparar os modelos é criar uma suíte de testes com requisições representativas e executá-la nos dois IDs de modelo.
No Apidog, configure uma coleção apontando para o endpoint compatível com OpenAI do Model Studio e crie dois ambientes:
Ambiente: qwen-3.7
MODEL_ID=qwen3.7-max
Ambiente: qwen-3.8
MODEL_ID=qwen3.8-max
Use a variável na requisição:
{
"model": "{{MODEL_ID}}",
"messages": [
{
"role": "user",
"content": "{{PROMPT_DE_TESTE}}"
}
]
}
Em seguida:
- Salve prompts de produção representativos como cenários de teste.
- Execute os mesmos casos nos dois ambientes.
- Compare saída, latência e uso de tokens.
- Teste
reasoning_effortemxhigh,mediumelow. - Registre custo e qualidade por tarefa.
- Repita os testes quando houver mudanças de preço ou atualizações do modelo.
Como os dois modelos compartilham a mesma superfície de API, uma única coleção pode cobrir ambos. Isso transforma a decisão de upgrade de um debate sobre benchmarks em uma comparação baseada no seu tráfego.
Baixe o Apidog gratuitamente e valide a migração antes de mudar qualquer configuração de produção.
FAQ
O Qwen 3.8-Max é mais barato que o Qwen 3.7-Max?
Pelo preço de tabela, sim: $2 / $6 versus $2.5 / $7.5 por 1M de tokens.
Pelos preços atuais, não. A promoção temporária de 50% do 3.7-Max reduz seu preço para $1.25 / $3.75, tornando-o 38% mais barato que o 3.8-Max. Como não há data pública para o fim da promoção, use o preço de tabela do 3.8-Max como referência para planejamento de longo prazo.
Veja os detalhes no guia de preços do Qwen 3.8.
Preciso mudar meu código para alternar de qwen3.7-max para qwen3.8-max?
Para uso básico, não. Os dois modelos usam os endpoints compatíveis com OpenAI do Model Studio, então a mudança principal é o ID do modelo.
Porém, defina reasoning_effort explicitamente no 3.8-Max. O padrão é xhigh, e os tokens de pensamento são cobrados como saída.
Se você enviar imagens, essa é uma capacidade exclusiva do 3.8-Max e exige o formato padrão de mensagem para entrada de imagem.
O Qwen 3.7-Max tem pesos abertos?
Não. Com base no histórico da Alibaba para essa linha, ele não terá pesos abertos.
O Qwen 3.8-Max é o primeiro modelo da classe Max com pesos abertos prometidos, esperados no Hugging Face e ModelScope por volta de 10 de agosto de 2026. Em 3 de agosto, eles ainda não estavam disponíveis para download.
O Qwen 3.8-Max é melhor que Claude ou GPT?
Depende do benchmark, e os números disponíveis são da própria Alibaba.
Na tabela do fornecedor, o Qwen 3.8-Max:
- Supera Opus 4.8 e Fable 5 no Terminal Bench 2.1.
- Lidera no PaperBench e IFBench.
- Fica atrás do Fable 5 no SWE-bench Pro: 67.7 contra 80.0.
- Continua atrás dos modelos de fronteira no HLE.
Como ainda não há benchmarks independentes publicados, a abordagem correta é testar os modelos na sua carga de trabalho antes de tirar conclusões de produção.

Top comments (0)