Por duas semanas, a história do Qwen 3.8 teve uma lacuna: as prévias para a imprensa em julho prometeram um modelo de classe de fronteira, mas não incluíram pontuações. Em 3 de agosto de 2026, a publicação oficial de lançamento da Alibaba para o Qwen 3.8-Max mudou esse cenário ao trazer benchmarks contra Claude Opus 4.8, Fable 5, GPT-5.6 Sol e Qwen3.7-Max, além de uma tabela multimodal contra Gemini 3.1 Pro e GPT-5.6 Sol.
Os números mostram vitórias relevantes, perdas claras e detalhes metodológicos que mudam a leitura da tabela. Antes de usar essas pontuações para escolher um modelo, valide-o com prompts e métricas da sua própria aplicação. Para consultar parâmetros, preços e opções de acesso, comece pelo nosso explicador do Qwen 3.8-Max.
Importante: todas as pontuações abaixo foram publicadas pela própria Alibaba, com dados de leaderboard datados de 3 de agosto de 2026 nas notas de rodapé. Não havia avaliações independentes no momento da redação.
A tabela em um relance
Estas são as principais linhas do modelo de texto, conforme publicadas pela Alibaba. Em todos os casos, uma pontuação maior é melhor.
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity’s Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Fonte: tabela executada pelo fornecedor da Alibaba. Esse detalhe metodológico é importante e será abordado mais adiante.
Onde o Qwen 3.8-Max vence
PaperBench: o resultado mais forte
No PaperBench, que avalia a capacidade de reproduzir resultados de artigos de pesquisa, o Qwen 3.8-Max alcança 93.0. Ele supera GPT-5.6 Sol (90.5), Fable 5 (88.8) e Opus 4.8 (80.3).
O salto em relação ao Qwen3.7-Max também é grande: de 64.8 para 93.0. Uma diferença geracional de 28 pontos merece validação independente, mas, se for confirmada, indica uma melhoria significativa em tarefas de pesquisa de longo prazo.
IFBench: seguimento de instruções
No IFBench, o Qwen 3.8-Max registra 82.8. O modelo não-Qwen mais próximo na tabela é o GPT-5.6 Sol, com 72.7.
| Modelo | IFBench |
|---|---|
| Qwen 3.8-Max | 82.8 |
| Qwen3.7-Max | 79.1 |
| GPT-5.6 Sol | 72.7 |
| Fable 5 | 63.5 |
| Claude Opus 4.8 | 62.2 |
Como o Qwen3.7-Max já tinha 79.1 nesse benchmark, o seguimento de instruções parece ser uma característica consistente da família Qwen, e não apenas um resultado isolado desta versão.
Terminal Bench 2.1: competitivo em tarefas de terminal
Na execução da Alibaba para o Terminal Bench 2.1, o Qwen 3.8-Max obtém 86.6, contra 84.6 para Opus 4.8 e Fable 5.
O GPT-5.6 Sol lidera com 88.8, portanto este resultado coloca o Qwen em segundo lugar, não em primeiro. Ainda assim, a margem sobre o Opus 4.8 é relevante para equipes que avaliam agentes voltados a tarefas de terminal.
Resultados multimodais
Na tabela multimodal, a Alibaba reporta:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
O modelo também lidera quase todas as linhas de OCR apresentadas. Como Opus 4.8 e Fable 5 não aparecem diretamente nessa comparação multimodal, a leitura exige cautela. Porém, contra Gemini 3.1 Pro e GPT-5.6 Sol, raciocínio visual e inteligência de documentos parecem ser os diferenciais mais claros do Qwen 3.8-Max.
Se você está comparando o modelo com outro lançamento de peso aberto, há uma diferença prática importante: o Kimi K3 é apenas de texto. Veja a comparação entre Qwen 3.8 e Kimi K3.
Onde ele perde
A tabela da Alibaba também inclui resultados desfavoráveis ao Qwen 3.8-Max. Três áreas se destacam.
HLE: atrás dos concorrentes
No Humanity’s Last Exam (HLE), o Qwen 3.8-Max registra 43.6.
| Modelo | HLE |
|---|---|
| Fable 5 | 53.3 |
| GPT-5.6 Sol | 47.2 |
| Claude Opus 4.8 | 45.7 |
| Qwen 3.8-Max | 43.6 |
| Qwen3.7-Max | 41.4 |
É o último resultado entre os quatro modelos de fronteira comparados. Embora supere os 41.4 do Qwen3.7-Max, a melhoria é pequena. Como o HLE tende a resistir melhor à otimização específica para benchmarks, essa linha merece atenção.
SWE-bench Pro: lacuna em engenharia de software
No SWE-bench Pro, o Qwen 3.8-Max atinge 67.7:
| Modelo | SWE-bench Pro |
|---|---|
| Fable 5 | 80.0 |
| Claude Opus 4.8 | 69.2 |
| Qwen 3.8-Max | 67.7 |
| GPT-5.6 Sol | 64.6 |
| Qwen3.7-Max | 60.6 |
A evolução em relação ao Qwen3.7-Max é real, de 60.6 para 67.7. No entanto, o modelo ainda fica cerca de 12 pontos atrás do Fable 5 nessa avaliação de engenharia de software.
DeepSWE e tarefas agentivas mais profundas
O DeepSWE é outra linha na qual o Qwen 3.8-Max fica atrás da fronteira na tabela da Alibaba. O padrão é consistente:
- competitivo em tarefas agentivas orientadas por terminal;
- atrás em avaliações mais profundas de engenharia de software;
- forte em multimodalidade e inteligência de documentos.
O resumo honesto é que o Qwen 3.8-Max supera o Opus 4.8 em algumas linhas agentivas, mas fica atrás do Fable 5 em boa parte das tarefas centrais de código. Para um modelo precificado em US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, conforme a página oficial de preços, é um resultado forte — mas não uma vitória generalizada sobre todos os modelos de fronteira.
Como interpretar as letras miúdas
A tabela é útil, mas quatro detalhes metodológicos determinam quanto peso você deve dar a cada resultado.
1. Todos os números foram executados pelo fornecedor
A Alibaba avaliou tanto o próprio modelo quanto modelos concorrentes. Isso é comum em anúncios de lançamento, mas significa que o fornecedor controla fatores como:
- versão do benchmark;
- estratégia de prompting;
- parâmetros de amostragem;
- política de repetição;
- ambiente e harness de execução.
Isso não implica fraude. Porém, essas escolhas afetam os resultados e devem ser consideradas ao comparar modelos.
2. A maioria dos benchmarks de código usou o harness Claude Code
A Alibaba executou grande parte dos benchmarks de programação com o Claude Code, o harness de agente da Anthropic, conectando o Qwen 3.8-Max por sua API compatível com Anthropic.
Isso tem duas implicações:
- Todos os modelos são avaliados na mesma ferramenta, o que ajuda a padronizar a comparação.
- As pontuações representam o desempenho do Qwen dentro de um harness específico, e não necessariamente seu desempenho em qualquer integração agentiva.
Benchmarks de agentes podem variar vários pontos apenas com a troca do harness, das ferramentas disponíveis ou do formato de prompt.
3. Alguns benchmarks são internos do Qwen
QwenSWEBench, QwenQoderBench, CoWorkBench e RecreationBench foram criados pela equipe Qwen.
Benchmarks internos não são inúteis: eles podem medir capacidades ausentes das avaliações públicas. Mas uma boa pontuação em um benchmark criado pelo fornecedor é uma evidência diferente de uma boa pontuação no SWE-bench Pro.
Ao citar uma linha da tabela, verifique primeiro se o benchmark é:
- público e amplamente utilizado;
- interno do fornecedor;
- executado em um harness específico;
- reproduzível por terceiros.
4. A nota de rodapé sobre o Fable 5
A tabela da Alibaba informa que “os resultados do Fable5 podem envolver fallbacks”. Isso sugere que os números de pelo menos um concorrente podem não refletir uma execução ideal do modelo.
Esse tipo de detalhe não deve ser ignorado. Notas de rodapé, versões de modelo, modos de raciocínio e configurações de ferramenta podem mudar a interpretação de uma tabela inteira.
O padrão não é exclusivo da Alibaba. Anthropic, OpenAI e Google também publicam tabelas com escolhas metodológicas próprias. O mesmo ponto apareceu na nossa análise dos benchmarks do Kimi K3: uma tabela de fornecedor é uma afirmação, não uma medição independente.
Como avaliar a próxima tabela de benchmark
Em 3 de agosto de 2026, não havia avaliações independentes publicadas para o Qwen 3.8-Max. A Artificial Analysis e os principais leaderboards da comunidade ainda não tinham pontuado o modelo.
Enquanto isso, use esta checklist ao analisar benchmarks de qualquer fornecedor:
Quem executou a avaliação?
Resultados auto-relatados devem receber mais escrutínio, especialmente para concorrentes.Qual harness e quais configurações foram usados?
Benchmarks agentivos são sensíveis ao ambiente de execução.Quais benchmarks foram criados pelo fornecedor?
Avaliações internas podem ser úteis, mas não têm o mesmo peso de benchmarks públicos.Quais são as notas de rodapé?
Termos como “pode envolver fallbacks” alteram a confiabilidade da comparação.O que está faltando?
Benchmarks omitidos podem ser tão informativos quanto os publicados. Compare com como a geração anterior se saiu entre fornecedores para identificar linhas que desapareceram.Existe uma segunda fonte?
Aguarde avaliações independentes antes de tomar uma decisão de arquitetura baseada apenas em uma tabela de lançamento.
Execute sua própria avaliação
A melhor forma de reduzir a dependência de tabelas de fornecedores é testar o modelo na sua própria carga de trabalho.
O Qwen 3.8-Max está disponível no Alibaba Cloud Model Studio com o ID:
qwen3.8-max
Ele é listado na página oficial de modelos e oferece APIs compatíveis com OpenAI e Anthropic.
Fluxo prático de avaliação
No Apidog, crie duas requisições equivalentes:
- uma usando
qwen3.8-max; - outra usando seu modelo atual, como Qwen3.7-Max, Kimi K3, Claude ou GPT.
Use os mesmos prompts, parâmetros e critérios de sucesso nas duas requisições.
Exemplo de payload para um endpoint compatível com chat completions:
{
"model": "qwen3.8-max",
"messages": [
{
"role": "system",
"content": "Você é um assistente técnico. Responda com JSON válido."
},
{
"role": "user",
"content": "Analise este erro de API e sugira uma correção."
}
]
}
Em seguida:
- Separe de 20 a 30 prompts reais ou representativos da produção.
- Salve-os como um cenário de teste.
- Adicione asserções alinhadas ao seu caso de uso:
- JSON válido;
- campos obrigatórios presentes;
- formato esperado;
- ausência de respostas vazias;
- latência abaixo do limite;
- status HTTP esperado.
- Execute o mesmo cenário para cada modelo.
- Compare taxa de aprovação, tempo de resposta e custo estimado.
Exemplos de critérios que podem virar asserções:
response.status == 200
response.body.answer existe
response.body é JSON válido
latência < 5000 ms
Os relatórios de teste do Apidog permitem comparar taxas de aprovação e tempos de resposta por modelo usando a sua carga de trabalho, não a carga de trabalho da Alibaba.
Pontos específicos para testar no Qwen 3.8-Max
Ao montar a avaliação, teste estes fatores separadamente:
- O modelo assume
reasoning_effort: xhighcomo padrão. Meça custo e latência no nível de esforço que você pretende usar em produção. - Se usar o endpoint compatível com Anthropic, valide esse protocolo de forma independente.
- Não compare apenas a qualidade final: registre também erros de formato, chamadas de ferramenta, consistência e tempo total da tarefa.
- Execute múltiplas rodadas se a tarefa usar amostragem ou raciocínio variável.
Você pode baixar o Apidog, configurar cada endpoint como um ambiente e obter métricas próprias antes da publicação dos leaderboards independentes.
Perguntas frequentes
Os números de benchmark do Qwen 3.8 são verificados independentemente?
Não. Em 3 de agosto de 2026, todos os números publicados vinham da tabela da Alibaba. A Artificial Analysis e os leaderboards da comunidade ainda não tinham pontuado o Qwen 3.8-Max. Trate os resultados como afirmações do fornecedor até que execuções independentes sejam publicadas.
Qual é o melhor resultado de benchmark do Qwen 3.8-Max?
Na tabela principal, o melhor resultado é o PaperBench, com 93.0, à frente de GPT-5.6 Sol (90.5), Fable 5 (88.8) e Opus 4.8 (80.3). Na tabela multimodal, MathVision (95.2) e as linhas de OCR são os resultados mais fortes.
Onde o Qwen 3.8-Max claramente perde?
No HLE, ele obtém 43.6, o menor resultado entre os quatro modelos de fronteira comparados e bem abaixo dos 53.3 do Fable 5. No SWE-bench Pro, registra 67.7 contra 80.0 do Fable 5, e também fica atrás no DeepSWE. Engenharia de software aprofundada e exames de conhecimento geral são as áreas mais fracas do modelo na própria tabela da Alibaba.
Quão melhor é o Qwen 3.8 em relação ao Qwen 3.7-Max?
Os ganhos geracionais publicados pela Alibaba são expressivos:
| Benchmark | Qwen3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
A decisão de atualizar depende da sua carga de trabalho, modalidade, custo e latência. Para uma análise mais ampla, consulte a comparação entre Qwen 3.8 e Qwen 3.7.

Top comments (0)