A Alibaba lançou o Qwen 3.8-Max no início de agosto de 2026, encerrando a promoção de pré-visualização de julho. Na disponibilidade geral, a página oficial de preços do Model Studio lista o qwen3.8-max por US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída, em uma única faixa que cobre toda a janela de contexto de 1 milhão de tokens.
Isso é relevante porque muitos modelos aumentam o preço por token quando o prompt ultrapassa determinados limites de contexto. No Qwen 3.8-Max, a taxa permanece US$ 2/US$ 6 tanto para 5.000 quanto para 900.000 tokens de contexto.
Este guia mostra como calcular custos, quando usar cache, como controlar o impacto dos tokens de raciocínio e como comparar o modelo com Qwen 3.7-Max, Kimi K3, Claude Opus 5 e GPT-5.6 Terra. Para conhecer o modelo antes de analisar os preços, leia o que é o Qwen 3.8 e por que ele é importante.
Preços de tabela são estimativas. O Qwen 3.8-Max usa
reasoning_effort=xhighpor padrão, e tokens de pensamento são cobrados como saída. Meça o uso real antes de definir um orçamento. O Apidog permite inspecionar o uso de tokens em cada resposta durante os testes.
Preço GA: US$ 2 de entrada e US$ 6 de saída
A tabela abaixo resume o preço oficial do qwen3.8-max, verificado na página do Model Studio em 3 de agosto de 2026.
| Item | Preço por 1 milhão de tokens |
|---|---|
| Entrada | US$ 2,00 |
| Saída, incluindo tokens de pensamento | US$ 6,00 |
Entrada em cache (cache hit) |
10% da taxa de entrada |
| Criação explícita de cache | 125% da taxa de entrada |
| Contexto | Faixa única: 0 a 1 milhão de tokens |
| Pensamento e não-pensamento | Mesma taxa |
Pontos práticos:
- A janela inteira de 1 milhão de tokens usa a mesma faixa de preço.
- Tokens de pensamento são cobrados como tokens de saída.
- A saída máxima é de 65.536 tokens por solicitação, ou cerca de US$ 0,39 no máximo em saída.
O anúncio oficial do Qwen 3.8 descreve o modelo como o mais capaz da Alibaba até o momento: 2,4T de parâmetros totais, 95B ativos, contexto de 1 milhão de tokens e entrada multimodal.
Por que uma única faixa para 1 milhão de tokens importa
Preços por nível de contexto são comuns: o custo por token aumenta após um limite porque contextos longos são mais caros para atender.
A própria Alibaba usa esse modelo em outros produtos. Na página de preços do Model Studio, modelos como qwen3-max e qwen3-coder-plus têm preços que aumentam conforme o contexto cresce.
No Qwen 3.8-Max, o orçamento é linear:
custo = (tokens_entrada × US$ 2 / 1.000.000)
+ (tokens_saida × US$ 6 / 1.000.000)
Isso reduz surpresas em cargas como:
- RAG com documentos extensos;
- análise de repositórios grandes;
- agentes que acumulam resultados de ferramentas;
- prompts com centenas de milhares de tokens.
Comparação com o Qwen 3.7-Max
O Qwen 3.8-Max foi lançado abaixo do preço de tabela de seu antecessor:
- Qwen 3.7-Max: US$ 2,50 de entrada / US$ 7,50 de saída por 1 milhão de tokens.
- Qwen 3.8-Max: US$ 2,00 de entrada / US$ 6,00 de saída por 1 milhão de tokens.
Isso representa uma redução de 20% em entrada e saída, com contexto maior, entrada multimodal e melhores pontuações de benchmark.
Há uma ressalva: o Qwen 3.7-Max está com promoção de 50%, chegando a US$ 1,25/US$ 3,75. Se você não precisa do contexto de 1 milhão de tokens nem dos ganhos multimodais e agênticos, ele pode ser uma opção econômica enquanto a promoção durar.
Para workloads de menor custo, o Qwen 3.7-Plus continua como alternativa a US$ 0,40/US$ 1,60, também com promoção de 20%.
Tokens de pensamento são cobrados como saída
O parâmetro reasoning_effort possui três níveis:
xhigh
medium
low
O padrão é xhigh. Nesse modo, o modelo produz tokens internos de raciocínio antes da resposta final. Esses tokens são cobrados pela taxa de saída de US$ 6 por milhão.
Isso significa que a resposta visível não representa necessariamente o custo completo.
Por exemplo, uma resposta final com 800 tokens pode ter usado milhares de tokens de pensamento em uma tarefa difícil. Para controlar custos:
- Use
mediumoulowem tarefas simples, como classificação, extração e formatação. - Registre o objeto
usageretornado em cada resposta. - Monitore separadamente tokens de entrada e saída: a saída custa 3 vezes mais do que a entrada.
Exemplo de configuração:
{
"model": "qwen3.8-max",
"reasoning_effort": "medium",
"messages": [
{
"role": "user",
"content": "Extraia os campos deste documento em JSON."
}
]
}
Cache de contexto: 10% para hits e 125% para criação
Se sua aplicação reutiliza o mesmo prefixo — como prompt de sistema, documentos estáveis ou definições de ferramentas — o cache pode reduzir muito o custo de entrada.
- Cache hit: US$ 0,20 por 1 milhão de tokens, ou 10% da taxa normal.
- Criação explícita de cache: US$ 2,50 por 1 milhão de tokens, ou 125% da taxa normal.
O custo extra de criação é de 25%, mas cada reutilização economiza 90% no prefixo armazenado. Na prática, o cache já se paga quando o prefixo é reutilizado duas vezes.
Use cache para:
- prompts de sistema longos;
- catálogos ou documentação de produto;
- schemas de ferramentas;
- contexto fixo de agentes;
- instruções compartilhadas por muitas conversas.
Cota gratuita: 1 milhão de tokens por 90 dias
O Model Studio oferece uma cota gratuita para qwen3.8-max, com restrições importantes:
- Volume: 1 milhão de tokens.
- Região: somente Singapura.
- Validade: 90 dias a partir da ativação.
Use este endpoint para a região de Singapura:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
A cota não é válida para Pequim nem US-Virginia. Tokens de pensamento também consomem essa cota, portanto tarefas com reasoning_effort=xhigh podem esgotá-la rapidamente.
Veja todas as opções de acesso sem custo em como usar o Qwen 3.8 gratuitamente.
Comparação de preços
Valores por 1 milhão de tokens. Promoções podem expirar.
| Modelo | Entrada | Saída | Observações |
|---|---|---|---|
| Qwen 3.8-Max | US$ 2,00 | US$ 6,00 | Preço fixo até 1M de contexto; cache hit a 10% |
| Qwen 3.7-Max | US$ 2,50 | US$ 7,50 | Promoção atual: US$ 1,25/US$ 3,75 |
| Qwen 3.7-Plus | US$ 0,40 | US$ 1,60 | Promoção atual de 20% |
| Kimi K3 | US$ 3,00 | US$ 15,00 | Cache hit a US$ 0,30 |
| Claude Opus 5 | US$ 5,00 | US$ 25,00 | — |
| GPT-5.6 Terra | US$ 2,00 | US$ 12,00 | — |
Leitura rápida:
- Contra o Kimi K3, o Qwen 3.8-Max custa um terço a menos na entrada e 60% a menos na saída. Consulte o guia da API Kimi K3.
- Contra o Claude Opus 5, o Qwen custa 60% menos na entrada e 76% menos na saída.
- Contra o GPT-5.6 Terra, a entrada tem o mesmo preço, mas a saída do Qwen custa metade.
Preço não substitui validação de qualidade. Compare os modelos usando seus prompts, documentos e critérios de aceitação.
Exemplos de custo
Exemplo 1: sessão de agente com 50 mil tokens
Uma execução usa:
- 38.000 tokens de entrada;
- 12.000 tokens de saída.
Cálculo:
Entrada: 38.000 × US$ 2 / 1.000.000 = US$ 0,076
Saída: 12.000 × US$ 6 / 1.000.000 = US$ 0,072
Total: US$ 0,148
Custo aproximado: US$ 0,15 por sessão.
Se o modelo usar mais 8.000 tokens de pensamento com xhigh:
Saída total: 20.000 tokens
Saída: 20.000 × US$ 6 / 1.000.000 = US$ 0,12
Total: US$ 0,196
Custo aproximado: US$ 0,20 por sessão.
Exemplo 2: análise de documento com 800 mil tokens
Uma solicitação recebe 800.000 tokens de documentos e gera um resumo de 5.000 tokens.
Entrada: 800.000 × US$ 2 / 1.000.000 = US$ 1,60
Saída: 5.000 × US$ 6 / 1.000.000 = US$ 0,03
Total: US$ 1,63
Custo aproximado: US$ 1,63 por execução.
A vantagem é a previsibilidade: todos os 800 mil tokens usam a mesma taxa de entrada.
Exemplo 3: prefixo de 100 mil tokens em cache, 50 chamadas por dia
Sem cache:
100.000 × US$ 2 / 1.000.000 = US$ 0,20 por chamada
US$ 0,20 × 50 = US$ 10,00 por dia
Com cache explícito:
Criação:
100.000 × US$ 2,50 / 1.000.000 = US$ 0,25
49 cache hits:
49 × (100.000 × US$ 0,20 / 1.000.000) = US$ 0,98
Total diário: US$ 1,23
Isso reduz o custo diário do prefixo de US$ 10,00 para cerca de US$ 1,23, uma economia de aproximadamente 88%.
Meça custos com dados reais
Os exemplos anteriores usam contagens assumidas. Em produção, os números variam por tarefa, tamanho de prompt, ferramentas chamadas e nível de raciocínio.
Use este fluxo:
- Defina uma amostra de prompts representativos.
- Execute cada prompt em cada nível de
reasoning_effort. - Registre o objeto
usageretornado pela API. - Calcule médias por tipo de tarefa.
- Multiplique os resultados pelas taxas de entrada e saída.
O guia da API Qwen 3.8 mostra as três URLs base regionais e os protocolos compatíveis com OpenAI e Anthropic.
No Apidog, salve cada endpoint como um ambiente, envie o mesmo payload com diferentes níveis de reasoning_effort e inspecione o retorno de usage.
Você também pode comparar o mesmo prompt com qwen3.7-max e Kimi K3 no mesmo workspace. Baixe o Apidog para testar e obter custos reais por tarefa.
Conclusão
O Qwen 3.8-Max combina US$ 2 de entrada, US$ 6 de saída e preço único para até 1 milhão de tokens de contexto. Para workloads com contexto longo, alto volume de saída ou prefixos reutilizados, essa estrutura torna o orçamento mais previsível.
Antes de escolher o modelo:
- meça o uso real de tokens;
- ajuste
reasoning_effortconforme a tarefa; - use cache para contexto reutilizado;
- não baseie projeções de longo prazo em preços promocionais;
- valide custo e qualidade com sua própria carga de trabalho.
Perguntas frequentes
O Qwen 3.8 custa mais para prompts longos?
Não. A precificação oficial lista uma única faixa de 0 a 1 milhão de tokens. Um prompt de 900 mil tokens usa a mesma taxa de entrada de US$ 2 por milhão aplicada a prompts menores.
Isso difere de modelos com preços em níveis, incluindo alguns da lista de modelos do Model Studio.
Tokens de pensamento custam mais no Qwen 3.8?
Não há uma tarifa separada para pensamento. Porém, tokens de pensamento contam como saída e são cobrados a US$ 6 por milhão. Como reasoning_effort usa xhigh por padrão, tarefas complexas podem custar mais do que a resposta visível indica.
Use medium ou low em tarefas simples e confira o objeto usage em cada resposta.
Existe uma forma gratuita de experimentar o Qwen 3.8?
Sim. O Model Studio inclui uma cota gratuita de 1 milhão de tokens, válida por 90 dias, apenas no endpoint de Singapura. O Qwen Chat também oferece acesso gratuito pelo navegador.
Veja os detalhes em como usar o Qwen 3.8 gratuitamente.
O preço de pré-visualização de 10% ainda está disponível?
Não. A promoção era válida durante a pré-visualização em julho de 2026. Na disponibilidade geral, a referência é a tabela padrão de US$ 2/US$ 6 do Model Studio.
Top comments (0)