DEV Community

Cover image for Qwen 3.8: Preços Explicados – $2 Input / $6 Output para 1M de Contexto
Lucas
Lucas

Posted on Originally published at apidog.com

Qwen 3.8: Preços Explicados – $2 Input / $6 Output para 1M de Contexto

A Alibaba lançou o Qwen 3.8-Max no início de agosto de 2026, encerrando a promoção de pré-visualização de julho. Na disponibilidade geral, a página oficial de preços do Model Studio lista o qwen3.8-max por US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída, em uma única faixa que cobre toda a janela de contexto de 1 milhão de tokens.

Experimente o Apidog hoje

Isso é relevante porque muitos modelos aumentam o preço por token quando o prompt ultrapassa determinados limites de contexto. No Qwen 3.8-Max, a taxa permanece US$ 2/US$ 6 tanto para 5.000 quanto para 900.000 tokens de contexto.

Este guia mostra como calcular custos, quando usar cache, como controlar o impacto dos tokens de raciocínio e como comparar o modelo com Qwen 3.7-Max, Kimi K3, Claude Opus 5 e GPT-5.6 Terra. Para conhecer o modelo antes de analisar os preços, leia o que é o Qwen 3.8 e por que ele é importante.

Preços de tabela são estimativas. O Qwen 3.8-Max usa reasoning_effort=xhigh por padrão, e tokens de pensamento são cobrados como saída. Meça o uso real antes de definir um orçamento. O Apidog permite inspecionar o uso de tokens em cada resposta durante os testes.

Preço GA: US$ 2 de entrada e US$ 6 de saída

A tabela abaixo resume o preço oficial do qwen3.8-max, verificado na página do Model Studio em 3 de agosto de 2026.

Item Preço por 1 milhão de tokens
Entrada US$ 2,00
Saída, incluindo tokens de pensamento US$ 6,00
Entrada em cache (cache hit) 10% da taxa de entrada
Criação explícita de cache 125% da taxa de entrada
Contexto Faixa única: 0 a 1 milhão de tokens
Pensamento e não-pensamento Mesma taxa

Pontos práticos:

  • A janela inteira de 1 milhão de tokens usa a mesma faixa de preço.
  • Tokens de pensamento são cobrados como tokens de saída.
  • A saída máxima é de 65.536 tokens por solicitação, ou cerca de US$ 0,39 no máximo em saída.

O anúncio oficial do Qwen 3.8 descreve o modelo como o mais capaz da Alibaba até o momento: 2,4T de parâmetros totais, 95B ativos, contexto de 1 milhão de tokens e entrada multimodal.

Por que uma única faixa para 1 milhão de tokens importa

Preços por nível de contexto são comuns: o custo por token aumenta após um limite porque contextos longos são mais caros para atender.

A própria Alibaba usa esse modelo em outros produtos. Na página de preços do Model Studio, modelos como qwen3-max e qwen3-coder-plus têm preços que aumentam conforme o contexto cresce.

No Qwen 3.8-Max, o orçamento é linear:

custo = (tokens_entrada × US$ 2 / 1.000.000)
      + (tokens_saida × US$ 6 / 1.000.000)
Enter fullscreen mode Exit fullscreen mode

Isso reduz surpresas em cargas como:

  • RAG com documentos extensos;
  • análise de repositórios grandes;
  • agentes que acumulam resultados de ferramentas;
  • prompts com centenas de milhares de tokens.

Comparação com o Qwen 3.7-Max

O Qwen 3.8-Max foi lançado abaixo do preço de tabela de seu antecessor:

  • Qwen 3.7-Max: US$ 2,50 de entrada / US$ 7,50 de saída por 1 milhão de tokens.
  • Qwen 3.8-Max: US$ 2,00 de entrada / US$ 6,00 de saída por 1 milhão de tokens.

Isso representa uma redução de 20% em entrada e saída, com contexto maior, entrada multimodal e melhores pontuações de benchmark.

Há uma ressalva: o Qwen 3.7-Max está com promoção de 50%, chegando a US$ 1,25/US$ 3,75. Se você não precisa do contexto de 1 milhão de tokens nem dos ganhos multimodais e agênticos, ele pode ser uma opção econômica enquanto a promoção durar.

Para workloads de menor custo, o Qwen 3.7-Plus continua como alternativa a US$ 0,40/US$ 1,60, também com promoção de 20%.

Tokens de pensamento são cobrados como saída

O parâmetro reasoning_effort possui três níveis:

xhigh
medium
low
Enter fullscreen mode Exit fullscreen mode

O padrão é xhigh. Nesse modo, o modelo produz tokens internos de raciocínio antes da resposta final. Esses tokens são cobrados pela taxa de saída de US$ 6 por milhão.

Isso significa que a resposta visível não representa necessariamente o custo completo.

Por exemplo, uma resposta final com 800 tokens pode ter usado milhares de tokens de pensamento em uma tarefa difícil. Para controlar custos:

  1. Use medium ou low em tarefas simples, como classificação, extração e formatação.
  2. Registre o objeto usage retornado em cada resposta.
  3. Monitore separadamente tokens de entrada e saída: a saída custa 3 vezes mais do que a entrada.

Exemplo de configuração:

{
  "model": "qwen3.8-max",
  "reasoning_effort": "medium",
  "messages": [
    {
      "role": "user",
      "content": "Extraia os campos deste documento em JSON."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Cache de contexto: 10% para hits e 125% para criação

Se sua aplicação reutiliza o mesmo prefixo — como prompt de sistema, documentos estáveis ou definições de ferramentas — o cache pode reduzir muito o custo de entrada.

  • Cache hit: US$ 0,20 por 1 milhão de tokens, ou 10% da taxa normal.
  • Criação explícita de cache: US$ 2,50 por 1 milhão de tokens, ou 125% da taxa normal.

O custo extra de criação é de 25%, mas cada reutilização economiza 90% no prefixo armazenado. Na prática, o cache já se paga quando o prefixo é reutilizado duas vezes.

Use cache para:

  • prompts de sistema longos;
  • catálogos ou documentação de produto;
  • schemas de ferramentas;
  • contexto fixo de agentes;
  • instruções compartilhadas por muitas conversas.

Cota gratuita: 1 milhão de tokens por 90 dias

O Model Studio oferece uma cota gratuita para qwen3.8-max, com restrições importantes:

  • Volume: 1 milhão de tokens.
  • Região: somente Singapura.
  • Validade: 90 dias a partir da ativação.

Use este endpoint para a região de Singapura:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

A cota não é válida para Pequim nem US-Virginia. Tokens de pensamento também consomem essa cota, portanto tarefas com reasoning_effort=xhigh podem esgotá-la rapidamente.

Veja todas as opções de acesso sem custo em como usar o Qwen 3.8 gratuitamente.

Comparação de preços

Valores por 1 milhão de tokens. Promoções podem expirar.

Modelo Entrada Saída Observações
Qwen 3.8-Max US$ 2,00 US$ 6,00 Preço fixo até 1M de contexto; cache hit a 10%
Qwen 3.7-Max US$ 2,50 US$ 7,50 Promoção atual: US$ 1,25/US$ 3,75
Qwen 3.7-Plus US$ 0,40 US$ 1,60 Promoção atual de 20%
Kimi K3 US$ 3,00 US$ 15,00 Cache hit a US$ 0,30
Claude Opus 5 US$ 5,00 US$ 25,00
GPT-5.6 Terra US$ 2,00 US$ 12,00

Leitura rápida:

  • Contra o Kimi K3, o Qwen 3.8-Max custa um terço a menos na entrada e 60% a menos na saída. Consulte o guia da API Kimi K3.
  • Contra o Claude Opus 5, o Qwen custa 60% menos na entrada e 76% menos na saída.
  • Contra o GPT-5.6 Terra, a entrada tem o mesmo preço, mas a saída do Qwen custa metade.

Preço não substitui validação de qualidade. Compare os modelos usando seus prompts, documentos e critérios de aceitação.

Exemplos de custo

Exemplo 1: sessão de agente com 50 mil tokens

Uma execução usa:

  • 38.000 tokens de entrada;
  • 12.000 tokens de saída.

Cálculo:

Entrada: 38.000 × US$ 2 / 1.000.000 = US$ 0,076
Saída:   12.000 × US$ 6 / 1.000.000 = US$ 0,072
Total:   US$ 0,148
Enter fullscreen mode Exit fullscreen mode

Custo aproximado: US$ 0,15 por sessão.

Se o modelo usar mais 8.000 tokens de pensamento com xhigh:

Saída total: 20.000 tokens
Saída: 20.000 × US$ 6 / 1.000.000 = US$ 0,12
Total: US$ 0,196
Enter fullscreen mode Exit fullscreen mode

Custo aproximado: US$ 0,20 por sessão.

Exemplo 2: análise de documento com 800 mil tokens

Uma solicitação recebe 800.000 tokens de documentos e gera um resumo de 5.000 tokens.

Entrada: 800.000 × US$ 2 / 1.000.000 = US$ 1,60
Saída:     5.000 × US$ 6 / 1.000.000 = US$ 0,03
Total: US$ 1,63
Enter fullscreen mode Exit fullscreen mode

Custo aproximado: US$ 1,63 por execução.

A vantagem é a previsibilidade: todos os 800 mil tokens usam a mesma taxa de entrada.

Exemplo 3: prefixo de 100 mil tokens em cache, 50 chamadas por dia

Sem cache:

100.000 × US$ 2 / 1.000.000 = US$ 0,20 por chamada
US$ 0,20 × 50 = US$ 10,00 por dia
Enter fullscreen mode Exit fullscreen mode

Com cache explícito:

Criação:
100.000 × US$ 2,50 / 1.000.000 = US$ 0,25

49 cache hits:
49 × (100.000 × US$ 0,20 / 1.000.000) = US$ 0,98

Total diário: US$ 1,23
Enter fullscreen mode Exit fullscreen mode

Isso reduz o custo diário do prefixo de US$ 10,00 para cerca de US$ 1,23, uma economia de aproximadamente 88%.

Meça custos com dados reais

Os exemplos anteriores usam contagens assumidas. Em produção, os números variam por tarefa, tamanho de prompt, ferramentas chamadas e nível de raciocínio.

Use este fluxo:

  1. Defina uma amostra de prompts representativos.
  2. Execute cada prompt em cada nível de reasoning_effort.
  3. Registre o objeto usage retornado pela API.
  4. Calcule médias por tipo de tarefa.
  5. Multiplique os resultados pelas taxas de entrada e saída.

O guia da API Qwen 3.8 mostra as três URLs base regionais e os protocolos compatíveis com OpenAI e Anthropic.

No Apidog, salve cada endpoint como um ambiente, envie o mesmo payload com diferentes níveis de reasoning_effort e inspecione o retorno de usage.

Você também pode comparar o mesmo prompt com qwen3.7-max e Kimi K3 no mesmo workspace. Baixe o Apidog para testar e obter custos reais por tarefa.

Conclusão

O Qwen 3.8-Max combina US$ 2 de entrada, US$ 6 de saída e preço único para até 1 milhão de tokens de contexto. Para workloads com contexto longo, alto volume de saída ou prefixos reutilizados, essa estrutura torna o orçamento mais previsível.

Antes de escolher o modelo:

  • meça o uso real de tokens;
  • ajuste reasoning_effort conforme a tarefa;
  • use cache para contexto reutilizado;
  • não baseie projeções de longo prazo em preços promocionais;
  • valide custo e qualidade com sua própria carga de trabalho.

Perguntas frequentes

O Qwen 3.8 custa mais para prompts longos?

Não. A precificação oficial lista uma única faixa de 0 a 1 milhão de tokens. Um prompt de 900 mil tokens usa a mesma taxa de entrada de US$ 2 por milhão aplicada a prompts menores.

Isso difere de modelos com preços em níveis, incluindo alguns da lista de modelos do Model Studio.

Tokens de pensamento custam mais no Qwen 3.8?

Não há uma tarifa separada para pensamento. Porém, tokens de pensamento contam como saída e são cobrados a US$ 6 por milhão. Como reasoning_effort usa xhigh por padrão, tarefas complexas podem custar mais do que a resposta visível indica.

Use medium ou low em tarefas simples e confira o objeto usage em cada resposta.

Existe uma forma gratuita de experimentar o Qwen 3.8?

Sim. O Model Studio inclui uma cota gratuita de 1 milhão de tokens, válida por 90 dias, apenas no endpoint de Singapura. O Qwen Chat também oferece acesso gratuito pelo navegador.

Veja os detalhes em como usar o Qwen 3.8 gratuitamente.

O preço de pré-visualização de 10% ainda está disponível?

Não. A promoção era válida durante a pré-visualização em julho de 2026. Na disponibilidade geral, a referência é a tabela padrão de US$ 2/US$ 6 do Model Studio.

Top comments (0)