DEV Community

Cover image for Como Usar Qwen 3.8 Grátis
Lucas
Lucas

Posted on Originally published at apidog.com

Como Usar Qwen 3.8 Grátis

O Alibaba lançou o Qwen 3.8-Max no início de agosto de 2026. Apesar das alegações de “grátis para sempre”, as opções reais têm limites claros. Este guia mostra, com base nas páginas da Alibaba verificadas em 3 de agosto de 2026, como testar o modelo sem custo e o que considerar antes de integrá-lo a um projeto.

Experimente o Apidog hoje

Existem quatro rotas relevantes: duas já funcionam, uma depende da liberação dos pesos e uma usa modelos Qwen anteriores. Para entender primeiro o modelo — 2,4 trilhões de parâmetros totais, 95B ativos e contexto de 1M de tokens — consulte a visão geral do Qwen 3.8.

Mapa rápido

Rota Grátis? Funciona hoje? Observação
Qwen Chat Sim Sim Aplicativo para consumidor, sem API
Cota da API do Model Studio 1M tokens Sim Apenas região de Singapura, por 90 dias
Pesos abertos (auto-hospedagem) Pesos grátis Ainda não Prometidos para a próxima semana; hardware não é grátis
Modelos Qwen mais antigos Sim Sim Não é o Qwen 3.8-Max

Rota 1: Qwen Chat para testar sem configuração

A maneira mais rápida de testar o Qwen 3.8-Max é usar o Qwen Chat. Faça login, selecione o modelo e comece a conversar sem cartão de crédito ou console em nuvem. A publicação oficial de lançamento indica esse fluxo como a forma padrão de experimentar o modelo.

Qwen Chat

Você obtém acesso gratuito à interface de chat, incluindo recursos de compreensão de imagens e documentos demonstrados no lançamento.

Mas há uma limitação importante para desenvolvedores: não existe API nessa rota. Você não recebe chave, automação ou integração com aplicações e pipelines de teste. Além disso, o comportamento no chat pode diferir da API, pois a interface aplica prompts e configurações de sistema próprios.

Use esta rota para: validar rapidamente capacidades gerais do modelo.

Não use esta rota para: benchmark de API, testes automatizados ou integração de produto.

Rota 2: use a cota gratuita do Model Studio

Para integração via código, use o Alibaba Cloud Model Studio. Novas ativações recebem uma cota gratuita de 1 milhão de tokens para qwen3.8-max.

Antes de ativar a conta, considere as condições da página de preços.

1. A cota gratuita é exclusiva da região de Singapura

A cota gratuita vale apenas para a região internacional de Singapura. Use esta URL base:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Endpoints de Pequim ou EUA-Virgínia não usam essa cota gratuita. Neles, a cobrança começa no primeiro token.

2. A cota expira em 90 dias

Os 1M de tokens são válidos por 90 dias após a ativação. Tokens não utilizados expiram e não acumulam.

Planeje a avaliação antes de ativar a conta:

  1. Defina os cenários de teste.
  2. Prepare prompts e conjuntos de avaliação.
  3. Configure alertas de uso e cobrança.
  4. Ative a cota somente quando estiver pronto para executar os testes.

3. Após a cota, há cobrança por token

Depois que a cota expirar ou for consumida, o custo informado é:

  • US$ 2 por milhão de tokens de entrada
  • US$ 6 por milhão de tokens de saída

A tarifa vale para todo o contexto de 1M de tokens, sem níveis adicionais. Consulte o guia de preços do Qwen 3.8 para estimar custos de cargas de trabalho reais.

Configure a chave de API

O fluxo básico é:

  1. Crie uma conta no Model Studio.
  2. Ative o serviço.
  3. Gere uma chave de API.
  4. Armazene-a na variável de ambiente DASHSCOPE_API_KEY.
  5. Configure a URL base para a região de Singapura.
export DASHSCOPE_API_KEY="sua-chave-aqui"
Enter fullscreen mode Exit fullscreen mode

O catálogo de modelos lista qwen3.8-max entre os modelos recomendados. O endpoint é compatível com o protocolo OpenAI e também existe um endpoint compatível com Anthropic. Para detalhes de streaming e saída de raciocínio, consulte o guia da API do Qwen 3.8.

Evite desperdiçar a cota com raciocínio

O Qwen 3.8-Max usa reasoning_effort como xhigh por padrão. Os tokens de raciocínio contam como tokens de saída.

Isso significa que uma requisição complexa pode consumir milhares de tokens antes de gerar a resposta final. Para tarefas rotineiras, reduza o esforço de raciocínio:

{
  "reasoning_effort": "low"
}
Enter fullscreen mode Exit fullscreen mode

Use medium ou xhigh apenas quando a tarefa realmente exigir raciocínio mais profundo.

Faça 1 milhão de tokens durar

Adote um fluxo de desenvolvimento que minimize chamadas reais à API:

  • Valide a requisição antes de automatizar. Monte e teste a chamada no Apidog, revise parâmetros e inspecione respostas em streaming antes de adicionar retries no código.
  • Use mocks durante o desenvolvimento. Depois de capturar uma resposta válida, salve-a e use um servidor mock para desenvolver frontend, agentes ou integrações sem consumir tokens.
  • Monitore usage em cada resposta. Registre tokens de entrada, saída e raciocínio por requisição para identificar prompts caros antes que a cota termine.
  • Separe ambientes por região. Armazene URLs base de Singapura, Pequim e EUA em ambientes distintos para evitar chamadas acidentais a uma região paga.

Você pode baixar o Apidog para montar esse fluxo com ambientes, inspeção de respostas e mocks.

Veredito: esta é a melhor rota gratuita para desenvolvedores, desde que você use a região de Singapura e respeite a validade de 90 dias.

Rota 3: pesos abertos, mas ainda indisponíveis

O Qwen 3.8-Max é o primeiro modelo da classe Qwen-Max anunciado com pesos abertos. A Alibaba informou que os pesos seriam publicados no Hugging Face e no ModelScope “na próxima semana”, por volta de 10 de agosto de 2026.

Em 3 de agosto de 2026, os pesos ainda não estavam disponíveis. Portanto:

  • não há download oficial;
  • não há quantização para testar;
  • não há execução local;
  • tutoriais que afirmam rodar o Qwen 3.8 localmente antes da publicação dos pesos devem ser tratados com ceticismo.

Auto-hospedagem não significa hardware gratuito

Mesmo após a liberação, os pesos abertos não tornarão o modelo viável em hardware comum.

O Qwen 3.8-Max tem 2,4 trilhões de parâmetros. Como referência, o Kimi K3, com 2,8T de parâmetros, foi lançado com 594 GB de pesos mesmo usando quantização agressiva MXFP4. Para o Qwen 3.8-Max, espere centenas de gigabytes de pesos e uma infraestrutura de serving com múltiplas GPUs, provavelmente distribuída entre nós.

Não é um modelo para notebook ou uma única workstation. O guia para executar o Kimi K3 localmente mostra o tipo de hardware e de custo envolvido nessa classe de modelo.

Na prática, os pesos abertos provavelmente terão este efeito para a maioria dos desenvolvedores:

  1. provedores terceiros poderão hospedar o modelo;
  2. haverá concorrência entre serviços de inferência;
  3. os preços de API podem cair;
  4. a rota mais acessível será API hospedada, não execução local.

Veredito: ainda não é uma opção disponível. Quando os pesos forem liberados, planeje orçamento para hospedagem, não para um laptop.

Rota 4: use modelos Qwen anteriores sem custo

Se sua necessidade é usar um modelo Qwen capaz sem pagar, e não necessariamente o Qwen 3.8-Max, os modelos anteriores oferecem alternativas mais acessíveis.

Modelos menores com pesos abertos já podem rodar em hardware mais comum, e algumas rotas de acesso não dependem de uma cota que expira em 90 dias. Consulte o guia de como usar o Qwen 3.7 gratuitamente.

A troca é simples: você abre mão dos ganhos de benchmark do 3.8-Max. Para projetos paralelos, classificação, protótipos ou aprendizado da API Qwen, modelos anteriores podem ser suficientes.

O que não existe em 3 de agosto de 2026

Para evitar perder tempo, estas opções não estão disponíveis:

  • Não há camada de API gratuita ilimitada. A cota é de 1M de tokens e expira.
  • Não há camada gratuita fora de Singapura. Pequim e EUA-Virgínia cobram desde o primeiro token.
  • Não há pesos oficiais para download. “Próxima semana” é uma promessa, não um link de download.
  • Não há acesso oficial gratuito ao Qwen 3.8 em agregadores terceiros. Antes da liberação dos pesos, alegações de acesso gratuito ao 3.8-Max devem ser verificadas com cuidado.

FAQ

A API do Qwen 3.8 é realmente gratuita?

Parcialmente. O Alibaba Cloud Model Studio oferece 1 milhão de tokens gratuitos para qwen3.8-max, válidos por 90 dias e apenas na região de Singapura. Depois disso, a cobrança é de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída.

Posso baixar e executar o Qwen 3.8 localmente agora?

Não. Em 3 de agosto de 2026, os pesos ainda não tinham sido lançados. A previsão era disponibilizá-los no Hugging Face e no ModelScope por volta de 10 de agosto de 2026. Quando estiverem disponíveis, espere centenas de gigabytes de pesos e necessidade de infraestrutura multi-GPU.

Como isso difere das opções gratuitas do Kimi K3?

Os pesos do Kimi K3 já estão disponíveis para download, então a auto-hospedagem é possível hoje. Para o Qwen 3.8, essa rota ainda dependia da liberação dos pesos. Em ambos os casos, o tamanho dos modelos torna a execução em hardware de consumidor impraticável. Veja o guia de como usar o Kimi K3 gratuitamente.

A cota gratuita cobre tokens de raciocínio?

Sim, mas esses tokens consomem a cota. Como reasoning_effort usa xhigh por padrão, chamadas complexas podem gastar muitos tokens de saída em raciocínio. Reduza o valor para low ou medium em chamadas rotineiras.

Conclusão

O acesso gratuito ao Qwen 3.8 é real, mas limitado:

  • Use o Qwen Chat para testar o modelo manualmente.
  • Use os 1M de tokens do Model Studio para integração e avaliação via API.
  • Use a região de Singapura para aproveitar a cota.
  • Reduza reasoning_effort para evitar consumo desnecessário.
  • Use mocks e inspeção de requisições para preservar tokens.
  • Aguarde os pesos abertos se sua estratégia depende de provedores de inferência terceirizados.

Se optar pela API, reserve chamadas reais para avaliações que importam. Crie e valide requisições no Apidog, simule respostas durante o desenvolvimento e consuma sua cota apenas quando precisar validar o comportamento real do Qwen 3.8-Max.

Top comments (0)