O GLM-5.3-Flash está com 50% de desconto até 9 de setembro de 2026. Depois dessa data, toda projeção baseada nas taxas atuais dobrará. Os valores abaixo foram verificados em 27 de agosto de 2026; confirme os preços com seu provedor antes de fechar um orçamento.
Preços do GLM-5.3-Flash
| Preço de lançamento — até 9 de setembro | Preço de tabela — depois | |
|---|---|---|
| Entrada | US$ 0,075 / 1M tokens | US$ 0,15 / 1M tokens |
| Saída | US$ 0,25 / 1M tokens | US$ 0,50 / 1M tokens |
| Entrada em cache | US$ 0,015 / 1M tokens | US$ 0,03 / 1M tokens |
A Artificial Analysis estima um custo combinado de US$ 0,10 por milhão de tokens, usando uma proporção de 7:2:1 entre entrada, saída e cache. Use isso apenas como referência: sua mistura real de tokens determina a conta.
Custos práticos no preço de tabela
Classificador de suporte
Para 100.000 tickets por mês, com cerca de 800 tokens de entrada e 100 de saída por ticket:
- Entrada: 80M tokens → US$ 12
- Saída: 10M tokens → US$ 5
- Total: US$ 17/mês
Para classificação, roteamento, extração ou formatação, use:
{
"reasoning_effort": "low"
}
Isso pode reduzir ainda mais o custo de saída.
Assistente de codificação
Para 500 sessões por dia, com 15.000 tokens de entrada e 2.000 de saída por sessão:
- Entrada mensal: 225M tokens
- Saída mensal: 30M tokens
- Sem cache: US$ 48,75/mês
- Com 70% da entrada em cache: cerca de US$ 30/mês
Pipeline de documentos com imagens
Para 10.000 documentos mensais, cada um com 40.000 tokens de entrada — incluindo imagens — e 1.500 tokens de saída:
- Entrada: 400M tokens → US$ 60
- Saída: 15M tokens → US$ 7,50
- Total: US$ 67,50/mês
Esses valores baixos são precisamente a proposta do modelo.
Cache é a maior alavanca de custo
A entrada em cache custa US$ 0,03 por milhão, contra US$ 0,15 para entrada nova. Tokens em cache custam um quinto do valor normal.
Estruture prompts para manter um prefixo idêntico entre chamadas:
- Coloque instruções estáveis primeiro.
- Mantenha prompts de sistema, documentos recorrentes e contexto de código no início.
- Adicione dados variáveis — IDs, timestamps, nome do usuário e solicitação atual — no final.
Um timestamp ou ID de solicitação no começo do prompt pode invalidar o cache do restante do contexto.
A Z.ai também listou armazenamento de entrada em cache gratuito por tempo limitado. Trate isso como promocional e confirme os termos atuais antes de depender dele.
Ajuste reasoning_effort
O padrão do GLM-5.3-Flash é:
{
"reasoning_effort": "max"
}
Os modos disponíveis são low, high e max. Como tokens de raciocínio são cobrados como saída, usar max em tarefas simples pode aumentar muito a conta.
Use low para:
- Classificação
- Extração estruturada
- Roteamento
- Formatação
- Transformação de dados
Veja a configuração no guia de API. É uma alteração de uma linha e deve ser a primeira otimização quando o gasto real superar a previsão.
Comparação com GLM-5.3
| Modelo | Custo combinado por 1M tokens |
|---|---|
| GLM-5.3-Flash | US$ 0,10 |
| GLM-5.3 | US$ 0,90 |
O GLM-5.3-Flash custa aproximadamente nove vezes menos para uma diferença de três pontos no Índice de Inteligência da Artificial Analysis: 57 contra 60.
A troca pode ser ruim quando você transmite respostas longas para uma pessoa aguardando, porque o GLM-5.3 gera texto quase duas vezes mais rápido. Veja a comparação completa.
Em relação ao GLM-5.2, a Z.ai afirma um custo de aproximadamente um décimo do preço, além de US$ 0,045 por tarefa. Consulte o detalhamento de preços do GLM-5.2 ao planejar uma migração.
O GLM-5.3-Flash também é competitivo contra modelos multimodais baratos de outros provedores e se destaca pela licença MIT, que mantém a auto-hospedagem como opção. Para a comparação com o Google, veja o post sobre preços do Gemini 3.7 Flash.
Revendedores podem cobrar valores diferentes
O modelo está disponível diretamente pela Z.ai, além de OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten e io.net.
Os preços não são uniformes. A AIHubMix, por exemplo, listou cerca de:
- Entrada: US$ 0,113 / 1M
- Saída: US$ 0,394 / 1M
Esses preços ficam entre as taxas promocionais e de tabela da Z.ai.
Se você usa um agregador, consulte o preço efetivo do provedor. Um gateway unificado pode incluir margem, embora ela seja fácil de tolerar nesses níveis absolutos de custo.
Quando vale a pena auto-hospedar
Os pesos têm licença MIT, mas a economia só começa em volume muito alto.
Uma estimativa para precisão total exige um nó equivalente a 8x H200, custando aproximadamente US$ 24 a US$ 48 por dia em nuvem — cerca de US$ 1.000 por mês.
Ao preço de tabela da API, US$ 1.000 compram aproximadamente 6,7 bilhões de tokens de entrada. Portanto, para a maioria das equipes, auto-hospedagem é uma decisão de:
- Controle operacional
- Residência de dados
- Licenciamento
- Uso de hardware já disponível
A exceção são versões quantizadas, como GGUF. Se você já possui o hardware, o custo marginal passa a ser principalmente eletricidade. O guia de execução local explica o que cada faixa de hardware consegue executar.
Alternativa: plano de codificação
Para uma pessoa desenvolvedora usando Claude Code ou Cline, cobrar por token pode não ser o melhor modelo.
O Plano de Codificação GLM começa em torno de US$ 18 por mês, inclui o GLM-5.3-Flash e, segundo a Z.ai, oferece três vezes a cota utilizável do GLM-5.3. Chamadas fora do pico também podem consumir metade dos pontos padrão.
Para uso diário individual, um plano fixo costuma ser mais barato e previsível que acesso medido por API. Veja o guia de configuração e a comparação entre planos de codificação.
Monitore a saída, não apenas a entrada
A entrada chama atenção pelo volume, mas a saída pode quebrar o orçamento:
- Saída custa US$ 0,50 / 1M tokens.
- Entrada custa US$ 0,15 / 1M tokens.
- Tokens de raciocínio são cobrados como saída.
- Com
reasoning_effort: "max", o modelo pode gerar muito mais tokens internos do que os exibidos na resposta final.
O valor combinado de US$ 0,10 por milhão presume uma proporção de 7:2:1. Muitas cargas reais não seguem esse padrão.
Em vez de estimar, registre o objeto usage de cada resposta e acompanhe:
- Tokens de entrada
- Tokens de saída
- Tokens em cache
- Proporção de saída no total
Se a saída passar de aproximadamente 15% dos seus tokens totais, reduza reasoning_effort primeiro e revise o tamanho do prompt depois.
O que fazer antes de 9 de setembro
- Meça a mistura real de tokens. Se sua carga for intensiva em saída, seu custo estará mais próximo de US$ 0,50 por milhão do que do valor combinado de US$ 0,10.
- Verifique o cache. Há uma diferença de 5x entre entrada nova e entrada em cache.
- Refaça a projeção com o preço de tabela. Os custos dobram em 10 de setembro. Se a carga só funciona com o desconto, resolva isso agora.
Capture respostas reais e use o objeto usage para obter as contagens de entrada, saída e cache. Executar chamadas representativas como uma coleção salva no Apidog, usando o ID do modelo como variável de ambiente, permite comparar o GLM-5.3-Flash com o GLM-5.3 usando seus próprios dados em vez de marketing.
FAQ
O GLM-5.3-Flash é gratuito?
Não. Ele foi gratuito por cerca de uma semana enquanto operava anonimamente como ox-alpha, antes do lançamento. O desconto atual de 50% não significa uso gratuito.
Quando o desconto termina?
Em 9 de setembro de 2026. Os preços de tabela passam a valer depois disso.
Por que sites mostram preços diferentes?
Alguns exibem a promoção, outros o preço de tabela, e revendedores definem suas próprias margens. Verifique sempre o provedor que você usa.
Imagem custa extra?
Imagens consomem tokens de contexto e são cobradas como entrada. Não há sobretaxa separada, mas imagens em alta resolução podem usar muitos tokens.
Auto-hospedar é mais barato?
Apenas em volume sustentado muito alto ou quando você já possui hardware compatível e usa uma versão quantizada. A US$ 0,15 por milhão de tokens de entrada, alugar um nó 8x H200 é difícil de justificar apenas pelo custo.
Top comments (0)