DEV Community

Cover image for GLM-5.3-Flash: Preços Antes e Depois do Desconto de Lançamento
Lucas
Lucas

Posted on Originally published at apidog.com

GLM-5.3-Flash: Preços Antes e Depois do Desconto de Lançamento

O GLM-5.3-Flash está com 50% de desconto até 9 de setembro de 2026. Depois dessa data, toda projeção baseada nas taxas atuais dobrará. Os valores abaixo foram verificados em 27 de agosto de 2026; confirme os preços com seu provedor antes de fechar um orçamento.

Experimente o Apidog hoje

Preços do GLM-5.3-Flash

Preço de lançamento — até 9 de setembro Preço de tabela — depois
Entrada US$ 0,075 / 1M tokens US$ 0,15 / 1M tokens
Saída US$ 0,25 / 1M tokens US$ 0,50 / 1M tokens
Entrada em cache US$ 0,015 / 1M tokens US$ 0,03 / 1M tokens

A Artificial Analysis estima um custo combinado de US$ 0,10 por milhão de tokens, usando uma proporção de 7:2:1 entre entrada, saída e cache. Use isso apenas como referência: sua mistura real de tokens determina a conta.

Custos práticos no preço de tabela

Classificador de suporte

Para 100.000 tickets por mês, com cerca de 800 tokens de entrada e 100 de saída por ticket:

  • Entrada: 80M tokens → US$ 12
  • Saída: 10M tokens → US$ 5
  • Total: US$ 17/mês

Para classificação, roteamento, extração ou formatação, use:

{
  "reasoning_effort": "low"
}
Enter fullscreen mode Exit fullscreen mode

Isso pode reduzir ainda mais o custo de saída.

Assistente de codificação

Para 500 sessões por dia, com 15.000 tokens de entrada e 2.000 de saída por sessão:

  • Entrada mensal: 225M tokens
  • Saída mensal: 30M tokens
  • Sem cache: US$ 48,75/mês
  • Com 70% da entrada em cache: cerca de US$ 30/mês

Pipeline de documentos com imagens

Para 10.000 documentos mensais, cada um com 40.000 tokens de entrada — incluindo imagens — e 1.500 tokens de saída:

  • Entrada: 400M tokens → US$ 60
  • Saída: 15M tokens → US$ 7,50
  • Total: US$ 67,50/mês

Esses valores baixos são precisamente a proposta do modelo.

Cache é a maior alavanca de custo

A entrada em cache custa US$ 0,03 por milhão, contra US$ 0,15 para entrada nova. Tokens em cache custam um quinto do valor normal.

Estruture prompts para manter um prefixo idêntico entre chamadas:

  1. Coloque instruções estáveis primeiro.
  2. Mantenha prompts de sistema, documentos recorrentes e contexto de código no início.
  3. Adicione dados variáveis — IDs, timestamps, nome do usuário e solicitação atual — no final.

Um timestamp ou ID de solicitação no começo do prompt pode invalidar o cache do restante do contexto.

A Z.ai também listou armazenamento de entrada em cache gratuito por tempo limitado. Trate isso como promocional e confirme os termos atuais antes de depender dele.

Ajuste reasoning_effort

O padrão do GLM-5.3-Flash é:

{
  "reasoning_effort": "max"
}
Enter fullscreen mode Exit fullscreen mode

Os modos disponíveis são low, high e max. Como tokens de raciocínio são cobrados como saída, usar max em tarefas simples pode aumentar muito a conta.

Use low para:

  • Classificação
  • Extração estruturada
  • Roteamento
  • Formatação
  • Transformação de dados

Veja a configuração no guia de API. É uma alteração de uma linha e deve ser a primeira otimização quando o gasto real superar a previsão.

Comparação com GLM-5.3

Modelo Custo combinado por 1M tokens
GLM-5.3-Flash US$ 0,10
GLM-5.3 US$ 0,90

O GLM-5.3-Flash custa aproximadamente nove vezes menos para uma diferença de três pontos no Índice de Inteligência da Artificial Analysis: 57 contra 60.

A troca pode ser ruim quando você transmite respostas longas para uma pessoa aguardando, porque o GLM-5.3 gera texto quase duas vezes mais rápido. Veja a comparação completa.

Em relação ao GLM-5.2, a Z.ai afirma um custo de aproximadamente um décimo do preço, além de US$ 0,045 por tarefa. Consulte o detalhamento de preços do GLM-5.2 ao planejar uma migração.

O GLM-5.3-Flash também é competitivo contra modelos multimodais baratos de outros provedores e se destaca pela licença MIT, que mantém a auto-hospedagem como opção. Para a comparação com o Google, veja o post sobre preços do Gemini 3.7 Flash.

Revendedores podem cobrar valores diferentes

O modelo está disponível diretamente pela Z.ai, além de OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten e io.net.

Os preços não são uniformes. A AIHubMix, por exemplo, listou cerca de:

  • Entrada: US$ 0,113 / 1M
  • Saída: US$ 0,394 / 1M

Esses preços ficam entre as taxas promocionais e de tabela da Z.ai.

Se você usa um agregador, consulte o preço efetivo do provedor. Um gateway unificado pode incluir margem, embora ela seja fácil de tolerar nesses níveis absolutos de custo.

Quando vale a pena auto-hospedar

Os pesos têm licença MIT, mas a economia só começa em volume muito alto.

Uma estimativa para precisão total exige um nó equivalente a 8x H200, custando aproximadamente US$ 24 a US$ 48 por dia em nuvem — cerca de US$ 1.000 por mês.

Ao preço de tabela da API, US$ 1.000 compram aproximadamente 6,7 bilhões de tokens de entrada. Portanto, para a maioria das equipes, auto-hospedagem é uma decisão de:

  • Controle operacional
  • Residência de dados
  • Licenciamento
  • Uso de hardware já disponível

A exceção são versões quantizadas, como GGUF. Se você já possui o hardware, o custo marginal passa a ser principalmente eletricidade. O guia de execução local explica o que cada faixa de hardware consegue executar.

Alternativa: plano de codificação

Para uma pessoa desenvolvedora usando Claude Code ou Cline, cobrar por token pode não ser o melhor modelo.

O Plano de Codificação GLM começa em torno de US$ 18 por mês, inclui o GLM-5.3-Flash e, segundo a Z.ai, oferece três vezes a cota utilizável do GLM-5.3. Chamadas fora do pico também podem consumir metade dos pontos padrão.

Para uso diário individual, um plano fixo costuma ser mais barato e previsível que acesso medido por API. Veja o guia de configuração e a comparação entre planos de codificação.

Monitore a saída, não apenas a entrada

A entrada chama atenção pelo volume, mas a saída pode quebrar o orçamento:

  • Saída custa US$ 0,50 / 1M tokens.
  • Entrada custa US$ 0,15 / 1M tokens.
  • Tokens de raciocínio são cobrados como saída.
  • Com reasoning_effort: "max", o modelo pode gerar muito mais tokens internos do que os exibidos na resposta final.

O valor combinado de US$ 0,10 por milhão presume uma proporção de 7:2:1. Muitas cargas reais não seguem esse padrão.

Em vez de estimar, registre o objeto usage de cada resposta e acompanhe:

  • Tokens de entrada
  • Tokens de saída
  • Tokens em cache
  • Proporção de saída no total

Se a saída passar de aproximadamente 15% dos seus tokens totais, reduza reasoning_effort primeiro e revise o tamanho do prompt depois.

O que fazer antes de 9 de setembro

  1. Meça a mistura real de tokens. Se sua carga for intensiva em saída, seu custo estará mais próximo de US$ 0,50 por milhão do que do valor combinado de US$ 0,10.
  2. Verifique o cache. Há uma diferença de 5x entre entrada nova e entrada em cache.
  3. Refaça a projeção com o preço de tabela. Os custos dobram em 10 de setembro. Se a carga só funciona com o desconto, resolva isso agora.

Capture respostas reais e use o objeto usage para obter as contagens de entrada, saída e cache. Executar chamadas representativas como uma coleção salva no Apidog, usando o ID do modelo como variável de ambiente, permite comparar o GLM-5.3-Flash com o GLM-5.3 usando seus próprios dados em vez de marketing.

FAQ

O GLM-5.3-Flash é gratuito?

Não. Ele foi gratuito por cerca de uma semana enquanto operava anonimamente como ox-alpha, antes do lançamento. O desconto atual de 50% não significa uso gratuito.

Quando o desconto termina?

Em 9 de setembro de 2026. Os preços de tabela passam a valer depois disso.

Por que sites mostram preços diferentes?

Alguns exibem a promoção, outros o preço de tabela, e revendedores definem suas próprias margens. Verifique sempre o provedor que você usa.

Imagem custa extra?

Imagens consomem tokens de contexto e são cobradas como entrada. Não há sobretaxa separada, mas imagens em alta resolução podem usar muitos tokens.

Auto-hospedar é mais barato?

Apenas em volume sustentado muito alto ou quando você já possui hardware compatível e usa uma versão quantizada. A US$ 0,15 por milhão de tokens de entrada, alugar um nó 8x H200 é difícil de justificar apenas pelo custo.

Top comments (0)