GLM-5.3 é um grande modelo de linguagem lançado em 14 de agosto de 2026 pela Zhipu AI, laboratório chinês que opera internacionalmente como Z.ai. É uma atualização pós-treinamento do GLM-5 voltada para codificação e fluxos agênticos. A Zhipu planeja publicar os pesos abertos no Hugging Face cerca de duas semanas após o lançamento. Segundo avaliações internas da empresa, a capacidade de codificação melhorou 50% em relação ao GLM-5.2.
O lançamento chama atenção porque a Zhipu — descrita pelo Seeking Alpha como uma “desafiante chinesa da OpenAI” — afirma que o modelo está “se aproximando do Claude Fable 5” em codificação e agentes, com pesos abertos previstos em seguida. Ele chegou um dia após o lançamento mais recente da DeepSeek, abordado no nosso guia da API DeepSeek V4 Pro.
Neste artigo, você verá o que muda no GLM-5.3, como interpretar os benchmarks, o plano de pesos abertos e como fazer sua primeira chamada à API. Você também pode testar a requisição no Apidog sem escrever código.
Resumo
- GLM-5.3 foi lançado em 14 de agosto de 2026 pela Zhipu AI (Z.ai). Ele usa o mesmo modelo base GLM-5; os ganhos vêm do pós-treinamento escalonado.
- No Terminal-Bench 3.0, a pontuação subiu de 4,6 para 28,3: um salto de 6,2x e primeiro lugar entre modelos de código aberto.
- O modelo também ocupa o primeiro lugar entre modelos abertos no Agents’ Last Exam.
- No CyberGym, alcançou 84,5%, ligeiramente acima de Claude Mythos 5 e GPT-5.6 Sol. No ExploitBench, marcou 54,4% e ainda ficou atrás dos modelos de ponta.
- Os pesos abertos devem chegar ao Hugging Face por volta de 28 de agosto de 2026, após a revisão de risco da Zhipu.
- A família GLM-5 usa arquitetura Mixture of Experts (MoE), com 744B de parâmetros totais, aproximadamente 40B ativos por passagem e janela de contexto de 200K tokens.
- A API é compatível com OpenAI em
https://api.z.ai/api/paas/v4/chat/completions. Nenhum preço específico da versão 5.3 foi publicado no lançamento.
O que é o GLM-5.3
GLM-5.3 é a terceira atualização pontual da família GLM-5 e a mais direcionada para desenvolvimento. A Zhipu não retreinou o modelo base. Segundo a documentação oficial, o GLM-5 mantém:
- Arquitetura Mixture of Experts;
- 744B de parâmetros totais;
- Cerca de 40B de parâmetros ativos por passagem;
- Janela de contexto de 200K tokens.
As melhorias vêm do pós-treinamento escalonado aplicado aos mesmos pesos base. Na prática, isso indica que o principal avanço está no pipeline de alinhamento e treinamento posterior, não em uma nova arquitetura.
As cargas de trabalho alvo são específicas:
- agentes orientados por terminal;
- engenharia de software de longa duração;
- tarefas de segurança;
- automação de fluxos de desenvolvimento.
Se você precisa avaliar modelos para agentes de código, GLM-5.3 é uma opção a comparar com APIs fechadas e modelos abertos auto-hospedados assim que os pesos forem liberados.
Benchmarks do GLM-5.3: números e fontes
A cobertura de lançamento da BigGo Finance e da Pandaily relatou os resultados abaixo.
Atenção à fonte de cada métrica: alguns dados vêm de relatórios de lançamento e outros de avaliações internas da Zhipu. Resultados internos ainda precisam de reprodução independente.
| Benchmark | Resultado GLM-5.3 | Contexto | Fonte |
|---|---|---|---|
| Terminal-Bench 3.0 | 28,3, acima de 4,6 | Salto de 6,2x; primeiro entre modelos de código aberto | Relatório de lançamento |
| Agents’ Last Exam | Primeiro entre modelos de código aberto | Pontuação não divulgada | Relatório de lançamento |
| CyberGym | 84,5% | Ligeiramente acima de Claude Mythos 5 e GPT-5.6 Sol | Relatório de lançamento |
| ExploitBench | 54,4% | Ainda atrás de modelos de ponta | Relatório de lançamento |
| SWE-Marathon | Aproximadamente 2x GLM-5.2 | Engenharia de software de longo prazo | Interno da Zhipu |
| Capacidade de codificação agregada | +50% vs. GLM-5.2 | Reivindicação principal da Zhipu | Interno da Zhipu |
Como interpretar esses números
O salto no Terminal-Bench 3.0 é relevante. Esse tipo de benchmark avalia se o modelo consegue:
- Executar comandos shell em sequência;
- Ler e interpretar saídas;
- Corrigir erros;
- Continuar tarefas de várias etapas.
Sair de 4,6 para 28,3 muda o potencial do modelo para pipelines de agentes, CI e automação baseada em terminal.
Por outro lado, as alegações de ganho de 50% em codificação e de aproximadamente 2x no SWE-Marathon são avaliações internas. Elas não devem ser tratadas como resultados reproduzíveis até que os pesos sejam publicados e a comunidade execute as mesmas suítes.
O que “aproximando-se do Claude Fable 5” significa na prática
A Zhipu afirma que o GLM-5.3 está “se aproximando do Claude Fable 5” em codificação e comportamento agêntico. Essa formulação não significa equivalência geral.
O que os números sugerem:
- Em tarefas de terminal e agentes, o GLM-5.3 parece competitivo.
- O primeiro lugar entre modelos abertos no Terminal-Bench 3.0 e no Agents’ Last Exam é relevante para agentes de codificação.
- No CyberGym, os 84,5% superam ligeiramente Claude Mythos 5 e GPT-5.6 Sol, embora pequenas diferenças possam variar entre execuções.
- No ExploitBench, os 54,4% indicam que o modelo ainda fica atrás da fronteira em raciocínio mais profundo e desenvolvimento de exploits.
Para sua pilha, isso sugere um plano simples:
- Teste o GLM-5.3 em agentes de terminal, automação de CI e tarefas de repositório.
- Mantenha modelos fechados de ponta na comparação para tarefas de raciocínio difícil.
- Use uma suíte própria antes de mover tráfego de produção.
Para comparar os modelos de ponta nesses eixos, consulte a comparação entre Grok 4.6, GPT-5.6 e Claude Fable 5.
Plano de pesos abertos: Hugging Face por volta de 28 de agosto
A Zhipu se comprometeu a publicar os pesos abertos do GLM-5.3 cerca de duas semanas após o lançamento. A previsão é por volta de 28 de agosto de 2026, na organização zai-org no Hugging Face.
O intervalo de duas semanas faz parte da revisão de risco anunciada pela empresa. Isso é especialmente relevante porque o resultado de 84,5% no CyberGym indica capacidade significativa em segurança ofensiva. Publicar pesos abertos é diferente de disponibilizar o modelo por uma API monitorada.
Planeje a execução local com realismo
A família GLM-5 tem 744B de parâmetros totais, mesmo que apenas cerca de 40B estejam ativos por token. Portanto:
- Inferência em precisão total exige hardware de servidor e múltiplas GPUs.
- A maioria das equipes provavelmente dependerá de variantes quantizadas da comunidade.
- Vale construir uma linha de base contra a API hospedada antes de testar a implantação local.
Para se preparar, veja o guia de auto-hospedagem do GLM-5.3.
Como o GLM-5.3 se encaixa no cenário de modelos abertos
A comparação mais direta é com DeepSeek. Os dois laboratórios:
- São chineses;
- Publicam pesos abertos;
- Oferecem APIs com preços competitivos;
- Tiveram lançamentos separados por aproximadamente 24 horas.
A diferença está no foco. A linha V4 Pro da DeepSeek é apresentada como generalista, enquanto o GLM-5.3 é uma aposta especializada em agentes de codificação.
Se seu tráfego envolve principalmente desenvolvimento agêntico, comece a avaliação pelo GLM-5.3. Se você precisa de um modelo generalista, compare os dois com prompts e métricas representativos da sua aplicação.
A economia também importa. O aumento de preço da DeepSeek, discutido no guia de otimização de custos da API DeepSeek, mostra que preços de APIs podem mudar rapidamente. Pesos abertos oferecem uma alternativa de auto-hospedagem para equipes que precisam reduzir dependência de provedores.
No lançamento, a Zhipu não havia publicado preço específico para o GLM-5.3. Como referência, a página oficial de preços listava o GLM-5.2 a US$ 1,4 por 1M de tokens de entrada e US$ 4,4 por 1M de tokens de saída.
Quando variantes quantizadas estiverem disponíveis, o GLM-5.3 poderá entrar no conjunto de modelos executáveis sem dependência de API. Veja também a lista dos melhores LLMs locais em 2026.
Cotas do Plano de Codificação GLM foram redefinidas
Em 14 de agosto, a Zhipu redefiniu as cotas do Plano de Codificação GLM para todos os usuários. Se você assina o plano pelo Z.ai, seu limite foi renovado no dia do lançamento.
O Plano de Codificação é diferente do acesso à API por token:
- O plano é uma oferta de tarifa fixa para ferramentas de codificação;
- A redefinição se aplica ao plano, não à cobrança da API;
- Usuários da China Continental acessam o ecossistema pelo open.bigmodel.cn, com planos e faturamento próprios.
Experimente a API em cinco minutos
A API do Z.ai é compatível com OpenAI. Se você já usa uma API de LLM, o formato será familiar.
Endpoint internacional:
https://api.z.ai/api/paas/v4/chat/completions
Endpoint para China Continental:
https://open.bigmodel.cn/api/paas/v4/chat/completions
A autenticação usa Bearer Token. No lançamento, a documentação ainda listava glm-5 como ID documentado. O exemplo abaixo usa glm-5.3 seguindo a convenção da família, mas confirme o ID na documentação do modelo antes de implantar.
export GLM_API_KEY="your-key-from-z.ai"
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Escreva um script bash que encontre os cinco maiores arquivos em um repositório git, excluindo o diretório .git."
}
],
"temperature": 0.6,
"max_tokens": 1024
}'
A resposta segue o esquema da OpenAI:
-
choices: array com a resposta do modelo; -
choices[0].message.content: conteúdo gerado; -
usage: contagem de tokens de entrada e saída.
Organize testes no Apidog
Em vez de editar comandos cURL manualmente, importe a requisição para o Apidog e configure:
- Uma variável de ambiente chamada
GLM_API_KEY; - Um ambiente para
api.z.ai; - Um ambiente para
open.bigmodel.cn; - Variáveis para IDs de modelo;
- Respostas salvas como linha de base para testes de regressão.
Assim, você pode trocar região, endpoint ou modelo por um menu, sem alterar a requisição manualmente.
Para exemplos em Python e Node.js, streaming e tratamento de erros, consulte o guia de início rápido completo da API GLM-5.3.
FAQ
O GLM-5.3 é de código aberto?
Ainda não, mas terá pesos abertos. A Zhipu planeja liberar os pesos no Hugging Face por volta de 28 de agosto de 2026, após uma revisão de risco que a empresa descreve como a mais extensa até o momento. Até lá, o acesso é feito pela API hospedada.
Como o GLM-5.3 é diferente do GLM-5.2?
O modelo base é o mesmo. As melhorias vêm do pós-treinamento escalonado. A Zhipu relata:
- +50% em capacidade de codificação em avaliações internas;
- Terminal-Bench 3.0 de 4,6 para 28,3;
- Aproximadamente o dobro da pontuação no SWE-Marathon.
Arquitetura, janela de contexto e contagem de parâmetros permanecem inalteradas.
Qual é o custo do GLM-5.3?
A Zhipu não publicou um preço específico para a versão 5.3 no lançamento. A melhor referência disponível era o GLM-5.2, listado a US$ 1,4 por 1M de tokens de entrada e US$ 4,4 por 1M de tokens de saída.
Antes de definir orçamento, confira a página de preços atualizada. Para reduzir custo por token, veja o guia de otimização de custos após o aumento de preço da API DeepSeek.
Posso executar o GLM-5.3 no meu próprio hardware?
Depois da liberação dos pesos, sim, com ressalvas. A família GLM-5 usa 744B de parâmetros totais e cerca de 40B ativos por passagem. A execução em precisão total exige hardware de servidor multi-GPU.
Variantes quantizadas da comunidade devem reduzir os requisitos. Veja o guia de preparação para auto-hospedagem para dimensionamento mais realista.
O GLM-5.3 é melhor que Claude ou GPT para codificação?
Nos benchmarks de agentes e terminal relatados, ele é competitivo. Ficou em primeiro entre modelos abertos no Terminal-Bench 3.0 e superou Claude Mythos 5 e GPT-5.6 Sol no CyberGym.
No ExploitBench, porém, marcou 54,4% e ficou atrás dos modelos de ponta. A decisão depende da sua carga de trabalho. Execute uma suíte própria antes de mover tráfego de produção, como faria ao testar qualquer API antes da adoção.
Onde o GLM-5.3 se encaixa na sua pilha
GLM-5.3 é um lançamento especializado para agentes de codificação: desempenho forte em tarefas de terminal, pesos abertos previstos em duas semanas e uma API compatível com OpenAI que você pode testar imediatamente.
A leitura prática é:
- Use a API para criar uma linha de base hoje;
- Monte uma pequena suíte de prompts baseada nas suas tarefas reais;
- Compare resultados com seus modelos atuais;
- Reavalie quando os pesos abertos e variantes quantizadas estiverem disponíveis;
- Só então considere mover tráfego de produção.
Comece enviando a requisição cURL deste artigo e salve o resultado. Você pode baixar o Apidog para organizar a suíte, manter os endpoints do Z.ai e do bigmodel.cn em ambientes alternáveis e transformar testes exploratórios em uma base de regressão para comparar a API hospedada com sua futura implantação local.

Top comments (0)