GLM-5.3 est un grand modèle linguistique lancé le 14 août 2026 par Zhipu AI, le laboratoire chinois qui opère internationalement sous le nom de Z.ai. Il s'agit d'une mise à niveau post-entraînement du modèle de base GLM-5, spécifiquement destinée au codage et aux tâches d'agent. Zhipu prévoit de publier ses poids ouverts sur Hugging Face environ deux semaines après le lancement. Selon ses évaluations internes, la capacité de codage a progressé de 50 % par rapport à GLM-5.2.
Essayez Apidog dès aujourd’hui
Cette version est notable pour deux raisons : un laboratoire que Seeking Alpha décrit comme un « challenger chinois d'OpenAI » annonce un modèle de codage qui « approche Claude Fable 5 », puis prévoit de distribuer ses poids. Cette annonce arrive un jour après la dernière version de DeepSeek, couverte dans notre guide API DeepSeek V4 Pro.
Dans cet article, vous allez voir ce qu'est GLM-5.3, interpréter ses benchmarks, préparer l'arrivée des poids ouverts et envoyer votre première requête API. Vous pouvez tester cette requête dans Apidog sans écrire de code.
En bref
- GLM-5.3 a été lancé le 14 août 2026 par Zhipu AI (Z.ai). Il utilise le même modèle de base que GLM-5 : les gains annoncés viennent du post-entraînement.
- Le score Terminal-Bench 3.0 passe de 4.6 à 28.3, soit une amélioration de 6.2x. Zhipu le classe premier parmi les modèles open source.
- GLM-5.3 est également annoncé premier parmi les modèles ouverts sur Agents’ Last Exam.
- CyberGym atteint 84.5 %, légèrement au-dessus de Claude Mythos 5 et GPT-5.6 Sol selon le rapport de lancement. ExploitBench atteint 54.4 %, derrière les modèles de pointe.
- Les poids ouverts sont attendus sur Hugging Face vers le 28 août 2026.
- L'architecture GLM-5 reste un Mixture of Experts (MoE) de 744B paramètres totaux, environ 40B actifs par passe avant, avec une fenêtre de contexte de 200K tokens.
- L'API est compatible OpenAI via
https://api.z.ai/api/paas/v4/chat/completions. Aucun tarif spécifique à GLM-5.3 n'a été publié au lancement.
Qu'est-ce que GLM-5.3 ?
GLM-5.3 est la troisième version ponctuelle de la famille GLM-5, avec une cible claire : le codage, les agents pilotés par terminal et l'analyse de sécurité.
Zhipu n'a pas ré-entraîné le modèle fondamental. Les documents officiels indiquent que la base GLM-5 conserve les mêmes caractéristiques :
- architecture Mixture of Experts ;
- 744 milliards de paramètres totaux ;
- environ 40 milliards de paramètres activés par passe avant ;
- fenêtre de contexte de 200K tokens.
Les améliorations annoncées proviennent donc du post-entraînement à grande échelle, appliqué aux mêmes poids de base.
Pour une équipe de développement, cela signifie que GLM-5.3 doit être évalué comme un modèle spécialisé, pas comme une simple mise à jour de chatbot. Les cas d'usage prioritaires sont :
- les agents qui exécutent et corrigent des commandes shell ;
- l'automatisation CI/CD ;
- les tâches de maintenance sur un dépôt ;
- les workflows d'ingénierie logicielle à long horizon ;
- l'analyse de sécurité.
Si vous cherchez un modèle de codage autonome avec une future option d'auto-hébergement, GLM-5.3 mérite une évaluation ciblée.
Benchmarks GLM-5.3 : séparer résultats publics et revendications internes
La couverture du lancement par BigGo Finance et Pandaily rapporte les résultats suivants.
| Benchmark | Résultat GLM-5.3 | Contexte | Source |
|---|---|---|---|
| Terminal-Bench 3.0 | 28.3, contre 4.6 | Gain de 6.2x ; premier parmi les modèles open source | Rapport de lancement |
| Agents’ Last Exam | Premier parmi les modèles open source | Score non divulgué au lancement | Rapport de lancement |
| CyberGym | 84.5 % | Légèrement au-dessus de Claude Mythos 5 et GPT-5.6 Sol | Rapport de lancement |
| ExploitBench | 54.4 % | Derrière les modèles de pointe | Rapport de lancement |
| SWE-Marathon | Environ 2x GLM-5.2 | Ingénierie logicielle à long terme | Interne Zhipu |
| Capacité de codage agrégée | +50 % vs GLM-5.2 | Principale revendication de Zhipu | Interne Zhipu |
Utilisez ces chiffres avec deux niveaux de confiance.
Ce qui est utile pour une présélection
Le passage de 4.6 à 28.3 sur Terminal-Bench 3.0 est le signal le plus exploitable. Les benchmarks de terminal évaluent la capacité d'un modèle à :
- lancer des commandes shell ;
- lire les sorties ;
- interpréter les erreurs ;
- adapter les commandes suivantes ;
- terminer une tâche en plusieurs étapes.
Pour un agent de développement, cette progression justifie un test comparatif avec vos modèles actuels.
Ce qui doit être reproduit
Les affirmations les plus fortes — +50 % en capacité de codage et environ 2x sur SWE-Marathon — proviennent des évaluations internes de Zhipu. Elles ne sont pas nécessairement incorrectes, mais elles restent à vérifier par des tests indépendants après la publication des poids.
En pratique, ne migrez pas votre trafic de production sur la seule base de ces chiffres. Créez plutôt une suite d'évaluation composée de tâches issues de vos dépôts, CI et tickets réels.
Que signifie « approcher Claude Fable 5 » ?
Zhipu indique que les capacités de codage et d'agent de GLM-5.3 « approchent Claude Fable 5 ». Cette formulation ne signifie pas que les modèles sont équivalents sur tous les axes.
Les résultats rapportés suggèrent que GLM-5.3 est particulièrement compétitif pour les agents et les environnements de terminal :
- première place parmi les modèles ouverts sur Terminal-Bench 3.0 ;
- première place parmi les modèles ouverts sur Agents’ Last Exam ;
- 84.5 % sur CyberGym, légèrement au-dessus de Claude Mythos 5 et GPT-5.6 Sol selon le rapport de lancement.
En revanche, le score de 54.4 % sur ExploitBench reste derrière les modèles de pointe. Les tâches d'exploitation demandent souvent un raisonnement multi-étapes profond dans des contextes ambigus : c'est probablement une zone où les meilleurs modèles fermés gardent un avantage.
Pour votre stack :
- testez GLM-5.3 pour les agents de terminal, la CI et les tâches de dépôt ;
- conservez des modèles de pointe comme références pour les problèmes de raisonnement complexes ;
- exécutez votre propre benchmark avant toute bascule de production.
Pour comparer les modèles de pointe sur des catégories similaires, consultez notre comparaison Grok 4.6 vs GPT-5.6 vs Claude Fable 5.
Poids ouverts : publication attendue vers le 28 août 2026
Zhipu prévoit de publier les poids ouverts de GLM-5.3 environ deux semaines après son lancement, vers le 28 août 2026, sur l'organisation zai-org sur Hugging Face.
Le délai est présenté comme une période d'examen des risques. Ce point est cohérent avec les capacités de sécurité annoncées : un modèle à 84.5 % sur CyberGym pose des enjeux différents lorsqu'il est distribué sous forme de poids exécutables localement plutôt que via une API surveillée.
Préparer l'auto-hébergement
Un MoE de 744B paramètres ne cible pas une machine de développement standard en pleine précision, même si environ 40B paramètres seulement sont activés par token. La plupart des équipes devront attendre des variantes quantifiées et des runtimes communautaires adaptés.
Avant la disponibilité des poids :
- mesurez la qualité de l'API hébergée sur vos prompts ;
- enregistrez les réponses de référence ;
- définissez vos métriques : taux de réussite, temps de réponse, coût et consommation GPU ;
- comparez ensuite l'API à votre déploiement local.
Notre guide d'auto-hébergement de GLM-5.3 couvre le dimensionnement, les piles de services et la comparaison avec l'API hébergée.
GLM-5.3 dans le paysage des modèles ouverts
La comparaison la plus directe est DeepSeek. Les deux laboratoires publient des poids ouverts, ciblent des coûts compétitifs et ont lancé leurs versions à moins de 24 heures d'intervalle.
La différence principale est le positionnement :
- DeepSeek V4 Pro vise un rôle de modèle généraliste phare ;
- GLM-5.3 cible plus directement le codage agentique et les tâches de terminal.
Si votre trafic consiste majoritairement en génération de code, automatisation de dépôts ou agents CI, commencez par benchmarker GLM-5.3.
La tarification reste un facteur important. Zhipu n'avait pas publié de prix spécifique à GLM-5.3 au lancement. À titre de référence, la page tarifaire officielle affichait pour GLM-5.2 :
- 1,4 $ par million de tokens d'entrée ;
- 4,4 $ par million de tokens de sortie.
Ne déduisez pas le prix de GLM-5.3 à partir de ces montants : vérifiez la page officielle avant de budgétiser. Pour optimiser des appels par token, consultez également notre guide d'optimisation des coûts de l'API DeepSeek.
Après la publication de variantes quantifiées, GLM-5.3 pourra rejoindre les modèles exécutables sans dépendance à une API externe. Notre sélection des meilleurs LLM locaux en 2026 donne le contexte pour comparer les options ouvertes.
Quotas du plan de codage GLM
Le 14 août, Zhipu a réinitialisé les quotas du plan de codage GLM pour tous les utilisateurs.
Si vous êtes abonné via Z.ai, votre allocation a été renouvelée le jour du lancement. Vous pouvez l'utiliser pour tester GLM-5.3 sans attendre les poids ouverts.
Ce plan de codage est distinct de la facturation API par token. Pour la Chine continentale, l'écosystème passe par open.bigmodel.cn, avec ses propres offres et sa propre facturation.
Essayez l'API en cinq minutes
L'API de Z.ai est compatible OpenAI. Si vous utilisez déjà une API LLM courante, la structure de requête vous sera familière.
- Point de terminaison international :
https://api.z.ai/api/paas/v4/chat/completions - Point de terminaison Chine continentale :
https://open.bigmodel.cn/api/paas/v4/chat/completions - Authentification : jeton Bearer
Au lancement, la documentation officielle mentionne encore glm-5 comme ID documenté. L'exemple glm-5.3 ci-dessous suit la convention de nommage de la famille, mais vous devez confirmer l'ID exact sur la documentation du modèle avant tout déploiement.
export GLM_API_KEY="votre-clé-de-z.ai"
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Écrivez un script bash qui trouve les cinq fichiers les plus volumineux dans un dépôt git, en excluant le répertoire .git."
}
],
"temperature": 0.6,
"max_tokens": 1024
}'
La réponse suit le format OpenAI habituel :
-
choicescontient les réponses générées ; -
choices[0].message.contentcontient le texte ; -
usagecontient les compteurs de tokens.
Tester la requête dans Apidog
Pour éviter d'éditer des commandes cURL à chaque essai, importez cette requête dans Apidog.
Configurez ensuite :
- une variable d'environnement
GLM_API_KEY; - un environnement
internationalavechttps://api.z.ai; - un environnement
chineavechttps://open.bigmodel.cn; - une variable
MODEL_IDpour changer de version sans modifier le corps JSON ; - des exemples de réponses enregistrés pour vos tests de régression.
Vous pourrez alors changer de région ou de modèle avec un menu déroulant, puis conserver les résultats comme base de comparaison lorsque les poids ouverts seront publiés.
Pour les exemples Python, Node.js, streaming et gestion d'erreurs, consultez le guide de démarrage rapide de l'API GLM-5.3.
FAQ
GLM-5.3 est-il open source ?
Pas encore, mais ses poids doivent être publiés. Zhipu prévoit une publication sur Hugging Face vers le 28 août 2026, environ deux semaines après le lancement API, après un examen des risques présenté comme le plus approfondi de l'entreprise à ce jour.
Jusqu'à cette publication, l'accès passe par l'API hébergée.
En quoi GLM-5.3 diffère-t-il de GLM-5.2 ?
Le modèle de base est identique. Les changements annoncés viennent du post-entraînement à grande échelle :
- +50 % de capacité de codage selon les évaluations internes de Zhipu ;
- Terminal-Bench 3.0 de 4.6 à 28.3 ;
- score SWE-Marathon environ doublé.
L'architecture, le nombre de paramètres et la fenêtre de contexte de la famille GLM-5 restent inchangés.
Combien coûte GLM-5.3 ?
Aucun prix API spécifique à GLM-5.3 n'avait été publié au lancement. La meilleure référence disponible est le prix affiché pour GLM-5.2 : 1,4 $ par million de tokens d'entrée et 4,4 $ par million de tokens de sortie.
Vérifiez la tarification en direct avant de fixer un budget. Pour réduire les coûts, appliquez les tactiques décrites dans notre guide sur l'optimisation des coûts API après l'augmentation de prix de DeepSeek.
Puis-je exécuter GLM-5.3 sur mon propre matériel ?
Oui, après la publication des poids, mais avec des contraintes matérielles importantes. La famille GLM-5 utilise un MoE de 744B paramètres, avec environ 40B paramètres actifs par passe avant. Une exécution en pleine précision nécessite une infrastructure serveur multi-GPU.
Les versions quantifiées communautaires devraient réduire ces exigences. Consultez le guide de préparation à l'auto-hébergement pour un dimensionnement réaliste.
GLM-5.3 est-il meilleur que Claude ou GPT pour le codage ?
Les résultats rapportés indiquent qu'il est compétitif pour les agents et le terminal : première place parmi les modèles ouverts sur Terminal-Bench 3.0, et 84.5 % sur CyberGym selon le rapport de lancement.
Cependant, GLM-5.3 atteint 54.4 % sur ExploitBench et reste derrière les modèles de pointe sur ce benchmark. La réponse dépend donc de votre charge de travail.
Avant de basculer du trafic de production, testez vos propres tâches de code, de CI et de maintenance de dépôts, comme vous le feriez pour toute API avant son adoption.
Où GLM-5.3 s'intègre dans votre stack
GLM-5.3 propose un positionnement clair : performances d'agent de codage proches des modèles de pointe, API compatible OpenAI et poids ouverts attendus deux semaines après le lancement.
Les résultats sont particulièrement intéressants pour les tâches de terminal et les agents. L'écart sur ExploitBench reste notable, et une partie des gains annoncés n'est pas encore vérifiable indépendamment.
La démarche la moins coûteuse est simple :
- envoyez la requête cURL ;
- sauvegardez la réponse ;
- créez une petite suite de prompts basée sur vos tâches réelles ;
- mesurez qualité, latence, coût et taux de réussite ;
- répétez ces tests lorsque les poids ouverts seront disponibles.
Téléchargez Apidog pour organiser cette suite de tests, conservez les points de terminaison Z.ai et bigmodel.cn dans des environnements séparés, puis utilisez vos appels actuels comme référence de régression pour comparer l'API hébergée à votre futur déploiement local.

Top comments (0)