GLM-5.3-Flash : le modèle multimodal open source à connaître
Z.ai a lancé GLM-5.3-Flash le 26 août 2026. Ce modèle mélange d’experts compte 320 milliards de paramètres, dont 18 milliards actifs. Distribué sous licence MIT, il est le premier modèle de la série GLM-5 à gérer nativement les images, plutôt que de déléguer la vision à un adaptateur distinct.
Essayez Apidog dès aujourd’hui
Il s’agit aussi du modèle que de nombreux développeurs utilisaient déjà depuis une semaine sous le nom ox-alpha. Et contrairement à ce que son nom suggère, « Flash » ne signifie pas nécessairement « rapide ».
En bref
- Modèle : mélange d’experts à poids ouverts, 320B-A18B, sous licence MIT.
- Lancement : 26 août 2026.
- Nouveauté principale : multimodalité native pour le texte, les images, les vidéos et les fichiers.
- Contexte : 1 048 576 jetons, comme GLM-5.3.
- Prix : environ un dixième de GLM-5.2, soit 0,15 $ par million de jetons en entrée et 0,50 $ par million en sortie.
- Vitesse : 48,7 jetons de sortie par seconde selon Artificial Analysis.
- Temps de premier jeton : 1,52 seconde.
-
Accès : API Z.ai sous l’identifiant
glm-5.3-flash, OpenRouter, Cloudflare Workers AI, Vercel AI Gateway et plusieurs autres fournisseurs. -
Poids : disponibles sur Hugging Face sous
zai-org/GLM-5.3-Flash.
Spécifications
| Propriété | Valeur |
|---|---|
| Paramètres totaux | 320B |
| Paramètres actifs | 18B |
| Architecture | Mélange d’experts, attention hybride linéaire et clairsemée |
| Licence | MIT |
| Fenêtre contextuelle | 1 048 576 jetons |
| Modalités d’entrée | Texte, image, vidéo, fichiers |
| Sortie | Texte |
| Modes de raisonnement | Faible, élevé, max — max par défaut |
| ID de modèle API | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
Vérifiez la limite de sortie chez votre fournisseur
Le nombre maximal de jetons de sortie n’est pas cohérent selon les sources :
- OpenRouter indique 131 072 jetons ;
- la carte Hugging Face indique 163 840 jetons ;
- Z.ai n’a pas encore publié de valeur permettant de trancher.
Si votre application génère de très longues réponses, vérifiez cette limite auprès du fournisseur réellement utilisé avant de concevoir votre intégration.
La multimodalité native est la vraie nouveauté
Les capacités de vision précédentes de la gamme GLM étaient proposées via des modèles ou des chemins distincts. Z.ai avait notamment publié GLM-5V-Turbo et GLM-4.6V comme modèles de vision séparés. Pour analyser une capture d’écran, il fallait donc appeler un point de terminaison différent de celui utilisé pour le trafic textuel.
GLM-5.3-Flash regroupe ces capacités dans une seule requête de complétion de chat :
- un seul ID de modèle ;
- une seule ligne de facturation ;
- une seule fenêtre contextuelle ;
- du texte, des images, des vidéos et des fichiers dans la même requête.
Cette combinaison devient particulièrement intéressante avec une fenêtre d’un million de jetons. Vous pouvez fournir une longue spécification, une capture d’écran de l’interface rendue et des consignes textuelles, puis demander au modèle d’identifier les écarts.
Z.ai présente justement GLM-5.3-Flash comme un modèle capable d’observer des interfaces, des résultats de rendu et des retours d’interaction. Le cas d’usage visé est donc davantage l’agent de codage que la simple légende d’image.
Pour les scénarios spécialisés, consultez aussi :
Architecture : les éléments importants
Z.ai a construit GLM-5.3-Flash sur un nouveau modèle de base, plutôt que de simplement post-entraîner GLM-5.2.
Attention hybride
Le modèle combine :
- une attention linéaire, adaptée aux dépendances locales à moindre coût ;
- une attention clairsemée, qui recherche les jetons globalement pertinents.
Selon Z.ai, cette architecture réduit d’environ trois fois la puissance de calcul nécessaire à l’attention par rapport à GLM-5.3. Elle réduit également le cache KV d’un facteur d’environ 4,4.
Manifold-Constrained Hyper-Connections
Il s’agit du nom donné par Z.ai à une autre technique d’efficacité de mise à l’échelle utilisée dans cette version. Les détails publics restent insuffisants pour permettre une évaluation indépendante.
Il faut donc considérer cette technique comme une caractéristique architecturale déclarée par le fournisseur, et non comme un avantage déjà démontré par des mesures tierces.
Conséquence pratique : un cache KV plus petit
Le cache KV est l’un des principaux facteurs de coût mémoire pour l’inférence à long contexte. Sa réduction de 4,4 fois explique en grande partie comment le modèle peut proposer une fenêtre de 1M de jetons à un prix nettement inférieur à celui de GLM-5.2.
L’entraînement a utilisé un corpus que Z.ai décrit comme contenant environ 30 000 milliards de jetons multimodaux.
« Flash » ne signifie pas rapide
Artificial Analysis mesure GLM-5.3-Flash à 48,7 jetons de sortie par seconde. Pour comparaison, GLM-5.3 atteint environ 86 jetons par seconde selon la même mesure.
Le modèle Flash est donc environ deux fois plus lent en génération continue.
Son avantage se situe au niveau du temps de premier jeton : 1,52 seconde, contre une médiane de 2,14 secondes pour les modèles à poids ouverts. Pour une application interactive avec de nombreux échanges courts, cette réactivité est utile. Pour la génération de longs documents, GLM-5.3 terminera généralement plus vite.
L’efficacité de GLM-5.3-Flash concerne principalement :
- le coût par jeton ;
- la consommation mémoire ;
- le déploiement de contextes très longs ;
- l’intégration native des entrées multimodales.
Elle ne se traduit pas automatiquement par un streaming plus rapide.
Choisissez donc ce modèle parce qu’il est économique et multimodal, pas parce que vous vous attendez à une génération rapide. Plusieurs articles publiés après le lancement ont repris le positionnement de Z.ai sans vérifier le débit pourtant disponible publiquement.
Benchmarks
Les résultats publiés par Z.ai doivent être considérés comme des affirmations du fournisseur tant qu’ils ne sont pas reproduits par des évaluations indépendantes.
Artificial Analysis attribue à GLM-5.3-Flash un score de 57 sur son indice d’intelligence v4.1.1, contre 60 pour GLM-5.3. La médiane des modèles à poids ouverts de taille similaire est de 27.
Le résultat reste donc excellent pour cette catégorie, même s’il est inférieur à celui de son grand frère.
Z.ai affirme que GLM-5.3-Flash s’approche de Claude Opus 4.8 pour le codage et les tâches d’agent. Cette comparaison repose sur les évaluations internes de Z.ai, et non sur une mesure tierce. L’écart de trois points avec GLM-5.3 invite à interpréter cette affirmation avec prudence.
Pour replacer ces chiffres dans l’évolution de la gamme, consultez l’analyse des benchmarks de GLM-5.2.
La semaine d’Ox Alpha
Le 20 août, un modèle anonyme nommé ox-alpha est apparu sur plusieurs plateformes d’inférence tierces. Il proposait une fenêtre d’un million de jetons et un accès gratuit. En quelques jours, il est devenu l’un des modèles les plus utilisés sur ces plateformes.
La communauté a identifié Zhipu comme son probable créateur en environ 48 heures, notamment grâce à ses caractéristiques de sortie.
Le 26 août, Z.ai a confirmé qu’Ox Alpha était en réalité GLM-5.3-Flash. La semaine gratuite correspondait à un test de charge volontaire avant le lancement officiel.
Z.ai affirme également que tout le trafic de cette période était servi sur des accélérateurs chinois utilisant une pile basée sur SGLang. Le fournisseur estime le coût par jeton comparable à celui d’un matériel NVIDIA grand public. Cette information n’a pas été vérifiée indépendamment.
Ce scénario rappelle le cas de Pony Alpha, finalement associé à un modèle DeepSeek ou GLM. Les lancements anonymes sur des routeurs tiers deviennent une étape courante : un modèle performant, gratuit et doté d’une fenêtre contextuelle inhabituellement ronde sert souvent à collecter des données d’évaluation avant l’annonce officielle.
Comment l’utiliser
API hébergée
L’API Z.ai est compatible avec le format OpenAI. Il suffit de diriger votre client vers :
https://api.z.ai/api/paas/v4/
Puis définissez le modèle sur :
glm-5.3-flash
Le guide de l’API GLM-5.3-Flash détaille l’authentification, le format des entrées image et le paramètre d’effort de raisonnement.
Fournisseurs tiers
OpenRouter propose le modèle sous le nom z-ai/glm-5.3-flash. Il est également disponible sur :
- Cloudflare Workers AI ;
- Vercel AI Gateway ;
- DeepInfra ;
- Novita ;
- GMICloud ;
- Baseten ;
- io.net.
Les tarifs et limites peuvent varier sensiblement selon le revendeur.
Agents de codage
GLM-5.3-Flash est inclus dans le Plan de Codage GLM. Z.ai indique que son quota utilisable serait trois fois supérieur à celui de GLM-5.3.
La documentation précise également que les appels effectués en heures creuses consomment la moitié des points standards.
Auto-hébergement
Les poids sont disponibles sur Hugging Face sous licence MIT :
zai-org/GLM-5.3-Flash
Le modèle est pris en charge par :
- vLLM ;
- SGLang ;
- TokenSpeed ;
- KTransformers.
Des quantifications GGUF existent également pour les configurations plus limitées.
GLM-5.3-Flash ou GLM-5.3 ?
Choisissez GLM-5.3-Flash si vous avez besoin :
- d’analyser des images ou des vidéos avec le même appel que le texte ;
- de réduire votre coût par jeton ;
- d’une fenêtre contextuelle d’un million de jetons ;
- de poids ouverts auto-hébergeables sous licence permissive ;
- d’un temps de premier jeton faible pour des échanges interactifs.
Préférez GLM-5.3 si vous privilégiez :
- les derniers points de qualité en raisonnement ;
- un débit de génération supérieur ;
- la vitesse de production de longs documents.
La comparaison côte à côte de GLM-5.3-Flash et GLM-5.3 détaille ce choix. Vous pouvez aussi consulter ce qu’est GLM-5.3.
Les deux modèles utilisent un point d’accès compatible OpenAI : le test consiste donc essentiellement à remplacer l’ID du modèle, puis à comparer les réponses sur votre propre charge de travail.
Pour valider un changement de modèle, envoyez de vraies requêtes, y compris des requêtes multimodales. Avec Apidog, vous pouvez enregistrer ces appels dans une collection réutilisable et ajouter des assertions. Vous vérifiez ainsi que la structure et le contenu des réponses restent compatibles avant le passage en production.
FAQ
GLM-5.3-Flash est-il gratuit ?
Non. L’accès gratuit à Ox Alpha s’est terminé lors de l’annonce officielle. Une réduction de lancement de 50 % est prévue jusqu’au 9 septembre 2026 ; les tarifs habituels s’appliqueront ensuite.
Est-il plus rapide que GLM-5.3 ?
Non. Il génère environ 49 jetons par seconde contre 86 pour GLM-5.3. En revanche, il commence à répondre plus tôt, avec un temps de premier jeton de 1,52 seconde.
Peut-il gérer un million de jetons de contexte ?
La fenêtre configurée est de 1 048 576 jetons, valeur confirmée par la configuration du modèle et Artificial Analysis.
OpenRouter affiche toutefois 1 310 720 jetons. Considérez cette valeur comme une limite déclarée par le fournisseur, et non comme une spécification confirmée du modèle.
Accepte-t-il la vidéo ?
Oui. La documentation de Z.ai liste les entrées texte, image, vidéo et fichier. Le support vidéo étant plus récent et moins utilisé que l’entrée image, testez vos propres médias avant d’en faire une dépendance critique.
Sous quelle licence sont les poids ?
Les poids sont distribués sous licence MIT et publiés sur Hugging Face à l’adresse zai-org/GLM-5.3-Flash.



Top comments (0)