GLM-5.3-Flash est un modèle MIT de 320 milliards de paramètres. Il est donc libre à auto-héberger, mais exigeant en mémoire.
Essayez Apidog dès aujourd’hui
Ses 18 milliards de paramètres actifs par token et les versions quantifiées le rendent toutefois accessible au-delà d’un nœud 8x H200. Voici comment choisir votre matériel, votre runtime et vos paramètres.
Ce que vous chargez réellement
| Propriété | Valeur |
|---|---|
| Paramètres totaux | 320B |
| Actifs par token | 18B |
| Architecture | MoE, attention hybride linéaire et sparse |
| Contexte | 1 048 576 tokens |
| Licence | MIT |
| Poids | zai-org/GLM-5.3-Flash |
| Quantifications GGUF | unsloth/GLM-5.3-Flash-GGUF |
L’architecture MoE réduit surtout le calcul : 18B de paramètres participent à chaque token. En revanche, les 320B de poids doivent résider en mémoire. Votre contrainte principale est donc la mémoire, pas les FLOPs.
Z.ai indique aussi un cache KV environ 4,4 fois plus petit que GLM-5.3. C’est important pour les longues fenêtres de contexte, où le cache KV devient généralement la principale source de consommation mémoire.
Niveau 1 : pleine précision en production
Pour servir le modèle à pleine qualité avec de la concurrence, prévoyez un nœud 8x H200 de 141 Go, soit environ 1 128 Go au total. Un nœud 8x H20 peut également convenir.
Les poids seuls demandent environ 700 à 800 Go selon la précision. Ajoutez une marge pour le cache KV et les frais d’exécution. En cloud, comptez approximativement 24 à 48 $ par jour.
Servir avec vLLM
vLLM est le choix le plus répandu. Utilisez une taille de parallélisation tensorielle puissance de deux :
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--trust-remote-code
Commencez avec une valeur --max-model-len plus faible. Réserver immédiatement un million de tokens alloue le cache KV correspondant et peut provoquer une erreur mémoire qui masque un problème de configuration plus simple.
Servir avec SGLang
SGLang propose des recettes pour H100, H200, B200, B300 et GB200, y compris pour le service multimodal. Z.ai a utilisé une pile basée sur SGLang pour son service de pré-lancement.
python -m sglang.launch_server \
--model-path zai-org/GLM-5.3-Flash \
--tp 8 \
--context-length 1048576
SGLang est souvent intéressant pour les sorties structurées et les charges agentiques très concurrentes. Pour un agent de code, mesurez vLLM et SGLang sur votre trafic réel plutôt que de choisir par défaut.
Dans les deux cas, configurez un analyseur d’appels d’outils pour activer correctement le function calling. Vérifiez les options de votre version : leurs noms évoluent entre les releases.
Niveau 2 : versions quantifiées sur matériel modeste
Les quantifications GGUF de unsloth/GLM-5.3-Flash-GGUF incluent des formats très agressifs, comme IQ1_S et IQ2_XXS. À 2 bits, les poids d’un modèle 320B peuvent tenir sur une station de travail riche en mémoire ou une machine multi-GPU grand public, en particulier avec déchargement CPU.
Gardez deux limites en tête :
- La quantification agressive dégrade la qualité. IQ1_S est loin de la pleine précision. La dégradation peut être plus tolérable sur un MoE que sur un modèle dense, mais validez vos cas d’usage réels, notamment les outils et sorties structurées.
- La documentation Unsloth est encore en cours de développement. Vérifiez les fichiers publiés et les réglages recommandés avant de concevoir votre déploiement autour d’un format précis.
Pour les machines hybrides CPU/GPU, KTransformers garde les experts MoE en RAM système et déplace vers le GPU uniquement ce qui est nécessaire. Avec seulement 18B de paramètres actifs par token, cette approche convient particulièrement bien à GLM-5.3-Flash. TokenSpeed figure également parmi les runtimes pris en charge.
Consultez aussi nos guides pour exécuter GLM-4.7-Flash localement et exécuter GLM-5 localement gratuitement.
Dimensionner votre budget mémoire
Basez votre capacité sur deux éléments.
Poids
En BF16, comptez environ 2 octets par paramètre :
- 320B en BF16 : environ 640 Go avant frais généraux ;
- FP8 : environ la moitié ;
- 4 bits : environ 160 Go ;
- 2 bits : moins encore, avec une perte de qualité significative.
Cache KV
Le cache KV augmente avec la longueur de contexte et la concurrence. Une configuration stable à 8K peut échouer à 128K uniquement parce que le cache a grossi.
La réduction de 4,4x rapportée par Z.ai aide, mais la croissance reste linéaire en nombre de tokens. Dimensionnez donc le serveur pour votre contexte réel, pas pour le million de tokens annoncé si vous ne l’utilisez jamais.
L’article précédent sur l’auto-hébergement de GLM-5.3 précède la sortie de Flash. Les poids de GLM-5.3-Flash sont désormais disponibles sous licence MIT.
Réglage fin
La licence MIT autorise le réglage fin et la redistribution. C’est l’une des meilleures raisons de conserver les poids en interne.
Un fine-tuning complet de 320B est hors de portée de la plupart des équipes. Privilégiez LoRA ou d’autres méthodes efficaces en paramètres. Sur un MoE, déterminez également si vous adaptez le routeur, les experts ou les couches d’attention.
Avant d’entraîner le modèle, testez le prompting et la récupération de contexte. Avec une fenêtre d’un million de tokens, injecter les connaissances métier dans l’invite peut être moins coûteux et plus efficace qu’un entraînement.
Paramètres d’échantillonnage
Z.ai recommande les valeurs suivantes :
| Cas d’utilisation | temperature |
top_p |
|---|---|---|
| Général | 1.0 | 0.95 |
| Codage | 0.95 | 1.0 |
Le modèle propose aussi reasoning_effort avec low, high et max. max est la valeur par défaut.
En local, ce réglage influence directement le temps de génération. Si votre matériel est lent, utilisez low pour rendre les réponses exploitables.
L’auto-hébergement est-il rentable ?
Généralement, non : l’API reste souvent moins chère.
Au tarif catalogue, GLM-5.3-Flash coûte 0,15 $ par million de tokens d’entrée. Un nœud 8x H200 à environ 1 000 $ par mois équivaut à environ 6,7 milliards de tokens d’entrée via l’API. Sauf charge élevée et continue, le coût fixe du matériel loué est difficile à justifier.
Auto-hébergez plutôt pour :
- la résidence des données et la confidentialité ;
- l’absence de limites de débit externes ;
- des garanties de disponibilité indépendantes d’un fournisseur ;
- la possibilité de modifier, affiner et redistribuer les poids MIT ;
- l’exploitation de GPU déjà achetés et inutilisés.
Notre analyse des prix détaille la comparaison côté API.
Vérifier le déploiement
vLLM et SGLang exposent des endpoints compatibles OpenAI. Testez votre serveur local avec une requête minimale :
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [{"role": "user", "content": "reply with OK"}]
}'
Ne vous limitez pas à ce smoke test. Validez :
- le contexte long à la longueur réellement requise ;
- les entrées image si vous servez la version multimodale ;
- les appels d’outils avec vos schémas de production ;
- le débit sous concurrence.
Configurez une collection de tests dans Apidog, puis exécutez-la contre votre serveur local et Z.ai en faisant de l’URL de base une variable d’environnement. Vous pourrez comparer les réponses et identifier rapidement les régressions de quantification, notamment sur les schémas d’outils.
FAQ
Quel est le matériel minimum ?
En pleine précision, un nœud de classe 8x H200. Les GGUF quantifiés demandent beaucoup moins, mais la qualité baisse avec le niveau de quantification.
Dois-je charger les 320B de paramètres en mémoire ?
Oui. Seuls 18B sont actifs par token, mais tous les poids doivent être présents en mémoire.
vLLM ou SGLang ?
SGLang a publié très tôt des recettes multimodales et excelle souvent avec la concurrence et les sorties structurées. vLLM bénéficie d’un écosystème plus large. Testez les deux sur votre charge réelle.
Puis-je l’exécuter sur un seul GPU ?
Pas en pleine précision. Avec une quantification agressive et le déchargement CPU via KTransformers, un GPU doté de beaucoup de VRAM accompagné de beaucoup de RAM système est plausible, mais lent.
La licence est-elle vraiment MIT ?
Oui. Elle permet l’usage commercial, la modification et la redistribution.
Top comments (0)