GLM-5.3-Flash est actuellement proposé à moitié prix. Cette offre se termine le 9 septembre 2026 : après cette date, toutes les projections fondées sur les tarifs actuels doubleront.
Essayez Apidog dès aujourd’hui
Voici ce que le modèle coûte maintenant, ce qu’il coûtera ensuite, comment il se compare aux alternatives et comment vérifier si l’écart compte pour votre charge de travail. Chiffres vérifiés le 27 août 2026 : les pages tarifaires pouvant changer, confirmez-les auprès de votre fournisseur avant de fixer un budget.
Tarifs
| Type | Prix de lancement (jusqu’au 9 sept. 2026) | Prix catalogue (après) |
|---|---|---|
| Input | 0,075 $ / 1 M de jetons | 0,15 $ / 1 M de jetons |
| Output | 0,25 $ / 1 M de jetons | 0,50 $ / 1 M de jetons |
| Input mis en cache | 0,015 $ / 1 M de jetons | 0,03 $ / 1 M de jetons |
Artificial Analysis publie un tarif combiné de 0,10 $ par million de jetons, calculé avec un ratio cache/entrée/sortie de 7:2:1. Ce chiffre facilite les comparaisons, mais votre ratio réel détermine votre facture.
Coût de trois charges de travail
Les exemples suivants utilisent le prix catalogue, le plus pertinent pour planifier les coûts après le 9 septembre.
Classificateur de support
Pour 100 000 tickets par mois, avec environ 800 jetons d’entrée et 100 jetons de sortie par ticket :
- 80 millions de jetons d’entrée : 12 $
- 10 millions de jetons de sortie : 5 $
- Total : 17 $ par mois
Pour ce type de tâche, définissez reasoning_effort sur low : la quantité de sortie, et donc son coût, peut encore diminuer.
Assistant de codage
Pour 500 sessions par jour, avec 15 000 jetons d’entrée — dont une grande partie de contexte de fichiers répété — et 2 000 jetons de sortie par session :
- 225 millions de jetons d’entrée : 33,75 $
- 30 millions de jetons de sortie : 15 $
- Sans cache : 48,75 $ par mois
Si 70 % des entrées sont mises en cache, le coût d’entrée descend à environ 14,85 $, pour un total d’environ 30 $ par mois.
Pipeline documentaire avec images
Pour 10 000 documents par mois, avec environ 40 000 jetons d’entrée — images comprises — et 1 500 jetons de sortie par document :
- 400 millions de jetons d’entrée : 60 $
- 15 millions de jetons de sortie : 7,50 $
- Total : 67,50 $ par mois
Aucun de ces montants n’est élevé. C’est précisément l’intérêt de GLM-5.3-Flash.
Le cache est votre principal levier
À 0,03 $ par million contre 0,15 $ pour une nouvelle entrée, un jeton mis en cache coûte cinq fois moins cher.
Les charges de travail comportant un préfixe stable — invite système, document interrogé à plusieurs reprises ou base de code — doivent conserver ce préfixe identique d’un appel à l’autre.
L’erreur la plus fréquente consiste à placer une valeur variable au début de l’invite. Un horodatage, un identifiant de requête ou un nom d’utilisateur dans l’invite système invalide tout ce qui suit. Placez donc le contenu stable en premier et le contenu variable en dernier.
Z.ai a également indiqué que le stockage des entrées mises en cache était gratuit pour une durée limitée. Considérez cette mesure comme promotionnelle et vérifiez les conditions actuelles avant d’en dépendre architecturalement.
Réduisez l’effort de raisonnement
Sur ce modèle, reasoning_effort vaut par défaut max. C’est le réglage le plus coûteux.
Les trois modes disponibles sont low, high et max. Les jetons de raisonnement sont facturés comme des jetons de sortie. Une tâche de classification, d’extraction, de routage ou de formatage peut donc payer pour une réflexion qui n’apparaît jamais dans la réponse finale.
Pour ces tâches, commencez par low. La configuration est détaillée dans notre guide API. Il s’agit d’un changement d’une seule ligne et du premier réglage à vérifier si votre facture dépasse vos estimations.
Comparaison avec les autres modèles
Par rapport à son propre frère, au prix catalogue :
| Modèle | Tarif combiné par million |
|---|---|
| GLM-5.3-Flash | 0,10 $ |
| GLM-5.3 | 0,90 $ |
L’écart est d’environ neuf fois pour seulement trois points de différence sur l’indice d’intelligence d’Artificial Analysis : 57 contre 60.
Notre comparaison complète détaille les cas où ce compromis devient défavorable. En bref : si vous diffusez de longues réponses à une personne en attente, GLM-5.3 peut être préférable, car il génère presque deux fois plus vite.
Par rapport à GLM-5.2, Z.ai annonce un prix environ dix fois inférieur, avec un coût par tâche de 0,045 $. Notre analyse des tarifs de GLM-5.2 reprend l’ancienne grille pour planifier une migration.
Face aux gammes multimodales économiques d’autres fournisseurs, GLM-5.3-Flash est compétitif et se distingue par sa licence MIT, qui laisse ouverte l’option de l’auto-hébergement. Notre article sur la tarification de Gemini 3.7 Flash couvre la comparaison la plus proche chez Google.
Les revendeurs appliquent leurs propres tarifs
Le modèle est disponible directement via Z.ai, mais aussi sur OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten et io.net.
Les tarifs peuvent varier fortement. AIHubMix, par exemple, a affiché environ 0,113 $ en entrée et 0,394 $ en sortie : des prix situés entre les tarifs promotionnels et catalogue de Z.ai. Certains fournisseurs répercutent la remise de lancement, d’autres non.
Si vous utilisez un agrégateur, vérifiez son tarif actuel au lieu de supposer qu’il correspond à celui de Z.ai. Une passerelle unifiée peut appliquer une marge, même si celle-ci reste facile à négliger à ces niveaux de prix.
À partir de quel volume l’auto-hébergement devient-il rentable ?
Les poids sont sous licence MIT, donc l’exécution locale est possible. Toutefois, la forte baisse du prix API rend le seuil de rentabilité plus difficile à atteindre.
À titre indicatif, un service en pleine précision nécessite un nœud de classe H200 avec huit GPU, facturé entre 24 $ et 48 $ par jour dans le cloud. En prenant un coût fixe de 1 000 $ par mois, que le nœud soit actif ou non :
- 1 000 $ au prix catalogue achètent environ 6,7 milliards de jetons d’entrée ;
- il faut donc un volume très élevé et régulier pour amortir le nœud.
Pour la plupart des équipes, l’auto-hébergement de GLM-5.3-Flash se justifie davantage par le contrôle, la résidence des données ou la licence que par le prix.
L’équation change avec une version quantifiée. Des quantifications GGUF existent, et l’exécution sur du matériel déjà disponible réduit le coût marginal à celui de l’électricité. Notre guide d’exécution locale explique les capacités de chaque niveau matériel.
Le forfait de codage peut coûter moins cher
Si vous êtes une personne qui code dans Claude Code ou Cline plutôt qu’une application qui effectue des appels API, la facturation au jeton n’est peut-être pas le bon modèle.
Le forfait de codage GLM commence autour de 18 $ par mois, inclut GLM-5.3-Flash et fournirait apparemment trois fois le quota utilisable de GLM-5.3. La documentation de Z.ai indique aussi que les appels effectués en heures creuses consomment la moitié des points standards.
Pour une personne qui code quotidiennement, un forfait fixe est généralement moins cher et plus prévisible qu’un accès API à la consommation. Notre guide de configuration du harnais explique la mise en place. Notre comparaison des forfaits de codage met le forfait GLM face aux alternatives.
Surveillez surtout les sorties
L’entrée attire l’attention parce qu’elle représente souvent le plus gros volume. Pourtant, les budgets dérapent généralement côté sortie :
- La sortie coûte plus de trois fois l’entrée par jeton : 0,50 $ contre 0,15 $.
- Les jetons de raisonnement sont facturés comme des sorties.
- Avec
reasoning_effortréglé surmax, le modèle peut générer plusieurs fois plus de jetons que la réponse finale visible.
Une application avec une invite courte mais des réponses longues peut donc être dominée par les sorties, même si elle semble orientée vers l’entrée. Le tarif combiné de 0,10 $ suppose un ratio 7:2:1 que de nombreuses charges réelles ne respectent pas.
Mesurez au lieu d’estimer. Chaque réponse de complétion contient un objet usage indiquant les jetons consommés pour l’appel. Enregistrez ces valeurs, agrégerez-les et comparez le ratio réel avec votre hypothèse budgétaire.
Si les sorties dépassent environ 15 % du total des jetons, vérifiez d’abord reasoning_effort, puis la longueur des invites.
À faire avant le 9 septembre
Pendant la période de remise :
- Mesurez votre répartition réelle. Le tarif combiné repose sur un ratio 7:2:1. Si vos sorties sont nombreuses, votre coût effectif se rapprochera davantage de 0,50 $ que de 0,10 $ par million.
- Contrôlez le taux d’accès au cache. Avec un écart de prix de cinq fois entre une entrée mise en cache et une nouvelle entrée, c’est votre principal levier.
- Recalculez au prix catalogue. Tout double le 10 septembre. Si votre charge de travail n’est rentable qu’au tarif promotionnel, corrigez-la maintenant.
Pour suivre l’utilisation réelle, capturez les réponses de complétion : l’objet usage contient les comptes d’entrée, de sortie et de cache nécessaires. Exécutez vos appels représentatifs comme une collection enregistrée dans Apidog, avec l’identifiant du modèle comme variable d’environnement. Vous pourrez comparer les factures par requête et rejouer la même suite contre GLM-5.3 plutôt que de vous fier au marketing.
FAQ
GLM-5.3-Flash est-il gratuit ?
Non. Il a été gratuit pendant environ une semaine lorsqu’il fonctionnait anonymement sous le nom « ox-alpha », avant son lancement. La remise actuelle de 50 % ne signifie pas qu’il est gratuit.
Quand la remise se termine-t-elle exactement ?
Le 9 septembre 2026. Le prix catalogue s’applique à partir de cette date.
Pourquoi les prix diffèrent-ils selon les sites ?
Certains affichent le tarif promotionnel, d’autres le prix catalogue, et les revendeurs ajoutent leur propre marge. Vérifiez toujours le fournisseur que vous appelez réellement.
Les images coûtent-elles plus cher ?
Les images consomment des jetons de contexte et sont facturées comme des entrées. Il n’existe pas de supplément image séparé, mais une image haute résolution peut consommer beaucoup de jetons.
L’auto-hébergement est-il moins cher ?
Seulement à très grand volume régulier, ou sur du matériel que vous possédez déjà avec une version quantifiée. À 0,15 $ par million de jetons d’entrée, louer un nœud H200 à huit GPU est difficile à justifier uniquement par le coût.
Top comments (0)