DEV Community

Cover image for Tarification Kimi K3 : Coûts API et l'économie du cache
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Tarification Kimi K3 : Coûts API et l'économie du cache

Kimi K3 a été lancé le 16 juillet 2026. Sa tarification semble simple, jusqu'à ce que vous remarquiez deux prix d'entrée : 0,30 $ par million de tokens pour les entrées en cache (cache-hit), 3,00 $ pour les entrées hors cache (cache-miss) et 15,00 $ pour les sorties. Le coût qui détermine réellement votre facture n'est pas le tarif affiché de 3,00 $, mais votre taux d'entrée combiné. Sur des charges de travail de code avec un cache efficace, ce taux se rapproche davantage de 0,30 $. Voici comment calculer votre coût effectif, l'appliquer à une tâche agentique et comparer Kimi K3 à Claude Opus 4.8, GPT-5.6 Sol et DeepSeek V4.

Essayez Apidog dès aujourd'hui

TL;DR

Kimi K3 facture :

  • 0,30 $ / 1M tokens pour les entrées en cache ;
  • 3,00 $ / 1M tokens pour les entrées hors cache ;
  • 15,00 $ / 1M tokens pour les sorties.

Moonshot indique un taux de cache-hit supérieur à 90 % pour des charges de travail de codage via l'architecture d'inférence désagrégée Mooncake. Avec 90 % de cache-hit, le coût effectif des entrées tombe à environ 0,57 $ par million de tokens.

La conséquence pratique est simple :

  1. stabilisez vos préfixes de prompt pour maximiser le cache ;
  2. limitez les sorties, car elles constituent le poste le plus coûteux ;
  3. mesurez vos propres compteurs de tokens plutôt que de vous fier à un taux théorique.

Vous pouvez inspecter l'utilisation des tokens de chaque réponse dans Apidog pendant vos tests.

Les prix affichés

Pour le modèle kimi-k3, Moonshot publie les tarifs suivants :

Type de token Prix par 1M de tokens
Entrée en cache (cache-hit) 0,30 $
Entrée hors cache (cache-miss) 3,00 $
Sortie 15,00 $

L'écart est important :

  • une entrée hors cache coûte 10× plus qu'une entrée en cache ;
  • une sortie coûte 5× plus qu'une entrée hors cache ;
  • une sortie coûte 50× plus qu'une entrée en cache.

Ne partez donc pas du principe que tous les tokens d'entrée sont facturés à 3,00 $. À l'inverse, ne traitez pas les tokens de sortie comme un détail : ils peuvent rapidement dominer votre facture.

Pour le contexte sur le modèle, consultez notre explication de Kimi K3. Pour la configuration des requêtes, les URL de base et les SDK, consultez le guide API de Kimi K3.

Illustration de la tarification Kimi K3

Calculer le coût réel des entrées

La mise en cache des prompts détermine l'écart entre le prix affiché et le prix effectivement payé.

Lorsqu'un préfixe de prompt est réutilisé, le fournisseur peut le relire depuis le cache plutôt que de le retraiter. Les tokens réutilisés sont alors facturés au tarif cache-hit de 0,30 $, au lieu du tarif cache-miss de 3,00 $.

Moonshot indique que Kimi K3 utilise l'architecture d'inférence désagrégée Mooncake, qui sépare les étapes de préremplissage et de décodage. Selon l'entreprise, cette architecture atteint plus de 90 % de cache-hit sur des charges de travail de code.

Formule du taux d'entrée combiné

Utilisez cette formule :

coût_entrée_combiné =
  (taux_cache_hit × prix_cache_hit)
  + ((1 - taux_cache_hit) × prix_cache_miss)
Enter fullscreen mode Exit fullscreen mode

Avec un taux de cache-hit de 90 % :

(0,90 × 0,30 $) + (0,10 × 3,00 $)
= 0,27 $ + 0,30 $
= 0,57 $ par million de tokens
Enter fullscreen mode Exit fullscreen mode

Avec un taux de cache-hit de 95 % :

(0,95 × 0,30 $) + (0,05 × 3,00 $)
= 0,285 $ + 0,15 $
= 0,435 $ par million de tokens
Enter fullscreen mode Exit fullscreen mode

Votre taux réel dépend de la stabilité de vos prompts :

  • un agent qui réutilise le même prompt système, les mêmes outils et le même contexte de dépôt peut bien se mettre en cache ;
  • un chatbot avec des prompts fortement variables aura probablement un taux de hit inférieur.

Mesurez donc votre propre ratio avant de bâtir un budget dessus.

Exemple : coût d'une tâche de codage agentique

Supposons une session de codage contre un dépôt de taille moyenne.

Sur l'ensemble des tours, le modèle consomme :

  • 2 000 000 tokens d'entrée ;
  • 200 000 tokens de sortie.

Le volume d'entrée est élevé car le contexte est renvoyé à chaque tour.

Scénario 1 : aucun cache

Entrée :
2 000 000 × 3,00 $ / 1 000 000 = 6,00 $

Sortie :
200 000 × 15,00 $ / 1 000 000 = 3,00 $

Total :
9,00 $
Enter fullscreen mode Exit fullscreen mode

Scénario 2 : 90 % de cache-hit

Entrée en cache :
1 800 000 × 0,30 $ / 1 000 000 = 0,54 $

Entrée hors cache :
200 000 × 3,00 $ / 1 000 000 = 0,60 $

Sous-total entrée :
1,14 $

Sortie :
200 000 × 15,00 $ / 1 000 000 = 3,00 $

Total :
4,14 $
Enter fullscreen mode Exit fullscreen mode

La mise en cache réduit :

  • le coût d'entrée de 6,00 $ à 1,14 $ ;
  • le coût total de 9,00 $ à 4,14 $.

Soit une économie de 54 % sur cette tâche.

Le point clé : la sortie reste à 3,00 $ dans les deux scénarios. Vous pouvez mettre en cache le contexte réutilisé, mais pas le texte que le modèle doit encore générer.

Optimiser votre facture Kimi K3

Kimi K3 est bon marché à alimenter, mais coûteux à faire parler.

Actions à privilégier

  • Limitez les sorties. Demandez un diff ou un résultat structuré au lieu d'une longue explication non nécessaire.
  • Fixez max_tokens lorsque votre tâche a une limite claire.
  • Stabilisez les préfixes. Gardez le prompt système, les schémas d'outils et le bloc de contexte identiques, idéalement au niveau des octets.
  • Réutilisez le contexte chaud. Groupez les appels liés plutôt que de démarrer un nouveau contexte à chaque requête.
  • Retournez des formats contraints. Par exemple, JSON, listes courtes ou patchs ciblés lorsque cela suffit.

Exemple de consigne concise :

Analyse ce fichier et retourne uniquement :
1. les erreurs bloquantes ;
2. un patch unifié ;
3. les commandes de validation.

Ne fournis pas d'explication générale.
Enter fullscreen mode Exit fullscreen mode

Ce qu'il ne faut pas optimiser aveuglément

Réduire l'entrée n'est pas toujours le meilleur levier.

Si le contexte est déjà mis en cache, son coût est faible. Supprimer des informations utiles peut dégrader la réponse, déclencher des questions de clarification et générer davantage de tokens de sortie, qui sont beaucoup plus chers.

Comparaison avec d'autres modèles

Les prix évoluent : vérifiez toujours les tarifs actuels avant de prendre une décision de production.

Modèle Entrée (par 1M) Sortie (par 1M) Notes
Kimi K3 0,30 $ en cache / 3,00 $ hors cache 15,00 $ Contexte de 1M, poids ouverts vers le 27 juillet
Claude Opus 4.8 5,00 $ 25,00 $ Niveau Premium ; vérifier les prix actuels
GPT-5.6 Sol ~5,00 $ ~30,00 $ Niveau phare ; des niveaux GPT-5.6 moins chers existent
DeepSeek V4 Niveau valeur Niveau valeur Confirmer les tarifs actuels

Face à Claude Opus 4.8

Selon les tarifs affichés, Kimi K3 est moins cher sur tous les axes que Claude Opus 4.8 :

  • entrée hors cache Kimi K3 : 3,00 $ ;
  • entrée Opus 4.8 : 5,00 $ ;
  • sortie Kimi K3 : 15,00 $ ;
  • sortie Opus 4.8 : 25,00 $.

Sur la tâche précédente de 2M tokens d'entrée et 200K tokens de sortie :

Claude Opus 4.8 :
2M × 5,00 $ / 1M = 10,00 $ d'entrée
200K × 25,00 $ / 1M = 5,00 $ de sortie
Total ≈ 15,00 $
Enter fullscreen mode Exit fullscreen mode

À comparer avec 4,14 $ pour Kimi K3 avec 90 % de cache-hit.

Anthropic propose également une mise en cache de prompts, ce qui peut réduire le coût réel d'Opus. Cette comparaison reste donc une indication tarifaire, pas un benchmark définitif. Consultez le prix de Claude Opus 4.8.

Face à GPT-5.6

Selon nos analyses, GPT-5.6 Sol se situe autour de :

  • 5 $ par million de tokens d'entrée ;
  • 30 $ par million de tokens de sortie.

Kimi K3 est donc moins cher que GPT-5.6 Sol. Cependant, GPT-5.6 propose aussi des niveaux Terra et Luna moins coûteux. Le bon choix dépend du compromis acceptable sur la capacité et la qualité.

Consultez la tarification GPT-5.6 avant de décider.

Face à DeepSeek V4

DeepSeek V4 est également positionné comme une option de valeur. Il peut être moins cher que Kimi K3 sur le prix brut des sorties.

Kimi K3 compense avec :

  • un contexte de 1M ;
  • un tarif de cache-hit très bas sur les entrées ;
  • un avantage potentiel pour les charges de travail qui réutilisent fortement leur contexte.

Pour un agent gourmand en entrée avec des préfixes stables, cet écart peut se réduire, voire s'inverser. Vérifiez la tarification DeepSeek V4.

Mesurer les tokens et le cache-hit avec Apidog

Le calcul n'est utile que si vous observez vos chiffres réels.

Chaque réponse Kimi K3 renvoie un objet d'utilisation contenant les compteurs de :

  • tokens d'entrée ;
  • tokens de sortie ;
  • tokens issus du cache-hit.

Inspection de l'utilisation des tokens dans Apidog

Pour tester votre taux de cache-hit :

  1. configurez Apidog avec l'URL de base Kimi K3, votre jeton porteur et le modèle kimi-k3 ;
  2. envoyez une requête représentative ;
  3. renvoyez la même requête avec le même préfixe ;
  4. comparez les objets d'utilisation des deux réponses ;
  5. calculez votre ratio de cache-hit et injectez-le dans la formule de coût combiné.

Kimi K3 étant compatible avec l'OpenAI SDK, sa configuration suit le format habituel d'une API de style OpenAI.

Vous pouvez aussi comparer deux modèles sur votre trafic réel :

  1. enregistrez la même requête pour kimi-k3 et votre modèle actuel ;
  2. exécutez les deux requêtes ;
  3. comparez la qualité des réponses ;
  4. relevez les compteurs de tokens ;
  5. calculez le delta de coût à partir de vos propres volumes.

Si vous travaillez depuis votre éditeur, consultez le guide pour utiliser Apidog dans VS Code. Vous pouvez aussi télécharger Apidog pour configurer ce test.

Verdict

Kimi K3 est bon marché à alimenter et coûteux à faire parler.

Avec le tarif de 0,30 $ pour les entrées en cache et le taux de hit supérieur à 90 % rapporté par Moonshot pour les charges de travail de code, le coût effectif des entrées peut se rapprocher du plancher tarifaire. Les sorties à 15,00 $ par million de tokens restent le principal poste à surveiller.

Pour contrôler votre budget :

  • exploitez la mise en cache ;
  • gardez les préfixes stables ;
  • limitez les sorties ;
  • mesurez votre propre taux de hit ;
  • comparez les modèles sur des requêtes représentatives.

Kimi K3 est moins cher que Claude Opus 4.8 selon les tarifs affichés et moins cher que GPT-5.6 Sol. Face à DeepSeek V4, le résultat dépendra surtout de l'intensité de vos entrées et de l'efficacité du cache.

Pour valider l'économie sur votre charge réelle, téléchargez Apidog, envoyez plusieurs requêtes représentatives à kimi-k3 et inspectez directement les compteurs de cache-hit dans l'objet d'utilisation.

FAQ

Combien coûte l'API Kimi K3 ?

Kimi K3 coûte 0,30 $ par million de tokens pour les entrées en cache, 3,00 $ pour les entrées hors cache et 15,00 $ pour les sorties sur l'API directe de Moonshot.

Des listes tierces comme OpenRouter affichent un prix fixe de 3,00 $ en entrée et 15,00 $ en sortie, sans niveau distinct de cache-hit. Consultez le guide de l'API Kimi K3 pour la configuration des requêtes.

Qu'est-ce que le taux de cache-hit et pourquoi est-il important ?

Le taux de cache-hit représente la part des tokens d'entrée réutilisés depuis le cache. Moonshot rapporte un taux supérieur à 90 % pour des charges de travail de code via l'inférence désagrégée Mooncake.

C'est important car les tokens en cache coûtent 0,30 $ au lieu de 3,00 $. Avec 90 % de cache-hit, le coût combiné des entrées est d'environ 0,57 $ par million de tokens.

Kimi K3 est-il moins cher que Claude Opus 4.8 ?

Oui, selon les prix affichés.

Kimi K3 facture 15,00 $ par million de tokens de sortie, contre 25,00 $ pour Claude Opus 4.8. Son entrée hors cache est également inférieure au tarif d'entrée d'Opus.

Dans l'exemple de 2M tokens d'entrée et 200K tokens de sortie :

  • Kimi K3 avec cache : environ 4,14 $ ;
  • Claude Opus 4.8 aux tarifs affichés : environ 15,00 $.

Anthropic propose sa propre mise en cache, qui réduit potentiellement cet écart. Consultez la tarification de Claude Opus 4.8 et la comparaison Kimi K3 vs Claude Opus 4.8.

Comment Kimi K3 se compare-t-il à GPT-5.6 et DeepSeek V4 ?

Kimi K3 est moins cher que GPT-5.6 Sol, estimé autour de 5 $ en entrée et 30 $ en sortie. GPT-5.6 propose toutefois des niveaux Terra et Luna moins chers.

DeepSeek V4 est une autre option de valeur qui peut être plus compétitive sur le prix brut des sorties. Si votre charge de travail réutilise beaucoup de contexte, les entrées en cache de Kimi K3 peuvent réduire ou inverser l'écart.

Vérifiez les tarifs actuels via la tarification de GPT-5.6 et la tarification de DeepSeek V4.

Comment réduire ma facture Kimi K3 ?

Concentrez-vous principalement sur les sorties :

  • limitez max_tokens ;
  • demandez des réponses concises ;
  • utilisez des formats de sortie contraints ;
  • maintenez un prompt système et un préfixe de contexte stables ;
  • réutilisez le même contexte pour les appels liés.

Réduire l'entrée aide moins lorsque le cache est efficace, car l'entrée mise en cache est déjà peu coûteuse.

Comment vérifier mon taux de cache-hit réel ?

Inspectez l'objet d'utilisation renvoyé par chaque réponse Kimi K3. Il contient les compteurs de tokens d'entrée, de sortie et de cache-hit.

Envoyez deux fois la même requête via Apidog, puis comparez les compteurs de cache-hit. Vous pourrez ainsi calculer le taux réellement obtenu par votre charge de travail et l'utiliser dans votre formule de coût combiné.

Top comments (0)