DEV Community

Cover image for Kimi K3 vs Kimi K2.7 Code : Qu'est-ce qui a vraiment changé ?
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Kimi K3 vs Kimi K2.7 Code : Qu'est-ce qui a vraiment changé ?

Si vous utilisez déjà Kimi, le lancement de Kimi K3 le 16 juillet 2026 pose une question pratique : devez-vous migrer, ou pouvez-vous conserver Kimi K2.7 Code ? K2.7 Code est la version orientée codage de la gamme K2, souvent intégrée à des agents et pipelines CI. K3 est différent : il s’agit du nouveau fleuron de Moonshot, construit à une échelle bien plus grande, avec une nouvelle conception de l’attention et une fenêtre contextuelle de 1 million de tokens. Voici comment évaluer une migration sans réécrire votre production à l’aveugle.

Essayez Apidog dès aujourd’hui

Les deux modèles exposent une API compatible OpenAI. Vous pouvez donc envoyer exactement la même requête à kimi-k3 et kimi-k2-7-code, puis comparer qualité, latence et consommation de tokens dans Apidog avant de modifier votre intégration.

TL;DR : le verdict

  • K3 est plus grand et plus généraliste. C’est un modèle MoE de 2,8 T de paramètres, contre une lignée K2 autour de 1 T de paramètres. K2.7 Code est un spécialiste du code ; K3 est un fleuron généraliste qui reste performant pour le codage agentique.
  • Le contexte atteint 1M de tokens. K3 accepte jusqu’à 1 048 576 tokens.
  • L’architecture change réellement. Kimi Delta Attention, Attention Residuals et Stable LatentMoE font partie de la différence, au-delà de la taille.
  • La tarification augmente. K3 coûte 0,30 $/M de tokens d’entrée avec cache, 3 $/M sans cache et 15 $/M en sortie.
  • K3 n’est pas le leader absolu. Moonshot indique lui-même qu’il reste derrière Claude Fable 5 et GPT-5.6 Sol globalement.
  • Migrez si vous avez besoin d’un contexte massif, de raisonnement général ou d’agents de longue durée. Restez sur K2.7 Code si vos tâches de code ciblées atteignent déjà votre niveau de qualité et votre budget.

Deux modèles conçus pour des usages différents

Avant de comparer les chiffres, retenez ceci : K2.7 Code et K3 ne ciblent pas exactement le même problème.

Kimi K2.7 Code est le modèle orienté développement de la lignée K2 : génération, modification et correction de code, ainsi que tâches agentiques pour développeurs. Si votre besoin est principalement « écrire ou corriger du code via API », c’était un choix spécialisé et économiquement cohérent.

Pour les paramètres exacts, le contexte et les prix de K2.7 Code, consultez notre guide : Qu’est-ce que Kimi K2.7 Code ?.

K3 n’est pas une simple nouvelle version de modèle de code. C’est le nouveau fleuron généraliste de Moonshot, avec le codage comme capacité forte parmi un ensemble plus large. Votre décision consiste donc à comparer :

  • un spécialiste du codage ;
  • un généraliste plus puissant, qui sait aussi coder.

Ce qui change réellement avec K3

Échelle : environ trois fois plus de paramètres totaux

K3 est un modèle mélange d’experts de 2,8 T de paramètres. La gamme K2 se situait autour de la classe des 1 T de paramètres.

Attention : Moonshot n’a pas publié le nombre exact de paramètres actifs de K3. Dans un modèle MoE, seule une partie des experts est activée pour chaque token. Ne déduisez donc pas le coût d’inférence à partir du seul chiffre de 2,8 T.

Architecture : une nouvelle conception de l’attention

K3 introduit trois composants nommés :

  • Kimi Delta Attention : un mécanisme hybride d’attention linéaire, mieux adapté aux très longues séquences que l’attention quadratique standard.
  • Attention Residuals : présenté par Moonshot comme un remplacement direct des connexions résiduelles standard.
  • Stable LatentMoE : le framework MoE qui active 16 experts sur 896 par token.

Moonshot rapporte une amélioration d’environ 2,5x de l’efficacité de mise à l’échelle par rapport à Kimi K2. L’écart n’est donc pas uniquement lié à la taille : K3 est construit différemment.

Contexte : jusqu’à 1M de tokens

K3 prend en charge 1 048 576 tokens de contexte.

Pour un workflow de développement, cela peut changer l’approche :

  • fournir une portion beaucoup plus large d’un monorepo ;
  • inclure davantage de tests et de logs ;
  • conserver l’historique d’un agent sur une tâche multi-étapes ;
  • réduire le découpage manuel du contexte.

Si K2.7 Code atteint régulièrement ses limites sur de grands dépôts ou de longues sessions d’agent, c’est probablement l’argument de migration le plus concret.

Positionnement : du spécialiste au généraliste

K2.7 Code est explicitement orienté code. K3 est conçu pour des tâches générales complexes, y compris le codage agentique à long terme.

Moonshot mentionne notamment des exécutions autonomes sur des problèmes complexes en plusieurs étapes, dont une exécution de 48 heures sur une tâche de conception de puce. Ne traitez pas cette anecdote comme une garantie : testez vos propres tâches. Mais l’intention produit est claire : K3 cible des agents persistants, avec de nombreux appels d’outils et un contexte durable.

Tarification : comprendre l’impact du cache

K3 est tarifé à :

Type de token Tarif K3
Entrée avec cache 0,30 $ / M
Entrée sans cache 3 $ / M
Sortie 15 $ / M

Le différentiel de 10x sur l’entrée est déterminant.

Si votre agent réutilise une grande invite système et le même contexte de dépôt sur plusieurs appels, un cache-hit élevé peut faire approcher votre coût d’entrée de 0,30 $/M. En revanche, une requête ponctuelle avec un nouveau contexte paiera le tarif cache-miss de 3 $/M.

Pour détailler ce calcul, consultez notre guide de tarification Kimi K3.

Kimi K3 vs Kimi K2.7 Code

Dimension Kimi K2.7 Code Kimi K3
Positionnement Version orientée codage de la gamme K2 Modèle généraliste phare, performant pour le codage agentique
Génération Lignée K2 Nouvelle génération K3
Paramètres totaux Classe ~1 T 2,8 T au total, MoE
Paramètres actifs Voir la documentation K2.7 Code Non publié ; 16 experts sur 896 actifs
Attention Architecture de génération K2 Kimi Delta Attention + Attention Residuals
Framework MoE MoE de génération K2 Stable LatentMoE
Contexte Voir la documentation K2.7 Code 1 048 576 tokens
ID du modèle kimi-k2-7-code kimi-k3
API Compatible OpenAI SDK Compatible OpenAI SDK
Tarification Voir la documentation K2.7 Code 0,30 $ / 3 $ en entrée, 15 $ en sortie par M
Poids ouverts Voir la couverture K2.7 Code Attendus vers le 27 juillet 2026
Meilleur cas d’usage Code ciblé à coût connu Contexte massif, agents longs, travail général + code

Pour les spécifications exactes de K2.7 Code, utilisez nos références dédiées :

Où K3 se situe face aux modèles de pointe

Ne lisez pas « 2,8 T de paramètres » comme « meilleur modèle du marché ».

Le blog de lancement de Moonshot indique que K3 reste derrière Claude Fable 5 et GPT-5.6 Sol sur le plan global. Il est compétitif sur certains benchmarks et en avance sur d’autres, mais ne revendique pas la première place universelle.

Selon Artificial Analysis, K3 atteint un indice d’intelligence de 57, classé #4 sur 189 modèles, avec une vitesse d’environ 62 tokens par seconde.

Les benchmarks publiés par Moonshot donnent une image nuancée :

Benchmark K3 Fable 5
DeepSWE 67,5 70,0
Terminal-Bench 2.1 88,3 84,6

K3 gagne certains matchs et en perd d’autres. C’est un résultat solide pour un modèle à poids ouverts, mais pas une raison de le survendre.

Consultez le post de lancement officiel de Kimi K3 et notre analyse des benchmarks Kimi K3.

Faut-il migrer vers K3 ?

Répondez à ces questions dans cet ordre.

Migrez vers K3 si…

  • Vous atteignez les limites de contexte. Les grands dépôts, refactorisations de services et longues transcriptions d’agents bénéficient directement du contexte de 1M.
  • Vos tâches sont agentiques et longues. Les workflows avec de nombreux appels d’outils et un état persistant sont explicitement visés par K3.
  • Vous avez besoin de raisonnement général. Si votre produit combine code, planification et analyse, un modèle uniquement spécialisé code peut être moins adapté.
  • Votre taux de cache-hit est élevé. La réutilisation du contexte partagé réduit fortement le coût effectif d’entrée.

Restez sur K2.7 Code si…

  • Votre charge de travail est ciblée et la qualité est déjà suffisante. Un modèle plus grand n’est pas automatiquement un meilleur investissement.
  • Votre trafic renouvelle souvent le contexte. Avec peu de cache-hit, les 3 $/M en entrée sans cache et les 15 $/M en sortie de K3 sont plus difficiles à justifier.
  • La latence est votre contrainte principale. Les ~62 tokens/s rapportés pour K3 doivent être évalués sur votre trafic réel.
  • Votre stratégie dépend de poids ouverts immédiatement disponibles. Les poids de K3 étaient annoncés pour le 27 juillet 2026 ; vérifiez la publication effective sur Hugging Face de Moonshot avant de planifier un auto-hébergement.

Scénarios concrets

Bot CI de correction de code sur un dépôt moyen

Si votre bot réussit déjà ses tests, reste dans le budget et ne souffre pas du contexte avec K2.7 Code, vous n’avez probablement pas besoin de K3.

Restez sur K2.7 Code et réévaluez uniquement si :

  • les taux d’échec augmentent ;
  • le dépôt grossit ;
  • votre agent doit traiter davantage de fichiers simultanément.

Agent de refactoring autonome sur un grand monorepo

C’est un cas d’usage plus favorable à K3 :

  • davantage de code, tests et logs peuvent être chargés ensemble ;
  • les tâches multi-fichiers bénéficient du contexte long ;
  • les exécutions à long terme correspondent au positionnement du modèle.

Dans ce cas, K3 mérite un test contrôlé.

Pour démarrer :

Comment A/B tester K2.7 Code et K3

La décision la plus fiable consiste à envoyer les mêmes requêtes aux deux modèles.

Puisqu’ils sont compatibles OpenAI SDK, le changement principal est l’ID de modèle.

from openai import OpenAI

client = OpenAI(
    api_key="VOTRE_CLE_API",
    base_url="VOTRE_ENDPOINT_MOONSHOT"
)

common_payload = {
    "messages": [
        {
            "role": "system",
            "content": "Tu es un assistant de développement. Analyse et corrige le code fourni."
        },
        {
            "role": "user",
            "content": "Voici le dépôt, les logs et les tests à corriger : ..."
        }
    ],
    "temperature": 0.2,
}

k27_result = client.chat.completions.create(
    model="kimi-k2-7-code",
    **common_payload
)

k3_result = client.chat.completions.create(
    model="kimi-k3",
    **common_payload
)
Enter fullscreen mode Exit fullscreen mode

Gardez tous les autres paramètres fixes :

  • même invite système ;
  • même message utilisateur ;
  • même température ;
  • mêmes outils ;
  • même stratégie de streaming ;
  • même jeu de tests.

Comparez ensuite trois dimensions.

1. Qualité de sortie

Évaluez les réponses avec les critères de production :

  • les tests passent-ils ?
  • le patch est-il minimal ?
  • les appels d’outils sont-ils corrects ?
  • la réponse respecte-t-elle les conventions du dépôt ?
  • l’agent termine-t-il réellement la tâche ?

Évitez une comparaison « au feeling ». Utilisez un jeu de tâches représentatif.

2. Latence

Mesurez :

  • temps jusqu’au premier token ;
  • temps total de réponse ;
  • durée des appels d’outils ;
  • débit en tokens par seconde.

Le modèle le plus capable n’est pas forcément le meilleur pour une interface interactive.

3. Coût effectif

Ne comparez pas seulement le prix affiché. Enregistrez pour chaque appel :

  • tokens d’entrée ;
  • tokens de sortie ;
  • cache-hit ou cache-miss ;
  • nombre de tours d’agent ;
  • coût total de la tâche réussie.

Une tâche plus chère par appel peut parfois coûter moins cher au total si elle nécessite moins de corrections. L’inverse est aussi vrai.

Apidog facilite ce test côte à côte :

  1. Créez une requête compatible OpenAI.
  2. Dupliquez-la.
  3. Remplacez uniquement kimi-k2-7-code par kimi-k3.
  4. Utilisez une variable d’environnement pour l’ID du modèle.
  5. Comparez les réponses, le streaming, les appels d’outils et l’usage des tokens.

Vous pouvez télécharger Apidog et, si vous travaillez dans un éditeur, utiliser Apidog dans VS Code pour garder ces requêtes à côté de votre code.

En résumé

K3 est un saut générationnel réel par rapport à K2.7 Code :

  • environ trois fois plus de paramètres totaux, à 2,8 T ;
  • une nouvelle architecture d’attention ;
  • un contexte de 1M de tokens ;
  • un positionnement généraliste et agentique ;
  • un coût plus élevé, particulièrement sans cache.

La migration n’est pas automatique.

Choisissez K3 si vous avez besoin de contexte massif, de raisonnement général ou d’agents qui opèrent longtemps. Conservez K2.7 Code si vos tâches de code ciblées atteignent déjà vos objectifs de qualité, coût et latence.

La bonne méthode reste simple : exécutez vos propres requêtes sur les deux modèles, mesurez les résultats et choisissez sur preuves.

Foire aux questions

Lequel est le meilleur pour le codage ?

K2.7 Code est conçu spécifiquement pour le codage et reste un choix rentable pour des tâches ciblées. K3 est un généraliste phare, également solide pour le codage agentique de longue durée, avec un contexte beaucoup plus large.

Pour des tâches d’agent multi-étapes sur de grands dépôts, K3 possède un avantage structurel. Pour du code ciblé que K2.7 traite déjà correctement, K2.7 Code peut rester le choix le plus rationnel en coût.

Kimi K3 est-il plus cher que K2.7 Code ?

K3 coûte 0,30 $/M en entrée avec cache, 3 $/M en entrée sans cache et 15 $/M en sortie. Son coût réel par tâche dépend toutefois de votre taux de cache-hit, de la longueur des sorties et du nombre de tours nécessaires.

Les deux modèles étant compatibles OpenAI SDK, les comparer revient surtout à changer l’ID de modèle et rejouer vos prompts.

Kimi K3 est-il open source ?

Pas le jour du lancement. Moonshot a indiqué que les poids complets étaient attendus vers le 27 juillet 2026. Avant leur publication effective, K3 est accessible via API et applications.

Considérez tout plan d’auto-hébergement comme conditionnel à cette sortie.

K3 est-il meilleur que Claude Fable 5 ou GPT-5.6 Sol ?

D’après le propre blog de Moonshot, non, pas globalement. K3 est compétitif ou en avance sur certains benchmarks, mais reste derrière ces modèles sur le plan général.

Artificial Analysis lui attribue un indice d’intelligence de 57 et une place de #4 sur 189 modèles. C’est un concurrent solide à poids ouverts, mais pas le leader incontesté de la frontière.

Top comments (0)