DEV Community

Cover image for Kimi K3 : Qu'est-ce que c'est ? Le fleuron ouvert 2.8T de Moonshot
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Kimi K3 : Qu'est-ce que c'est ? Le fleuron ouvert 2.8T de Moonshot

Moonshot AI a lancé Kimi K3 le 16 juillet 2026 en le présentant comme « le premier modèle ouvert de classe 3T au monde ». Derrière cette formule, on trouve un modèle Mixture-of-Experts (MoE) de 2,8 billions de paramètres, une fenêtre de contexte de 1 million de tokens, une nouvelle pile d’attention et une API compatible OpenAI. K3 est disponible sur Kimi.com, Kimi Work, Kimi Code et l’API Kimi. Moonshot a annoncé la publication des poids complets d’ici le 27 juillet 2026. Ce guide explique comment l’évaluer, l’appeler via API, estimer son coût et décider s’il convient à votre stack.

Essayez Apidog dès aujourd’hui

TL;DR : qu’est-ce que Kimi K3 ?

Kimi K3 est le modèle de langage phare de Moonshot AI. Ses caractéristiques principales :

  • Architecture : Mixture-of-Experts, 2,8 billions de paramètres totaux
  • Routage : 16 experts activés sur 896 par token
  • Contexte : 1 048 576 tokens
  • ID API : kimi-k3
  • Compatibilité : SDK OpenAI
  • Prix d’entrée avec cache-hit : 0,30 $ / 1M tokens
  • Prix d’entrée sans cache : 3,00 $ / 1M tokens
  • Prix de sortie : 15,00 $ / 1M tokens
  • Artificial Analysis Intelligence Index : score de 57, rang #4 sur 189 modèles
  • Poids ouverts : annoncés pour le 27 juillet 2026

Moonshot indique explicitement que K3 reste derrière Claude Fable 5 et GPT-5.6 Sol. Il faut donc le positionner comme un modèle ouvert très proche de la frontière, et non comme le meilleur modèle absolu.

Pourquoi Kimi K3 mérite un test

Pour une équipe de développement, l’intérêt de K3 repose sur trois éléments :

  1. Une qualité proche des modèles de frontière
  2. Un coût d’entrée fortement réduit lorsque le cache est réutilisé
  3. Une compatibilité OpenAI qui réduit le coût d’intégration

Kimi K3

Si votre application appelle déjà une API de style OpenAI, vous pouvez généralement rediriger votre client vers l’endpoint Kimi, définir model: "kimi-k3" et commencer vos tests.

Vous pouvez aussi tester les requêtes, le streaming SSE et les appels d’outils dans Apidog. L’objectif est de valider le comportement réel du modèle avant de l’insérer dans une boucle d’agent ou un service de production.

Pour approfondir :

Écosystème Kimi K3

Positionnement : un modèle ouvert de classe 3T

Moonshot présente K3 comme son modèle le plus performant, successeur de la gamme K2.

Si vous avez déjà utilisé Kimi K2 ou Kimi K2.7 Code, K3 correspond à une nouvelle génération avec une couche d’attention reconstruite.

L’expression « modèle ouvert de classe 3T » doit être lue avec précision :

  • Ouvert : les poids n’étaient pas disponibles le jour du lancement. Moonshot a annoncé leur publication d’ici le 27 juillet 2026.
  • Classe 3T : K3 contient 2,8 billions de paramètres au total.
  • MoE sparse : seuls 16 experts sur 896 sont activés pour chaque token, ce qui limite le coût de calcul pendant l’inférence.

Autrement dit, K3 vise une échelle de paramètres comparable aux très grands modèles propriétaires tout en conservant une inférence plus abordable qu’un modèle dense de taille équivalente.

Architecture : ce qui change sous le capot

K3 ne se limite pas à augmenter la taille de K2. Moonshot met en avant plusieurs composants d’architecture.

Kimi Delta Attention (KDA)

KDA est un mécanisme d’attention linéaire hybride. Son rôle est de mieux contrôler la croissance des besoins mémoire et calcul lorsque le contexte augmente.

C’est une partie importante de la stratégie qui rend une fenêtre de contexte de 1 million de tokens exploitable.

Résidus d’attention (AttnRes)

AttnRes remplace les connexions résiduelles standard par un mécanisme conçu pour récupérer plus sélectivement les représentations des couches précédentes.

L’objectif : conserver les informations importantes à travers une pile profonde de couches, plutôt que de diluer le contexte au fil du réseau.

Stable LatentMoE

La couche MoE de K3 utilise :

  • 896 experts au total ;
  • 16 experts activés par token ;
  • un mécanisme de routage nommé Quantile Balancing.

Ce routage sparse explique le compromis central de K3 : le modèle peut stocker une grande capacité dans ses paramètres totaux sans exécuter l’ensemble du réseau pour chaque token.

Moonshot mentionne également :

  • Per-Head Muon ;
  • SiTU ;
  • Gated MLA ;
  • quantification avec poids MXFP4 et activations MXFP8.

Spécifications de Kimi K3

Spécification Kimi K3
Développeur Moonshot AI
Date de sortie 16 juillet 2026
Paramètres totaux 2,8 billions, Mixture-of-Experts
Experts actifs 16 sur 896 par token
Fenêtre de contexte 1 048 576 tokens
ID de modèle API kimi-k3
Slug OpenRouter moonshotai/kimi-k3
Compatibilité API Compatible OpenAI SDK
Entrée avec cache-hit 0,30 $ / 1M tokens
Entrée avec cache-miss 3,00 $ / 1M tokens
Sortie 15,00 $ / 1M tokens
Vitesse de sortie Environ 62 tokens/s
Temps avant le premier token Environ 1,99 s
Artificial Analysis Intelligence Index 57, rang #4 sur 189
Poids ouverts Attendus vers le 27 juillet 2026

Pour calculer le coût selon votre trafic réel, consultez le guide de tarification Kimi K3.

Contexte de 1M : exploiter le cache pour réduire les coûts

Une fenêtre de 1 048 576 tokens permet notamment de transmettre :

  • un dépôt de code important ;
  • un corpus documentaire ;
  • de longues transcriptions ;
  • une invite système très détaillée ;
  • une arborescence de fichiers et des instructions d’agent répétées.

Le point clé est la différence entre les deux prix d’entrée :

Type d’entrée Prix
Cache-hit 0,30 $ / 1M tokens
Cache-miss 3,00 $ / 1M tokens

Un cache-hit coûte donc dix fois moins cher qu’un cache-miss.

Pour en profiter, structurez vos appels afin de réutiliser les parties stables du contexte :

  1. Placez les règles globales et instructions système au début.
  2. Gardez les fichiers ou documents communs dans une portion stable de l’invite.
  3. Ajoutez les changements spécifiques à la demande à la fin.
  4. Réutilisez le même préfixe lors des étapes successives d’un agent.

Ce modèle est particulièrement pertinent pour les agents de code qui renvoient à chaque itération :

  • les règles du dépôt ;
  • le contexte d’architecture ;
  • les fichiers ouverts ;
  • les conventions de contribution.

Moonshot indique que son inférence Mooncake peut atteindre plus de 90 % de cache-hit pour certaines charges de travail de codage. Il s’agit d’une donnée annoncée par Moonshot : mesurez votre propre taux de cache-hit avant d’établir une prévision budgétaire.

Latence et débit

Artificial Analysis a mesuré :

  • environ 62 tokens de sortie par seconde ;
  • environ 1,99 seconde avant le premier token.

Le débit de sortie est inférieur à la médiane de catégorie de 72,7 tokens/s, tandis que le temps avant le premier token est légèrement meilleur.

En pratique :

  • choisissez K3 pour les tâches longues, raisonnées et sensibles au coût de contexte ;
  • comparez-le à des modèles plus rapides si votre produit dépend d’une latence de génération minimale ;
  • testez plusieurs réglages d’effort de raisonnement, car K3 privilégie par défaut un effort élevé.

Positionnement honnête face aux modèles fermés

Le blog officiel de lancement de Kimi K3 reconnaît que K3 reste derrière Claude Fable 5 et GPT-5.6 Sol, tout en présentant ses résultats comme proches du niveau de frontière.

Les chiffres indépendants apportent du contexte :

La conclusion pratique est simple :

  • pour la qualité maximale absolue sur des tâches très difficiles, les modèles fermés de tête restent devant ;
  • pour un modèle proche de la frontière, avec une voie de poids ouverts annoncée et un coût de contexte potentiellement faible, K3 est un candidat sérieux.

Comparaisons directes :

Où utiliser Kimi K3

Surface Utilisation
Kimi.com Application de chat web, K3 comme modèle par défaut
Kimi Work Espace de travail collaboratif
Kimi Code Agent de codage en terminal
Kimi API Accès programmatique avec kimi-k3
Applications mobiles iOS, Android et HarmonyOS
Bureau Kimi Work 3.1.0 et versions ultérieures
OpenRouter Accès via moonshotai/kimi-k3

Pour le terminal, consultez le tutoriel CLI de Kimi Code.

Pour comparer K3 à la génération précédente orientée code :

Pour évaluer le modèle sans coût :

Capacités exposées par l’API

L’API K3 expose les fonctionnalités attendues pour des applications agentiques et de sortie structurée :

  • mise en cache du contexte ;
  • appels d’outils ;
  • contraintes de choix d’outils ;
  • mode JSON ;
  • sortie structurée ;
  • complétions partielles ;
  • recherche Internet ;
  • chargement dynamique d’outils ;
  • effort de raisonnement configurable, y compris max.

Ces capacités permettent d’intégrer K3 dans :

  • des agents de code ;
  • des pipelines d’extraction JSON ;
  • des workflows d’appels de fonctions ;
  • des assistants métier connectés à des outils internes.

Intégrer Kimi K3 avec le SDK OpenAI

Moonshot fournit une API compatible avec le SDK OpenAI. Vérifiez l’URL de base actuelle dans la console platform.kimi.ai avant de la coder en dur.

Voici une structure d’intégration typique en JavaScript :

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.KIMI_API_KEY,
  baseURL: process.env.KIMI_BASE_URL,
});

const completion = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    {
      role: "system",
      content: "Tu es un assistant technique. Réponds avec des étapes vérifiables.",
    },
    {
      role: "user",
      content: "Analyse cette erreur de build et propose un correctif.",
    },
  ],
});

console.log(completion.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

Pour tester le streaming, activez stream: true :

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  stream: true,
  messages: [
    {
      role: "user",
      content: "Explique ce fichier TypeScript étape par étape.",
    },
  ],
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
Enter fullscreen mode Exit fullscreen mode

Avant de déployer, vérifiez au minimum :

  1. la forme exacte des réponses ;
  2. le comportement des chunks SSE ;
  3. les limites de taille d’invite ;
  4. les erreurs HTTP et les tentatives de reprise ;
  5. la structure des tool_calls ;
  6. le coût avec et sans cache-hit ;
  7. la latence selon l’effort de raisonnement.

Le détail des requêtes et réponses est disponible dans le guide de l’API Kimi K3.

Tester Kimi K3 avant le déploiement

Avant d’ajouter K3 à un agent, testez l’endpoint indépendamment de votre application.

Tester Kimi K3 avec Apidog

Avec Apidog, vous pouvez créer une requête de complétion de chat, stocker la clé API dans une variable d’environnement et activer le streaming.

Exemple de corps de requête à valider :

{
  "model": "kimi-k3",
  "stream": true,
  "messages": [
    {
      "role": "system",
      "content": "Tu es un assistant de développement."
    },
    {
      "role": "user",
      "content": "Résume les risques de cette modification."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Pour un appel d’outil, inspectez en particulier :

  • le champ tool_calls ;
  • le nom de l’outil sélectionné ;
  • la validité des arguments JSON ;
  • la réaction du modèle lorsque l’outil échoue ;
  • le comportement de reprise après un résultat d’outil.

Cette validation évite de découvrir en production que votre parseur SSE, votre schéma JSON ou votre boucle d’agent ne gère pas correctement la réponse du modèle.

Foire aux questions

Qu’est-ce que Kimi K3 ?

Kimi K3 est le modèle de langage phare de Moonshot AI, lancé le 16 juillet 2026. Il s’agit d’un modèle MoE de 2,8 billions de paramètres avec une fenêtre de contexte de 1 million de tokens. Son ID API est kimi-k3.

Combien de paramètres Kimi K3 possède-t-il ?

K3 possède 2,8 billions de paramètres au total. Il active 16 experts sur 896 par token. Moonshot n’a pas publié le nombre exact de paramètres actifs ; évitez donc de citer un chiffre précis de paramètres actifs comme un fait.

Combien coûte l’API Kimi K3 ?

Les tarifs annoncés sont :

  • 0,30 $ / 1M tokens d’entrée avec cache-hit ;
  • 3,00 $ / 1M tokens d’entrée avec cache-miss ;
  • 15,00 $ / 1M tokens de sortie.

Consultez la répartition des prix pour un calcul détaillé.

Kimi K3 est-il open source ?

Pas le jour du lancement. Moonshot a annoncé la publication des poids complets d’ici le 27 juillet 2026. Avant cette date, K3 est accessible via les produits hébergés et l’API payante.

Kimi K3 est-il meilleur que Claude Fable 5 ou GPT-5.6 Sol ?

Non, selon Moonshot lui-même. K3 se positionne comme un modèle proche de la frontière, mais les modèles propriétaires les plus puissants restent devant.

Puis-je utiliser Kimi K3 avec le SDK OpenAI ?

Oui. L’API Moonshot est compatible avec le SDK OpenAI. Vérifiez l’URL de base actuelle dans platform.kimi.ai, configurez votre client et utilisez model: "kimi-k3".

Vous pouvez d’abord vérifier vos requêtes dans Apidog.

Quelle est la vitesse de Kimi K3 ?

Artificial Analysis rapporte environ 62 tokens de sortie par seconde et environ 1,99 seconde avant le premier token. K3 favorise davantage la profondeur de raisonnement que la vitesse maximale.

Comment Kimi K3 se compare-t-il à Kimi K2.7 Code ?

K3 est le modèle de nouvelle génération au-dessus de la ligne K2, avec une pile d’attention reconstruite. K2.7 Code reste une option orientée spécifiquement vers le code. Consultez Kimi K3 vs Kimi K2.7 Code.

Top comments (0)