DEV Community

Cover image for Qwen 3.8 contre Kimi K3 : Les deux géants open-source chinois comparés
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Qwen 3.8 contre Kimi K3 : Les deux géants open-source chinois comparés

Juillet 2026 a marqué une accélération pour les modèles frontaliers chinois à poids ouverts. Moonshot AI a lancé Kimi K3 le 16 juillet, puis Alibaba a présenté Qwen 3.8-Max le 19 juillet avant sa disponibilité générale début août. Les deux modèles reposent sur une architecture mixture-of-experts (MoE), dépassent le billion de paramètres, s’intègrent à des harnais d’agents de style Claude Code et visent des coûts API inférieurs à ceux des laboratoires américains.

Essayez Apidog dès aujourd’hui

Les différences importantes concernent toutefois ce que vous pouvez réellement télécharger, les modalités d’entrée, les limites de contexte et le coût d’une charge de travail agentique. Cette comparaison reflète les informations vérifiables au 3 août 2026. Pour les spécifications détaillées du modèle Alibaba, consultez notre explication de Qwen 3.8-Max.

Note méthodologique : il n’existe pas encore de benchmark indépendant comparant directement Qwen 3.8-Max et Kimi K3 dans le même harnais. Les chiffres de benchmark cités ci-dessous proviennent des fournisseurs respectifs. Utilisez-les comme indicateurs, pas comme verdict définitif.

La chronologie : qui a livré quoi, et quand

L’ordre de sortie compte particulièrement ici : les deux fournisseurs parlent de « poids ouverts », mais un seul modèle est téléchargeable au 3 août 2026.

  • Kimi K3 a été lancé le 16 juillet 2026. Moonshot a publié les poids 11 jours plus tard, le 27 juillet, sur Hugging Face. La version MXFP4 pèse 594 Go. Vous pouvez donc déjà télécharger le modèle, le quantifier et l’exécuter sur votre propre infrastructure.
  • Qwen 3.8-Max a été annoncé le 19 juillet et est devenu disponible via Alibaba Cloud Model Studio début août, selon l’annonce officielle de Qwen. Les poids étaient annoncés pour Hugging Face et ModelScope « la semaine prochaine », soit autour du 10 août. Au 3 août, ils ne sont pas encore disponibles.

Si l’auto-hébergement est un prérequis, Kimi K3 est donc le seul choix concret à cette date.

Paramètres : deux MoE à l’échelle du billion

Les deux modèles utilisent une architecture MoE clairsemée : le nombre total de paramètres ne correspond pas au nombre de paramètres activés pour chaque token.

Spécification Qwen 3.8-Max Kimi K3
Paramètres totaux 2,4T 2,8T
Paramètres actifs par token 95B 104B
Taux d’activation ~4 % ~3,7 %
Architecture Fondation Qwen 3.5, MoE MoE
Poids ouverts Promis vers le 10 août MXFP4, 594 Go sur Hugging Face

Qwen 3.8-Max active environ 9 milliards de paramètres de moins par token que Kimi K3. Cela ne prouve pas qu’il est plus capable, mais cela influence directement le coût de service à grande échelle.

Pour l’auto-hébergement, retenez surtout les 594 Go de Kimi K3 en MXFP4. Avant même d’ajouter le cache KV pour les longs contextes, vous entrez dans une configuration multi-GPU ou multi-nœuds. Qwen 3.8-Max, avec 2,4T de paramètres au total, devrait nécessiter un volume de stockage comparable lorsque ses poids seront publiés.

Ouverture : poids disponibles ou promesse de publication

Kimi K3 est réellement ouvert aujourd’hui :

  1. les poids sont publics ;
  2. le dépôt et la licence sont vérifiables ;
  3. vous pouvez effectuer des quantifications, du fine-tuning ou de l’hébergement tiers ;
  4. vous pouvez épingler une version précise du modèle pour vos évaluations et votre conformité.

Qwen 3.8-Max pourrait devenir le premier modèle de classe Qwen-Max publié avec des poids ouverts. Ce serait un changement important, car les précédents modèles Max d’Alibaba étaient uniquement accessibles via API.

Mais tant que le dépôt n’est pas disponible, Qwen 3.8-Max reste un modèle API avec une promesse de publication.

Décision au 3 août 2026 : attribuez cet axe à Kimi K3. Réévaluez-le autour du 10 août, lorsque les poids Qwen seront potentiellement publiés.

Modalité : Qwen accepte les images, K3 reste textuel

C’est l’écart fonctionnel le plus net.

Qwen 3.8-Max accepte des entrées texte et image :

{
  "input_modalities": ["text", "image"]
}
Enter fullscreen mode Exit fullscreen mode

Alibaba présente également des démonstrations de compréhension de documents longs et de vidéo. Considérez ces éléments comme des démos de blog, et non comme des types d’entrée API garantis. En revanche, l’entrée image est documentée et disponible via l’API.

Kimi K3 est un modèle texte. Pour traiter :

  • des captures d’écran ;
  • des PDF numérisés ;
  • des interfaces utilisateur ;
  • des documents avec graphiques ou tableaux visuels ;
  • des tâches d’agent nécessitant de la vision ;

vous devrez ajouter un modèle de vision séparé à votre pipeline K3. Cela introduit du code d’orchestration, de la latence et potentiellement des coûts supplémentaires.

Choix pratique :

  • Charges de travail exclusivement textuelles : cet axe est secondaire.
  • Analyse documentaire, OCR, agents navigateur ou UI : Qwen 3.8-Max est le choix naturel.

Contexte, sortie et compatibilité API

Qwen 3.8-Max propose :

  • une fenêtre contextuelle de 1 000 000 tokens ;
  • une sortie maximale de 65 536 tokens ;
  • un paramètre reasoning_effort avec les niveaux xhigh, medium et low ;
  • la conservation de la sortie de raisonnement par défaut ;
  • le même tarif pour les modes raisonnement et non-raisonnement.

L’accès passe par Alibaba Cloud Model Studio, avec des endpoints régionaux à Pékin, Singapour et US-Virginie. La plateforme fournit deux formats de protocole :

  • un endpoint compatible OpenAI ;
  • un endpoint compatible Anthropic.

Cette compatibilité Anthropic permet d’utiliser Qwen 3.8-Max dans un harnais compatible Claude Code avec une configuration minimale :

export ANTHROPIC_BASE_URL="https://votre-endpoint-dashscope"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

La disponibilité régionale est décrite dans la page des modèles de Model Studio. Si vous testez plusieurs régions ou fournisseurs, Apidog permet de définir chaque URL de base dans un environnement séparé, puis de changer de cible sans modifier vos requêtes.

Kimi K3 prend également en charge le protocole Anthropic et peut être branché dans des harnais de style Claude Code. Pour les URLs d’endpoint et les limites actuelles, consultez notre explication de Kimi K3.

Tarification : Qwen favorise les charges riches en sortie

Tarifs publiés par million de tokens :

Tarif Qwen 3.8-Max Kimi K3
Entrée 2,00 $ 3,00 $
Sortie 6,00 $ 15,00 $
Entrée avec cache 0,20 $ 0,30 $
Nivellement Forfait jusqu’à 1M de contexte Selon la grille Moonshot

Selon la page officielle de tarification Model Studio, Qwen 3.8-Max facture 2 $ par million de tokens en entrée et 6 $ en sortie, y compris sur un contexte allant jusqu’à 1 million de tokens.

Pour Qwen :

  • la création explicite de cache est facturée à 125 % du prix d’entrée ;
  • les accès au cache coûtent 10 % du prix d’entrée ;
  • un quota gratuit de 1M tokens est disponible pendant 90 jours dans la région de Singapour ;
  • les tokens de raisonnement sont facturés comme des tokens de sortie.

Kimi K3 est plus cher en sortie : 15 $ contre 6 $ par million de tokens. Cet écart est particulièrement important pour les boucles d’agents qui génèrent du raisonnement, des appels outils ou du code.

Estimer le coût réel

Ne vous fiez pas uniquement au prix affiché. Pour une charge de travail avec beaucoup de prompts répétés, le cache réduit fortement l’écart :

  • Qwen avec cache : 0,20 $ / million de tokens ;
  • Kimi avec cache : 0,30 $ / million de tokens.

En revanche, pour une charge de travail riche en sortie, Qwen est nettement moins cher :

Kimi K3 : 15 $ / million de tokens de sortie
Qwen 3.8-Max : 6 $ / million de tokens de sortie
Enter fullscreen mode Exit fullscreen mode

Attention : reasoning_effort est configuré sur xhigh par défaut dans Qwen. Si vous laissez ce réglage actif, la réflexion augmente votre volume de tokens de sortie facturés. Pour approfondir ce point, consultez notre analyse de la tarification de Qwen 3.8.

Benchmarks : deux tableaux de fournisseurs, pas un comparatif direct

Voici le point essentiel : il n’existe pas encore d’évaluation indépendante plaçant Qwen 3.8-Max et Kimi K3 dans le même tableau, avec le même harnais et les mêmes paramètres d’échantillonnage.

Alibaba a publié des résultats pour Qwen 3.8-Max face à Claude Opus 4.8, Fable 5, GPT-5.6 Sol et Qwen 3.7-Max. Moonshot a publié ses propres résultats pour Kimi K3 face à des modèles frontaliers comparables.

D’après le tableau Alibaba, exécuté par Alibaba :

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86,6 84,6 84,6 88,8
SWE-bench Pro 67,7 69,2 80,0 64,6
PaperBench 93,0 80,3 88,8 90,5
GPQA Diamond 92,6 92,0 92,6 94,1
HLE 43,6 45,7 53,3 47,2

Les propres résultats d’Alibaba montrent des limites claires :

  • Qwen 3.8-Max est derrière Fable 5 sur SWE-bench Pro ;
  • il est derrière tous les modèles listés sur HLE ;
  • ses forces mises en avant incluent PaperBench, IFBench et les benchmarks multimodaux ;
  • certains résultats reposent sur des benchmarks internes Alibaba, difficiles à vérifier indépendamment.

Le tableau de lancement Moonshot positionne Kimi K3 devant Claude Opus 4.8 sur plusieurs mesures internes à Moonshot, mais globalement derrière Fable 5 et GPT-5.6 Sol. Nous avons détaillé ces résultats dans notre comparaison Kimi K3 vs Claude Opus 4.8.

Conclusion honnête : les deux fournisseurs montrent que leur modèle est compétitif sur des tâches agentiques. Aucun tableau ne permet de conclure lequel est le meilleur entre Qwen 3.8-Max et Kimi K3. Pour les résultats détaillés d’Alibaba, consultez notre analyse des benchmarks de Qwen 3.8.

Exécutez votre propre comparatif direct dans Apidog

Le benchmark utile est celui qui utilise vos prompts, votre codebase et vos critères de succès.

Les deux modèles exposent des endpoints de complétion de chat compatibles OpenAI. Vous pouvez donc créer un test A/B reproductible dans Apidog.

1. Créez deux environnements

Configurez un environnement par fournisseur :

Qwen
- BASE_URL=https://...
- API_KEY=...
- MODEL=qwen3.8-max

Kimi
- BASE_URL=https://...
- API_KEY=...
- MODEL=kimi-k3
Enter fullscreen mode Exit fullscreen mode

2. Utilisez une requête unique

Conservez exactement le même payload et remplacez les valeurs par vos variables d’environnement :

{
  "model": "{{MODEL}}",
  "messages": [
    {
      "role": "system",
      "content": "Tu es un assistant de développement précis."
    },
    {
      "role": "user",
      "content": "Analyse cette erreur et propose un correctif minimal : ..."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

3. Testez avec des tâches réelles

Préférez des tâches provenant de votre produit :

  • corriger un test qui échoue ;
  • générer une migration ;
  • expliquer une trace d’erreur ;
  • extraire des informations d’un document ;
  • produire une modification ciblée sur un dépôt ;
  • analyser une capture d’écran, si votre workflow est multimodal.

4. Ajoutez des assertions

Transformez une comparaison subjective en test réexécutable :

- Code HTTP = 200
- Latence < seuil attendu
- Réponse conforme au schéma JSON
- Présence de champs obligatoires
- Absence de mots interdits
- Taille de sortie maximale respectée
Enter fullscreen mode Exit fullscreen mode

La vue de réponse d’Apidog permet de comparer statut, latence et corps de réponse. Le débogage SSE est également utile pour observer la diffusion des tokens de raisonnement, surtout si votre interface les affiche.

Téléchargez Apidog gratuitement et lancez au moins dix prompts réels sur les deux endpoints avant de choisir un fournisseur.

Le tableau de bord

Axe Vainqueur aujourd’hui Mise en garde
Paramètres totaux et actifs Qwen 3.8-Max Plus petit ne signifie pas automatiquement meilleur ; cela indique surtout un coût de service potentiel plus faible
Poids ouverts Kimi K3 Les poids Qwen étaient attendus autour du 10 août
Modalité Qwen 3.8-Max L’entrée image est documentée ; les démos vidéo et documents longs ne sont pas nécessairement des types API garantis
Fenêtre contextuelle Qwen 3.8-Max 1M de tokens et 65 536 tokens de sortie annoncés
Prix Qwen 3.8-Max Le raisonnement xhigh peut augmenter fortement le coût réel
Benchmarks Impossible de conclure Les résultats disponibles sont fournis par les fournisseurs
Écosystème de harnais Égalité Les deux s’intègrent via des endpoints compatibles Anthropic
Historique des promesses Kimi K3 Les poids ont été publiés 11 jours après le lancement

Lequel choisir ?

Choisissez Kimi K3 si

  • vous devez auto-héberger un modèle immédiatement ;
  • votre conformité exige des poids que vous pouvez télécharger, épingler et auditer ;
  • votre charge est entièrement textuelle ;
  • vos prompts sont longs, fortement réutilisés et bien mis en cache.

Choisissez Qwen 3.8-Max si

  • vous devez traiter des images, documents ou captures d’écran ;
  • votre agent génère beaucoup de code ou de raisonnement ;
  • vous avez besoin d’un contexte de 1M tokens ;
  • vous préférez une tarification de sortie plus basse et forfaitaire.

Attendez si

Les poids ouverts sont votre critère principal. Si Alibaba publie réellement les poids autour du 10 août, la décision reposera surtout sur :

  1. les termes de licence ;
  2. la qualité des quantifications ;
  3. la modalité image ;
  4. le coût réel sur votre distribution de tokens ;
  5. vos résultats de benchmark internes.

Le point important n’est pas de choisir le meilleur tableau marketing. Vous disposez désormais de deux modèles frontaliers chinois compétitifs, compatibles avec des harnais d’agents et relativement peu coûteux. Branchez-les sur les mêmes requêtes, mesurez les résultats sur vos tâches, puis choisissez.

FAQ

Kimi K3 est-il plus ouvert que Qwen 3.8-Max ?

Au 3 août 2026, oui. Les poids de Kimi K3 sont disponibles sur Hugging Face depuis le 27 juillet 2026, dans une version MXFP4 de 594 Go. Les poids de Qwen 3.8-Max sont annoncés pour environ le 10 août mais ne sont pas encore téléchargeables.

Si Alibaba tient sa promesse, les différences se déplaceront vers la licence, les quantifications et le support communautaire. En attendant, seul K3 peut être auto-hébergé. Consultez notre guide local K3 pour évaluer les contraintes d’infrastructure.

Quel modèle est le meilleur pour le codage ?

Il est trop tôt pour répondre de façon fiable. Les deux fournisseurs publient des résultats solides sur le codage agentique, mais dans des conditions différentes.

Le tableau Alibaba montre lui-même que Qwen 3.8-Max est derrière Fable 5 sur SWE-bench Pro. Les tableaux disponibles sont utiles pour identifier des tendances, mais pas pour choisir un modèle pour votre dépôt.

Exécutez les deux modèles sur vos tickets, vos tests et vos conventions de code avant de prendre une décision.

Puis-je utiliser les deux modèles dans Claude Code ?

Oui. Les deux exposent des endpoints compatibles Anthropic.

Pour Qwen 3.8-Max :

export ANTHROPIC_BASE_URL="https://votre-endpoint-dashscope"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Kimi K3 utilise le même principe via l’endpoint Moonshot. Cette compatibilité partagée simplifie la mise en place d’un test A/B.

Lequel est le moins cher pour un agent ?

Au prix affiché, Qwen 3.8-Max est moins cher :

Modèle Entrée / 1M tokens Sortie / 1M tokens
Qwen 3.8-Max 2 $ 6 $
Kimi K3 3 $ 15 $

Nuances importantes :

  • le cache Kimi K3 à 0,30 $ par million de tokens reste compétitif pour des charges très riches en entrée ;
  • Qwen facture les tokens de raisonnement comme de la sortie ;
  • reasoning_effort=xhigh est activé par défaut, ce qui peut augmenter sensiblement la facture.

Modélisez votre propre ratio entrée/sortie et votre taux de réutilisation du cache avant de choisir uniquement sur les prix affichés.

Top comments (0)