Juillet 2026 a marqué une accélération pour les modèles frontaliers chinois à poids ouverts. Moonshot AI a lancé Kimi K3 le 16 juillet, puis Alibaba a présenté Qwen 3.8-Max le 19 juillet avant sa disponibilité générale début août. Les deux modèles reposent sur une architecture mixture-of-experts (MoE), dépassent le billion de paramètres, s’intègrent à des harnais d’agents de style Claude Code et visent des coûts API inférieurs à ceux des laboratoires américains.
Essayez Apidog dès aujourd’hui
Les différences importantes concernent toutefois ce que vous pouvez réellement télécharger, les modalités d’entrée, les limites de contexte et le coût d’une charge de travail agentique. Cette comparaison reflète les informations vérifiables au 3 août 2026. Pour les spécifications détaillées du modèle Alibaba, consultez notre explication de Qwen 3.8-Max.
Note méthodologique : il n’existe pas encore de benchmark indépendant comparant directement Qwen 3.8-Max et Kimi K3 dans le même harnais. Les chiffres de benchmark cités ci-dessous proviennent des fournisseurs respectifs. Utilisez-les comme indicateurs, pas comme verdict définitif.
La chronologie : qui a livré quoi, et quand
L’ordre de sortie compte particulièrement ici : les deux fournisseurs parlent de « poids ouverts », mais un seul modèle est téléchargeable au 3 août 2026.
- Kimi K3 a été lancé le 16 juillet 2026. Moonshot a publié les poids 11 jours plus tard, le 27 juillet, sur Hugging Face. La version MXFP4 pèse 594 Go. Vous pouvez donc déjà télécharger le modèle, le quantifier et l’exécuter sur votre propre infrastructure.
- Qwen 3.8-Max a été annoncé le 19 juillet et est devenu disponible via Alibaba Cloud Model Studio début août, selon l’annonce officielle de Qwen. Les poids étaient annoncés pour Hugging Face et ModelScope « la semaine prochaine », soit autour du 10 août. Au 3 août, ils ne sont pas encore disponibles.
Si l’auto-hébergement est un prérequis, Kimi K3 est donc le seul choix concret à cette date.
Paramètres : deux MoE à l’échelle du billion
Les deux modèles utilisent une architecture MoE clairsemée : le nombre total de paramètres ne correspond pas au nombre de paramètres activés pour chaque token.
| Spécification | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Paramètres totaux | 2,4T | 2,8T |
| Paramètres actifs par token | 95B | 104B |
| Taux d’activation | ~4 % | ~3,7 % |
| Architecture | Fondation Qwen 3.5, MoE | MoE |
| Poids ouverts | Promis vers le 10 août | MXFP4, 594 Go sur Hugging Face |
Qwen 3.8-Max active environ 9 milliards de paramètres de moins par token que Kimi K3. Cela ne prouve pas qu’il est plus capable, mais cela influence directement le coût de service à grande échelle.
Pour l’auto-hébergement, retenez surtout les 594 Go de Kimi K3 en MXFP4. Avant même d’ajouter le cache KV pour les longs contextes, vous entrez dans une configuration multi-GPU ou multi-nœuds. Qwen 3.8-Max, avec 2,4T de paramètres au total, devrait nécessiter un volume de stockage comparable lorsque ses poids seront publiés.
Ouverture : poids disponibles ou promesse de publication
Kimi K3 est réellement ouvert aujourd’hui :
- les poids sont publics ;
- le dépôt et la licence sont vérifiables ;
- vous pouvez effectuer des quantifications, du fine-tuning ou de l’hébergement tiers ;
- vous pouvez épingler une version précise du modèle pour vos évaluations et votre conformité.
Qwen 3.8-Max pourrait devenir le premier modèle de classe Qwen-Max publié avec des poids ouverts. Ce serait un changement important, car les précédents modèles Max d’Alibaba étaient uniquement accessibles via API.
Mais tant que le dépôt n’est pas disponible, Qwen 3.8-Max reste un modèle API avec une promesse de publication.
Décision au 3 août 2026 : attribuez cet axe à Kimi K3. Réévaluez-le autour du 10 août, lorsque les poids Qwen seront potentiellement publiés.
Modalité : Qwen accepte les images, K3 reste textuel
C’est l’écart fonctionnel le plus net.
Qwen 3.8-Max accepte des entrées texte et image :
{
"input_modalities": ["text", "image"]
}
Alibaba présente également des démonstrations de compréhension de documents longs et de vidéo. Considérez ces éléments comme des démos de blog, et non comme des types d’entrée API garantis. En revanche, l’entrée image est documentée et disponible via l’API.
Kimi K3 est un modèle texte. Pour traiter :
- des captures d’écran ;
- des PDF numérisés ;
- des interfaces utilisateur ;
- des documents avec graphiques ou tableaux visuels ;
- des tâches d’agent nécessitant de la vision ;
vous devrez ajouter un modèle de vision séparé à votre pipeline K3. Cela introduit du code d’orchestration, de la latence et potentiellement des coûts supplémentaires.
Choix pratique :
- Charges de travail exclusivement textuelles : cet axe est secondaire.
- Analyse documentaire, OCR, agents navigateur ou UI : Qwen 3.8-Max est le choix naturel.
Contexte, sortie et compatibilité API
Qwen 3.8-Max propose :
- une fenêtre contextuelle de 1 000 000 tokens ;
- une sortie maximale de 65 536 tokens ;
- un paramètre
reasoning_effortavec les niveauxxhigh,mediumetlow; - la conservation de la sortie de raisonnement par défaut ;
- le même tarif pour les modes raisonnement et non-raisonnement.
L’accès passe par Alibaba Cloud Model Studio, avec des endpoints régionaux à Pékin, Singapour et US-Virginie. La plateforme fournit deux formats de protocole :
- un endpoint compatible OpenAI ;
- un endpoint compatible Anthropic.
Cette compatibilité Anthropic permet d’utiliser Qwen 3.8-Max dans un harnais compatible Claude Code avec une configuration minimale :
export ANTHROPIC_BASE_URL="https://votre-endpoint-dashscope"
export ANTHROPIC_MODEL="qwen3.8-max"
La disponibilité régionale est décrite dans la page des modèles de Model Studio. Si vous testez plusieurs régions ou fournisseurs, Apidog permet de définir chaque URL de base dans un environnement séparé, puis de changer de cible sans modifier vos requêtes.
Kimi K3 prend également en charge le protocole Anthropic et peut être branché dans des harnais de style Claude Code. Pour les URLs d’endpoint et les limites actuelles, consultez notre explication de Kimi K3.
Tarification : Qwen favorise les charges riches en sortie
Tarifs publiés par million de tokens :
| Tarif | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Entrée | 2,00 $ | 3,00 $ |
| Sortie | 6,00 $ | 15,00 $ |
| Entrée avec cache | 0,20 $ | 0,30 $ |
| Nivellement | Forfait jusqu’à 1M de contexte | Selon la grille Moonshot |
Selon la page officielle de tarification Model Studio, Qwen 3.8-Max facture 2 $ par million de tokens en entrée et 6 $ en sortie, y compris sur un contexte allant jusqu’à 1 million de tokens.
Pour Qwen :
- la création explicite de cache est facturée à 125 % du prix d’entrée ;
- les accès au cache coûtent 10 % du prix d’entrée ;
- un quota gratuit de 1M tokens est disponible pendant 90 jours dans la région de Singapour ;
- les tokens de raisonnement sont facturés comme des tokens de sortie.
Kimi K3 est plus cher en sortie : 15 $ contre 6 $ par million de tokens. Cet écart est particulièrement important pour les boucles d’agents qui génèrent du raisonnement, des appels outils ou du code.
Estimer le coût réel
Ne vous fiez pas uniquement au prix affiché. Pour une charge de travail avec beaucoup de prompts répétés, le cache réduit fortement l’écart :
- Qwen avec cache : 0,20 $ / million de tokens ;
- Kimi avec cache : 0,30 $ / million de tokens.
En revanche, pour une charge de travail riche en sortie, Qwen est nettement moins cher :
Kimi K3 : 15 $ / million de tokens de sortie
Qwen 3.8-Max : 6 $ / million de tokens de sortie
Attention : reasoning_effort est configuré sur xhigh par défaut dans Qwen. Si vous laissez ce réglage actif, la réflexion augmente votre volume de tokens de sortie facturés. Pour approfondir ce point, consultez notre analyse de la tarification de Qwen 3.8.
Benchmarks : deux tableaux de fournisseurs, pas un comparatif direct
Voici le point essentiel : il n’existe pas encore d’évaluation indépendante plaçant Qwen 3.8-Max et Kimi K3 dans le même tableau, avec le même harnais et les mêmes paramètres d’échantillonnage.
Alibaba a publié des résultats pour Qwen 3.8-Max face à Claude Opus 4.8, Fable 5, GPT-5.6 Sol et Qwen 3.7-Max. Moonshot a publié ses propres résultats pour Kimi K3 face à des modèles frontaliers comparables.
D’après le tableau Alibaba, exécuté par Alibaba :
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86,6 | 84,6 | 84,6 | 88,8 |
| SWE-bench Pro | 67,7 | 69,2 | 80,0 | 64,6 |
| PaperBench | 93,0 | 80,3 | 88,8 | 90,5 |
| GPQA Diamond | 92,6 | 92,0 | 92,6 | 94,1 |
| HLE | 43,6 | 45,7 | 53,3 | 47,2 |
Les propres résultats d’Alibaba montrent des limites claires :
- Qwen 3.8-Max est derrière Fable 5 sur SWE-bench Pro ;
- il est derrière tous les modèles listés sur HLE ;
- ses forces mises en avant incluent PaperBench, IFBench et les benchmarks multimodaux ;
- certains résultats reposent sur des benchmarks internes Alibaba, difficiles à vérifier indépendamment.
Le tableau de lancement Moonshot positionne Kimi K3 devant Claude Opus 4.8 sur plusieurs mesures internes à Moonshot, mais globalement derrière Fable 5 et GPT-5.6 Sol. Nous avons détaillé ces résultats dans notre comparaison Kimi K3 vs Claude Opus 4.8.
Conclusion honnête : les deux fournisseurs montrent que leur modèle est compétitif sur des tâches agentiques. Aucun tableau ne permet de conclure lequel est le meilleur entre Qwen 3.8-Max et Kimi K3. Pour les résultats détaillés d’Alibaba, consultez notre analyse des benchmarks de Qwen 3.8.
Exécutez votre propre comparatif direct dans Apidog
Le benchmark utile est celui qui utilise vos prompts, votre codebase et vos critères de succès.
Les deux modèles exposent des endpoints de complétion de chat compatibles OpenAI. Vous pouvez donc créer un test A/B reproductible dans Apidog.
1. Créez deux environnements
Configurez un environnement par fournisseur :
Qwen
- BASE_URL=https://...
- API_KEY=...
- MODEL=qwen3.8-max
Kimi
- BASE_URL=https://...
- API_KEY=...
- MODEL=kimi-k3
2. Utilisez une requête unique
Conservez exactement le même payload et remplacez les valeurs par vos variables d’environnement :
{
"model": "{{MODEL}}",
"messages": [
{
"role": "system",
"content": "Tu es un assistant de développement précis."
},
{
"role": "user",
"content": "Analyse cette erreur et propose un correctif minimal : ..."
}
]
}
3. Testez avec des tâches réelles
Préférez des tâches provenant de votre produit :
- corriger un test qui échoue ;
- générer une migration ;
- expliquer une trace d’erreur ;
- extraire des informations d’un document ;
- produire une modification ciblée sur un dépôt ;
- analyser une capture d’écran, si votre workflow est multimodal.
4. Ajoutez des assertions
Transformez une comparaison subjective en test réexécutable :
- Code HTTP = 200
- Latence < seuil attendu
- Réponse conforme au schéma JSON
- Présence de champs obligatoires
- Absence de mots interdits
- Taille de sortie maximale respectée
La vue de réponse d’Apidog permet de comparer statut, latence et corps de réponse. Le débogage SSE est également utile pour observer la diffusion des tokens de raisonnement, surtout si votre interface les affiche.
Téléchargez Apidog gratuitement et lancez au moins dix prompts réels sur les deux endpoints avant de choisir un fournisseur.
Le tableau de bord
| Axe | Vainqueur aujourd’hui | Mise en garde |
|---|---|---|
| Paramètres totaux et actifs | Qwen 3.8-Max | Plus petit ne signifie pas automatiquement meilleur ; cela indique surtout un coût de service potentiel plus faible |
| Poids ouverts | Kimi K3 | Les poids Qwen étaient attendus autour du 10 août |
| Modalité | Qwen 3.8-Max | L’entrée image est documentée ; les démos vidéo et documents longs ne sont pas nécessairement des types API garantis |
| Fenêtre contextuelle | Qwen 3.8-Max | 1M de tokens et 65 536 tokens de sortie annoncés |
| Prix | Qwen 3.8-Max | Le raisonnement xhigh peut augmenter fortement le coût réel |
| Benchmarks | Impossible de conclure | Les résultats disponibles sont fournis par les fournisseurs |
| Écosystème de harnais | Égalité | Les deux s’intègrent via des endpoints compatibles Anthropic |
| Historique des promesses | Kimi K3 | Les poids ont été publiés 11 jours après le lancement |
Lequel choisir ?
Choisissez Kimi K3 si
- vous devez auto-héberger un modèle immédiatement ;
- votre conformité exige des poids que vous pouvez télécharger, épingler et auditer ;
- votre charge est entièrement textuelle ;
- vos prompts sont longs, fortement réutilisés et bien mis en cache.
Choisissez Qwen 3.8-Max si
- vous devez traiter des images, documents ou captures d’écran ;
- votre agent génère beaucoup de code ou de raisonnement ;
- vous avez besoin d’un contexte de 1M tokens ;
- vous préférez une tarification de sortie plus basse et forfaitaire.
Attendez si
Les poids ouverts sont votre critère principal. Si Alibaba publie réellement les poids autour du 10 août, la décision reposera surtout sur :
- les termes de licence ;
- la qualité des quantifications ;
- la modalité image ;
- le coût réel sur votre distribution de tokens ;
- vos résultats de benchmark internes.
Le point important n’est pas de choisir le meilleur tableau marketing. Vous disposez désormais de deux modèles frontaliers chinois compétitifs, compatibles avec des harnais d’agents et relativement peu coûteux. Branchez-les sur les mêmes requêtes, mesurez les résultats sur vos tâches, puis choisissez.
FAQ
Kimi K3 est-il plus ouvert que Qwen 3.8-Max ?
Au 3 août 2026, oui. Les poids de Kimi K3 sont disponibles sur Hugging Face depuis le 27 juillet 2026, dans une version MXFP4 de 594 Go. Les poids de Qwen 3.8-Max sont annoncés pour environ le 10 août mais ne sont pas encore téléchargeables.
Si Alibaba tient sa promesse, les différences se déplaceront vers la licence, les quantifications et le support communautaire. En attendant, seul K3 peut être auto-hébergé. Consultez notre guide local K3 pour évaluer les contraintes d’infrastructure.
Quel modèle est le meilleur pour le codage ?
Il est trop tôt pour répondre de façon fiable. Les deux fournisseurs publient des résultats solides sur le codage agentique, mais dans des conditions différentes.
Le tableau Alibaba montre lui-même que Qwen 3.8-Max est derrière Fable 5 sur SWE-bench Pro. Les tableaux disponibles sont utiles pour identifier des tendances, mais pas pour choisir un modèle pour votre dépôt.
Exécutez les deux modèles sur vos tickets, vos tests et vos conventions de code avant de prendre une décision.
Puis-je utiliser les deux modèles dans Claude Code ?
Oui. Les deux exposent des endpoints compatibles Anthropic.
Pour Qwen 3.8-Max :
export ANTHROPIC_BASE_URL="https://votre-endpoint-dashscope"
export ANTHROPIC_MODEL="qwen3.8-max"
Kimi K3 utilise le même principe via l’endpoint Moonshot. Cette compatibilité partagée simplifie la mise en place d’un test A/B.
Lequel est le moins cher pour un agent ?
Au prix affiché, Qwen 3.8-Max est moins cher :
| Modèle | Entrée / 1M tokens | Sortie / 1M tokens |
|---|---|---|
| Qwen 3.8-Max | 2 $ | 6 $ |
| Kimi K3 | 3 $ | 15 $ |
Nuances importantes :
- le cache Kimi K3 à 0,30 $ par million de tokens reste compétitif pour des charges très riches en entrée ;
- Qwen facture les tokens de raisonnement comme de la sortie ;
-
reasoning_effort=xhighest activé par défaut, ce qui peut augmenter sensiblement la facture.
Modélisez votre propre ratio entrée/sortie et votre taux de réutilisation du cache avant de choisir uniquement sur les prix affichés.
Top comments (0)