Alibaba a officiellement lancé Qwen 3.8-Max début août 2026. Le modèle combine une architecture MoE (Mixture-of-Experts) de 2,4 billions de paramètres, dont seulement 95 milliards sont activés par jeton, une fenêtre de contexte de 1 million de jetons et une tarification forfaitaire de 2 $ en entrée / 6 $ en sortie par million de jetons. Alibaba annonce également la publication prochaine des poids sur Hugging Face et ModelScope — une première pour un modèle de classe Qwen-Max.
Essayez Apidog dès aujourd’hui
L’annonce officielle présente Qwen 3.8-Max comme le modèle Qwen le plus performant à ce jour. Pour les développeurs, les points importants sont concrets : API compatibles OpenAI et Anthropic, entrées texte et image, contrôle du raisonnement, et trois régions API. Un client API comme Apidog permet notamment de tester les deux protocoles avec la même clé et les mêmes prompts.
Qwen 3.8-Max en un coup d’œil
| Spécification | Qwen 3.8-Max |
|---|---|
| Développeur | Alibaba (équipe Qwen) |
| Lancement | Début août 2026 — disponibilité générale sur Model Studio le 3 août |
| Architecture | MoE, basé sur la fondation Qwen 3.5 |
| Paramètres totaux | 2,4T |
| Paramètres actifs | 95 milliards, soit environ 4 % d’activation |
| Fenêtre de contexte | 1 000 000 de jetons |
| Sortie maximale | 65 536 jetons |
| Modalités | Entrée texte + image, sortie texte |
| Contrôles de raisonnement |
reasoning_effort : xhigh (défaut), medium, low
|
| ID de modèle API | qwen3.8-max |
| Tarification | 2 $ entrée / 6 $ sortie par million de jetons |
| Poids ouverts | Promis pour la semaine suivante (~10 août), non téléchargeables début août 2026 |
| Protocoles API | Compatibles OpenAI et Anthropic |
Ces données proviennent des documents de lancement d’Alibaba et de la page de tarification de Model Studio.
Ce qu’est Qwen 3.8-Max
Qwen 3.8-Max est le nouveau modèle phare de la famille Qwen, construit sur les fondations de Qwen 3.5. Il remplace Qwen 3.7-Max au sommet de la gamme.
Selon le tableau de benchmarks d’Alibaba, les gains par rapport à Qwen 3.7-Max sont importants :
- Terminal Bench 2.1 : de
74.5à86.6 - PaperBench : de
64.8à93.0
Pour choisir entre les deux versions, consultez cette comparaison entre Qwen 3.8 et Qwen 3.7-Max.
Le point technique principal est son ratio de paramètres actifs. Bien que le modèle contienne 2,4 billions de paramètres, seuls 95 milliards sont utilisés lors de chaque passage avant. Cette architecture MoE permet de proposer un modèle très grand sans activer l’intégralité de ses paramètres à chaque jeton.
À titre de comparaison, Kimi K3 utilise 2,8 billions de paramètres au total et 104 milliards de paramètres actifs. Qwen 3.8-Max est donc légèrement plus petit sur ces deux mesures.
Entrées et raisonnement
L’API accepte :
- du texte ;
- des images ;
- une sortie texte.
Alibaba montre aussi des démonstrations de compréhension de PDF de plus de 200 pages et de vidéos de 100 heures via des « graphes de mémoire ». Ces capacités sont présentées dans le blog du fournisseur ; les configurations API publiées listent toutefois uniquement le texte et l’image comme modalités d’entrée.
Le raisonnement est réglable avec reasoning_effort :
{
"reasoning_effort": "xhigh"
}
Valeurs disponibles :
-
xhigh: valeur par défaut ; -
medium; -
low.
Les paramètres enable_thinking et preserve_thinking sont également disponibles. Le raisonnement est conservé par défaut.
Les jetons de raisonnement sont facturés comme des jetons de sortie. Avec
xhigh, le coût réel peut donc dépasser une estimation basée uniquement sur les jetons visibles dans la réponse finale.
Le premier Qwen de classe Max à poids ouverts
Alibaba a déjà ouvert les poids de nombreux modèles Qwen, mais jamais ceux d’un modèle de la catégorie Max.
Pour Qwen 3.8-Max, Alibaba annonce une disponibilité des poids sur Hugging Face et ModelScope « la semaine prochaine », soit autour du 10 août 2026.
Avant de planifier un déploiement, gardez deux limites en tête :
- Les poids ne sont pas encore disponibles au téléchargement. Début août 2026, il s’agit encore d’une annonce. Kimi K3 a récemment montré qu’un délai entre lancement et publication des poids reste possible.
- Auto-héberger 2,4 billions de paramètres nécessite une infrastructure multi-nœuds. Même avec de la quantification, ce modèle ne cible pas une station de travail classique.
Pour la plupart des équipes, l’intérêt des poids ouverts sera probablement l’accès à des fournisseurs hébergés alternatifs plutôt qu’un déploiement local.
Si votre priorité est de tester le modèle sans prix catalogue, utilisez Qwen Chat ou le quota gratuit de Model Studio. Le guide utiliser Qwen 3.8 gratuitement détaille ces options.
Ce que montrent les benchmarks — y compris les défaites
Alibaba compare Qwen 3.8-Max à Claude Opus 4.8, Fable 5, GPT-5.6 Sol et Qwen 3.7-Max.
Interprétez ces résultats avec prudence :
- les mesures proviennent du fournisseur ;
- la plupart des benchmarks de code ont été exécutés avec Claude Code pour tous les modèles ;
- plusieurs benchmarks sont internes à Alibaba, notamment QwenSWEBench, QwenQoderBench, CoWorkBench et RecreationBench ;
- aucune évaluation indépendante par des organismes tels qu’Artificial Analysis n’était disponible lors de la rédaction.
Domaines où Qwen 3.8-Max est en tête
PaperBench : 93.0
Devant GPT-5.6 Sol (90.5), Fable 5 (88.8) et Opus 4.8 (80.3).IFBench : 82.8
Meilleur score de la ligne, devant les72.7de Sol.Terminal Bench 2.1 : 86.6
Devant Opus 4.8 et Fable 5 (84.6chacun), juste derrière Sol (88.8).Multimodal et documents
MathVision95.2, LogicVista91.9, OSWorld-Verified86.1, ainsi que des résultats OCR solides.
Domaines où il est en retrait
SWE-bench Pro : 67.7
Derrière Fable 5 (80.0) et Opus 4.8 (69.2), mais devant Sol (64.6).HLE : 43.6
Derrière Fable 5 (53.3), Sol (47.2) et Opus 4.8 (45.7).
En pratique, les chiffres d’Alibaba positionnent Qwen 3.8-Max comme un modèle compétitif pour les agents, le multimodal et l’intelligence documentaire. Pour le codage de base, Fable 5 conserve l’avantage sur les résultats publiés.
Sur GPQA Diamond, Qwen 3.8-Max atteint 92.6, à égalité avec Fable 5 et proche de Sol (94.1).
Pour consulter le tableau complet et les réserves méthodologiques, lisez l’analyse des benchmarks de Qwen 3.8.
Alibaba a aussi présenté plusieurs démonstrations :
- une session de codage autonome de 16 jours sur un dépôt public ;
- 265 commits et 127 pull requests ;
- une reproduction d’article dépassant le résultat AIME24 de l’article original ;
- une participation à un concours Tianchi qui aurait dépassé 458 des 526 équipes humaines en 24 heures.
Ce sont des démonstrations du fournisseur, pas des évaluations contrôlées. Pour la configuration de l’outillage de code, voir Qwen 3.8 pour le codage.
Comparaison avec Kimi K3, Fable 5 et GPT-5.6 Sol
Qwen 3.8-Max vs Kimi K3
La comparaison est naturelle : deux laboratoires chinois, deux grands modèles MoE annoncés à quelques semaines d’intervalle.
| Critère | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Paramètres totaux | 2,4T | 2,8T |
| Paramètres actifs | 95 milliards | 104 milliards |
| Modalités | Texte + image | Texte uniquement |
| Prix entrée | 2 $ / M tokens | 3 $ / M tokens |
| Prix sortie | 6 $ / M tokens | 15 $ / M tokens |
| Poids | Annoncés, pas encore disponibles | Déjà disponibles |
Il n’existe pas encore d’évaluation indépendante directe entre les deux modèles. Chaque fournisseur publie son propre tableau.
Consultez la comparaison détaillée Qwen 3.8 vs Kimi K3, ou commencez par ce qu’est Kimi K3.
Qwen 3.8-Max vs Fable 5
Fable 5 reste la référence à battre pour le code dans le tableau d’Alibaba :
- SWE-bench Pro :
80.0pour Fable 5 contre67.7pour Qwen ; - HLE :
53.3contre43.6.
Qwen 3.8-Max propose en contrepartie :
- un prix inférieur ;
- 1 million de jetons de contexte ;
- des poids ouverts annoncés ;
- des résultats multimodaux plus solides.
Qwen 3.8-Max vs GPT-5.6 Sol
GPT-5.6 Sol est devant sur :
- Terminal Bench :
88.8contre86.6; - GPQA :
94.1contre92.6; - HLE :
47.2contre43.6.
Qwen 3.8-Max prend l’avantage sur :
- PaperBench :
93.0contre90.5; - IFBench :
82.8contre72.7.
Sur les prix publiés, Qwen affiche 2 $ / 6 $, contre 2 $ / 12 $ pour GPT-5.6 Terra en sortie. Le niveau Sol est encore plus cher.
À titre de comparaison supplémentaire, Claude Opus 5 est tarifé à 5 $ / 25 $. Pour des charges à fort volume, le prix de Qwen change donc sensiblement le calcul.
Tarification : 2 $ / 6 $ sur 1 million de jetons
La structure tarifaire est simple :
- 2 $ par million de jetons en entrée ;
- 6 $ par million de jetons en sortie ;
- même prix du premier jeton jusqu’à 1 million de jetons de contexte ;
- même tarif avec ou sans raisonnement.
Le point notable est l’absence de palier de prix pour les prompts longs. De nombreux modèles augmentent le prix après un certain seuil de contexte ; Qwen 3.8-Max conserve ici son tarif forfaitaire.
Qwen 3.8-Max est aussi lancé moins cher que Qwen 3.7-Max au tarif catalogue (2,5 $ / 7,5 $). Qwen 3.7-Max bénéficie toutefois d’une promotion de 50 % (1,25 $ / 3,75 $), ce qui en fait encore une option économique pertinente.
Coût du cache
Pour les charges de travail avec un préfixe répété :
- lecture de cache : 10 % du tarif d’entrée ;
- création explicite de cache : 125 % du tarif d’entrée.
Un quota gratuit de 1 million de jetons est disponible dans la région de Singapour pendant 90 jours.
Pour estimer les coûts par type de tâche et intégrer les jetons de raisonnement, consultez le guide de tarification de Qwen 3.8.
Comment accéder à Qwen 3.8-Max
Vous pouvez accéder au modèle par cinq voies.
1. Qwen Chat
L’application grand public ne nécessite pas de clé API. C’est le moyen le plus rapide de tester les capacités du modèle avec vos propres prompts.
2. API Alibaba Cloud Model Studio (DashScope)
- Obtenez une clé depuis home.qwencloud.com.
- Définissez la variable d’environnement :
export DASHSCOPE_API_KEY="votre-cle-api"
- Utilisez l’ID de modèle :
qwen3.8-max
Les URL de base compatibles OpenAI disponibles sont :
# Pékin
https://dashscope.aliyuncs.com/compatible-mode/v1
# Singapour
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
# Virginie, États-Unis
https://dashscope-us.aliyuncs.com/compatible-mode/v1
La page des modèles Model Studio liste Qwen 3.8-Max parmi les modèles recommandés.
3. Point de terminaison compatible Anthropic
DashScope fournit également une compatibilité avec le protocole Anthropic Messages :
https://dashscope-intl.aliyuncs.com/apps/anthropic
Cette option permet de connecter des outils conçus pour Claude à Qwen 3.8-Max en modifiant principalement l’URL de base et le modèle ciblé.
4. Agents et outils de codage
Alibaba publie des configurations pour :
- Claude Code ;
- Codex ;
- Qoder ;
- Qwen Code ;
- OpenClaw.
Pour Claude Code, la configuration repose notamment sur :
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Alibaba indique aussi avoir exécuté une grande partie de ses benchmarks de code dans Claude Code. La configuration publiée correspond donc à l’environnement utilisé pour une partie de ses propres résultats.
5. Poids ouverts
Hugging Face et ModelScope sont annoncés comme canaux de distribution des poids. Début août 2026, ils ne sont pas encore disponibles.
Pour des exemples Python et cURL prêts à adapter, consultez le guide API Qwen 3.8.
Tester l’API sur les deux protocoles
La compatibilité OpenAI et Anthropic est utile, mais elle introduit une question de validation : vos prompts, outils et réponses se comportent-ils de la même façon avec les deux protocoles ?
Procédure recommandée :
- Créez un environnement par région API.
- Enregistrez les trois URL DashScope.
- Envoyez le même prompt au point de terminaison compatible OpenAI.
- Envoyez-le ensuite au point de terminaison compatible Anthropic.
- Comparez le contenu final, la structure des réponses et le streaming SSE.
- Mesurez les deltas
reasoning_contentpour suivre le volume de raisonnement généré.
Dans Apidog, vous pouvez gérer les URL régionales sous forme d’environnements, rejouer les mêmes requêtes et comparer les sorties avant de choisir un protocole pour votre application.
Téléchargez Apidog pour tester qwen3.8-max face à qwen3.7-max ou kimi-k3 avec des prompts identiques.
Positionnement dans la gamme Qwen
Qwen 3.8-Max se situe au-dessus de Qwen 3.7-Max et des modèles Plus.
Choix rapide :
- Qwen 3.8-Max : tâches agentiques, multimodales, documentaires et contexte long ;
- Qwen 3.7-Max : option phare plus économique tant que la promotion de 50 % est disponible ;
- Modèles Plus : charges routinières à coût réduit.
Le guide des meilleurs modèles Qwen aide à choisir le niveau selon votre charge de travail.
FAQ
Qwen 3.8 est-il open source ?
Pas encore au moment de la rédaction. Alibaba annonce les poids sur Hugging Face et ModelScope « la semaine prochaine » après le lancement début août 2026. Ce serait le premier Qwen de classe Max à poids ouverts.
En attendant, utilisez l’API ou Qwen Chat. Consultez comment utiliser Qwen 3.8 gratuitement pour les options sans coût.
Combien coûte Qwen 3.8-Max ?
Le tarif est de 2 $ par million de jetons en entrée et de 6 $ par million de jetons en sortie, sur l’ensemble de la fenêtre de contexte de 1 million de jetons.
Les lectures de cache coûtent 10 % du tarif d’entrée. Les jetons de raisonnement sont comptés comme sortie. Avec reasoning_effort: "xhigh", prévoyez donc une consommation supérieure à celle des réponses finales seules.
Qwen 3.8-Max est-il meilleur que Kimi K3 ?
Aucune évaluation indépendante directe n’est encore disponible.
Sur le papier, Qwen 3.8-Max est :
- plus petit : 2,4T / 95B actifs contre 2,8T / 104B ;
- multimodal, là où Kimi K3 est textuel ;
- moins cher en sortie : 6 $ contre 15 $.
Kimi K3 conserve l’avantage de disposer déjà de poids publics.
Puis-je utiliser Qwen 3.8-Max dans Claude Code ?
Oui. Alibaba fournit une configuration basée sur ANTHROPIC_BASE_URL et :
export ANTHROPIC_MODEL="qwen3.8-max"
Des configurations officielles existent aussi pour Codex, Qoder, Qwen Code et OpenClaw.
Que faire ensuite
Qwen 3.8-Max est un lancement complet : disponibilité générale dans trois régions API, tarification publique, compatibilité avec deux protocoles, benchmarks publiés et poids ouverts annoncés.
La méthode la plus fiable consiste à le tester sur vos propres cas d’usage :
- Activez le quota gratuit.
- Préparez un jeu de prompts représentatifs.
- Testez le protocole OpenAI et le protocole Anthropic.
- Comparez la qualité, la latence, la consommation de jetons et le coût du raisonnement.
- Comparez si nécessaire
qwen3.8-max,qwen3.7-maxetkimi-k3.
Commencez avec le guide de configuration de l’API, puis vérifiez autour du 10 août si les poids ont été publiés.

Top comments (0)