Alibaba a lancé Qwen 3.8-Max début août 2026. Si vous exécutez déjà qwen3.7-max en production, la question n’est pas seulement de savoir si le nouveau modèle est meilleur, mais si ses gains justifient le changement pour vos prompts, vos coûts et vos flux agentiques. Qwen 3.8-Max progresse fortement sur plusieurs benchmarks d’agents et de recherche, ajoute l’entrée d’images, réduit le prix catalogue et promet des poids ouverts.
Essayez Apidog dès aujourd’hui
La décision n’est toutefois pas automatique : qwen3.7-max bénéficie actuellement d’une réduction de 50 %, ce qui le rend moins coûteux que qwen3.8-max à court terme. Certains écarts de benchmarks sont majeurs, d’autres sont presque nuls. Voici comment évaluer concrètement une migration, attendre la fin de la promotion ou utiliser un modèle Plus.
Pour une vue d’ensemble, consultez l’explication de Qwen 3.8-Max. Pour le modèle précédent, voyez ce que Qwen 3.7 a apporté.
Note méthodologique : tous les chiffres de benchmark ci-dessous proviennent du tableau publié par Alibaba dans le billet officiel de sortie de Qwen 3.8. Les deux modèles ont été évalués dans la même exécution fournisseur : les écarts sont donc cohérents en interne, mais des validations indépendantes restent nécessaires. La plupart des tests de code ont été exécutés dans l’environnement Claude Code, et plusieurs benchmarks sont internes à Qwen.
La version courte
| Ce qui change | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74,5 | 86,6 |
| SWE-bench Pro | 60,6 | 67,7 |
| PaperBench | 64,8 | 93,0 |
| IFBench | 79,1 | 82,8 |
| GPQA Diamond | 92,4 | 92,6 |
| HLE | 41,4 | 43,6 |
| Prix catalogue pour 1 M de tokens | 2,5 $ entrée / 7,5 $ sortie | 2 $ entrée / 6 $ sortie |
| Prix actuel | 1,25 $ entrée / 3,75 $ sortie | 2 $ entrée / 6 $ sortie |
| Entrée d’images | Non | Oui |
| Architecture divulguée | Non | 2,4 T total, 95 B MoE actifs |
| Poids ouverts | Jamais publiés | Promis « la semaine prochaine » (vers le 10 août) |
| Fenêtre de contexte | 1 M de tokens | 1 M de tokens |
Où Qwen 3.8-Max progresse réellement
Les gains se concentrent sur les tâches agentiques longues : planification, exécution dans un terminal, correction d’erreurs et raisonnement multi-étapes.
Terminal Bench 2.1 : 74,5 → 86,6
Le gain de 12 points concerne les tâches pilotées par terminal. C’est le signal le plus utile si vous construisez des agents capables d’exécuter des commandes, inspecter un dépôt ou corriger un environnement.
Dans le tableau Alibaba, Qwen 3.8-Max dépasse Claude Opus 4.8 et Fable 5, tous deux à 84,6. GPT-5.6 Sol reste devant à 88,8.
Action : testez vos scénarios shell réels : installation de dépendances, résolution d’échecs CI, lecture de logs, modifications multi-fichiers et exécution de tests.
SWE-bench Pro : 60,6 → 67,7
Le gain de 7 points est significatif pour l’ingénierie logicielle, mais il ne place pas Qwen 3.8-Max en tête : Fable 5 atteint 80,0 dans le même tableau.
Action : si votre principal critère est la correction autonome de tickets complexes, mesurez le taux de réussite sur vos propres issues GitHub ou Jira avant de migrer. Le modèle progresse, mais le benchmark indique davantage un rattrapage qu’un dépassement.
PaperBench : 64,8 → 93,0
C’est l’écart le plus important : +28 points sur la reproduction de travaux de recherche en IA. Qwen 3.8-Max arrive en tête de cette ligne dans la comparaison Alibaba.
Action : privilégiez 3.8-Max si vos flux impliquent :
- la lecture de documents techniques longs ;
- la reconstruction d’expériences ;
- l’analyse de protocoles ;
- le raisonnement scientifique en plusieurs étapes ;
- la synthèse de résultats issus de plusieurs sources.
IFBench : 79,1 → 82,8
Le suivi d’instructions gagne près de 4 points. Qwen 3.7-Max était déjà solide ici, donc 3.8-Max étend une force existante plutôt que de résoudre une faiblesse.
GPQA Diamond : 92,4 → 92,6
Le résultat est pratiquement stable. Si votre charge ressemble à de la question-réponse scientifique de niveau universitaire, la migration ne devrait pas apporter de gain de qualité notable.
HLE : 41,4 → 43,6
Le gain est limité à 2 points. Dans le tableau Alibaba, Fable 5 atteint 53,3 et GPT-5.6 Sol 47,2.
Conclusion benchmark :
- migrez pour les agents, les terminaux et la recherche longue ;
- attendez ou gardez 3.7-Max pour des charges généralistes déjà satisfaisantes ;
- ne justifiez pas la migration uniquement par GPQA ou HLE.
Pour le détail des environnements et des benchmarks internes, consultez l’analyse des benchmarks de Qwen 3.8.
Architecture : enfin des chiffres exploitables
Qwen 3.8-Max est un modèle MoE (Mixture of Experts) de :
- 2,4 trillions de paramètres au total ;
- 95 milliards de paramètres actifs par passe avant ;
- une base architecturale Qwen 3.5.
Le ratio d’activation est donc d’environ 4 %. Pour la planification d’infrastructure et les modèles de coût, cela signifie que le calcul actif concerne 95 B de paramètres, non les 2,4 T complets.
Alibaba n’avait pas publié de chiffres comparables pour Qwen 3.7-Max : nombre de paramètres, experts et ratio d’activation restaient non divulgués. Avec Qwen 3.8-Max, la documentation Model Studio et le billet de sortie donnent davantage d’éléments pour dimensionner l’usage.
À titre de contexte, Kimi K3 est annoncé avec 2,8 T de paramètres totaux et 104 B actifs. Qwen 3.8-Max est plus petit sur les deux dimensions.
Entrée d’images : un vrai changement de périmètre
Qwen 3.7-Max est textuel. Qwen 3.8-Max accepte nativement des images en entrée.
Alibaba publie notamment les scores suivants pour son tableau multimodal :
- MathVision : 95,2 ;
- LogicVista : 91,9 ;
- OSWorld-Verified : 86,1.
Il n’existe pas de colonne Qwen 3.7-Max dans cette comparaison : le modèle précédent ne prend pas d’images en charge.
En pratique, vous pouvez potentiellement unifier des flux auparavant répartis entre un modèle texte et un modèle vision :
- analyse de captures d’écran ;
- compréhension de documents numérisés ;
- extraction d’informations depuis des graphiques ;
- automatisation d’interfaces utilisateur ;
- analyse de visuels dans des tickets de support.
Avant d’intégrer cette capacité en production, vérifiez le format exact attendu par l’API pour votre endpoint et votre région. Le billet de lancement démontre aussi la compréhension de longs documents et de vidéos, mais il faut confirmer la disponibilité API de ces formats selon votre cas d’usage.
Tarification : moins cher au catalogue, plus cher aujourd’hui
Au prix catalogue, Qwen 3.8-Max est proposé à :
- 2 $ / million de tokens d’entrée ;
- 6 $ / million de tokens de sortie.
Qwen 3.7-Max est listé à :
- 2,5 $ / million de tokens d’entrée ;
- 7,5 $ / million de tokens de sortie.
Qwen 3.8-Max est donc 20 % moins cher au catalogue, tout en affichant de meilleurs résultats sur plusieurs benchmarks.
Mais la promotion en cours modifie le calcul :
| Modèle | Entrée | Sortie |
|---|---|---|
qwen3.7-max avec réduction de 50 % |
1,25 $ | 3,75 $ |
qwen3.8-max |
2 $ | 6 $ |
Au tarif actuel, Qwen 3.7-Max est environ 38 % moins cher que Qwen 3.8-Max.
Les tarifs officiels sont disponibles sur la page de tarification Model Studio.
Calculez le coût réel par tâche
Ne comparez pas uniquement le prix par million de tokens. Qwen 3.8-Max utilise par défaut :
{
"reasoning_effort": "xhigh"
}
Les tokens de raisonnement sont facturés comme des tokens de sortie. Pour évaluer le coût réel, journalisez au minimum :
coût_requête =
(tokens_entrée × prix_entrée)
+ (tokens_sortie × prix_sortie)
+ (tokens_raisonnement × prix_sortie)
À surveiller :
- La promotion 3.7-Max peut se terminer. Alibaba la présente comme limitée dans le temps sans date de fin publiée.
-
Le raisonnement peut gonfler la facture. Comparez les niveaux
xhigh,mediumetlowsur vos tâches avant de figer un budget.
Le guide de tarification Qwen 3.8 détaille l’économie du cache et le calcul du coût par tâche.
Si les modèles Max dépassent votre budget, qwen3.7-plus reste une option économique à 0,4 $ / 1,6 $ avec une réduction actuelle de 20 %. Consultez la comparaison Qwen Plus vs Max pour identifier les charges où Plus suffit.
Poids ouverts : une première promise pour Max
Aucun modèle Qwen-Max n’avait été livré avec des poids ouverts auparavant. Qwen 3.7-Max n’en a pas reçu, et Alibaba n’a jamais indiqué qu’il en recevrait.
Pour Qwen 3.8-Max, le communiqué promet une publication sur Hugging Face et ModelScope « la semaine prochaine », soit approximativement vers le 10 août 2026.
Au 3 août 2026, les poids ne sont pas encore téléchargeables. Traitez donc cette annonce comme une promesse, pas comme une capacité disponible.
Même si les poids sont publiés, auto-héberger un modèle de 2,4 T de paramètres est un projet multi-nœuds, y compris avec quantification. Pour la plupart des équipes, l’effet pratique sera plutôt :
- davantage d’options d’hébergement tiers ;
- plus de flexibilité d’approvisionnement ;
- une pression possible sur les prix ;
- des possibilités de conformité supplémentaires.
Si les poids ouverts sont une exigence de gouvernance ou de conformité, ce point peut à lui seul trancher entre 3.7-Max et 3.8-Max.
Ce qui ne change pas
Fenêtre de contexte : 1 M de tokens
Les deux modèles gardent une fenêtre de contexte de 1 M de tokens. Si vous utilisiez 3.7-Max pour le long contexte, 3.8-Max conserve cette capacité avec un tarif fixe sur l’ensemble de la fenêtre.
Migration : un changement d’ID de modèle
Les deux modèles sont servis via Alibaba Cloud Model Studio avec des endpoints compatibles OpenAI. Pour un usage texte simple, la migration consiste principalement à modifier l’ID :
- "model": "qwen3.7-max"
+ "model": "qwen3.8-max"
Qwen 3.8-Max ajoute aussi une surface API compatible Anthropic. Testez-la dans un client tel qu’Apidog si votre outillage utilise déjà ce protocole.
Contrôles de raisonnement explicites
Qwen 3.8-Max documente plusieurs paramètres de raisonnement :
-
reasoning_effort:xhighpar défaut,medium,low; -
enable_thinking; -
preserve_thinking.
Au lieu de dépendre d’un comportement implicite ou de prompts contournant le raisonnement, vous pouvez désormais mesurer l’impact de réglages explicites.
Exemple de point de départ :
{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Analyse cette demande et retourne une réponse structurée."
}
],
"reasoning_effort": "medium",
"enable_thinking": true
}
Faut-il migrer ? Trois décisions pratiques
Migrez maintenant vers Qwen 3.8-Max si…
- vos agents utilisent un terminal ;
- vos tâches nécessitent de la recherche longue ou technique ;
- vous voulez envoyer des images au même modèle ;
- les gains sur Terminal Bench et PaperBench correspondent à vos flux ;
- vous privilégiez le prix catalogue à long terme.
Les écarts de Terminal Bench (74,5 → 86,6) et PaperBench (64,8 → 93,0) sont suffisamment importants pour justifier une expérimentation rapide.
Gardez Qwen 3.7-Max pendant la promotion si…
- votre trafic est surtout composé de Q&R, résumés, classification ou chat ;
- 3.7-Max satisfait déjà vos critères de qualité ;
- la réduction à 1,25 $ / 3,75 $ a un impact budgétaire significatif ;
- vous n’avez pas besoin d’entrée d’images.
Ajoutez un rappel mensuel pour vérifier l’état de la promotion. Votre scénario de repli tarifaire est alors Qwen 3.8-Max à 2 $ / 6 $, pas Qwen 3.7-Max à son ancien prix catalogue.
Utilisez qwen3.7-plus si…
- vos tâches sont routinières ;
- le prix est le critère principal ;
- vous faites surtout de la classification, de l’extraction ou de la génération de formats structurés.
À 0,4 $ / 1,6 $, qwen3.7-plus coûte cinq fois moins cher que Qwen 3.8-Max en entrée.
Testez la migration avant de modifier la production
Les benchmarks fournisseur ne remplacent pas une comparaison sur vos propres prompts, vos données et vos règles de validation.
Le moyen le plus simple est d’exécuter les mêmes requêtes contre les deux modèles avec deux environnements.
1. Créez une collection unique
Configurez une requête vers l’endpoint compatible OpenAI de Model Studio :
POST {{base_url}}/chat/completions
Authorization: Bearer {{api_key}}
Content-Type: application/json
{
"model": "{{model_id}}",
"messages": {{messages}},
"reasoning_effort": "{{reasoning_effort}}"
}
2. Définissez deux environnements
Environnement qwen-3.7-max
{
"model_id": "qwen3.7-max",
"reasoning_effort": "xhigh"
}
Environnement qwen-3.8-max
{
"model_id": "qwen3.8-max",
"reasoning_effort": "xhigh"
}
3. Exécutez un jeu de tests représentatif
Incluez au moins :
- des prompts courts et longs ;
- des cas avec outils ou terminal ;
- des sorties JSON structurées ;
- des demandes contenant des documents ;
- des captures d’écran ou images pour 3.8-Max ;
- des cas d’échec connus ;
- vos contraintes de latence et de coût.
4. Comparez les résultats
Mesurez pour chaque modèle :
| Critère | À mesurer |
|---|---|
| Qualité | Taux de réussite, score humain, conformité au schéma |
| Latence | P50, P95, P99 |
| Coût | Tokens d’entrée, sortie et raisonnement |
| Fiabilité | Erreurs, reprises, sorties invalides |
| Agentique | Nombre d’étapes, succès terminal, corrections nécessaires |
Dans Apidog, vous pouvez basculer entre les environnements, conserver les requêtes de production comme scénarios de test et comparer les réponses, la latence et l’usage des tokens sans dupliquer toute votre collection.
Téléchargez Apidog gratuitement, exécutez cette comparaison sur votre trafic représentatif, puis modifiez la configuration de production avec des données plutôt qu’avec un benchmark seul.
FAQ
Qwen 3.8-Max est-il moins cher que Qwen 3.7-Max ?
Au prix catalogue, oui : 2 $ / 6 $ contre 2,5 $ / 7,5 $ par million de tokens.
Au tarif actuel, non : la promotion de 50 % sur Qwen 3.7-Max le ramène à 1,25 $ / 3,75 $, soit environ 38 % de moins que Qwen 3.8-Max. La promotion n’a pas de date de fin publiée. Consultez le guide de tarification Qwen 3.8 pour les détails.
Dois-je modifier mon code pour passer de qwen3.7-max à qwen3.8-max ?
Pour l’usage texte de base, non : les deux modèles utilisent les mêmes endpoints Model Studio compatibles OpenAI. Changez l’ID de modèle :
- qwen3.7-max
+ qwen3.8-max
Définissez toutefois explicitement reasoning_effort, car 3.8-Max utilise xhigh par défaut et facture les tokens de raisonnement comme tokens de sortie. L’envoi d’images est une capacité propre à 3.8-Max et nécessite le format de message image approprié.
Qwen 3.7-Max a-t-il des poids ouverts ?
Non. Alibaba n’a pas publié de poids ouverts pour Qwen 3.7-Max et n’a jamais indiqué qu’il le ferait.
Qwen 3.8-Max est le premier modèle Max pour lequel des poids sont promis, avec une disponibilité attendue sur Hugging Face et ModelScope vers le 10 août 2026. Au 3 août, ils ne sont pas encore téléchargeables.
Qwen 3.8-Max est-il meilleur que Claude ou GPT ?
Cela dépend du benchmark, et les chiffres cités sont ceux d’Alibaba.
Dans son tableau, Qwen 3.8-Max dépasse Opus 4.8 et Fable 5 sur Terminal Bench 2.1, et mène sur PaperBench et IFBench. En revanche, Fable 5 le devance nettement sur SWE-bench Pro (80,0 contre 67,7), tandis que Qwen reste derrière les modèles de tête sur HLE.
Attendez des évaluations tierces, puis validez avec vos propres tests avant de conclure pour votre cas d’usage.

Top comments (0)