Pendant deux semaines, l’histoire de Qwen 3.8 a comporté un angle mort : les aperçus de presse de juillet annonçaient un modèle de pointe, sans publier de scores. Les premiers articles reposaient donc surtout sur des impressions. Cela a changé le 3 août 2026, lorsque le billet de blog officiel d’Alibaba sur Qwen 3.8-Max a publié un tableau de benchmarks comparant Claude Opus 4.8, Fable 5, GPT-5.6 Sol et Qwen3.7-Max, ainsi qu’un tableau multimodal distinct face à Gemini 3.1 Pro et GPT-5.6 Sol.
Essayez Apidog dès aujourd'hui
Ces chiffres sont utiles, mais ils ne suffisent pas à décider d’une migration de modèle. Ce guide identifie les gains et les limites de Qwen 3.8-Max, puis explique comment reproduire une évaluation sur vos propres requêtes API. Pour les paramètres, les tarifs et les options d’accès, consultez d’abord notre présentation de Qwen 3.8-Max.
Important : tous les scores ci-dessous proviennent du tableau publié par Alibaba. Les données de classement citées dans les notes de bas de page sont datées du 3 août 2026. Au moment de la rédaction, aucune évaluation indépendante n’était disponible.
Le tableau, en un coup d’œil
Voici les principales lignes du tableau texte publié par Alibaba. Pour chaque benchmark, un score plus élevé est meilleur.
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86,6 | 84,6 | 84,6 | 88,8 | 74,5 |
| SWE-bench Pro | 67,7 | 69,2 | 80,0 | 64,6 | 60,6 |
| PaperBench | 93,0 | 80,3 | 88,8 | 90,5 | 64,8 |
| GPQA Diamond | 92,6 | 92,0 | 92,6 | 94,1 | 92,4 |
| IFBench | 82,8 | 62,2 | 63,5 | 72,7 | 79,1 |
| HLE (Humanity’s Last Exam) | 43,6 | 45,7 | 53,3 | 47,2 | 41,4 |
Source : tableau géré par le fournisseur, Alibaba.
Où Qwen 3.8-Max gagne
PaperBench : le signal le plus fort
Sur PaperBench, Qwen 3.8-Max obtient 93,0, devant GPT-5.6 Sol (90,5), Fable 5 (88,8) et Opus 4.8 (80,3).
L’écart avec Qwen3.7-Max est particulièrement important : 64,8 à 93,0, soit plus de 28 points. Si ce gain est confirmé indépendamment, il peut indiquer une amélioration significative sur les tâches qui demandent de reproduire ou d’exploiter des résultats de recherche.
À tester dans votre produit :
- synthèse d’articles techniques ;
- génération de protocoles expérimentaux ;
- extraction de méthodes et de résultats ;
- vérification de contraintes dans des documents scientifiques.
IFBench : un avantage net sur le respect des instructions
Qwen 3.8-Max atteint 82,8 sur IFBench, contre 72,7 pour GPT-5.6 Sol, 63,5 pour Fable 5 et 62,2 pour Opus 4.8.
L’écart est notable, et Qwen3.7-Max obtenait déjà 79,1. Le respect des instructions semble donc être une force récurrente de la gamme Qwen plutôt qu’un résultat isolé.
Pour vérifier ce point dans votre API, créez des cas de test qui exigent :
- un JSON strictement valide ;
- des clés obligatoires ;
- un nombre maximal d’éléments ;
- une langue imposée ;
- l’absence de texte hors structure ;
- des règles de format explicites.
Exemple de prompt de test :
Retourne uniquement un objet JSON valide.
Contraintes :
- les clés doivent être : "summary", "risks", "next_actions"
- "risks" doit contenir exactement 3 éléments
- "next_actions" doit contenir entre 2 et 5 éléments
- aucun texte ne doit apparaître avant ou après le JSON
Terminal Bench 2.1 : devant Claude, mais derrière GPT-5.6 Sol
Dans l’exécution d’Alibaba, Qwen 3.8-Max atteint 86,6 sur Terminal Bench 2.1, contre 84,6 pour Opus 4.8 et Fable 5. GPT-5.6 Sol reste premier avec 88,8.
Le résultat est donc une deuxième place, pas une domination. Il reste toutefois important pour les workflows agentiques : Qwen dépasse les deux modèles Anthropic cités dans ce tableau sur une évaluation pilotée par terminal.
Multimodal : le différenciateur principal
Le tableau multimodal est la section où Qwen 3.8-Max paraît le plus compétitif. Alibaba indique notamment :
- MathVision : 95,2
- LogicVista : 91,9
- OSWorld-Verified : 86,1
Le modèle domine également presque toutes les lignes OCR du tableau publié.
Opus 4.8 et Fable 5 ne figurent pas directement dans cette comparaison multimodale, car ils y sont présentés comme des modèles axés texte. Face à Gemini 3.1 Pro et GPT-5.6 Sol, le raisonnement visuel et l’intelligence documentaire semblent être les différenciateurs les plus nets de Qwen 3.8-Max.
Par contraste, Kimi K3 est uniquement textuel. Notre comparaison Qwen 3.8 vs Kimi K3 détaille les implications de cette différence.
Où il perd, en toute honnêteté
Alibaba a conservé les lignes défavorables dans son tableau. Trois limites ressortent.
HLE : 43,6, loin derrière Fable 5
Sur Humanity’s Last Exam, Qwen 3.8-Max obtient 43,6 :
- Fable 5 : 53,3
- GPT-5.6 Sol : 47,2
- Claude Opus 4.8 : 45,7
- Qwen 3.8-Max : 43,6
Qwen progresse légèrement par rapport aux 41,4 de Qwen3.7-Max, mais reste dernier parmi les quatre modèles phares. Pour les usages centrés sur des questions de connaissances générales très difficiles, ce résultat doit être pris en compte.
SWE-bench Pro : 67,7 contre 80,0 pour Fable 5
Sur SWE-bench Pro, Qwen 3.8-Max obtient 67,7. Il dépasse GPT-5.6 Sol (64,6), se rapproche d’Opus 4.8 (69,2), mais reste 12,3 points derrière Fable 5 (80,0).
Le gain face à Qwen3.7-Max est réel — de 60,6 à 67,7 — mais il ne faut pas confondre deux affirmations compatibles :
- Qwen 3.8-Max dépasse Opus 4.8 sur Terminal Bench 2.1.
- Fable 5 le dépasse largement sur SWE-bench Pro.
Si votre usage principal est la correction de bugs complexes dans un dépôt existant, évaluez le modèle sur vos propres tickets avant de changer de fournisseur.
DeepSWE et les évaluations agentiques plus profondes
DeepSWE est une autre ligne où Qwen 3.8-Max est en retrait face aux modèles de pointe du tableau Alibaba.
Le profil qui se dessine est cohérent :
- compétitif sur des tâches agentiques guidées par terminal ;
- plus faible sur les évaluations d’ingénierie logicielle les plus approfondies ;
- fort sur le multimodal, l’OCR et l’intelligence documentaire.
En résumé, Qwen 3.8-Max affiche un résultat solide pour un modèle facturé 2 $ en entrée et 6 $ en sortie par million de jetons, selon la page de tarification officielle. Cela ne constitue toutefois pas une victoire généralisée sur tous les fronts.
Les petits caractères à lire avant de citer les scores
Un tableau de benchmarks ne décrit pas seulement un modèle. Il décrit aussi une méthode d’évaluation. Quatre détails du billet d’Alibaba changent la lecture des résultats.
1. Tous les chiffres sont gérés par le fournisseur
Alibaba a évalué son propre modèle et les modèles concurrents. C’est courant dans les annonces de lancement, mais cela implique des choix méthodologiques :
- version du benchmark ;
- prompts système ;
- stratégie de prompting ;
- paramètres d’échantillonnage ;
- politique de réessai ;
- configuration d’outils.
Cela ne prouve pas une fraude. Cela signifie simplement qu’un tableau de lancement est une affirmation du fournisseur, pas encore une mesure indépendante.
2. La plupart des benchmarks de code utilisent le harnais Claude Code
Alibaba indique avoir exécuté la plupart des benchmarks de code avec Claude Code, le harnais agentique d’Anthropic, relié à Qwen 3.8-Max via une API compatible Anthropic.
C’est utile parce que tous les modèles sont comparés dans le même outil. Mais cela a une conséquence importante : les scores mesurent aussi la compatibilité de Qwen avec ce harnais précis.
Pour les tâches agentiques, le harnais peut modifier les résultats de plusieurs points. Évaluez donc séparément :
- votre orchestrateur actuel ;
- votre stratégie de retry ;
- vos outils shell ou Git ;
- vos limites de temps ;
- votre format de sortie attendu.
3. Plusieurs benchmarks sont internes à Qwen
QwenSWEBench, QwenQoderBench, CoWorkBench et RecreationBench ont été développés par l’équipe Qwen.
Les benchmarks internes peuvent mesurer des capacités pertinentes que les évaluations publiques ne couvrent pas. Mais un score élevé sur le benchmark du créateur n’a pas le même poids qu’un score élevé sur une évaluation publique telle que SWE-bench Pro.
Avant de reprendre un chiffre, identifiez donc sa catégorie :
| Type de benchmark | Comment l’interpréter |
|---|---|
| Public et largement utilisé | Signal plus facilement comparable |
| Interne au fournisseur | Signal utile, mais à recouper |
| Exécuté avec un harnais spécifique | Dépend aussi de l’outillage et de la configuration |
4. La note de bas de page sur Fable 5
Le tableau d’Alibaba indique que les résultats de Fable 5 « peuvent impliquer des replis ».
Cette note ne permet pas, à elle seule, de conclure sur la cause technique. En revanche, elle signifie que la colonne Fable 5 comporte une réserve explicite de la part du fournisseur qui publie le tableau.
Lisez toujours les notes de bas de page avant de comparer deux scores proches.
Ce schéma ne concerne pas uniquement Alibaba : Anthropic, OpenAI et Google publient également des tableaux autogérés avec leurs propres choix méthodologiques. Nous avions relevé la même question dans notre analyse des benchmarks de Kimi K3.
Comment lire le prochain tableau de benchmarks
Au 3 août 2026, aucune évaluation indépendante de Qwen 3.8-Max n’était disponible. Artificial Analysis et les principaux classements communautaires n’avaient pas encore publié de résultats.
En attendant ces données, utilisez cette checklist pour évaluer n’importe quel tableau de fournisseur :
Qui a exécuté l’évaluation ?
Les chiffres publiés par le fournisseur doivent être recoupés avec une seconde source.Quel harnais a été utilisé ?
Les évaluations agentiques sont sensibles au framework, aux outils et aux paramètres d’exécution.Quels paramètres de génération ont été choisis ?
Température, budget de raisonnement, retries et limites de tokens peuvent faire varier le résultat.Quels benchmarks sont internes ?
Ils peuvent être pertinents, mais ne sont pas directement équivalents aux évaluations publiques.Que disent les notes de bas de page ?
Les réserves méthodologiques y apparaissent souvent.Qu’est-ce qui manque ?
L’absence d’un benchmark peut être aussi informative que sa présence. Comparez notamment avec la performance de la génération précédente chez les différents fournisseurs pour repérer les lignes disparues.Existe-t-il une seconde source ?
Quelques jours ou une semaine suffisent souvent pour obtenir des résultats indépendants.
Exécutez votre propre évaluation
Lire les tableaux est utile. Mesurer votre propre charge de travail est mieux.
Qwen 3.8-Max est disponible sur Alibaba Cloud Model Studio sous l’identifiant qwen3.8-max, listé sur la page officielle des modèles. Le service propose une API compatible OpenAI et une API compatible Anthropic.
L’objectif n’est pas de reproduire un benchmark académique complet. Commencez par comparer les modèles sur les requêtes qui déterminent réellement la qualité de votre application.
Étape 1 : sélectionnez 20 à 30 requêtes représentatives
Incluez des cas réels et anonymisés :
- requêtes simples ;
- entrées longues ;
- documents mal formatés ;
- cas limites ;
- demandes nécessitant un JSON strict ;
- tâches de code ;
- tâches avec images ou OCR, si elles font partie de votre produit.
Stockez-les dans un fichier de test ou une collection API. Exemple de structure :
[
{
"name": "Extraction de données",
"input": "Extrais le nom, la date et le montant de ce document.",
"expected_fields": ["name", "date", "amount"]
},
{
"name": "Réponse JSON stricte",
"input": "Retourne uniquement un JSON contenant status et actions.",
"expected_fields": ["status", "actions"]
}
]
Étape 2 : préparez deux requêtes identiques
Configurez :
- une requête vers
qwen3.8-max; - une requête vers votre modèle de référence actuel.
Votre référence peut être Qwen3.7-Max, Kimi K3, Claude ou GPT. Gardez constants :
- le prompt ;
- les messages système ;
- les limites de tokens ;
- la température ;
- les outils disponibles ;
- les règles de retry.
Sinon, vous mesurez autant la configuration que le modèle.
Étape 3 : ajoutez des assertions utiles
Dans Apidog, créez un scénario de test pour chaque lot de requêtes et vérifiez les propriétés qui comptent réellement pour votre application :
- code HTTP attendu ;
- JSON valide ;
- champs obligatoires présents ;
- valeurs respectant le schéma ;
- absence de texte parasite ;
- latence sous votre seuil ;
- réponse exploitable par l’étape suivante de votre workflow.
Exemples de critères :
- status_code == 200
- réponse JSON valide
- response.summary existe
- response.actions contient au moins 1 élément
- latence < seuil défini par votre service
Étape 4 : mesurez coût, latence et taux de réussite
Ne comparez pas uniquement la qualité perçue. Enregistrez également :
| Mesure | Pourquoi elle compte |
|---|---|
| Taux de réussite | Vérifie la conformité aux contraintes |
| Latence moyenne | Impacte directement l’expérience utilisateur |
| Latence p95 | Révèle les cas lents |
| Taille de sortie | Influence le coût et les étapes suivantes |
| Taux de JSON invalide | Critique pour les pipelines automatisés |
| Taux de retry | Révèle une fragilité opérationnelle |
Les rapports de test d’Apidog permettent de comparer les taux de réussite et les temps de réponse modèle par modèle, sur votre propre charge de travail.
Étape 5 : testez les variantes spécifiques à Qwen
Deux éléments méritent une vérification distincte :
Le niveau de raisonnement
Le modèle utilise par défautreasoning_effort: xhigh. Mesurez coût et latence au niveau que vous utiliserez réellement en production.Le protocole compatible Anthropic
Si vous prévoyez d’utiliser l’endpoint compatible Anthropic, testez-le séparément. C’est aussi le protocole utilisé par Alibaba pour la plupart de ses benchmarks de code via Claude Code.
Vous pouvez télécharger Apidog, configurer les deux endpoints comme environnements, puis exécuter les mêmes scénarios sur chaque modèle. Vous obtiendrez des données plus directement utiles que n’importe quel benchmark générique.
Foire aux questions
Les chiffres des benchmarks de Qwen 3.8 sont-ils vérifiés indépendamment ?
Non. Au 3 août 2026, tous les chiffres publiés provenaient du tableau d’Alibaba. Artificial Analysis et les classements communautaires n’avaient pas encore évalué Qwen 3.8-Max. Considérez donc ces résultats comme les affirmations du fournisseur jusqu’à la publication d’exécutions indépendantes.
Quel est le meilleur résultat de benchmark de Qwen 3.8-Max ?
Dans le tableau texte, PaperBench est son meilleur résultat avec 93,0, devant GPT-5.6 Sol (90,5), Fable 5 (88,8) et Opus 4.8 (80,3).
Dans le tableau multimodal, MathVision à 95,2 et les lignes OCR sont ses résultats les plus solides.
Où Qwen 3.8-Max perd-il clairement ?
Qwen 3.8-Max obtient 43,6 sur HLE, dernier parmi les quatre modèles phares et loin derrière Fable 5 à 53,3.
Sur SWE-bench Pro, il atteint 67,7 contre 80,0 pour Fable 5. Il est également en retrait sur DeepSWE. Les évaluations poussées d’ingénierie logicielle et les examens de connaissances générales sont ses points faibles dans le tableau Alibaba.
Dans quelle mesure Qwen 3.8 est-il meilleur que Qwen 3.7-Max sur les benchmarks ?
Les gains rapportés par Alibaba sont importants :
- Terminal Bench 2.1 : 74,5 → 86,6 ;
- SWE-bench Pro : 60,6 → 67,7 ;
- PaperBench : 64,8 → 93,0.
La pertinence de la migration dépend néanmoins de votre charge de travail, de la modalité utilisée et du coût. Notre comparaison Qwen 3.8 vs Qwen 3.7 couvre cette décision plus en détail.

Top comments (0)