DEV Community

Cover image for Benchmarks Qwen 3.8 : Ce que le tableau d'Alibaba révèle et ce qu'il omet
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Benchmarks Qwen 3.8 : Ce que le tableau d'Alibaba révèle et ce qu'il omet

Pendant deux semaines, l’histoire de Qwen 3.8 a comporté un angle mort : les aperçus de presse de juillet annonçaient un modèle de pointe, sans publier de scores. Les premiers articles reposaient donc surtout sur des impressions. Cela a changé le 3 août 2026, lorsque le billet de blog officiel d’Alibaba sur Qwen 3.8-Max a publié un tableau de benchmarks comparant Claude Opus 4.8, Fable 5, GPT-5.6 Sol et Qwen3.7-Max, ainsi qu’un tableau multimodal distinct face à Gemini 3.1 Pro et GPT-5.6 Sol.

Essayez Apidog dès aujourd'hui

Ces chiffres sont utiles, mais ils ne suffisent pas à décider d’une migration de modèle. Ce guide identifie les gains et les limites de Qwen 3.8-Max, puis explique comment reproduire une évaluation sur vos propres requêtes API. Pour les paramètres, les tarifs et les options d’accès, consultez d’abord notre présentation de Qwen 3.8-Max.

Important : tous les scores ci-dessous proviennent du tableau publié par Alibaba. Les données de classement citées dans les notes de bas de page sont datées du 3 août 2026. Au moment de la rédaction, aucune évaluation indépendante n’était disponible.

Le tableau, en un coup d’œil

Voici les principales lignes du tableau texte publié par Alibaba. Pour chaque benchmark, un score plus élevé est meilleur.

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86,6 84,6 84,6 88,8 74,5
SWE-bench Pro 67,7 69,2 80,0 64,6 60,6
PaperBench 93,0 80,3 88,8 90,5 64,8
GPQA Diamond 92,6 92,0 92,6 94,1 92,4
IFBench 82,8 62,2 63,5 72,7 79,1
HLE (Humanity’s Last Exam) 43,6 45,7 53,3 47,2 41,4

Source : tableau géré par le fournisseur, Alibaba.

Tableau de benchmarks Qwen 3.8-Max

Où Qwen 3.8-Max gagne

PaperBench : le signal le plus fort

Sur PaperBench, Qwen 3.8-Max obtient 93,0, devant GPT-5.6 Sol (90,5), Fable 5 (88,8) et Opus 4.8 (80,3).

L’écart avec Qwen3.7-Max est particulièrement important : 64,8 à 93,0, soit plus de 28 points. Si ce gain est confirmé indépendamment, il peut indiquer une amélioration significative sur les tâches qui demandent de reproduire ou d’exploiter des résultats de recherche.

À tester dans votre produit :

  • synthèse d’articles techniques ;
  • génération de protocoles expérimentaux ;
  • extraction de méthodes et de résultats ;
  • vérification de contraintes dans des documents scientifiques.

IFBench : un avantage net sur le respect des instructions

Qwen 3.8-Max atteint 82,8 sur IFBench, contre 72,7 pour GPT-5.6 Sol, 63,5 pour Fable 5 et 62,2 pour Opus 4.8.

L’écart est notable, et Qwen3.7-Max obtenait déjà 79,1. Le respect des instructions semble donc être une force récurrente de la gamme Qwen plutôt qu’un résultat isolé.

Pour vérifier ce point dans votre API, créez des cas de test qui exigent :

  • un JSON strictement valide ;
  • des clés obligatoires ;
  • un nombre maximal d’éléments ;
  • une langue imposée ;
  • l’absence de texte hors structure ;
  • des règles de format explicites.

Exemple de prompt de test :

Retourne uniquement un objet JSON valide.

Contraintes :
- les clés doivent être : "summary", "risks", "next_actions"
- "risks" doit contenir exactement 3 éléments
- "next_actions" doit contenir entre 2 et 5 éléments
- aucun texte ne doit apparaître avant ou après le JSON
Enter fullscreen mode Exit fullscreen mode

Terminal Bench 2.1 : devant Claude, mais derrière GPT-5.6 Sol

Dans l’exécution d’Alibaba, Qwen 3.8-Max atteint 86,6 sur Terminal Bench 2.1, contre 84,6 pour Opus 4.8 et Fable 5. GPT-5.6 Sol reste premier avec 88,8.

Le résultat est donc une deuxième place, pas une domination. Il reste toutefois important pour les workflows agentiques : Qwen dépasse les deux modèles Anthropic cités dans ce tableau sur une évaluation pilotée par terminal.

Multimodal : le différenciateur principal

Le tableau multimodal est la section où Qwen 3.8-Max paraît le plus compétitif. Alibaba indique notamment :

  • MathVision : 95,2
  • LogicVista : 91,9
  • OSWorld-Verified : 86,1

Le modèle domine également presque toutes les lignes OCR du tableau publié.

Opus 4.8 et Fable 5 ne figurent pas directement dans cette comparaison multimodale, car ils y sont présentés comme des modèles axés texte. Face à Gemini 3.1 Pro et GPT-5.6 Sol, le raisonnement visuel et l’intelligence documentaire semblent être les différenciateurs les plus nets de Qwen 3.8-Max.

Par contraste, Kimi K3 est uniquement textuel. Notre comparaison Qwen 3.8 vs Kimi K3 détaille les implications de cette différence.

Où il perd, en toute honnêteté

Alibaba a conservé les lignes défavorables dans son tableau. Trois limites ressortent.

HLE : 43,6, loin derrière Fable 5

Sur Humanity’s Last Exam, Qwen 3.8-Max obtient 43,6 :

  • Fable 5 : 53,3
  • GPT-5.6 Sol : 47,2
  • Claude Opus 4.8 : 45,7
  • Qwen 3.8-Max : 43,6

Qwen progresse légèrement par rapport aux 41,4 de Qwen3.7-Max, mais reste dernier parmi les quatre modèles phares. Pour les usages centrés sur des questions de connaissances générales très difficiles, ce résultat doit être pris en compte.

SWE-bench Pro : 67,7 contre 80,0 pour Fable 5

Sur SWE-bench Pro, Qwen 3.8-Max obtient 67,7. Il dépasse GPT-5.6 Sol (64,6), se rapproche d’Opus 4.8 (69,2), mais reste 12,3 points derrière Fable 5 (80,0).

Le gain face à Qwen3.7-Max est réel — de 60,6 à 67,7 — mais il ne faut pas confondre deux affirmations compatibles :

  1. Qwen 3.8-Max dépasse Opus 4.8 sur Terminal Bench 2.1.
  2. Fable 5 le dépasse largement sur SWE-bench Pro.

Si votre usage principal est la correction de bugs complexes dans un dépôt existant, évaluez le modèle sur vos propres tickets avant de changer de fournisseur.

DeepSWE et les évaluations agentiques plus profondes

DeepSWE est une autre ligne où Qwen 3.8-Max est en retrait face aux modèles de pointe du tableau Alibaba.

Le profil qui se dessine est cohérent :

  • compétitif sur des tâches agentiques guidées par terminal ;
  • plus faible sur les évaluations d’ingénierie logicielle les plus approfondies ;
  • fort sur le multimodal, l’OCR et l’intelligence documentaire.

En résumé, Qwen 3.8-Max affiche un résultat solide pour un modèle facturé 2 $ en entrée et 6 $ en sortie par million de jetons, selon la page de tarification officielle. Cela ne constitue toutefois pas une victoire généralisée sur tous les fronts.

Les petits caractères à lire avant de citer les scores

Un tableau de benchmarks ne décrit pas seulement un modèle. Il décrit aussi une méthode d’évaluation. Quatre détails du billet d’Alibaba changent la lecture des résultats.

1. Tous les chiffres sont gérés par le fournisseur

Alibaba a évalué son propre modèle et les modèles concurrents. C’est courant dans les annonces de lancement, mais cela implique des choix méthodologiques :

  • version du benchmark ;
  • prompts système ;
  • stratégie de prompting ;
  • paramètres d’échantillonnage ;
  • politique de réessai ;
  • configuration d’outils.

Cela ne prouve pas une fraude. Cela signifie simplement qu’un tableau de lancement est une affirmation du fournisseur, pas encore une mesure indépendante.

2. La plupart des benchmarks de code utilisent le harnais Claude Code

Alibaba indique avoir exécuté la plupart des benchmarks de code avec Claude Code, le harnais agentique d’Anthropic, relié à Qwen 3.8-Max via une API compatible Anthropic.

C’est utile parce que tous les modèles sont comparés dans le même outil. Mais cela a une conséquence importante : les scores mesurent aussi la compatibilité de Qwen avec ce harnais précis.

Pour les tâches agentiques, le harnais peut modifier les résultats de plusieurs points. Évaluez donc séparément :

  • votre orchestrateur actuel ;
  • votre stratégie de retry ;
  • vos outils shell ou Git ;
  • vos limites de temps ;
  • votre format de sortie attendu.

3. Plusieurs benchmarks sont internes à Qwen

QwenSWEBench, QwenQoderBench, CoWorkBench et RecreationBench ont été développés par l’équipe Qwen.

Les benchmarks internes peuvent mesurer des capacités pertinentes que les évaluations publiques ne couvrent pas. Mais un score élevé sur le benchmark du créateur n’a pas le même poids qu’un score élevé sur une évaluation publique telle que SWE-bench Pro.

Avant de reprendre un chiffre, identifiez donc sa catégorie :

Type de benchmark Comment l’interpréter
Public et largement utilisé Signal plus facilement comparable
Interne au fournisseur Signal utile, mais à recouper
Exécuté avec un harnais spécifique Dépend aussi de l’outillage et de la configuration

4. La note de bas de page sur Fable 5

Le tableau d’Alibaba indique que les résultats de Fable 5 « peuvent impliquer des replis ».

Cette note ne permet pas, à elle seule, de conclure sur la cause technique. En revanche, elle signifie que la colonne Fable 5 comporte une réserve explicite de la part du fournisseur qui publie le tableau.

Lisez toujours les notes de bas de page avant de comparer deux scores proches.

Ce schéma ne concerne pas uniquement Alibaba : Anthropic, OpenAI et Google publient également des tableaux autogérés avec leurs propres choix méthodologiques. Nous avions relevé la même question dans notre analyse des benchmarks de Kimi K3.

Comment lire le prochain tableau de benchmarks

Au 3 août 2026, aucune évaluation indépendante de Qwen 3.8-Max n’était disponible. Artificial Analysis et les principaux classements communautaires n’avaient pas encore publié de résultats.

En attendant ces données, utilisez cette checklist pour évaluer n’importe quel tableau de fournisseur :

  1. Qui a exécuté l’évaluation ?

    Les chiffres publiés par le fournisseur doivent être recoupés avec une seconde source.

  2. Quel harnais a été utilisé ?

    Les évaluations agentiques sont sensibles au framework, aux outils et aux paramètres d’exécution.

  3. Quels paramètres de génération ont été choisis ?

    Température, budget de raisonnement, retries et limites de tokens peuvent faire varier le résultat.

  4. Quels benchmarks sont internes ?

    Ils peuvent être pertinents, mais ne sont pas directement équivalents aux évaluations publiques.

  5. Que disent les notes de bas de page ?

    Les réserves méthodologiques y apparaissent souvent.

  6. Qu’est-ce qui manque ?

    L’absence d’un benchmark peut être aussi informative que sa présence. Comparez notamment avec la performance de la génération précédente chez les différents fournisseurs pour repérer les lignes disparues.

  7. Existe-t-il une seconde source ?

    Quelques jours ou une semaine suffisent souvent pour obtenir des résultats indépendants.

Exécutez votre propre évaluation

Lire les tableaux est utile. Mesurer votre propre charge de travail est mieux.

Qwen 3.8-Max est disponible sur Alibaba Cloud Model Studio sous l’identifiant qwen3.8-max, listé sur la page officielle des modèles. Le service propose une API compatible OpenAI et une API compatible Anthropic.

L’objectif n’est pas de reproduire un benchmark académique complet. Commencez par comparer les modèles sur les requêtes qui déterminent réellement la qualité de votre application.

Étape 1 : sélectionnez 20 à 30 requêtes représentatives

Incluez des cas réels et anonymisés :

  • requêtes simples ;
  • entrées longues ;
  • documents mal formatés ;
  • cas limites ;
  • demandes nécessitant un JSON strict ;
  • tâches de code ;
  • tâches avec images ou OCR, si elles font partie de votre produit.

Stockez-les dans un fichier de test ou une collection API. Exemple de structure :

[
  {
    "name": "Extraction de données",
    "input": "Extrais le nom, la date et le montant de ce document.",
    "expected_fields": ["name", "date", "amount"]
  },
  {
    "name": "Réponse JSON stricte",
    "input": "Retourne uniquement un JSON contenant status et actions.",
    "expected_fields": ["status", "actions"]
  }
]
Enter fullscreen mode Exit fullscreen mode

Étape 2 : préparez deux requêtes identiques

Configurez :

  • une requête vers qwen3.8-max ;
  • une requête vers votre modèle de référence actuel.

Votre référence peut être Qwen3.7-Max, Kimi K3, Claude ou GPT. Gardez constants :

  • le prompt ;
  • les messages système ;
  • les limites de tokens ;
  • la température ;
  • les outils disponibles ;
  • les règles de retry.

Sinon, vous mesurez autant la configuration que le modèle.

Étape 3 : ajoutez des assertions utiles

Dans Apidog, créez un scénario de test pour chaque lot de requêtes et vérifiez les propriétés qui comptent réellement pour votre application :

  • code HTTP attendu ;
  • JSON valide ;
  • champs obligatoires présents ;
  • valeurs respectant le schéma ;
  • absence de texte parasite ;
  • latence sous votre seuil ;
  • réponse exploitable par l’étape suivante de votre workflow.

Exemples de critères :

- status_code == 200
- réponse JSON valide
- response.summary existe
- response.actions contient au moins 1 élément
- latence < seuil défini par votre service
Enter fullscreen mode Exit fullscreen mode

Étape 4 : mesurez coût, latence et taux de réussite

Ne comparez pas uniquement la qualité perçue. Enregistrez également :

Mesure Pourquoi elle compte
Taux de réussite Vérifie la conformité aux contraintes
Latence moyenne Impacte directement l’expérience utilisateur
Latence p95 Révèle les cas lents
Taille de sortie Influence le coût et les étapes suivantes
Taux de JSON invalide Critique pour les pipelines automatisés
Taux de retry Révèle une fragilité opérationnelle

Les rapports de test d’Apidog permettent de comparer les taux de réussite et les temps de réponse modèle par modèle, sur votre propre charge de travail.

Étape 5 : testez les variantes spécifiques à Qwen

Deux éléments méritent une vérification distincte :

  1. Le niveau de raisonnement

    Le modèle utilise par défaut reasoning_effort: xhigh. Mesurez coût et latence au niveau que vous utiliserez réellement en production.

  2. Le protocole compatible Anthropic

    Si vous prévoyez d’utiliser l’endpoint compatible Anthropic, testez-le séparément. C’est aussi le protocole utilisé par Alibaba pour la plupart de ses benchmarks de code via Claude Code.

Vous pouvez télécharger Apidog, configurer les deux endpoints comme environnements, puis exécuter les mêmes scénarios sur chaque modèle. Vous obtiendrez des données plus directement utiles que n’importe quel benchmark générique.

Foire aux questions

Les chiffres des benchmarks de Qwen 3.8 sont-ils vérifiés indépendamment ?

Non. Au 3 août 2026, tous les chiffres publiés provenaient du tableau d’Alibaba. Artificial Analysis et les classements communautaires n’avaient pas encore évalué Qwen 3.8-Max. Considérez donc ces résultats comme les affirmations du fournisseur jusqu’à la publication d’exécutions indépendantes.

Quel est le meilleur résultat de benchmark de Qwen 3.8-Max ?

Dans le tableau texte, PaperBench est son meilleur résultat avec 93,0, devant GPT-5.6 Sol (90,5), Fable 5 (88,8) et Opus 4.8 (80,3).

Dans le tableau multimodal, MathVision à 95,2 et les lignes OCR sont ses résultats les plus solides.

Où Qwen 3.8-Max perd-il clairement ?

Qwen 3.8-Max obtient 43,6 sur HLE, dernier parmi les quatre modèles phares et loin derrière Fable 5 à 53,3.

Sur SWE-bench Pro, il atteint 67,7 contre 80,0 pour Fable 5. Il est également en retrait sur DeepSWE. Les évaluations poussées d’ingénierie logicielle et les examens de connaissances générales sont ses points faibles dans le tableau Alibaba.

Dans quelle mesure Qwen 3.8 est-il meilleur que Qwen 3.7-Max sur les benchmarks ?

Les gains rapportés par Alibaba sont importants :

  • Terminal Bench 2.1 : 74,5 → 86,6 ;
  • SWE-bench Pro : 60,6 → 67,7 ;
  • PaperBench : 64,8 → 93,0.

La pertinence de la migration dépend néanmoins de votre charge de travail, de la modalité utilisée et du coût. Notre comparaison Qwen 3.8 vs Qwen 3.7 couvre cette décision plus en détail.

Top comments (0)