La plupart des lancements de modèles présentent leurs capacités de codage avec un score HumanEval ou une fonction de recherche binaire. Alibaba adopte un autre angle avec Qwen 3.8-Max : le modèle ne se limiterait pas à écrire de bonnes fonctions, il pourrait gérer un projet logiciel pendant plusieurs semaines, ouvrir des issues, fusionner des pull requests et livrer des fonctionnalités sans intervention humaine.
Essayez Apidog dès aujourd’hui
Cette promesse mérite d’être examinée. Cet article couvre les trois démonstrations publiées par Alibaba au lancement — toutes fournies par le vendeur, dont une avec un dépôt public auditable — les benchmarks associés, puis la partie exploitable : utiliser réellement qwen3.8-max avec Claude Code, Codex, Qoder, Qwen Code ou OpenClaw, et tester les API produites par le code généré.
Si vous découvrez le modèle, commencez par cet aperçu de Qwen 3.8 : 2,4 T de paramètres totaux, 95 milliards actifs, une fenêtre de contexte de 1 million de jetons et des poids ouverts annoncés pour la semaine suivant le lancement. Ici, l’objectif est le workflow de développement. Les informations ci-dessous reflètent l’état au 3 août 2026.
Ce qu’Alibaba revendique réellement
Dans le billet officiel Qwen 3.8, Alibaba positionne Qwen 3.8-Max comme un modèle d’ingénierie autonome à long terme : il planifierait le travail, l’exécuterait sur plusieurs jours, se remettrait de ses erreurs et produirait un résultat révisable.
Trois éléments rendent cette annonce plus intéressante qu’une démonstration classique :
- Les exécutions sont longues. Seize jours ne ressemblent pas à un benchmark agentique de 20 minutes. La récupération après erreur, la gestion du contexte et la dérive deviennent centrales.
- Un dépôt est public. Vous pouvez lire les commits, les issues et les pull requests au lieu de vous fier à une vidéo ou une capture d’écran.
- L’environnement de test est connu. Alibaba indique avoir exécuté la majorité de ses benchmarks de code dans l’environnement Claude Code et publie une configuration officielle pour le reproduire.
Prudence : les chiffres cités proviennent des documents de lancement d’Alibaba. Début août 2026, aucune validation indépendante n’est disponible. Considérez ces résultats comme des démonstrations, pas comme des audits.
Les trois démonstrations de codage
oh-my-cli : 16 jours de développement autonome
La démonstration principale consiste en un outil CLI développé sans supervision. Au 30 juillet, l’exécution durait depuis 16 jours et avait produit :
- 265 commits ;
- 127 pull requests ;
- 151 issues.
Alibaba affirme que le modèle a lui-même ouvert, traité et fermé ces éléments.
Le dépôt est public : qwen-code-dev-bot/oh-my-cli. C’est l’artefact le plus utile de la démonstration : auditez les descriptions de PR, vérifiez si les issues correspondent à de vrais problèmes et inspectez la qualité du code.
Lors de votre audit, cherchez notamment :
- si les PR corrigent réellement les issues référencées ;
- si le modèle crée du travail artificiel pour le clôturer ensuite ;
- comment il détecte et corrige ses propres régressions ;
- si la structure du projet reste cohérente après de nombreux changements.
Ces signaux sont plus utiles pour évaluer l’autonomie qu’un score de benchmark isolé.
Reproduction d’article : du code de recherche
La deuxième démonstration cible la reproduction d’un article de recherche en machine learning à partir de zéro. Selon Alibaba, l’exécution a duré environ 125 heures, généré près de 7 600 lignes de code et lancé 33 cycles d’entraînement GPU.
Le modèle aurait reproduit 6 résultats de l’article, puis dépassé le résultat publié de 2,7 points sur AIME24.
Ce type de tâche est difficile à automatiser : dépendances cassées, hyperparamètres incomplets, détails cachés dans les notes de bas de page et bugs silencieux qui invalident une longue exécution. Traverser 33 cycles d’entraînement avec des résultats cohérents dépasse donc la simple auto-complétion.
Cette démonstration est directement liée au score PaperBench présenté plus loin.
Concours Tianchi : 24 heures contre des équipes humaines
La troisième démonstration place le modèle dans une compétition de data science sur la plateforme Tianchi d’Alibaba, avec une limite de 24 heures.
Selon Alibaba, le modèle a effectué 45 soumissions, ajusté son approche après chaque score et atteint une précision finale de 0.853. Ce résultat le place devant 458 des 526 équipes humaines participantes.
Le modèle n’a pas gagné le concours, mais il a dépassé 87 % des participants. Cette démonstration mesure surtout l’itération rapide sous contrainte : soumettre, lire un score, modifier l’approche et recommencer.
La réserve est importante : Tianchi est une plateforme Alibaba. La démonstration est réelle, mais le fournisseur contrôle aussi le terrain.
Les benchmarks de codage derrière les démos
Alibaba a publié un tableau de benchmarks. Voici les lignes les plus pertinentes pour le développement.
| Benchmark | Qwen 3.8-Max | Meilleur rival, selon le tableau Alibaba |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
À retenir :
-
Terminal Bench 2.1 : 86.6. Qwen 3.8-Max dépasse Claude Opus 4.8 et Fable 5, tous deux à 84.6 dans le tableau Alibaba. C’est le score qui soutient le scénario
oh-my-cli. - SWE-bench Pro : 67.7. Le modèle est derrière Fable 5 à 80.0. Pour la correction de bugs à l’échelle d’un dépôt, c’est un écart significatif de plus de 12 points.
- PaperBench : 93.0. C’est le meilleur score mis en avant par Alibaba et il correspond à la démonstration de reproduction d’article.
Lisez aussi les notes méthodologiques : Alibaba indique avoir exécuté la plupart des benchmarks dans Claude Code, y compris pour les modèles concurrents. Les notes précisent également que les résultats de Fable 5 peuvent inclure des mécanismes de repli.
Pour les benchmarks agentiques, le harnais d’exécution influence matériellement le résultat. Un tableau produit par un fournisseur est un signal utile, pas un verdict définitif.
Utiliser Qwen 3.8-Max pour coder aujourd’hui
Qwen 3.8-Max est disponible via Alibaba Cloud Model Studio. Vous avez besoin d’une clé API DashScope depuis home.qwencloud.com.
Selon la tarification officielle de Model Studio, le prix indiqué est :
- 2 $ par million de jetons en entrée ;
- 6 $ par million de jetons en sortie ;
- tarif identique jusqu’à la fenêtre de contexte de 1 million de jetons.
Claude Code
Qwen 3.8-Max propose un endpoint compatible Anthropic. Configurez Claude Code avec ces variables :
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Démarrez ensuite Claude Code normalement. Les requêtes seront routées vers Qwen 3.8-Max.
C’est la configuration la plus proche de l’environnement de benchmark déclaré par Alibaba. Pour la tester proprement :
- créez une branche dédiée ;
- donnez au modèle une tâche limitée et vérifiable ;
- demandez-lui d’exécuter les tests existants ;
- examinez le diff avant toute fusion ;
- élargissez progressivement le périmètre.
Codex
Codex requiert une définition de fournisseur dans sa configuration :
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Cette intégration utilise l’endpoint compatible OpenAI :
export DASHSCOPE_API_KEY=your-dashscope-api-key
Le modèle et la clé sont les mêmes que pour Claude Code ; seul le protocole change.
Qoder, Qwen Code et OpenClaw
Les autres options sont plus directes :
-
Qoder CLI : sélectionnez
qwen3.8-maxcomme modèle. -
Qwen Code : définissez
DASHSCOPE_API_KEY, puis sélectionnez le modèle. Si vous utilisiez déjà des modèles Qwen Code, le workflow reste identique. -
OpenClaw : la configuration officielle utilise l’ID
qwen3.8-maxavecmaxTokens = 65536, correspondant à la longueur maximale de sortie annoncée.
Pour éviter les configurations obsolètes, récupérez la version actuelle dans le billet de lancement officiel plutôt que depuis une capture d’écran.
Régler reasoning_effort selon la tâche
Qwen 3.8-Max propose trois niveaux de raisonnement :
-
xhigh: valeur par défaut ; -
medium; -
low.
Utilisez-les délibérément :
| Type de tâche | Réglage conseillé |
|---|---|
| Refactorisation multi-fichiers | xhigh |
| Débogage complexe | xhigh |
| Planification agentique | xhigh |
| Renommages mécaniques | low |
| Ajout de docstrings | low |
| Modifications répétitives | low |
Les jetons de raisonnement sont facturés comme des jetons de sortie. Une longue session agentique en xhigh peut donc coûter significativement plus cher qu’une modification mécanique exécutée en low.
Si Qwen 3.8-Max est surdimensionné pour votre tâche, Qwen3 Coder reste une option pour le code dédié, tandis que Qwen3 Coder Flash vise les cas rapides et économiques. Pour comparer avec un autre modèle open-weight, consultez Kimi K3 pour le développement.
Tester les API construites par le modèle
Une limite commune aux démonstrations de code autonome est rarement abordée : le code peut compiler, passer ses tests unitaires et pourtant appeler le mauvais endpoint, mal traiter un 429 ou envoyer un payload invalide.
Ajoutez une étape de validation API à votre workflow.
1. Tester les endpoints appelés par le code généré
Quand Qwen 3.8-Max génère un service ou un client API :
- importez votre spécification OpenAPI dans Apidog ;
- exécutez les flux d’authentification ;
- vérifiez les réponses d’erreur ;
- testez les payloads limites ;
- comparez les requêtes générées avec le contrat API.
Il est moins coûteux d’identifier une hypothèse erronée dans un test API que dans une trace de pile après plusieurs heures d’exécution agentique.
Si vous évaluez l’API du modèle, le guide API Qwen 3.8 détaille la configuration des protocoles OpenAI et Anthropic. Vous pouvez utiliser Apidog pour inspecter les deux formats, y compris le streaming et les deltas de raisonnement.
2. Utiliser une API mock avant la production
Ne laissez pas un agent autonome appeler directement votre infrastructure de production pendant une longue exécution.
Une session de plusieurs jours peut provoquer :
- des limites de débit ;
- des mutations de données non souhaitées ;
- des coûts imprévus ;
- des effets de bord difficiles à annuler.
Utilisez les serveurs mock d’Apidog pour fournir des réponses réalistes sans toucher aux systèmes réels.
Workflow recommandé :
Agent Qwen 3.8-Max
|
v
Environnement de développement
|
v
URL API mock Apidog
|
v
Validation humaine
|
v
URL API de production
Pointez d’abord le code généré vers l’URL mock. Après revue humaine et validation des scénarios d’erreur, basculez vers l’URL réelle. Vous pouvez télécharger Apidog gratuitement pour créer une maquette en quelques minutes.
Plus vous accordez d’autonomie à un agent de code, plus vos API deviennent une surface de contrôle essentielle. Vous ne pouvez pas nécessairement relire chaque commit en temps réel, mais vous pouvez contrôler les systèmes auxquels le code est autorisé à parler.
FAQ
Qwen 3.8 est-il bon pour le codage ?
Selon les chiffres d’Alibaba, il est performant pour le codage agentique et les tâches de recherche : 86.6 sur Terminal Bench 2.1 et 93.0 sur PaperBench. Il est moins compétitif sur la correction de bugs dans des dépôts réels, avec 67.7 sur SWE-bench Pro contre 80.0 pour Fable 5.
Ces chiffres ne disposent pas encore de validation indépendante. La lecture prudente : Qwen 3.8-Max semble solide pour les tâches autonomes longues, mais n’est pas le leader déclaré pour tous les scénarios de résolution de problèmes dans un dépôt.
Puis-je utiliser Qwen 3.8 dans Claude Code ?
Oui. Utilisez :
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Alibaba a publié cette configuration et indique avoir utilisé Claude Code pour la majorité de ses benchmarks de codage.
Combien coûte le codage avec Qwen 3.8 ?
Le tarif indiqué est de 2 $ par million de jetons d’entrée et 6 $ par million de jetons de sortie, jusqu’à 1 million de jetons de contexte.
Les jetons de raisonnement sont facturés comme des jetons de sortie. Avec reasoning_effort=xhigh, prévoyez donc un budget plus élevé pour les sessions agentiques. Consultez également l’analyse des benchmarks Qwen 3.8 et les informations tarifaires associées.
L’exécution de 16 jours d’oh-my-cli était-elle réellement autonome ?
C’est l’affirmation d’Alibaba. L’élément vérifiable est le dépôt public qwen-code-dev-bot/oh-my-cli, qui comptait 265 commits, 127 PR et 151 issues au 30 juillet 2026.
La qualité et la pertinence de ce travail restent à évaluer en lisant le dépôt. C’est précisément ce qui rend cette démonstration plus utile qu’une simple capture d’écran : vous pouvez auditer l’artefact vous-même.



Top comments (0)