Alibaba a lancé Qwen 3.8-Max début août 2026, et l’API est déjà disponible dans Model Studio. Le modèle totalise 2,4 T de paramètres, dont 95 milliards actifs, accepte jusqu’à 1 million de tokens de contexte et coûte 2 $ en entrée / 6 $ en sortie par million de tokens. Pour les détails sur le modèle, consultez notre explication de Qwen 3.8. Ce guide se concentre sur l’implémentation : clé API, région, premier appel, streaming et intégration dans vos outils.
Essayez Apidog dès aujourd’hui
Qwen 3.8-Max expose deux protocoles dès son lancement :
- un endpoint compatible OpenAI ;
- un endpoint compatible Anthropic.
Vous pouvez donc réutiliser un client OpenAI existant ou configurer Claude Code avec trois variables d’environnement. Vous pouvez aussi comparer les deux formats dans Apidog, notamment pour inspecter les réponses en streaming.
Ce dont vous avez besoin avant de commencer
| Élément | Valeur |
|---|---|
| ID du modèle | qwen3.8-max |
| Fenêtre de contexte | 1 000 000 tokens |
| Sortie maximale | 65 536 tokens |
| Types d’entrée | Texte et images |
| Tarification | 2 $ en entrée / 6 $ en sortie par million de tokens |
| Contrôle du raisonnement |
reasoning_effort : xhigh, medium, low
|
| Protocoles | Chat Completions et Responses OpenAI, Messages Anthropic |
| Variable de clé API | DASHSCOPE_API_KEY |
Ces informations proviennent de l’annonce officielle de Qwen 3.8 et de la documentation d’Alibaba Cloud Model Studio.
Début août 2026, Alibaba a annoncé que les poids ouverts seraient publiés sur Hugging Face et ModelScope la semaine suivante, mais ils ne sont pas encore téléchargeables. Les exemples ci-dessous utilisent donc l’API hébergée.
Étape 1 : obtenir une clé API QwenCloud
- Ouvrez home.qwencloud.com.
- Connectez-vous ou créez un compte.
- Créez une clé API dans la console.
- Exportez-la sous le nom
DASHSCOPE_API_KEY.
export DASHSCOPE_API_KEY="sk-your-key-here"
Ajoutez cette variable à votre profil shell ou à un fichier .env. Ne stockez pas la clé dans votre dépôt Git ni directement dans votre code.
Les nouveaux comptes disposent d’un quota gratuit de 1 million de tokens valable 90 jours. Ce quota est disponible uniquement dans la région de Singapour.
Étape 2 : choisir une URL de base régionale
Model Studio propose l’API compatible OpenAI dans trois régions :
| Région | URL de base |
|---|---|
| Beijing | https://dashscope.aliyuncs.com/compatible-mode/v1 |
| Singapour | https://dashscope-intl.aliyuncs.com/compatible-mode/v1 |
| États-Unis, Virginie | https://dashscope-us.aliyuncs.com/compatible-mode/v1 |
Pour la plupart des déploiements internationaux, utilisez Singapour :
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
C’est également la région qui donne accès au quota gratuit. La liste des modèles Model Studio indique que qwen3.8-max prend en charge la génération de texte ainsi que la compréhension d’images et de vidéos.
Dans les exemples suivants, remplacez l’URL de base si vos serveurs sont plus proches de Pékin ou de Virginie.
Étape 3 : effectuer votre premier appel avec le SDK OpenAI
Installez le SDK Python officiel :
pip install openai
Puis configurez le client avec l’URL DashScope :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "system",
"content": "You are a precise technical assistant."
},
{
"role": "user",
"content": "Explain idempotency in REST APIs in two sentences."
},
],
)
print(completion.choices[0].message.content)
L’équivalent en cURL :
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Explain idempotency in REST APIs in two sentences."
}
]
}'
Si vous utilisez déjà un fournisseur compatible OpenAI, la migration consiste principalement à modifier :
base_url- l’ID du modèle, avec
qwen3.8-max
Le flux est similaire à celui présenté dans ce guide de l’API Qwen 3.7 Plus.
Étape 4 : gérer le streaming et les deltas de raisonnement
Qwen 3.8-Max est un modèle de raisonnement. En streaming, les deltas de raisonnement arrivent dans reasoning_content, avant les deltas de réponse habituels dans content.
Gérez les deux types de contenu explicitement :
stream = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Design a rate limiting strategy for a public API."
}
],
stream=True,
)
thinking_done = False
for chunk in stream:
delta = chunk.choices[0].delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
print(reasoning, end="", flush=True)
continue
if delta.content:
if not thinking_done:
print("\n--- answer ---")
thinking_done = True
print(delta.content, end="", flush=True)
Points à surveiller :
- Les tokens de raisonnement sont facturés comme des tokens de sortie.
- Le niveau de raisonnement par défaut est
xhigh. - Une réponse plus réfléchie peut améliorer la qualité, mais augmente aussi la latence et le coût.
Pour une interface de chat temps réel, testez un effort inférieur avant de conserver xhigh en production.
Étape 5 : régler reasoning_effort et les options de réflexion
L’API propose trois niveaux :
| Valeur | Usage recommandé |
|---|---|
xhigh |
Codage complexe, analyse approfondie, tâches agencées |
medium |
Cas généraux lorsque le niveau optimal n’est pas encore connu |
low |
Classification, extraction, chat simple, endpoints à fort volume |
Les extensions DashScope suivantes contrôlent la réflexion :
-
reasoning_effort: niveau d’effort du raisonnement ; -
enable_thinking: active ou désactive le raisonnement ; -
preserve_thinking: conserve le contexte de raisonnement entre les tours ; activé par défaut.
Avec le SDK OpenAI, transmettez-les via extra_body :
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Classify this ticket: 'Login page 500s on Safari.'"
}
],
extra_body={
"reasoning_effort": "low",
"enable_thinking": True,
},
)
La facturation reste basée sur les tokens. Le principal levier de coût est donc le volume de tokens de raisonnement généré. Évaluez ces réglages sur vos propres prompts et vos propres métriques de latence.
Utiliser le endpoint compatible Anthropic
Qwen 3.8-Max propose aussi un endpoint compatible avec le protocole Anthropic Messages :
https://dashscope-intl.aliyuncs.com/apps/anthropic
Cette compatibilité permet aux outils prévus pour l’écosystème Claude de communiquer avec Qwen 3.8-Max. Pour Claude Code, définissez ces trois variables :
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max
Lancez ensuite :
claude
Claude Code utilisera alors Qwen 3.8-Max pour sa boucle agencée.
Alibaba a utilisé Claude Code pour une grande partie de ses benchmarks de codage. Si le codage agencé est votre cas d’usage, consultez cette analyse de Qwen 3.8 pour le codage, qui couvre également Codex, Qoder, Qwen Code et OpenClaw.
Le double protocole est utile si votre équipe maintient déjà des clients ou des outils répartis entre les écosystèmes OpenAI et Anthropic : vous pouvez tester les deux intégrations sans réécrire vos clients au préalable.
Comprendre les coûts
Le tarif annoncé est :
- 2 $ par million de tokens en entrée
- 6 $ par million de tokens en sortie
- un tarif identique pour les contextes de 0 à 1 million de tokens
La mise en cache de contexte réduit les entrées répétées à 10 % du prix d’entrée lors d’un cache hit. La création explicite d’un cache est facturée à 125 %.
Consultez la page officielle de tarification pour les montants à jour.
Le prix de lancement est inférieur au prix catalogue de Qwen 3.7-Max, fixé à 2,5 $ / 7,5 $. Toutefois, ne calculez pas vos coûts uniquement à partir des tokens visibles dans la réponse finale : les tokens de raisonnement comptent aussi comme des tokens de sortie.
Pour des exemples de calcul et les conditions du quota gratuit, consultez la ventilation des prix de Qwen 3.8.
Tester et déboguer Qwen 3.8 dans Apidog
Une API avec streaming, raisonnement, plusieurs régions et deux protocoles mérite une configuration de test reproductible.
1. Importer ou créer l’endpoint compatible OpenAI
Créez une requête :
POST /chat/completions
Vous pouvez importer une spécification OpenAI existante, puis modifier uniquement l’URL du serveur et l’ID du modèle.
Ajoutez aussi l’endpoint Anthropic Messages au même projet afin de conserver les deux protocoles au même endroit.
2. Créer un environnement par région
Créez trois environnements :
- Beijing
- Singapour
- États-Unis — Virginie
Dans chaque environnement, ajoutez :
base_url
DASHSCOPE_API_KEY
Exemple pour Singapour :
base_url=https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Vous pourrez changer de région sans modifier chaque requête manuellement, et comparer la latence depuis votre infrastructure.
3. Inspecter les événements SSE
Envoyez une requête avec :
{
"stream": true
}
Dans la réponse brute, vérifiez que les événements arrivent dans cet ordre :
- deltas
reasoning_content - deltas
content
Cette inspection aide à isoler les problèmes de streaming : comparez les événements SSE reçus avec la sortie de votre parseur applicatif.
4. Exécuter des comparaisons A/B
Dupliquez une requête et remplacez :
qwen3.8-max
par :
qwen3.7-max
Exécutez les deux requêtes avec le même prompt, puis comparez :
- la latence ;
- le nombre de tokens ;
- la qualité de la réponse ;
- le coût estimé.
Vous pouvez appliquer le même processus à plusieurs fournisseurs. Par exemple, conservez une requête pour l’API Kimi K3 dans le même projet et testez les modèles sur vos tâches réelles.
Téléchargez Apidog gratuitement pour reproduire cette configuration.
FAQ
Existe-t-il un moyen gratuit d’essayer l’API Qwen 3.8 ?
Oui. Les nouveaux comptes Model Studio reçoivent 1 million de tokens gratuits pour qwen3.8-max, valables 90 jours dans la région de Singapour uniquement.
Utilisez donc :
https://dashscope-intl.aliyuncs.com
pour vos tests d’évaluation.
Puis-je exécuter Qwen 3.8 localement ?
Pas encore, d’après les informations disponibles début août 2026. Alibaba a annoncé des poids ouverts pour Hugging Face et ModelScope, mais ils ne sont pas encore téléchargeables.
Avec 2,4 T de paramètres au total, l’auto-hébergement nécessiterait de toute façon une infrastructure multi-nœuds, même avec quantification. L’API hébergée est donc le seul chemin décrit ici.
Le endpoint Anthropic prend-il en charge les mêmes fonctionnalités que celui d’OpenAI ?
Le endpoint Anthropic utilise le protocole Anthropic Messages et cible principalement les outils de cet écosystème, notamment Claude Code.
Pour une intégration applicative directe, le endpoint compatible OpenAI est le chemin le mieux documenté pour :
-
reasoning_effort; -
enable_thinking; -
preserve_thinking; - le streaming avec
reasoning_content.
Comment qwen3.8-max se compare-t-il à Qwen3-Coder ?
Les deux modèles répondent à des besoins différents :
- Qwen3-Coder est une ligne spécialisée dans le codage ;
-
qwen3.8-maxest le modèle généraliste phare, avec de solides résultats de codage agencé dans les benchmarks fournis par Alibaba.
Les appels API sont identiques, à l’exception de l’ID du modèle. Testez les deux avec les mêmes prompts, jeux de données et contraintes de production.
Conclusion
L’adoption de Qwen 3.8-Max est simple si vous utilisez déjà OpenAI ou Claude Code :
- créez une clé
DASHSCOPE_API_KEY; - choisissez votre région ;
- pointez votre client OpenAI vers DashScope ;
- utilisez
qwen3.8-maxcomme ID de modèle ; - ajustez
reasoning_effortselon votre compromis qualité, latence et coût.
Commencez avec le quota gratuit de Singapour. Testez les réponses en streaming pour vérifier la gestion de reasoning_content, puis mesurez le modèle sur vos propres prompts avant de vous fier à un benchmark fournisseur.
Enfin, centralisez les régions, les clés et les requêtes OpenAI/Anthropic dans un projet Apidog pour rendre vos tests reproductibles par toute l’équipe.



Top comments (0)