DEV Community

Cover image for Comment utiliser l'API Qwen 3.8
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Comment utiliser l'API Qwen 3.8

Alibaba a lancé Qwen 3.8-Max début août 2026, et l’API est déjà disponible dans Model Studio. Le modèle totalise 2,4 T de paramètres, dont 95 milliards actifs, accepte jusqu’à 1 million de tokens de contexte et coûte 2 $ en entrée / 6 $ en sortie par million de tokens. Pour les détails sur le modèle, consultez notre explication de Qwen 3.8. Ce guide se concentre sur l’implémentation : clé API, région, premier appel, streaming et intégration dans vos outils.

Essayez Apidog dès aujourd’hui

Qwen 3.8-Max expose deux protocoles dès son lancement :

  • un endpoint compatible OpenAI ;
  • un endpoint compatible Anthropic.

Vous pouvez donc réutiliser un client OpenAI existant ou configurer Claude Code avec trois variables d’environnement. Vous pouvez aussi comparer les deux formats dans Apidog, notamment pour inspecter les réponses en streaming.

Ce dont vous avez besoin avant de commencer

Élément Valeur
ID du modèle qwen3.8-max
Fenêtre de contexte 1 000 000 tokens
Sortie maximale 65 536 tokens
Types d’entrée Texte et images
Tarification 2 $ en entrée / 6 $ en sortie par million de tokens
Contrôle du raisonnement reasoning_effort : xhigh, medium, low
Protocoles Chat Completions et Responses OpenAI, Messages Anthropic
Variable de clé API DASHSCOPE_API_KEY

Qwen 3.8-Max

Ces informations proviennent de l’annonce officielle de Qwen 3.8 et de la documentation d’Alibaba Cloud Model Studio.

Début août 2026, Alibaba a annoncé que les poids ouverts seraient publiés sur Hugging Face et ModelScope la semaine suivante, mais ils ne sont pas encore téléchargeables. Les exemples ci-dessous utilisent donc l’API hébergée.

Étape 1 : obtenir une clé API QwenCloud

  1. Ouvrez home.qwencloud.com.
  2. Connectez-vous ou créez un compte.
  3. Créez une clé API dans la console.
  4. Exportez-la sous le nom DASHSCOPE_API_KEY.
export DASHSCOPE_API_KEY="sk-your-key-here"
Enter fullscreen mode Exit fullscreen mode

Ajoutez cette variable à votre profil shell ou à un fichier .env. Ne stockez pas la clé dans votre dépôt Git ni directement dans votre code.

Les nouveaux comptes disposent d’un quota gratuit de 1 million de tokens valable 90 jours. Ce quota est disponible uniquement dans la région de Singapour.

Étape 2 : choisir une URL de base régionale

Model Studio propose l’API compatible OpenAI dans trois régions :

Région URL de base
Beijing https://dashscope.aliyuncs.com/compatible-mode/v1
Singapour https://dashscope-intl.aliyuncs.com/compatible-mode/v1
États-Unis, Virginie https://dashscope-us.aliyuncs.com/compatible-mode/v1

Pour la plupart des déploiements internationaux, utilisez Singapour :

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

C’est également la région qui donne accès au quota gratuit. La liste des modèles Model Studio indique que qwen3.8-max prend en charge la génération de texte ainsi que la compréhension d’images et de vidéos.

Dans les exemples suivants, remplacez l’URL de base si vos serveurs sont plus proches de Pékin ou de Virginie.

Étape 3 : effectuer votre premier appel avec le SDK OpenAI

Installez le SDK Python officiel :

pip install openai
Enter fullscreen mode Exit fullscreen mode

Puis configurez le client avec l’URL DashScope :

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "system",
            "content": "You are a precise technical assistant."
        },
        {
            "role": "user",
            "content": "Explain idempotency in REST APIs in two sentences."
        },
    ],
)

print(completion.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

L’équivalent en cURL :

curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Explain idempotency in REST APIs in two sentences."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Si vous utilisez déjà un fournisseur compatible OpenAI, la migration consiste principalement à modifier :

  1. base_url
  2. l’ID du modèle, avec qwen3.8-max

Le flux est similaire à celui présenté dans ce guide de l’API Qwen 3.7 Plus.

Étape 4 : gérer le streaming et les deltas de raisonnement

Qwen 3.8-Max est un modèle de raisonnement. En streaming, les deltas de raisonnement arrivent dans reasoning_content, avant les deltas de réponse habituels dans content.

Gérez les deux types de contenu explicitement :

stream = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Design a rate limiting strategy for a public API."
        }
    ],
    stream=True,
)

thinking_done = False

for chunk in stream:
    delta = chunk.choices[0].delta

    reasoning = getattr(delta, "reasoning_content", None)

    if reasoning:
        print(reasoning, end="", flush=True)
        continue

    if delta.content:
        if not thinking_done:
            print("\n--- answer ---")
            thinking_done = True

        print(delta.content, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Points à surveiller :

  • Les tokens de raisonnement sont facturés comme des tokens de sortie.
  • Le niveau de raisonnement par défaut est xhigh.
  • Une réponse plus réfléchie peut améliorer la qualité, mais augmente aussi la latence et le coût.

Pour une interface de chat temps réel, testez un effort inférieur avant de conserver xhigh en production.

Étape 5 : régler reasoning_effort et les options de réflexion

L’API propose trois niveaux :

Valeur Usage recommandé
xhigh Codage complexe, analyse approfondie, tâches agencées
medium Cas généraux lorsque le niveau optimal n’est pas encore connu
low Classification, extraction, chat simple, endpoints à fort volume

Les extensions DashScope suivantes contrôlent la réflexion :

  • reasoning_effort : niveau d’effort du raisonnement ;
  • enable_thinking : active ou désactive le raisonnement ;
  • preserve_thinking : conserve le contexte de raisonnement entre les tours ; activé par défaut.

Avec le SDK OpenAI, transmettez-les via extra_body :

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Classify this ticket: 'Login page 500s on Safari.'"
        }
    ],
    extra_body={
        "reasoning_effort": "low",
        "enable_thinking": True,
    },
)
Enter fullscreen mode Exit fullscreen mode

La facturation reste basée sur les tokens. Le principal levier de coût est donc le volume de tokens de raisonnement généré. Évaluez ces réglages sur vos propres prompts et vos propres métriques de latence.

Utiliser le endpoint compatible Anthropic

Qwen 3.8-Max propose aussi un endpoint compatible avec le protocole Anthropic Messages :

https://dashscope-intl.aliyuncs.com/apps/anthropic
Enter fullscreen mode Exit fullscreen mode

Cette compatibilité permet aux outils prévus pour l’écosystème Claude de communiquer avec Qwen 3.8-Max. Pour Claude Code, définissez ces trois variables :

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Lancez ensuite :

claude
Enter fullscreen mode Exit fullscreen mode

Claude Code utilisera alors Qwen 3.8-Max pour sa boucle agencée.

Alibaba a utilisé Claude Code pour une grande partie de ses benchmarks de codage. Si le codage agencé est votre cas d’usage, consultez cette analyse de Qwen 3.8 pour le codage, qui couvre également Codex, Qoder, Qwen Code et OpenClaw.

Le double protocole est utile si votre équipe maintient déjà des clients ou des outils répartis entre les écosystèmes OpenAI et Anthropic : vous pouvez tester les deux intégrations sans réécrire vos clients au préalable.

Comprendre les coûts

Le tarif annoncé est :

  • 2 $ par million de tokens en entrée
  • 6 $ par million de tokens en sortie
  • un tarif identique pour les contextes de 0 à 1 million de tokens

La mise en cache de contexte réduit les entrées répétées à 10 % du prix d’entrée lors d’un cache hit. La création explicite d’un cache est facturée à 125 %.

Consultez la page officielle de tarification pour les montants à jour.

Tarification Qwen 3.8

Le prix de lancement est inférieur au prix catalogue de Qwen 3.7-Max, fixé à 2,5 $ / 7,5 $. Toutefois, ne calculez pas vos coûts uniquement à partir des tokens visibles dans la réponse finale : les tokens de raisonnement comptent aussi comme des tokens de sortie.

Pour des exemples de calcul et les conditions du quota gratuit, consultez la ventilation des prix de Qwen 3.8.

Tester et déboguer Qwen 3.8 dans Apidog

Une API avec streaming, raisonnement, plusieurs régions et deux protocoles mérite une configuration de test reproductible.

Configuration Apidog

1. Importer ou créer l’endpoint compatible OpenAI

Créez une requête :

POST /chat/completions
Enter fullscreen mode Exit fullscreen mode

Vous pouvez importer une spécification OpenAI existante, puis modifier uniquement l’URL du serveur et l’ID du modèle.

Ajoutez aussi l’endpoint Anthropic Messages au même projet afin de conserver les deux protocoles au même endroit.

2. Créer un environnement par région

Créez trois environnements :

  • Beijing
  • Singapour
  • États-Unis — Virginie

Dans chaque environnement, ajoutez :

base_url
DASHSCOPE_API_KEY
Enter fullscreen mode Exit fullscreen mode

Exemple pour Singapour :

base_url=https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Vous pourrez changer de région sans modifier chaque requête manuellement, et comparer la latence depuis votre infrastructure.

3. Inspecter les événements SSE

Envoyez une requête avec :

{
  "stream": true
}
Enter fullscreen mode Exit fullscreen mode

Dans la réponse brute, vérifiez que les événements arrivent dans cet ordre :

  1. deltas reasoning_content
  2. deltas content

Cette inspection aide à isoler les problèmes de streaming : comparez les événements SSE reçus avec la sortie de votre parseur applicatif.

4. Exécuter des comparaisons A/B

Dupliquez une requête et remplacez :

qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

par :

qwen3.7-max
Enter fullscreen mode Exit fullscreen mode

Exécutez les deux requêtes avec le même prompt, puis comparez :

  • la latence ;
  • le nombre de tokens ;
  • la qualité de la réponse ;
  • le coût estimé.

Vous pouvez appliquer le même processus à plusieurs fournisseurs. Par exemple, conservez une requête pour l’API Kimi K3 dans le même projet et testez les modèles sur vos tâches réelles.

Téléchargez Apidog gratuitement pour reproduire cette configuration.

FAQ

Existe-t-il un moyen gratuit d’essayer l’API Qwen 3.8 ?

Oui. Les nouveaux comptes Model Studio reçoivent 1 million de tokens gratuits pour qwen3.8-max, valables 90 jours dans la région de Singapour uniquement.

Utilisez donc :

https://dashscope-intl.aliyuncs.com
Enter fullscreen mode Exit fullscreen mode

pour vos tests d’évaluation.

Puis-je exécuter Qwen 3.8 localement ?

Pas encore, d’après les informations disponibles début août 2026. Alibaba a annoncé des poids ouverts pour Hugging Face et ModelScope, mais ils ne sont pas encore téléchargeables.

Avec 2,4 T de paramètres au total, l’auto-hébergement nécessiterait de toute façon une infrastructure multi-nœuds, même avec quantification. L’API hébergée est donc le seul chemin décrit ici.

Le endpoint Anthropic prend-il en charge les mêmes fonctionnalités que celui d’OpenAI ?

Le endpoint Anthropic utilise le protocole Anthropic Messages et cible principalement les outils de cet écosystème, notamment Claude Code.

Pour une intégration applicative directe, le endpoint compatible OpenAI est le chemin le mieux documenté pour :

  • reasoning_effort ;
  • enable_thinking ;
  • preserve_thinking ;
  • le streaming avec reasoning_content.

Comment qwen3.8-max se compare-t-il à Qwen3-Coder ?

Les deux modèles répondent à des besoins différents :

  • Qwen3-Coder est une ligne spécialisée dans le codage ;
  • qwen3.8-max est le modèle généraliste phare, avec de solides résultats de codage agencé dans les benchmarks fournis par Alibaba.

Les appels API sont identiques, à l’exception de l’ID du modèle. Testez les deux avec les mêmes prompts, jeux de données et contraintes de production.

Conclusion

L’adoption de Qwen 3.8-Max est simple si vous utilisez déjà OpenAI ou Claude Code :

  1. créez une clé DASHSCOPE_API_KEY ;
  2. choisissez votre région ;
  3. pointez votre client OpenAI vers DashScope ;
  4. utilisez qwen3.8-max comme ID de modèle ;
  5. ajustez reasoning_effort selon votre compromis qualité, latence et coût.

Commencez avec le quota gratuit de Singapour. Testez les réponses en streaming pour vérifier la gestion de reasoning_content, puis mesurez le modèle sur vos propres prompts avant de vous fier à un benchmark fournisseur.

Enfin, centralisez les régions, les clés et les requêtes OpenAI/Anthropic dans un projet Apidog pour rendre vos tests reproductibles par toute l’équipe.

Top comments (0)