Alibaba a lancé Qwen 3.8-Max début août 2026. Les résultats de recherche affichent déjà des promesses du type « gratuit pour toujours », mais elles ne résistent pas à la lecture des conditions réelles. Voici les options vérifiées sur les pages d’Alibaba au 3 août 2026.
Essayez Apidog dès aujourd'hui
Il existe quatre voies utiles. Deux sont disponibles aujourd’hui, une est annoncée avec une date, et la dernière consiste à utiliser des modèles plus anciens. Pour le contexte complet sur le modèle — 2,4 billions de paramètres au total, 95 milliards actifs et 1 million de jetons de contexte — consultez notre aperçu de Qwen 3.8.
Aperçu rapide
| Voie | Gratuit ? | Fonctionne aujourd’hui ? | Restrictions |
|---|---|---|---|
| Qwen Chat | Oui | Oui | Application grand public, pas d’API |
| Quota d’API Model Studio | 1 million de jetons | Oui | Région de Singapour uniquement, 90 jours |
| Poids ouverts en auto-hébergement | Poids gratuits | Pas encore | Annoncés « la semaine prochaine » ; matériel non gratuit |
| Anciens modèles Qwen | Oui | Oui | Ce n’est pas Qwen 3.8-Max |
Voie 1 : Qwen Chat, sans configuration
Le moyen le plus rapide de tester le modèle est Qwen Chat. Connectez-vous, sélectionnez le modèle et échangez avec Qwen 3.8-Max sans carte bancaire ni console cloud. Le billet de blog officiel le présente comme le point d’entrée par défaut.
Vous obtenez un accès gratuit au modèle phare via une interface conversationnelle, y compris les fonctions de compréhension d’images et de documents montrées lors du lancement.
En revanche, vous n’obtenez pas :
- de clé API ;
- d’automatisation ;
- d’intégration dans une application ou une suite de tests ;
- un comportement strictement identique à l’API brute.
Les applications de chat appliquent leurs propres invites système et paramètres. Utilisez donc Qwen Chat pour découvrir le modèle, pas pour établir un benchmark produit reproductible.
Verdict : une option gratuite et immédiate pour une première évaluation manuelle, mais pas une voie d’intégration pour les développeurs.
Voie 2 : le quota gratuit de Model Studio
Pour écrire du code, utilisez Alibaba Cloud Model Studio. Les nouvelles activations reçoivent un quota gratuit de 1 million de jetons pour qwen3.8-max.
Ce quota est utile, mais il faut respecter trois contraintes.
1. Utilisez obligatoirement la région de Singapour
Le quota gratuit s’applique uniquement à la région internationale de Singapour. Configurez cette URL de base :
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Les points d’accès de Pékin ou de US-Virginie sont facturés dès le premier jeton. Si votre application doit impérativement utiliser une région américaine pour des raisons de latence, ce quota ne couvrira pas vos tests.
2. Le quota expire après 90 jours
Les 1 million de jetons sont valables pendant 90 jours après l’activation. Les jetons restants expirent à la fin de cette période.
Planifiez donc votre évaluation avant d’activer le service :
- préparez vos jeux de tests ;
- définissez les tâches à évaluer ;
- activez Model Studio ;
- exécutez vos tests dans la fenêtre de 90 jours.
3. Après le quota, l’API devient payante
Après expiration ou épuisement du quota, le tarif indiqué est de :
- 2 $ par million de jetons en entrée ;
- 6 $ par million de jetons en sortie.
Ce tarif s’applique au contexte complet de 1 million de jetons, sans paliers. Configurez une alerte de facturation avant de lancer des tests automatisés ou des boucles de retry.
Pour estimer le coût d’une charge de travail réelle, consultez notre guide de tarification de Qwen 3.8.
Configurer l’accès API
Pour démarrer :
- créez un compte Alibaba Cloud Model Studio ;
- activez le service ;
- générez une clé API ;
- stockez-la dans
DASHSCOPE_API_KEY; - utilisez le point d’accès de Singapour.
export DASHSCOPE_API_KEY="votre-cle-api"
export BASE_URL="https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
Le catalogue de modèles liste qwen3.8-max parmi les modèles recommandés. Le service propose un protocole compatible OpenAI ainsi qu’un point d’accès compatible Anthropic.
Notre tutoriel sur l’API Qwen 3.8 couvre les deux approches, y compris le streaming et la sortie de raisonnement.
Piège : le raisonnement est activé par défaut
Qwen 3.8-Max utilise reasoning_effort: xhigh par défaut. Les jetons de réflexion sont comptabilisés comme des jetons de sortie.
Pour les tâches routinières — extraction, classification, reformulation, génération de JSON — réduisez l’effort de raisonnement :
{
"model": "qwen3.8-max",
"reasoning_effort": "low"
}
Utilisez medium ou xhigh uniquement lorsque la tâche justifie réellement un raisonnement plus long. Sinon, une seule requête complexe peut consommer plusieurs milliers de jetons avant même la réponse visible.
Faire durer 1 million de jetons
Appliquez ces pratiques pendant l’évaluation.
- Validez la requête avant de l’automatiser. Construisez l’appel dans Apidog, ajustez les paramètres et inspectez une réponse à la fois, y compris les deltas de raisonnement en streaming.
- Simulez les réponses connues. Une fois le format de réponse validé, enregistrez un exemple et servez-le à votre frontend ou à votre agent avec un serveur mock. Vos itérations de développement ne consomment alors aucun jeton.
-
Suivez
usagedans chaque réponse. Enregistrez les compteurs de jetons par requête afin de connaître votre consommation réelle avant que le quota n’expire. - Évitez de renvoyer tout l’historique. Réduisez la taille des prompts de débogage, résumez les échanges précédents et n’incluez que le contexte nécessaire.
Téléchargez Apidog pour stocker les URL de base de Singapour, Pékin et US-Virginie dans des environnements séparés et basculer entre elles sans modifier votre code.
Verdict : c’est la meilleure voie gratuite actuelle pour les développeurs, à condition de respecter la région de Singapour et la limite de 90 jours.
Voie 3 : les poids ouverts, annoncés mais indisponibles
Qwen 3.8-Max est présenté comme le premier modèle de classe Qwen-Max avec des poids ouverts. Alibaba indique que les poids seront disponibles sur Hugging Face et ModelScope « la semaine prochaine », soit autour du 10 août 2026.
Au 3 août 2026, ils ne sont pas téléchargeables. Il n’y a donc encore rien à quantifier, à déployer ou à exécuter localement.
Si vous trouvez un tutoriel expliquant comment exécuter Qwen 3.8-Max localement avant la publication effective des poids, vérifiez la date et le modèle réellement utilisé.
Ce que signifie réellement l’auto-hébergement
Même lorsque les poids seront publiés, « gratuit » ne voudra pas dire « exécutable sur un ordinateur portable ».
Qwen 3.8-Max totalise 2,4 billions de paramètres. À titre de comparaison, Kimi K3, avec 2,8 billions de paramètres, a été publié avec 594 Go de poids malgré une quantification MXFP4 agressive.
Pour Qwen 3.8-Max, il faut donc prévoir :
- des centaines de gigaoctets de poids ;
- plusieurs GPU ;
- vraisemblablement une infrastructure multi-nœuds pour le service ;
- un budget matériel ou d’hébergement.
Une carte graphique grand public et une station de travail unique ne suffiront pas. Notre guide sur l’exécution locale de Kimi K3 montre le type d’infrastructure requis pour cette catégorie de modèles.
L’intérêt pratique des poids ouverts sera surtout l’apparition d’hébergeurs tiers. Cette concurrence peut faire baisser le coût d’accès API par rapport aux tarifs initiaux du fournisseur.
Verdict : cette voie n’est pas encore disponible. Revenez après la publication des poids et prévoyez un budget d’hébergement plutôt qu’un déploiement sur poste local.
Voie 4 : utiliser un ancien modèle Qwen gratuitement
Si votre besoin est un modèle Qwen capable sans coût immédiat, mais pas nécessairement Qwen 3.8-Max, les générations précédentes proposent des options plus accessibles.
Des modèles Qwen à poids ouverts plus petits peuvent déjà fonctionner sur du matériel réellement disponible. Ils disposent aussi de voies d’accès gratuites qui ne dépendent pas d’un quota de 90 jours.
Consultez notre guide pour utiliser Qwen 3.7 gratuitement.
Le compromis est simple : vous renoncez aux gains de performance mis en avant pour Qwen 3.8-Max. Pour un projet secondaire, un classificateur, un prototype ou l’apprentissage de l’API Qwen, un modèle plus ancien peut néanmoins suffire.
Ce qui n’existe pas au 3 août 2026
Pour éviter les fausses pistes :
- Il n’existe pas de niveau API gratuit illimité. Le quota est limité à 1 million de jetons et expire.
- Il n’existe pas de quota gratuit hors de Singapour. Pékin et US-Virginie sont facturés dès le premier jeton.
- Les poids ne sont pas encore téléchargeables. « La semaine prochaine » est une annonce, pas un lien de téléchargement.
- Il n’existe pas d’accès tiers officiel gratuit à Qwen 3.8-Max. Les hébergeurs tiers devraient surtout apparaître après la publication des poids. Avant cela, vérifiez le modèle réel derrière toute offre présentée comme du « Qwen 3.8-Max gratuit ».
FAQ
L’API Qwen 3.8 est-elle vraiment gratuite ?
Partiellement. Alibaba Cloud Model Studio fournit 1 million de jetons gratuits pour qwen3.8-max, valables pendant 90 jours et uniquement dans la région de Singapour. Ensuite, les tarifs indiqués sont de 2 $ par million de jetons en entrée et 6 $ par million de jetons en sortie.
Puis-je télécharger et exécuter Qwen 3.8 localement maintenant ?
Non. Les poids sont annoncés sur Hugging Face et ModelScope autour du 10 août 2026, mais ne sont pas encore publiés au moment de la rédaction. Lorsqu’ils seront disponibles, il faudra prévoir des centaines de gigaoctets de poids et une infrastructure multi-GPU.
Quelle différence avec les options gratuites de Kimi K3 ?
Les poids de Kimi K3 sont déjà disponibles, donc l’auto-hébergement est possible aujourd’hui. En revanche, Kimi K3 et Qwen 3.8-Max restent tous deux trop volumineux pour du matériel grand public. Consultez notre guide sur l’utilisation gratuite de Kimi K3 pour comparer les options.
Le quota gratuit couvre-t-il les jetons de réflexion ?
Oui, mais ils consomment le quota. Les sorties de raisonnement sont facturées comme des sorties normales, et reasoning_effort est réglé sur xhigh par défaut. Réduisez ce paramètre pour les appels courants.
En résumé
L’accès gratuit à Qwen 3.8-Max existe, mais il est limité :
- utilisez Qwen Chat pour une évaluation conversationnelle ;
- utilisez Model Studio à Singapour pour intégrer l’API et consommer jusqu’à 1 million de jetons pendant 90 jours ;
- attendez la publication des poids ouverts avant d’envisager l’auto-hébergement ou les fournisseurs tiers ;
- choisissez un ancien modèle Qwen si votre priorité est un accès sans coût plutôt que la version 3.8-Max.
Si vous utilisez l’API, réservez votre quota aux évaluations utiles. Prototypez vos requêtes dans Apidog, simulez les réponses pendant le développement, puis utilisez l’endpoint réel pour les tests qui détermineront si Qwen 3.8-Max mérite une place dans votre pile technique.

Top comments (0)