Alibaba lanzó oficialmente Qwen 3.8-Max a principios de agosto de 2026. Combina una arquitectura Mixture-of-Experts (MoE) de 2.4 billones de parámetros, con solo 95B activos por token, una ventana de contexto de 1M de tokens y precios fijos de $2/$6 por millón de tokens. También promete publicar los pesos en Hugging Face y ModelScope en una semana, algo inédito para un modelo de clase Qwen-Max.
El anuncio oficial presenta a Qwen 3.8-Max como el modelo Qwen más capaz hasta la fecha. Esta guía resume sus especificaciones, los benchmarks publicados por Alibaba, su posición frente a Kimi K3, Fable 5 y GPT-5.6 Sol, y cómo probarlo mediante API. El modelo ofrece endpoints compatibles con OpenAI y Anthropic, por lo que una herramienta como Apidog permite validar ambos protocolos con la misma clave.
Qwen 3.8-Max de un vistazo
| Especificación | Qwen 3.8-Max |
|---|---|
| Desarrollador | Alibaba (equipo Qwen) |
| Lanzamiento | Principios de agosto de 2026; disponibilidad general en Model Studio el 3 de agosto |
| Arquitectura | MoE, basada en Qwen 3.5 |
| Parámetros totales | 2.4T |
| Parámetros activos | 95B (~4% de activación) |
| Ventana de contexto | 1,000,000 tokens |
| Salida máxima | 65,536 tokens |
| Modalidades | Entrada de texto e imagen; salida de texto |
| Controles de razonamiento |
reasoning_effort: xhigh (predeterminado), medium, low
|
| ID de API | qwen3.8-max |
| Precios | $2 entrada / $6 salida por 1M de tokens |
| Pesos abiertos | Prometidos para la semana siguiente (~10 de agosto); no disponibles a principios de agosto de 2026 |
| Protocolos API | Compatible con OpenAI y Anthropic |
Las especificaciones proceden de los materiales de lanzamiento de Alibaba y de la página de precios de Model Studio.
Qué es Qwen 3.8-Max
Qwen 3.8-Max es el nuevo modelo insignia de Alibaba, construido sobre la base de Qwen 3.5. Sustituye a Qwen3.7-Max en la parte superior de la familia.
Según la tabla del proveedor, mejora de forma notable respecto a su predecesor:
- Terminal Bench 2.1: de 74.5 a 86.6
- PaperBench: de 64.8 a 93.0
Si evalúas una migración desde el modelo anterior, revisa esta comparación entre Qwen 3.8 y Qwen 3.7 Max.
La característica central es su relación entre parámetros totales y activos. Aunque tiene 2.4T de parámetros, el diseño MoE activa 95B por inferencia, aproximadamente el 4%. Esta eficiencia ayuda a explicar su precio de $2/$6 por millón de tokens.
Como referencia:
- Qwen 3.8-Max: 2.4T totales / 95B activos
- Kimi K3: 2.8T totales / 104B activos
La API acepta texto e imágenes como entrada. Alibaba también muestra comprensión de PDFs de más de 200 páginas y videos de 100 horas mediante “gráficos de memoria”, pero estas demostraciones no equivalen necesariamente a tipos de entrada API independientes.
Para controlar el razonamiento, utiliza:
{
"reasoning_effort": "xhigh"
}
Valores disponibles:
-
xhigh: valor predeterminado mediumlow
También existen enable_thinking y preserve_thinking; el pensamiento se preserva de forma predeterminada. Ten en cuenta que los tokens de razonamiento se facturan como salida, incluso si el precio base es igual para modos con y sin pensamiento.
El primer Qwen-Max con pesos abiertos
Alibaba ha publicado muchos modelos Qwen con pesos abiertos, pero nunca un modelo de la capa Max. Qwen 3.8-Max rompe ese patrón: la empresa prometió publicar los pesos en Hugging Face y ModelScope “la próxima semana”, aproximadamente el 10 de agosto.
Hay dos consideraciones prácticas:
- Los pesos todavía no estaban disponibles a principios de agosto de 2026. La promesa no equivale a una descarga disponible.
- Ejecutar un modelo de 2.4T localmente requiere infraestructura multinodo. Incluso cuantizado, no es una carga razonable para una estación de trabajo típica.
Para la mayoría de los equipos, los pesos abiertos probablemente implicarán acceso alojado mediante terceros, más que una implementación local.
Si tu prioridad es probar el modelo sin pagar el precio de lista, consulta cómo usar Qwen 3.8 gratis.
Qué dicen los benchmarks
Alibaba publicó benchmarks frente a Claude Opus 4.8, Fable 5, GPT-5.6 Sol y Qwen3.7-Max.
Antes de interpretar los resultados:
- Son evaluaciones ejecutadas por el proveedor.
- La mayoría de los benchmarks de código utilizaron el arnés Claude Code.
- Algunos conjuntos, como QwenSWEBench, QwenQoderBench, CoWorkBench y RecreationBench, son internos de Alibaba.
- No había resultados independientes de fuentes como Artificial Analysis al momento de redactar el contenido original.
Resultados donde destaca
- PaperBench: 93.0, por delante de GPT-5.6 Sol (90.5), Fable 5 (88.8) y Opus 4.8 (80.3).
- IFBench: 82.8, frente a 72.7 de Sol.
- Terminal Bench 2.1: 86.6, por encima de Opus 4.8 y Fable 5 (84.6), aunque por debajo de Sol (88.8).
- Multimodal: MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1 y resultados OCR competitivos.
Resultados donde queda atrás
- SWE-bench Pro: 67.7, frente a 80.0 de Fable 5 y 69.2 de Opus 4.8.
- HLE: 43.6, por debajo de Fable 5 (53.3), Sol (47.2) y Opus 4.8 (45.7).
En GPQA Diamond obtiene 92.6, empatando con Fable 5 y cerca de los 94.1 de Sol. Según la tabla de Alibaba, Qwen 3.8-Max destaca especialmente en tareas multimodales, documentos y algunos flujos de agentes, pero no lidera las evaluaciones principales de ingeniería de software.
Para revisar la tabla y sus condiciones de ejecución, consulta el desglose de benchmarks de Qwen 3.8.
Alibaba también mostró demostraciones de:
- Una sesión autónoma de programación de 16 días en un repositorio público, con 265 commits y 127 pull requests.
- Una reproducción de artículo que superó el resultado AIME24 del trabajo original.
- Una participación en Tianchi que superó a 458 de 526 equipos humanos en 24 horas.
Son demostraciones del proveedor, no evaluaciones controladas. Para reproducir configuraciones de arneses, consulta Qwen 3.8 para codificación.
Qwen 3.8-Max frente a Kimi K3, Fable 5 y GPT-5.6 Sol
Frente a Kimi K3
Kimi K3 es más grande:
| Modelo | Parámetros totales | Parámetros activos | Modalidades |
|---|---|---|---|
| Qwen 3.8-Max | 2.4T | 95B | Texto e imagen |
| Kimi K3 | 2.8T | 104B | Solo texto |
También difieren en precio:
| Modelo | Entrada / 1M tokens | Salida / 1M tokens |
|---|---|---|
| Qwen 3.8-Max | $2 | $6 |
| Kimi K3 | $3 | $15 |
Kimi K3 ya tiene pesos disponibles, mientras que Qwen 3.8-Max todavía los prometía para la semana siguiente. No existe una evaluación independiente cara a cara; ambos proveedores publicaron sus propios resultados.
Consulta Qwen 3.8 vs Kimi K3 y, si necesitas contexto sobre Moonshot, qué es Kimi K3.
Frente a Fable 5
Fable 5 mantiene ventaja en coding según la tabla de Alibaba:
- SWE-bench Pro: 80.0 vs 67.7
- HLE: 53.3 vs 43.6
Qwen compensa con un precio inferior, contexto de 1M, capacidades multimodales y pesos abiertos prometidos.
Frente a GPT-5.6 Sol
GPT-5.6 Sol lidera en:
- Terminal Bench: 88.8 vs 86.6
- GPQA: 94.1 vs 92.6
- HLE: 47.2 vs 43.6
Qwen 3.8-Max lidera en:
- PaperBench: 93.0 vs 90.5
- IFBench: 82.8 vs 72.7
En precio, Qwen ofrece $2/$6, frente a $2/$12 de GPT-5.6 Terra para salida. El acceso a Sol cuesta más.
Precios: $2/$6 en todo el contexto de 1M
El modelo cobra:
- $2 por millón de tokens de entrada
- $6 por millón de tokens de salida
La tarifa se mantiene desde el primer token hasta el límite de 1M de contexto. No cambia por el tamaño del prompt.
Para cargas con prefijos repetidos:
- Los aciertos de caché se cobran al 10% de la tarifa de entrada.
- La creación explícita de caché cuesta el 125%.
- Existe una cuota gratuita de 1M de tokens, solo en Singapur y válida durante 90 días.
Recuerda incluir los tokens de razonamiento en tus estimaciones: con reasoning_effort: "xhigh", pueden aumentar de forma significativa los tokens de salida facturables.
Consulta ejemplos de coste y escenarios de uso en la guía de precios de Qwen 3.8.
Cómo acceder a Qwen 3.8-Max
Hay cinco rutas principales.
1. Qwen Chat
La aplicación de consumo no requiere una clave API. Es la forma más rápida de probar prompts y evaluar resultados.
2. API de Alibaba Cloud Model Studio
Obtén una clave en home.qwencloud.com y define:
export DASHSCOPE_API_KEY="tu-clave"
Usa el modelo:
qwen3.8-max
Endpoints regionales compatibles con OpenAI:
# Beijing
https://dashscope.aliyuncs.com/compatible-mode/v1
# Singapur
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
# EE. UU. - Virginia
https://dashscope-us.aliyuncs.com/compatible-mode/v1
La página de modelos de Model Studio lo incluye como modelo recomendado.
Ejemplo con curl:
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Resume este documento en cinco puntos."
}
],
"reasoning_effort": "medium"
}'
3. Endpoint compatible con Anthropic
El endpoint compatible con Anthropic es:
https://dashscope-intl.aliyuncs.com/apps/anthropic
Esto permite redirigir herramientas diseñadas para el protocolo de mensajes de Anthropic hacia Qwen.
4. Arneses de programación
Alibaba publicó configuraciones para:
- Claude Code
- Codex
- Qoder
- Qwen Code
- OpenClaw
Para Claude Code, configura:
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Esta configuración es especialmente relevante porque Alibaba utilizó principalmente Claude Code para sus benchmarks de programación.
5. Pesos abiertos
Hugging Face y ModelScope eran la ruta prometida para los pesos abiertos, pero no estaban disponibles a principios de agosto de 2026.
Para más ejemplos de Python y curl, revisa la guía de API de Qwen 3.8.
Prueba ambos protocolos de API
Cuando un modelo expone protocolos compatibles con OpenAI y Anthropic, valida que ambos produzcan el comportamiento esperado con tus prompts.
Un flujo práctico en Apidog:
- Crea un entorno por región: Beijing, Singapur y Virginia.
- Guarda las URL base como variables de entorno.
- Duplica el mismo prompt para el endpoint OpenAI-compatible y el endpoint Anthropic-compatible.
- Compara respuesta final, uso de tokens y latencia.
- Inspecciona el flujo SSE para comprobar los deltas de
reasoning_content. - Repite la prueba con
reasoning_effortenxhigh,mediumylow.
Puedes descargar Apidog para guardar estas solicitudes en un workspace y comparar qwen3.8-max, qwen3.7-max o kimi-k3 con prompts idénticos.
Dónde encaja en la familia Qwen
Qwen 3.8-Max se sitúa por encima de Qwen3.7-Max y de los modelos Plus.
Una guía rápida de selección:
- Qwen 3.8-Max: tareas multimodales, agentes y trabajo de documentos complejo.
- Qwen3.7-Max: opción de valor mientras se mantenga la promoción del 50%.
- Modelos Plus: tareas rutinarias y cargas de trabajo sensibles al coste.
Consulta la guía de los mejores modelos Qwen para elegir según tu carga de trabajo.
Preguntas frecuentes
¿Qwen 3.8 es de código abierto?
Todavía no a principios de agosto de 2026. Alibaba prometió publicar los pesos en Hugging Face y ModelScope durante la semana siguiente. Hasta entonces, el acceso es mediante API o Qwen Chat.
Para rutas sin coste, consulta cómo usar Qwen 3.8 gratis.
¿Cuánto cuesta Qwen 3.8-Max?
Cuesta $2 por millón de tokens de entrada y $6 por millón de tokens de salida, con una tarifa plana en toda la ventana de contexto de 1M.
Los aciertos de caché cuestan el 10% de la entrada. Los tokens de razonamiento se cobran como salida.
¿Qwen 3.8-Max es mejor que Kimi K3?
No hay una evaluación independiente directa. Sobre el papel, Qwen es más pequeño, acepta imágenes y es más barato en salida. Kimi K3 tiene la ventaja de contar ya con pesos públicos.
¿Puedo usar Qwen 3.8-Max con Claude Code?
Sí. Configura ANTHROPIC_BASE_URL con el endpoint Anthropic-compatible de DashScope y define:
export ANTHROPIC_MODEL="qwen3.8-max"
Alibaba también publicó configuraciones para Codex, Qoder, Qwen Code y OpenClaw.
Qué hacer a continuación
Qwen 3.8-Max ofrece disponibilidad general en tres regiones API, precios publicados, compatibilidad con OpenAI y Anthropic, una tabla extensa de benchmarks del proveedor y pesos abiertos prometidos.
La forma útil de evaluarlo no es depender solo de benchmarks. Prueba tu propia carga de trabajo:
- Obtén la cuota gratuita.
- Envía los mismos prompts por ambos protocolos.
- Mide calidad, tiempo de respuesta y tokens de razonamiento.
- Compara contra
qwen3.7-maxokimi-k3. - Revisa la publicación de pesos alrededor del 10 de agosto.
Empieza con la guía de configuración de la API.

Top comments (0)