Alibaba lanzó Qwen 3.8-Max a principios de agosto de 2026. Si ejecutas qwen3.7-max en producción, la actualización merece una evaluación práctica: Qwen 3.8-Max mejora de forma notable en tareas de agentes e investigación, añade entrada de imágenes, baja el precio de lista y promete pesos abiertos.
La decisión no es automática. Qwen 3.7-Max tiene actualmente un descuento temporal del 50 %, por lo que hoy cuesta menos en términos absolutos. Algunas mejoras de benchmark son grandes; otras apenas cambian. Esta guía te ayuda a decidir si actualizar, mantener 3.7-Max durante la promoción o usar un modelo Plus.
Si necesitas contexto sobre ambos modelos, consulta el explicador de Qwen 3.8-Max y lo que aportó Qwen 3.7.
Metodología: todas las cifras de benchmark proceden de la tabla de Alibaba en la publicación oficial de Qwen 3.8. Ambos modelos se evaluaron en la misma ejecución del proveedor, así que las diferencias son internamente consistentes. Aun así, no sustituyen una evaluación independiente ni pruebas con tus propios prompts. La mayoría de las pruebas de código se ejecutaron con el arnés Claude Code y varios benchmarks son internos de Qwen.
La versión corta
| Qué cambió | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
| IFBench | 79.1 | 82.8 |
| GPQA Diamond | 92.4 | 92.6 |
| HLE | 41.4 | 43.6 |
| Precio de lista por 1M de tokens | $2.5 entrada / $7.5 salida | $2 entrada / $6 salida |
| Precio actual promocional | $1.25 entrada / $3.75 salida | $2 entrada / $6 salida |
| Entrada de imágenes | No | Sí |
| Arquitectura divulgada | No divulgada | 2.4T total, 95B MoE activa |
| Pesos abiertos | Nunca lanzados | Prometidos “la próxima semana” (~10 de agosto) |
| Ventana de contexto | 1M tokens | 1M tokens |
Dónde la mejora es relevante
Las ganancias de Qwen 3.8-Max se concentran en cargas de trabajo de agentes: tareas largas donde el modelo debe planificar, ejecutar herramientas, revisar resultados y corregirse.
Terminal Bench 2.1: 74.5 → 86.6
La mejora es de 12 puntos en tareas de agentes basadas en terminal. En la misma tabla de Alibaba, Qwen 3.8-Max supera a Claude Opus 4.8 y Fable 5, ambos con 84.6, aunque GPT-5.6 Sol mantiene el liderazgo con 88.8.
Actualiza si tus agentes ejecutan comandos, inspeccionan repositorios, modifican archivos o verifican resultados en una terminal.
SWE-bench Pro: 60.6 → 67.7
La mejora de 7 puntos es significativa para tareas reales de ingeniería de software. Sin embargo, Fable 5 alcanza 80.0 en la misma tabla.
Qué significa en producción: Qwen 3.8-Max mejora la capacidad de resolver issues y cambios de código, pero no convierte a Qwen en el líder de esta evaluación concreta. Evalúalo con tus tickets, tests y convenciones de repositorio antes de migrar.
PaperBench: 64.8 → 93.0
Este es el salto más grande: 28 puntos en reproducción de artículos de investigación de IA. También es la mejor puntuación de Qwen 3.8-Max en la tabla de Alibaba.
Actualiza si tu flujo incluye:
- Reproducir experimentos técnicos.
- Analizar documentos científicos extensos.
- Convertir papers en planes de implementación.
- Resolver tareas de razonamiento científico de varios pasos.
IFBench: 79.1 → 82.8
El seguimiento de instrucciones sube casi 4 puntos. Qwen 3.7-Max ya era fuerte en esta categoría, por lo que 3.8-Max amplía una fortaleza existente.
GPQA Diamond: 92.4 → 92.6
Aquí no hay una mejora práctica. Si tu tráfico se parece a preguntas científicas de nivel avanzado, actualizar no debería cambiar de forma perceptible la calidad.
HLE: 41.4 → 43.6
El Último Examen de la Humanidad mejora 2 puntos, pero Qwen 3.8-Max sigue por detrás de Fable 5 (53.3) y GPT-5.6 Sol (47.2) en la misma comparación.
Resumen de benchmarks:
- Grandes ganancias en agentes e investigación.
- Mejora incremental en seguimiento de instrucciones.
- Sin cambio relevante en conocimiento tipo GPQA.
- Brecha persistente en las evaluaciones de razonamiento más difíciles.
Para revisar la tabla completa y sus limitaciones, consulta el análisis de benchmarks de Qwen 3.8.
Arquitectura: ahora hay datos para planificar
Qwen 3.8-Max usa una arquitectura de mezcla de expertos (MoE) con:
- 2.4 billones de parámetros totales
- 95B de parámetros activos por pasada
- Una relación de activación aproximada del 4 %
- Base arquitectónica de Qwen 3.5
La relación importa para estimar la inferencia: aunque el modelo tiene 2.4T de parámetros totales, no activa todos en cada solicitud.
Alibaba no publicó cifras equivalentes para Qwen 3.7-Max. Para 3.8-Max, la documentación de modelos de Model Studio y la publicación de lanzamiento sí describen la arquitectura, lo que reduce la incertidumbre al planificar capacidad y costes.
Como referencia, Kimi K3 tiene 2.8T de parámetros totales y 104B activos. Qwen 3.8-Max es menor en ambos valores.
Multimodal: una capacidad nueva
Qwen 3.7-Max solo acepta texto. Qwen 3.8-Max admite imágenes de forma nativa.
Alibaba publica, entre otras, estas puntuaciones multimodales para Qwen 3.8-Max:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
No hay una columna comparable para Qwen 3.7-Max porque el modelo anterior no acepta imágenes.
Casos de uso que puedes consolidar
Con Qwen 3.8-Max, puedes probar un único modelo para texto e imagen en escenarios como:
- Comprensión de capturas de pantalla.
- Extracción de datos de documentos.
- Análisis de gráficos.
- Automatización de interfaces.
- Procesamiento de imágenes adjuntas en tickets o incidencias.
La publicación de lanzamiento también muestra comprensión de documentos extensos y vídeo. Verifica la documentación de API antes de asumir formatos de entrada específicos para tu caso.
Precios: más barato en lista, más caro durante la promoción
Qwen 3.8-Max se lanza con un precio fijo en toda la ventana de contexto de 1M:
- Entrada: $2 por 1M de tokens.
- Salida: $6 por 1M de tokens.
Qwen 3.7-Max tiene un precio de lista de:
- Entrada: $2.5 por 1M de tokens.
- Salida: $7.5 por 1M de tokens.
A precio de lista, Qwen 3.8-Max reduce el coste un 20 % respecto a su predecesor.
Sin embargo, Qwen 3.7-Max tiene una promoción temporal del 50 %:
- Entrada: $1.25 por 1M de tokens.
- Salida: $3.75 por 1M de tokens.
Eso hace que, al precio actual, Qwen 3.7-Max sea aproximadamente un 38 % más barato que Qwen 3.8-Max.
Consulta las tarifas vigentes en la página oficial de precios de Model Studio.
Calcula el coste efectivo, no solo el coste por token
Qwen 3.8-Max usa reasoning_effort: xhigh de forma predeterminada. Los tokens de pensamiento se facturan como salida, así que una solicitud compleja puede costar más de lo que sugiere la tarifa base.
Antes de migrar:
- Mide tokens de entrada, salida y pensamiento de una muestra real.
- Ejecuta la misma carga con
xhigh,mediumylow. - Compara calidad, latencia y coste por tarea completada.
- Define límites de presupuesto por endpoint o caso de uso.
La guía de precios de Qwen 3.8 explica el cálculo de coste por tarea y la economía de caché.
Si tu carga es rutinaria, qwen3.7-plus sigue siendo una opción de valor con $0.4 / $1.6, actualmente con un descuento del 20 %. Consulta la comparación Qwen 3.7-Plus vs Max para decidir cuándo Plus es suficiente.
Pesos abiertos: una novedad para la familia Max
Qwen 3.7-Max no publicó pesos abiertos y Alibaba nunca indicó que fuera a hacerlo.
Qwen 3.8-Max rompe ese patrón: la publicación de lanzamiento promete pesos en Hugging Face y ModelScope “la próxima semana”, aproximadamente el 10 de agosto de 2026.
Al 3 de agosto de 2026, los pesos todavía no están disponibles para descargar. Trátalo como una promesa, no como una capacidad disponible.
Aunque se publiquen, desplegar un modelo de 2.4T parámetros será un proyecto multinodo incluso con cuantización. Para muchos equipos, el impacto práctico será:
- Acceso mediante proveedores alojados.
- Más alternativas de despliegue.
- Presión competitiva sobre precios.
- Posibles opciones de cumplimiento o adquisición.
Si los pesos abiertos son un requisito de cumplimiento o estrategia de proveedor, esta diferencia puede ser decisiva: Qwen 3.8-Max probablemente los tendrá; Qwen 3.7-Max no.
Lo que no cambió
Ventana de contexto
Ambos modelos mantienen 1M de tokens. No hay expansión de contexto.
Ruta de acceso
Los dos se sirven mediante Alibaba Cloud Model Studio y endpoints compatibles con OpenAI. Para una migración básica, solo debes cambiar el ID del modelo:
- qwen3.7-max
+ qwen3.8-max
Qwen 3.8-Max también añade una superficie de API compatible con Anthropic. Puedes probar ambos protocolos con un cliente como Apidog si tu herramienta ya usa ese formato.
Controles de razonamiento
Qwen 3.8-Max documenta estos controles:
-
reasoning_effort:xhigh,mediumolow. enable_thinkingpreserve_thinking
En lugar de depender del comportamiento implícito del modelo, establece el nivel explícitamente y pruébalo por caso de uso.
Ejemplo de solicitud compatible con OpenAI:
{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Revisa este cambio y devuelve los riesgos principales."
}
],
"reasoning_effort": "medium",
"enable_thinking": true
}
¿Debes actualizar? Tres decisiones prácticas
Actualiza ahora si trabajas con agentes o investigación
Migra hacia Qwen 3.8-Max si tus aplicaciones:
- Operan terminales.
- Ejecutan flujos de varios pasos.
- Reproducen investigación técnica.
- Analizan capturas de pantalla o documentos.
- Requieren un único modelo para texto e imágenes.
Los saltos en Terminal Bench (74.5 → 86.6) y PaperBench (64.8 → 93.0) son los cambios más relevantes.
Mantén Qwen 3.7-Max durante la promoción si tu carga es estable
Mantén qwen3.7-max si:
- Tu aplicación es principalmente chat, resumen o preguntas y respuestas.
- La calidad actual ya cumple tus métricas.
- No necesitas entrada de imágenes.
- El coste es más importante que la mejora potencial.
El cambio en GPQA es de solo 0.2 puntos, mientras que el precio promocional de 3.7-Max es muy inferior.
Configura una revisión mensual del precio promocional. Tu presupuesto de reserva debería asumir Qwen 3.8-Max a $2 / $6, no Qwen 3.7-Max a $1.25 / $3.75.
Baja a qwen3.7-plus si tus tareas son rutinarias
Usa qwen3.7-plus para tareas como:
- Clasificación.
- Extracción estructurada.
- Generación con plantillas.
- Enriquecimiento de datos.
- Respuestas cortas y repetitivas.
Con $0.4 / $1.6, es cinco veces más barato que Qwen 3.8-Max en entrada. No pagues por capacidad Max si tu evaluación no demuestra que la necesitas.
Prueba la migración antes de cambiar producción
Los benchmarks del proveedor no predicen necesariamente el comportamiento con tus prompts, herramientas, documentos y formato de salida.
La forma más directa de decidir es ejecutar ambos modelos con tráfico representativo.
Configura una comparación lado a lado
- Crea una colección contra el endpoint compatible con OpenAI de Model Studio.
- Define una variable
model. - Crea dos entornos:
-
qwen37:model = qwen3.7-max -
qwen38:model = qwen3.8-max
-
- Guarda prompts reales como escenarios de prueba.
- Ejecuta ambos entornos con el mismo conjunto de solicitudes.
- Compara:
- Calidad de respuesta.
- Cumplimiento de formato.
- Latencia.
- Tokens de salida y pensamiento.
- Coste estimado por tarea completada.
Ejemplo de cuerpo reutilizable:
{
"model": "{{model}}",
"messages": [
{
"role": "system",
"content": "Responde en JSON válido con los campos summary, risks y next_steps."
},
{
"role": "user",
"content": "{{prompt}}"
}
],
"reasoning_effort": "{{reasoning_effort}}"
}
En Apidog, puedes cambiar entre entornos, inspeccionar respuestas y conservar tus prompts de producción como pruebas repetibles. Como ambos modelos comparten la misma superficie de API, una colección puede cubrir los dos.
Convierte la pregunta “¿debemos actualizar?” en una prueba de una tarde, no en una discusión basada solo en benchmarks. Descarga Apidog y compara ambos modelos con tus propias solicitudes antes de modificar producción.
Preguntas frecuentes
¿Qwen 3.8-Max es más barato que Qwen 3.7-Max?
A precio de lista, sí: $2 / $6 frente a $2.5 / $7.5 por 1M de tokens.
Con los precios actuales, no. La promoción temporal del 50 % de Qwen 3.7-Max reduce el coste a $1.25 / $3.75, aproximadamente un 38 % menos que Qwen 3.8-Max. La promoción no tiene una fecha pública de finalización. Consulta la guía de precios de Qwen 3.8 para los desgloses completos.
¿Necesito cambiar código para pasar de qwen3.7-max a qwen3.8-max?
Para uso básico, no. Ambos usan los endpoints compatibles con OpenAI de Model Studio, así que el cambio principal es el ID del modelo.
Conviene configurar reasoning_effort de forma explícita en Qwen 3.8-Max, porque usa xhigh por defecto y los tokens de pensamiento se facturan como salida. Si envías imágenes, necesitarás usar el formato de mensajes con entrada de imagen.
¿Qwen 3.7-Max tiene pesos abiertos?
No. Qwen 3.7-Max no publicó pesos abiertos y Alibaba no indicó que fuera a hacerlo.
Qwen 3.8-Max es el primer modelo Max con pesos abiertos prometidos, previstos para Hugging Face y ModelScope alrededor del 10 de agosto de 2026. Al 3 de agosto, todavía no estaban disponibles.
¿Qwen 3.8-Max es mejor que Claude o GPT?
Depende del benchmark, y las cifras proceden de Alibaba.
En su tabla, Qwen 3.8-Max supera a Opus 4.8 y Fable 5 en Terminal Bench 2.1, y lidera PaperBench e IFBench. Sin embargo, queda por detrás de Fable 5 en SWE-bench Pro (67.7 frente a 80.0) y de los modelos de vanguardia en HLE.
Hasta que existan evaluaciones independientes, valida cualquier conclusión con tus propias pruebas.

Top comments (0)