DEV Community

Cover image for Qwen 3.8 vs Qwen 3.7 Max: Novedades y Diferencias
Roobia
Roobia

Posted on • Originally published at apidog.com

Qwen 3.8 vs Qwen 3.7 Max: Novedades y Diferencias

Alibaba lanzó Qwen 3.8-Max a principios de agosto de 2026. Si ejecutas qwen3.7-max en producción, la actualización merece una evaluación práctica: Qwen 3.8-Max mejora de forma notable en tareas de agentes e investigación, añade entrada de imágenes, baja el precio de lista y promete pesos abiertos.

Prueba Apidog hoy

La decisión no es automática. Qwen 3.7-Max tiene actualmente un descuento temporal del 50 %, por lo que hoy cuesta menos en términos absolutos. Algunas mejoras de benchmark son grandes; otras apenas cambian. Esta guía te ayuda a decidir si actualizar, mantener 3.7-Max durante la promoción o usar un modelo Plus.

Si necesitas contexto sobre ambos modelos, consulta el explicador de Qwen 3.8-Max y lo que aportó Qwen 3.7.

Metodología: todas las cifras de benchmark proceden de la tabla de Alibaba en la publicación oficial de Qwen 3.8. Ambos modelos se evaluaron en la misma ejecución del proveedor, así que las diferencias son internamente consistentes. Aun así, no sustituyen una evaluación independiente ni pruebas con tus propios prompts. La mayoría de las pruebas de código se ejecutaron con el arnés Claude Code y varios benchmarks son internos de Qwen.

La versión corta

Qué cambió Qwen 3.7-Max Qwen 3.8-Max
Terminal Bench 2.1 74.5 86.6
SWE-bench Pro 60.6 67.7
PaperBench 64.8 93.0
IFBench 79.1 82.8
GPQA Diamond 92.4 92.6
HLE 41.4 43.6
Precio de lista por 1M de tokens $2.5 entrada / $7.5 salida $2 entrada / $6 salida
Precio actual promocional $1.25 entrada / $3.75 salida $2 entrada / $6 salida
Entrada de imágenes No
Arquitectura divulgada No divulgada 2.4T total, 95B MoE activa
Pesos abiertos Nunca lanzados Prometidos “la próxima semana” (~10 de agosto)
Ventana de contexto 1M tokens 1M tokens

Dónde la mejora es relevante

Las ganancias de Qwen 3.8-Max se concentran en cargas de trabajo de agentes: tareas largas donde el modelo debe planificar, ejecutar herramientas, revisar resultados y corregirse.

Comparativa de benchmarks de Qwen 3.7-Max y Qwen 3.8-Max

Terminal Bench 2.1: 74.5 → 86.6

La mejora es de 12 puntos en tareas de agentes basadas en terminal. En la misma tabla de Alibaba, Qwen 3.8-Max supera a Claude Opus 4.8 y Fable 5, ambos con 84.6, aunque GPT-5.6 Sol mantiene el liderazgo con 88.8.

Actualiza si tus agentes ejecutan comandos, inspeccionan repositorios, modifican archivos o verifican resultados en una terminal.

SWE-bench Pro: 60.6 → 67.7

La mejora de 7 puntos es significativa para tareas reales de ingeniería de software. Sin embargo, Fable 5 alcanza 80.0 en la misma tabla.

Qué significa en producción: Qwen 3.8-Max mejora la capacidad de resolver issues y cambios de código, pero no convierte a Qwen en el líder de esta evaluación concreta. Evalúalo con tus tickets, tests y convenciones de repositorio antes de migrar.

PaperBench: 64.8 → 93.0

Este es el salto más grande: 28 puntos en reproducción de artículos de investigación de IA. También es la mejor puntuación de Qwen 3.8-Max en la tabla de Alibaba.

Actualiza si tu flujo incluye:

  • Reproducir experimentos técnicos.
  • Analizar documentos científicos extensos.
  • Convertir papers en planes de implementación.
  • Resolver tareas de razonamiento científico de varios pasos.

IFBench: 79.1 → 82.8

El seguimiento de instrucciones sube casi 4 puntos. Qwen 3.7-Max ya era fuerte en esta categoría, por lo que 3.8-Max amplía una fortaleza existente.

GPQA Diamond: 92.4 → 92.6

Aquí no hay una mejora práctica. Si tu tráfico se parece a preguntas científicas de nivel avanzado, actualizar no debería cambiar de forma perceptible la calidad.

HLE: 41.4 → 43.6

El Último Examen de la Humanidad mejora 2 puntos, pero Qwen 3.8-Max sigue por detrás de Fable 5 (53.3) y GPT-5.6 Sol (47.2) en la misma comparación.

Resumen de benchmarks:

  • Grandes ganancias en agentes e investigación.
  • Mejora incremental en seguimiento de instrucciones.
  • Sin cambio relevante en conocimiento tipo GPQA.
  • Brecha persistente en las evaluaciones de razonamiento más difíciles.

Para revisar la tabla completa y sus limitaciones, consulta el análisis de benchmarks de Qwen 3.8.

Arquitectura: ahora hay datos para planificar

Qwen 3.8-Max usa una arquitectura de mezcla de expertos (MoE) con:

  • 2.4 billones de parámetros totales
  • 95B de parámetros activos por pasada
  • Una relación de activación aproximada del 4 %
  • Base arquitectónica de Qwen 3.5

La relación importa para estimar la inferencia: aunque el modelo tiene 2.4T de parámetros totales, no activa todos en cada solicitud.

Alibaba no publicó cifras equivalentes para Qwen 3.7-Max. Para 3.8-Max, la documentación de modelos de Model Studio y la publicación de lanzamiento sí describen la arquitectura, lo que reduce la incertidumbre al planificar capacidad y costes.

Como referencia, Kimi K3 tiene 2.8T de parámetros totales y 104B activos. Qwen 3.8-Max es menor en ambos valores.

Multimodal: una capacidad nueva

Qwen 3.7-Max solo acepta texto. Qwen 3.8-Max admite imágenes de forma nativa.

Alibaba publica, entre otras, estas puntuaciones multimodales para Qwen 3.8-Max:

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1

No hay una columna comparable para Qwen 3.7-Max porque el modelo anterior no acepta imágenes.

Casos de uso que puedes consolidar

Con Qwen 3.8-Max, puedes probar un único modelo para texto e imagen en escenarios como:

  • Comprensión de capturas de pantalla.
  • Extracción de datos de documentos.
  • Análisis de gráficos.
  • Automatización de interfaces.
  • Procesamiento de imágenes adjuntas en tickets o incidencias.

La publicación de lanzamiento también muestra comprensión de documentos extensos y vídeo. Verifica la documentación de API antes de asumir formatos de entrada específicos para tu caso.

Precios: más barato en lista, más caro durante la promoción

Qwen 3.8-Max se lanza con un precio fijo en toda la ventana de contexto de 1M:

  • Entrada: $2 por 1M de tokens.
  • Salida: $6 por 1M de tokens.

Qwen 3.7-Max tiene un precio de lista de:

  • Entrada: $2.5 por 1M de tokens.
  • Salida: $7.5 por 1M de tokens.

A precio de lista, Qwen 3.8-Max reduce el coste un 20 % respecto a su predecesor.

Sin embargo, Qwen 3.7-Max tiene una promoción temporal del 50 %:

  • Entrada: $1.25 por 1M de tokens.
  • Salida: $3.75 por 1M de tokens.

Eso hace que, al precio actual, Qwen 3.7-Max sea aproximadamente un 38 % más barato que Qwen 3.8-Max.

Consulta las tarifas vigentes en la página oficial de precios de Model Studio.

Calcula el coste efectivo, no solo el coste por token

Qwen 3.8-Max usa reasoning_effort: xhigh de forma predeterminada. Los tokens de pensamiento se facturan como salida, así que una solicitud compleja puede costar más de lo que sugiere la tarifa base.

Antes de migrar:

  1. Mide tokens de entrada, salida y pensamiento de una muestra real.
  2. Ejecuta la misma carga con xhigh, medium y low.
  3. Compara calidad, latencia y coste por tarea completada.
  4. Define límites de presupuesto por endpoint o caso de uso.

La guía de precios de Qwen 3.8 explica el cálculo de coste por tarea y la economía de caché.

Si tu carga es rutinaria, qwen3.7-plus sigue siendo una opción de valor con $0.4 / $1.6, actualmente con un descuento del 20 %. Consulta la comparación Qwen 3.7-Plus vs Max para decidir cuándo Plus es suficiente.

Pesos abiertos: una novedad para la familia Max

Qwen 3.7-Max no publicó pesos abiertos y Alibaba nunca indicó que fuera a hacerlo.

Qwen 3.8-Max rompe ese patrón: la publicación de lanzamiento promete pesos en Hugging Face y ModelScope “la próxima semana”, aproximadamente el 10 de agosto de 2026.

Al 3 de agosto de 2026, los pesos todavía no están disponibles para descargar. Trátalo como una promesa, no como una capacidad disponible.

Aunque se publiquen, desplegar un modelo de 2.4T parámetros será un proyecto multinodo incluso con cuantización. Para muchos equipos, el impacto práctico será:

  • Acceso mediante proveedores alojados.
  • Más alternativas de despliegue.
  • Presión competitiva sobre precios.
  • Posibles opciones de cumplimiento o adquisición.

Si los pesos abiertos son un requisito de cumplimiento o estrategia de proveedor, esta diferencia puede ser decisiva: Qwen 3.8-Max probablemente los tendrá; Qwen 3.7-Max no.

Lo que no cambió

Ventana de contexto

Ambos modelos mantienen 1M de tokens. No hay expansión de contexto.

Ruta de acceso

Los dos se sirven mediante Alibaba Cloud Model Studio y endpoints compatibles con OpenAI. Para una migración básica, solo debes cambiar el ID del modelo:

- qwen3.7-max
+ qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Qwen 3.8-Max también añade una superficie de API compatible con Anthropic. Puedes probar ambos protocolos con un cliente como Apidog si tu herramienta ya usa ese formato.

Controles de razonamiento

Qwen 3.8-Max documenta estos controles:

  • reasoning_effort: xhigh, medium o low.
  • enable_thinking
  • preserve_thinking

En lugar de depender del comportamiento implícito del modelo, establece el nivel explícitamente y pruébalo por caso de uso.

Ejemplo de solicitud compatible con OpenAI:

{
  "model": "qwen3.8-max",
  "messages": [
    {
      "role": "user",
      "content": "Revisa este cambio y devuelve los riesgos principales."
    }
  ],
  "reasoning_effort": "medium",
  "enable_thinking": true
}
Enter fullscreen mode Exit fullscreen mode

¿Debes actualizar? Tres decisiones prácticas

Actualiza ahora si trabajas con agentes o investigación

Migra hacia Qwen 3.8-Max si tus aplicaciones:

  • Operan terminales.
  • Ejecutan flujos de varios pasos.
  • Reproducen investigación técnica.
  • Analizan capturas de pantalla o documentos.
  • Requieren un único modelo para texto e imágenes.

Los saltos en Terminal Bench (74.5 → 86.6) y PaperBench (64.8 → 93.0) son los cambios más relevantes.

Mantén Qwen 3.7-Max durante la promoción si tu carga es estable

Mantén qwen3.7-max si:

  • Tu aplicación es principalmente chat, resumen o preguntas y respuestas.
  • La calidad actual ya cumple tus métricas.
  • No necesitas entrada de imágenes.
  • El coste es más importante que la mejora potencial.

El cambio en GPQA es de solo 0.2 puntos, mientras que el precio promocional de 3.7-Max es muy inferior.

Configura una revisión mensual del precio promocional. Tu presupuesto de reserva debería asumir Qwen 3.8-Max a $2 / $6, no Qwen 3.7-Max a $1.25 / $3.75.

Baja a qwen3.7-plus si tus tareas son rutinarias

Usa qwen3.7-plus para tareas como:

  • Clasificación.
  • Extracción estructurada.
  • Generación con plantillas.
  • Enriquecimiento de datos.
  • Respuestas cortas y repetitivas.

Con $0.4 / $1.6, es cinco veces más barato que Qwen 3.8-Max en entrada. No pagues por capacidad Max si tu evaluación no demuestra que la necesitas.

Prueba la migración antes de cambiar producción

Los benchmarks del proveedor no predicen necesariamente el comportamiento con tus prompts, herramientas, documentos y formato de salida.

La forma más directa de decidir es ejecutar ambos modelos con tráfico representativo.

Configura una comparación lado a lado

  1. Crea una colección contra el endpoint compatible con OpenAI de Model Studio.
  2. Define una variable model.
  3. Crea dos entornos:
    • qwen37: model = qwen3.7-max
    • qwen38: model = qwen3.8-max
  4. Guarda prompts reales como escenarios de prueba.
  5. Ejecuta ambos entornos con el mismo conjunto de solicitudes.
  6. Compara:
    • Calidad de respuesta.
    • Cumplimiento de formato.
    • Latencia.
    • Tokens de salida y pensamiento.
    • Coste estimado por tarea completada.

Ejemplo de cuerpo reutilizable:

{
  "model": "{{model}}",
  "messages": [
    {
      "role": "system",
      "content": "Responde en JSON válido con los campos summary, risks y next_steps."
    },
    {
      "role": "user",
      "content": "{{prompt}}"
    }
  ],
  "reasoning_effort": "{{reasoning_effort}}"
}
Enter fullscreen mode Exit fullscreen mode

En Apidog, puedes cambiar entre entornos, inspeccionar respuestas y conservar tus prompts de producción como pruebas repetibles. Como ambos modelos comparten la misma superficie de API, una colección puede cubrir los dos.

Convierte la pregunta “¿debemos actualizar?” en una prueba de una tarde, no en una discusión basada solo en benchmarks. Descarga Apidog y compara ambos modelos con tus propias solicitudes antes de modificar producción.

Preguntas frecuentes

¿Qwen 3.8-Max es más barato que Qwen 3.7-Max?

A precio de lista, sí: $2 / $6 frente a $2.5 / $7.5 por 1M de tokens.

Con los precios actuales, no. La promoción temporal del 50 % de Qwen 3.7-Max reduce el coste a $1.25 / $3.75, aproximadamente un 38 % menos que Qwen 3.8-Max. La promoción no tiene una fecha pública de finalización. Consulta la guía de precios de Qwen 3.8 para los desgloses completos.

¿Necesito cambiar código para pasar de qwen3.7-max a qwen3.8-max?

Para uso básico, no. Ambos usan los endpoints compatibles con OpenAI de Model Studio, así que el cambio principal es el ID del modelo.

Conviene configurar reasoning_effort de forma explícita en Qwen 3.8-Max, porque usa xhigh por defecto y los tokens de pensamiento se facturan como salida. Si envías imágenes, necesitarás usar el formato de mensajes con entrada de imagen.

¿Qwen 3.7-Max tiene pesos abiertos?

No. Qwen 3.7-Max no publicó pesos abiertos y Alibaba no indicó que fuera a hacerlo.

Qwen 3.8-Max es el primer modelo Max con pesos abiertos prometidos, previstos para Hugging Face y ModelScope alrededor del 10 de agosto de 2026. Al 3 de agosto, todavía no estaban disponibles.

¿Qwen 3.8-Max es mejor que Claude o GPT?

Depende del benchmark, y las cifras proceden de Alibaba.

En su tabla, Qwen 3.8-Max supera a Opus 4.8 y Fable 5 en Terminal Bench 2.1, y lidera PaperBench e IFBench. Sin embargo, queda por detrás de Fable 5 en SWE-bench Pro (67.7 frente a 80.0) y de los modelos de vanguardia en HLE.

Hasta que existan evaluaciones independientes, valida cualquier conclusión con tus propias pruebas.

Top comments (0)