DEV Community

Cover image for Qwen 3.8 Benchmarks: Qué revela la tabla de Alibaba y qué oculta
Roobia
Roobia

Posted on • Originally published at apidog.com

Qwen 3.8 Benchmarks: Qué revela la tabla de Alibaba y qué oculta

Durante dos semanas, la historia de Qwen 3.8 tuvo un vacío: las vistas previas para la prensa de julio prometían un modelo de clase fronteriza, pero no publicaron puntuaciones. La cobertura inicial se basó en impresiones. Eso cambió el 3 de agosto de 2026, cuando la publicación oficial de lanzamiento de Alibaba para Qwen 3.8-Max incluyó una tabla completa de benchmarks frente a Claude Opus 4.8, Fable 5, GPT-5.6 Sol y Qwen3.7-Max, además de una tabla multimodal frente a Gemini 3.1 Pro y GPT-5.6 Sol.

Prueba Apidog hoy

La tabla contiene victorias reales, pérdidas relevantes y detalles metodológicos que conviene revisar antes de usar sus resultados para elegir un modelo. En este artículo veremos los resultados principales y, sobre todo, cómo ejecutar una evaluación propia contra la API. Para un resumen del modelo, parámetros, precios y acceso, consulte primero este explicador de Qwen 3.8-Max.

Contexto importante: todos los números de este artículo proceden de la tabla publicada por Alibaba, con fecha de datos del 3 de agosto de 2026 según sus notas al pie. En el momento de redactar el contenido original, no existían evaluaciones independientes.

La tabla, de un vistazo

Estas son las filas principales del modelo de texto tal como las publicó Alibaba. Una puntuación más alta es mejor en todos los casos.

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (Humanity’s Last Exam) 43.6 45.7 53.3 47.2 41.4

Fuente: tabla de Alibaba gestionada por el proveedor. Esa condición importa: los resultados reflejan la configuración, el arnés y la metodología elegidos por quien publicó la comparación.

Tabla de benchmarks de Qwen 3.8-Max

Dónde gana Qwen 3.8-Max

PaperBench: su resultado principal

PaperBench evalúa si un modelo puede reproducir resultados de artículos de investigación. Qwen 3.8-Max obtiene 93.0, por delante de GPT-5.6 Sol (90.5), Fable 5 (88.8) y Opus 4.8 (80.3).

La mejora frente a Qwen3.7-Max también es grande: de 64.8 a 93.0. Es un salto de 28.2 puntos que merece validación independiente, pero, si se sostiene, indica una mejora relevante en tareas de investigación de varios pasos.

IFBench: seguimiento de instrucciones

En IFBench, Qwen 3.8-Max obtiene 82.8. El siguiente modelo no-Qwen de la tabla es GPT-5.6 Sol con 72.7, seguido por Fable 5 con 63.5 y Opus 4.8 con 62.2.

La ventaja es notable porque Qwen3.7-Max ya mostraba un buen resultado en esta prueba, con 79.1. Según esta tabla, el seguimiento de instrucciones parece una fortaleza consistente de la familia Qwen.

Terminal Bench 2.1: por delante de Claude

Qwen 3.8-Max logra 86.6 en Terminal Bench 2.1, frente a 84.6 de Opus 4.8 y 84.6 de Fable 5. GPT-5.6 Sol lidera esta fila con 88.8.

El resultado relevante no es una victoria absoluta: es un segundo lugar. Aun así, superar a ambos modelos de Anthropic en esta evaluación de agente de terminal es un resultado competitivo.

Resultados multimodales

La tabla multimodal separada es donde Qwen 3.8-Max parece más fuerte en conjunto. Alibaba reporta:

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1
  • Liderazgo en casi todas las filas de OCR incluidas en su tabla

Opus 4.8 y Fable 5 no aparecen como comparadores directos en esta sección centrada en multimodalidad. Frente a Gemini 3.1 Pro y GPT-5.6 Sol, el razonamiento visual y la inteligencia documental son los diferenciadores principales de Qwen 3.8-Max según Alibaba.

Si lo compara con Kimi K3, la diferencia multimodal es aún más clara: Kimi K3 es solo texto. Consulte la comparación entre Qwen 3.8 y Kimi K3 para revisar ese caso.

Dónde pierde claramente

Alibaba incluyó sus pérdidas en la tabla. Estas son las más importantes.

HLE: 43.6, por detrás de Fable 5

En Humanity’s Last Exam, Qwen 3.8-Max obtiene 43.6:

Modelo HLE
Fable 5 53.3
GPT-5.6 Sol 47.2
Claude Opus 4.8 45.7
Qwen 3.8-Max 43.6
Qwen3.7-Max 41.4

Qwen mejora ligeramente frente a su predecesor, pero queda último entre los cuatro modelos insignia. Dado que HLE intenta medir conocimiento amplio y razonamiento difícil, esta fila debe tener peso en una decisión de modelo generalista.

SWE-bench Pro: 67.7 frente a 80.0 de Fable 5

En SWE-bench Pro, Qwen 3.8-Max alcanza 67.7:

  • Por delante de GPT-5.6 Sol: 64.6
  • Por detrás de Opus 4.8: 69.2
  • A 12.3 puntos de Fable 5: 80.0

La mejora frente a Qwen3.7-Max, que obtuvo 60.6, es real. Sin embargo, los dos resultados siguientes pueden ser verdaderos al mismo tiempo:

  1. Qwen supera a Opus 4.8 en Terminal Bench 2.1.
  2. Qwen queda claramente por detrás de Fable 5 en SWE-bench Pro.

Para equipos que mantienen repositorios complejos, el segundo punto puede ser más relevante que el primero.

DeepSWE y las tareas agénticas más exigentes

DeepSWE es otra fila donde Qwen 3.8-Max queda por detrás de la frontera en la tabla de Alibaba. El patrón general de la sección de código es consistente:

  • Competitivo en tareas agénticas basadas en terminal.
  • Más rezagado en evaluaciones profundas de ingeniería de software.

El resumen práctico es el siguiente: Qwen 3.8-Max supera a Opus 4.8 en algunas filas agénticas, queda por detrás de Fable 5 en gran parte del trabajo central de código y destaca en inteligencia multimodal y documental.

Esto sigue siendo competitivo para un modelo con precio de entrada de $2 y salida de $6 por millón de tokens, según la página oficial de precios. Pero no demuestra una victoria generalizada en todos los tipos de tareas.

La letra pequeña de la tabla

Antes de reutilizar estos números en una decisión técnica, revise cuatro detalles metodológicos.

1. Todos los números fueron ejecutados por el proveedor

Alibaba evaluó su propio modelo y los modelos de sus competidores. Es una práctica habitual en las tablas de lanzamiento, pero implica que el proveedor controla factores relevantes:

  • Versiones de los benchmarks
  • Estrategias de prompting
  • Parámetros de muestreo
  • Políticas de reintentos
  • Entorno de ejecución

Esto no implica fraude. Significa que una tabla de lanzamiento es una afirmación metodológica del proveedor, no una medición neutral.

2. La mayoría de benchmarks de código usaron Claude Code

Alibaba ejecutó gran parte de sus benchmarks de programación usando Claude Code, el arnés de agente de Anthropic, conectado a Qwen 3.8-Max mediante una API compatible con Anthropic.

Esto tiene dos consecuencias:

  • Permite evaluar modelos dentro de una herramienta ampliamente usada.
  • Las puntuaciones reflejan el rendimiento de Qwen dentro del arnés de Anthropic, no necesariamente el resultado que obtendría con otro agente, prompt o protocolo.

Para cargas de trabajo agénticas, el arnés puede influir tanto como el modelo.

3. Varios benchmarks son internos de Qwen

QwenSWEBench, QwenQoderBench, CoWorkBench y RecreationBench fueron creados por el equipo de Qwen.

Los benchmarks internos pueden medir capacidades útiles, especialmente cuando las evaluaciones públicas todavía no cubren un caso de uso. Sin embargo, no ofrecen el mismo tipo de evidencia que un benchmark público e independiente como SWE-bench Pro.

Cuando cite una puntuación, identifique primero si procede de:

  • Un benchmark público.
  • Un benchmark interno del proveedor.
  • Una ejecución independiente.
  • Una ejecución autoinformada por el proveedor.

4. La nota al pie sobre Fable 5

La tabla de Alibaba incluye una nota que indica que los resultados de Fable 5 “pueden implicar retrocesos”. Esto sugiere que, al menos para ese competidor, los números podrían no representar una ejecución limpia del modelo.

No ignore las notas al pie: pueden cambiar la interpretación de una columna completa.

Este patrón no es exclusivo de Alibaba. Anthropic, OpenAI y Google también publican tablas con elecciones metodológicas propias. El mismo problema apareció en este desglose de benchmarks de Kimi K3: una tabla del proveedor sirve como punto de partida, no como veredicto final.

Cómo leer la siguiente tabla de benchmarks

A 3 de agosto de 2026, no existían evaluaciones independientes publicadas de Qwen 3.8-Max. Artificial Analysis y las principales tablas de clasificación comunitarias todavía no habían publicado resultados.

Mientras espera una segunda fuente, use esta lista de verificación:

  1. ¿Quién ejecutó la evaluación?

    Los números autoinformados requieren más contexto que una evaluación independiente.

  2. ¿Qué arnés y configuración se usaron?

    En benchmarks agénticos, el arnés, las herramientas disponibles y los límites de reintento pueden modificar el resultado.

  3. ¿El benchmark es público o interno?

    Las evaluaciones internas pueden ser útiles, pero deben etiquetarse como tales.

  4. ¿Qué dicen las notas al pie?

    Una aclaración sobre retrocesos, versiones o protocolos puede ser decisiva.

  5. ¿Qué filas faltan?

    Compare tablas entre generaciones para detectar evaluaciones que desaparecieron. Esta comparación de la generación anterior entre proveedores puede ayudar a identificar cambios.

  6. ¿Existe una segunda fuente?

    Esperar unos días para ver resultados independientes suele ser mejor que decidir solo con una tabla de lanzamiento.

Ejecute su propia evaluación

La forma más útil de reducir la dependencia de benchmarks públicos es probar el modelo con sus propios prompts, datos y criterios de aceptación.

Qwen 3.8-Max está disponible en Alibaba Cloud Model Studio con el ID de modelo qwen3.8-max, según la página oficial de modelos. El servicio ofrece APIs compatibles con OpenAI y Anthropic.

Configuración recomendada

Cree dos solicitudes equivalentes:

  1. Una dirigida a qwen3.8-max.
  2. Otra dirigida a su modelo de referencia actual, por ejemplo Qwen3.7-Max, Kimi K3, Claude o GPT.

Mantenga constantes los elementos que no está comparando:

  • Prompt del sistema
  • Prompt del usuario
  • Temperatura
  • Límite de tokens
  • Herramientas habilitadas
  • Número máximo de reintentos
  • Datos de entrada

Ejemplo de payload compatible con chat completions

Use la misma estructura para ambos modelos y cambie únicamente el valor de model.

{
  "model": "qwen3.8-max",
  "messages": [
    {
      "role": "system",
      "content": "Responde únicamente con JSON válido."
    },
    {
      "role": "user",
      "content": "Extrae el nombre, email y prioridad de este ticket: ..."
    }
  ],
  "temperature": 0,
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

Para una comparación útil, no use solo un prompt. Guarde entre 20 y 30 prompts de producción representativos, siempre eliminando o anonimizando información sensible antes de enviarla a un servicio externo.

Qué medir

Además de comparar la salida manualmente, defina aserciones que representen requisitos reales de su aplicación:

Métrica Ejemplo de aserción
JSON válido La respuesta puede parsearse sin error
Campos requeridos Existen name, email y priority
Calidad funcional La clasificación coincide con el resultado esperado
Latencia El tiempo total está por debajo de su umbral
Coste Los tokens usados caben en su presupuesto
Estabilidad La tasa de aprobación se mantiene en ejecuciones repetidas

En Apidog, puede crear una solicitud para cada endpoint, guardar los prompts como datos de prueba y ejecutar ambos escenarios de forma consecutiva. Esto permite comparar tasas de aprobación y tiempos de respuesta lado a lado en su carga de trabajo, no en la de Alibaba.

Pasos prácticos en Apidog

  1. Cree un entorno para Qwen 3.8-Max y otro para su modelo de referencia.
  2. Guarde las credenciales como variables de entorno, no dentro de los payloads.
  3. Cree una solicitud base de chat completions.
  4. Duplique la solicitud y cambie solo el endpoint, el modelo y la autenticación necesarios.
  5. Añada casos de prueba con sus prompts reales anonimizados.
  6. Defina aserciones para estructura, campos y tiempos de respuesta.
  7. Ejecute ambos escenarios con la misma colección de entradas.
  8. Compare la tasa de éxito, la latencia y los errores por tipo de tarea.

Dos detalles específicos de Qwen merecen una prueba separada:

  • El modelo usa reasoning_effort: xhigh por defecto, según el contenido original. Mida coste y latencia con el nivel de esfuerzo que realmente desplegaría.
  • Si usará el endpoint compatible con Anthropic, pruébelo por separado. La mayoría de los benchmarks de código de Alibaba se ejecutaron mediante ese protocolo y mediante Claude Code.

Puede descargar Apidog, conectar ambos endpoints como entornos y obtener resultados propios antes de que aparezcan más tablas independientes.

Preguntas frecuentes

¿Se han verificado de forma independiente los benchmarks de Qwen 3.8?

No. A 3 de agosto de 2026, todos los números publicados procedían de la tabla de Alibaba. Artificial Analysis y las tablas de clasificación comunitarias todavía no habían evaluado Qwen 3.8-Max en el momento de redactar el contenido original.

Trate estos resultados como afirmaciones del proveedor hasta que existan ejecuciones independientes.

¿Cuál es el mejor resultado de Qwen 3.8-Max?

En la tabla principal, PaperBench es su mejor fila: 93.0, por delante de GPT-5.6 Sol (90.5), Fable 5 (88.8) y Opus 4.8 (80.3).

En la tabla multimodal, MathVision con 95.2 y las filas de OCR son sus resultados más destacados.

¿Dónde pierde claramente Qwen 3.8-Max?

Sus debilidades más claras en la tabla de Alibaba son:

  • HLE: 43.6, último entre los cuatro modelos insignia.
  • SWE-bench Pro: 67.7 frente a 80.0 de Fable 5.
  • DeepSWE: también queda por detrás de la frontera.

Las evaluaciones de ingeniería de software profunda y los exámenes de conocimiento amplio son sus áreas menos favorables en la tabla publicada.

¿Cuánto mejora Qwen 3.8 frente a Qwen 3.7-Max?

Según la tabla de Alibaba, las mejoras generacionales son grandes:

Benchmark Qwen3.7-Max Qwen 3.8-Max Diferencia
Terminal Bench 2.1 74.5 86.6 +12.1
SWE-bench Pro 60.6 67.7 +7.1
PaperBench 64.8 93.0 +28.2

La actualización adecuada depende de su carga de trabajo, modalidad, latencia y coste. Consulte esta comparación entre Qwen 3.8 y Qwen 3.7 para evaluar la decisión completa.

Top comments (0)