DEV Community

Cover image for Qwen 3.8 vs Kimi K3: Los dos gigantes chinos de código abierto, comparados
Roobia
Roobia

Posted on • Originally published at apidog.com

Qwen 3.8 vs Kimi K3: Los dos gigantes chinos de código abierto, comparados

Julio de 2026 fue un mes decisivo para los modelos de frontera de pesos abiertos, con dos lanzamientos procedentes de China: Moonshot AI lanzó Kimi K3 el 16 de julio y Alibaba presentó Qwen 3.8-Max tres días después, con disponibilidad general a principios de agosto. Ambos son modelos MoE de escala billonaria, funcionan con arneses de agentes estilo Claude Code y compiten en precio con laboratorios de frontera de EE. UU. Sin embargo, difieren en aspectos prácticos: qué puedes descargar hoy, si admiten imágenes y cuánto cuesta operarlos a escala.

Prueba Apidog hoy

La similitud superficial oculta diferencias importantes para implementar: pesos disponibles, modalidades de entrada, contexto, protocolos compatibles y coste real por carga de trabajo. Para revisar las especificaciones del modelo de Alibaba antes de continuar, consulta esta explicación de Qwen 3.8-Max.

Nota de rigor: todavía no existe una evaluación independiente directa entre estos dos modelos. Los benchmarks citados proceden de las tablas publicadas por cada proveedor. Úsalos como señales iniciales, no como una decisión final de arquitectura.

La cronología: quién lanzó qué y cuándo

El orden de lanzamiento importa porque, a fecha del 3 de agosto de 2026, «pesos abiertos» no significa lo mismo para ambos modelos.

  • Kimi K3 se lanzó el 16 de julio de 2026. Moonshot prometió los pesos en el lanzamiento y los publicó 11 días después, el 27 de julio, en Hugging Face. La versión disponible usa MXFP4 y ocupa 594 GB.
  • Qwen 3.8-Max se previsualizó el 19 de julio y llegó a disponibilidad general en Alibaba Cloud Model Studio a principios de agosto, según la publicación oficial de Qwen. Sus pesos estaban prometidos para Hugging Face y ModelScope «la próxima semana», aproximadamente el 10 de agosto.

Decisión rápida

Si necesitas autoalojar un modelo ahora mismo por cumplimiento, privacidad, investigación o control de versiones, Kimi K3 es la única opción disponible en la práctica a fecha de esta comparación.

Parámetros: dos modelos MoE a escala de billones

Ambos utilizan una arquitectura de mezcla de expertos (Mixture of Experts, MoE). Esto significa que el total de parámetros no equivale directamente al coste por token: importa especialmente cuántos parámetros se activan durante la inferencia.

Especificación Qwen 3.8-Max Kimi K3
Parámetros totales 2.4T 2.8T
Parámetros activos por token 95B 104B
Tasa de activación ~4% ~3.7%
Base de arquitectura Qwen 3.5, MoE MoE
Formato de pesos abiertos Prometido (~10 de agosto) MXFP4, 594 GB en Hugging Face

Qwen 3.8-Max activa 95B parámetros por token, frente a los 104B de Kimi K3. Esta diferencia no determina por sí sola la calidad del modelo, pero sí puede influir en el coste de servirlo a gran escala.

Para autoalojamiento, el dato más relevante es el tamaño de descarga de Kimi K3: 594 GB en MXFP4. Añade memoria para caché KV, contexto largo, réplicas y margen operativo, y el despliegue entra rápidamente en territorio multinodo.

En la mayoría de los equipos, los endpoints alojados serán la opción predeterminada. El autoalojamiento suele reservarse para casos como:

  • requisitos de residencia o soberanía de datos;
  • auditoría de pesos y versiones;
  • ajuste fino o cuantización propia;
  • investigación y evaluación interna.

Apertura hoy: pesos disponibles frente a una promesa

Este es el eje donde el marketing de «modelo abierto» necesita más contexto.

Kimi K3

Los pesos de Kimi K3 ya son públicos. Eso permite:

  1. Descargar y fijar una versión concreta.
  2. Revisar la licencia antes de integrar el modelo.
  3. Ejecutar cuantizaciones comunitarias o propias.
  4. Probar ajuste fino.
  5. Evitar cambios silenciosos de comportamiento propios de un endpoint API.

Qwen 3.8-Max

Qwen 3.8-Max sería el primer modelo de clase Qwen-Max publicado con pesos abiertos. Es un cambio relevante frente a la estrategia anterior de Alibaba para la línea Max, pero los pesos no estaban disponibles a fecha del 3 de agosto.

Hasta que el repositorio esté activo, Qwen 3.8-Max debe tratarse como un modelo accesible mediante API con pesos anunciados, no como un modelo autoalojable.

Resultado actual: Kimi K3 gana este eje. Vuelve a comprobarlo alrededor del 10 de agosto, cuando la disponibilidad de pesos de Qwen podría igualar la comparación.

Modalidad: Qwen acepta imágenes; K3 es texto

Aquí la diferencia es clara.

Qwen 3.8-Max acepta texto e imágenes:

{
  "input_modalities": ["text", "image"]
}
Enter fullscreen mode Exit fullscreen mode

Alibaba también muestra demostraciones de comprensión de documentos largos y vídeo mediante gráficos de memoria. Sin embargo, conviene distinguir entre demostraciones de blog y tipos de entrada documentados en la API: la entrada de imagen sí está expuesta y disponible; las demás capacidades deben verificarse contra la documentación vigente del endpoint.

Kimi K3 es un modelo de texto. Si tu flujo incluye cualquiera de estos casos, necesitarás añadir un modelo de visión externo:

  • análisis de capturas de pantalla;
  • OCR sobre documentos escaneados;
  • agentes que operan interfaces de usuario;
  • extracción de datos desde PDFs visuales;
  • validación visual de resultados.

Ese modelo adicional introduce código de integración, una llamada extra, más latencia y otro punto de fallo.

Regla práctica

  • Para agentes de código y flujos puramente textuales: esta diferencia puede ser irrelevante.
  • Para automatización documental, análisis visual o agentes de ordenador: Qwen 3.8-Max tiene una ventaja funcional inmediata.

Contexto, salida y superficie de API

Qwen 3.8-Max ofrece:

  • ventana de contexto de 1.000.000 de tokens;
  • salida máxima de 65.536 tokens;
  • parámetro reasoning_effort con niveles xhigh, medium y low;
  • salida de razonamiento conservada por defecto;
  • misma tarifa para modos de razonamiento y no razonamiento.

El acceso se realiza mediante Alibaba Cloud Model Studio. La plataforma ofrece URL base para Beijing, Singapur y US-Virginia, además de dos interfaces de protocolo:

  • endpoint compatible con OpenAI;
  • endpoint compatible con Anthropic.

Esto permite conectar Qwen 3.8-Max a herramientas compatibles con Claude Code sin reescribir el cliente:

export ANTHROPIC_BASE_URL="https://<endpoint-dashscope>"
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_API_KEY="<tu-clave>"
Enter fullscreen mode Exit fullscreen mode

Consulta las regiones, modelos y endpoints actuales en la página de modelos de Model Studio.

Si trabajas con varias regiones, guarda cada URL base y clave como un entorno independiente. En herramientas como Apidog, esto permite cambiar de región sin editar manualmente las solicitudes.

Kimi K3 también expone un protocolo compatible con Anthropic y puede usarse con arneses estilo Claude Code. Para evitar depender de límites que pueden cambiar tras el lanzamiento, revisa la explicación de Kimi K3 antes de desplegarlo.

Precios: tarifa plana frente a salida más cara

Estas son las tarifas públicas por millón de tokens:

Tarifa Qwen 3.8-Max Kimi K3
Entrada $2.00 $3.00
Salida $6.00 $15.00
Entrada por acierto de caché $0.20 $0.30
Niveles Plano hasta 1M de contexto Según el calendario publicado de Moonshot

Qwen 3.8-Max cobra $2 por millón de tokens de entrada y $6 por millón de tokens de salida, con tarifa plana hasta una ventana de contexto de un millón de tokens. Según la página de precios de Model Studio, la creación explícita de caché se factura al 125% de la entrada y los aciertos de caché al 10%.

También existe una cuota gratuita de 1M de tokens en Singapur, válida durante 90 días.

Cómo estimar el coste de una carga de trabajo

Usa esta fórmula básica:

coste_total =
  (tokens_entrada / 1_000_000 × precio_entrada) +
  (tokens_salida / 1_000_000 × precio_salida) +
  (tokens_cache_hit / 1_000_000 × precio_cache_hit)
Enter fullscreen mode Exit fullscreen mode

Ejemplo simplificado para una ejecución con Qwen 3.8-Max:

Entrada: 2M tokens
Salida: 500K tokens
Aciertos de caché: 1M tokens

Coste =
  (2 × $2.00) +
  (0.5 × $6.00) +
  (1 × $0.20)

Coste total = $7.20
Enter fullscreen mode Exit fullscreen mode

La diferencia principal aparece en cargas con mucha salida:

  • Kimi K3: $15/M de salida.
  • Qwen 3.8-Max: $6/M de salida.

Los bucles de agentes que generan razonamiento, código, correcciones y reintentos suelen ser intensivos en salida. En teoría, eso favorece a Qwen 3.8-Max.

Advertencia: reasoning_effort usa xhigh por defecto en Qwen y los tokens de pensamiento se cobran como salida. No presupuestes únicamente los tokens visibles de la respuesta final.

Para estimaciones por tarea, consulta este desglose de precios de Qwen 3.8.

Comparativas: dos tablas de proveedores, sin árbitro

No hay una comparación independiente que evalúe Qwen 3.8-Max y Kimi K3 bajo el mismo arnés, configuración de muestreo y conjunto de tareas.

Lo que sí existe

  • Alibaba publicó benchmarks de Qwen 3.8-Max frente a Claude Opus 4.8, Fable 5, GPT-5.6 Sol y Qwen 3.7-Max.
  • Moonshot publicó benchmarks de Kimi K3 frente a una línea similar de modelos de frontera.
  • Ambos conjuntos son ejecuciones de proveedores.

Lo que no existe

  • Una tabla independiente con Qwen 3.8-Max y Kimi K3 bajo el mismo entorno.
  • Números de Artificial Analysis para Qwen 3.8-Max en el momento de redacción.
  • Una evaluación de Qwen por Moonshot o de Kimi K3 por Alibaba.

Resultados publicados por Alibaba:

Referencia Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

Los propios resultados de Alibaba muestran pérdidas claras: Qwen 3.8-Max queda por detrás de Fable 5 en SWE-bench Pro y de todos los modelos listados en HLE. Sus mejores resultados publicados incluyen PaperBench, seguimiento de instrucciones y benchmarks multimodales.

Moonshot, por su parte, publicó resultados donde Kimi K3 superaba a Claude Opus 4.8 en varias filas destacadas, aunque quedaba por detrás de Fable 5 y GPT-5.6 Sol en términos generales. Puedes revisar esas afirmaciones y sus advertencias en esta comparación entre Kimi K3 y Claude Opus 4.8.

La conclusión útil no es que uno gane por una tabla. Es esta:

Ambos proveedores muestran resultados competitivos frente a modelos de frontera de EE. UU., pero ninguna de las dos tablas permite decidir honestamente cuál es mejor entre Qwen 3.8-Max y Kimi K3.

Para revisar con más detalle los límites de los números publicados por Alibaba, consulta este análisis de benchmarks de Qwen 3.8.

Ejecuta tu propia comparación directa en Apidog

La comparación más útil es ejecutar ambos modelos sobre tareas de tu producto, repositorio o flujo de agente.

Como ambos exponen endpoints compatibles con OpenAI, puedes crear una prueba repetible con dos entornos en Apidog.

1. Crea dos entornos

Configura un entorno por proveedor:

Qwen 3.8-Max
BASE_URL=https://<endpoint-dashscope>
MODEL=qwen3.8-max
API_KEY=<clave-de-alibaba>

Kimi K3
BASE_URL=https://<endpoint-moonshot>
MODEL=<id-del-modelo-k3>
API_KEY=<clave-de-moonshot>
Enter fullscreen mode Exit fullscreen mode

2. Guarda una solicitud común

Usa una tarea real, no un acertijo de benchmark:

POST {{BASE_URL}}/v1/chat/completions
Authorization: Bearer {{API_KEY}}
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode
{
  "model": "{{MODEL}}",
  "messages": [
    {
      "role": "system",
      "content": "Eres un asistente de ingeniería. Responde con pasos verificables y código ejecutable cuando sea necesario."
    },
    {
      "role": "user",
      "content": "Analiza este error de producción y propone una corrección mínima: <pega aquí un caso real anonimizado>"
    }
  ],
  "temperature": 0.2
}
Enter fullscreen mode Exit fullscreen mode

3. Alterna entre entornos

Envía exactamente la misma carga útil a ambos modelos. Registra:

  • código de estado;
  • latencia total;
  • tokens de entrada y salida;
  • coste estimado;
  • calidad de la respuesta;
  • uso de herramientas, si aplica;
  • estabilidad del formato de salida.

4. Añade aserciones

Convierte la prueba manual en una evaluación mínima repetible:

- El código de estado debe ser 200.
- La respuesta debe incluir una causa probable.
- La respuesta debe incluir un plan de corrección.
- La latencia debe ser inferior al límite definido.
- La salida debe respetar el esquema esperado.
Enter fullscreen mode Exit fullscreen mode

La depuración SSE también es útil si tu interfaz muestra tokens de razonamiento o si necesitas inspeccionar cómo transmite cada modelo la respuesta.

Descarga Apidog para ejecutar esta prueba. Diez prompts reales en ambos endpoints probablemente te darán una señal más útil que cualquier tabla de proveedor.

El marcador

Eje Ganador hoy Advertencia
Parámetros totales/activos Qwen 3.8-Max Es más ligero: 2.4T/95B frente a 2.8T/104B. No implica mejor calidad por sí solo.
Pesos abiertos hoy Kimi K3 Disponible en Hugging Face, 594 GB MXFP4. Los pesos de Qwen se esperaban para ~10 de agosto.
Modalidad Qwen 3.8-Max Acepta texto e imagen. Las demostraciones de vídeo y documentos largos no equivalen necesariamente a tipos de entrada API documentados.
Ventana de contexto Qwen 3.8-Max Nivel plano de 1M y salida máxima de 65.536 tokens. Verifica los límites de K3 antes de implementar.
Precio Qwen 3.8-Max $2/$6 frente a $3/$15. El razonamiento xhigh puede incrementar el coste efectivo de salida.
Benchmarks No determinable Ambas tablas proceden de proveedores y no hay evaluación directa independiente.
Ecosistema de arneses Empate Ambos pueden integrarse mediante endpoints compatibles con Anthropic.
Historial de promesas Kimi K3 Entregó los pesos 11 días después del lanzamiento; la promesa de Qwen seguía pendiente.

Cuál elegir y cuándo

Elige Kimi K3 si

  • necesitas descargar y ejecutar pesos en tu propio hardware esta semana;
  • tu postura de cumplimiento exige fijar y auditar una versión de modelo;
  • necesitas cuantización o ajuste fino;
  • tu carga de trabajo es exclusivamente textual;
  • tus prompts tienen mucho contexto reutilizable y la caché domina tu coste.

Elige Qwen 3.8-Max si

  • procesas imágenes, capturas de pantalla o documentos visuales;
  • generas muchos tokens de salida, como en agentes de código;
  • necesitas una ventana de contexto de 1M de tokens;
  • quieres tarifas planas dentro de ese contexto;
  • necesitas compatibilidad OpenAI y Anthropic desde la misma plataforma.

Espera si

Los pesos abiertos son el único criterio decisivo. Si los pesos de Qwen 3.8-Max se publican según lo anunciado, la decisión pasará a depender de licencia, modalidad, calidad de cuantización, precio y tus propias evaluaciones.

La conclusión práctica es simple: hay dos opciones de frontera compatibles con arneses de agente, con precios competitivos y separadas por apenas unas semanas. Antes de comprometer una hoja de ruta, ejecuta tus prompts reales contra ambos endpoints.

Preguntas frecuentes

¿Es Kimi K3 más abierto que Qwen 3.8-Max?

A fecha del 3 de agosto de 2026, sí. Los pesos de Kimi K3 están disponibles en Hugging Face desde el 27 de julio de 2026, en formato MXFP4 y con un tamaño de 594 GB. Los pesos de Qwen 3.8-Max estaban prometidos aproximadamente para el 10 de agosto, pero todavía no eran descargables.

Si Alibaba publica los pesos, ambos pasarán a ser modelos de frontera con pesos abiertos. Entonces la comparación dependerá de la licencia, la disponibilidad de cuantizaciones y el soporte comunitario. Mientras tanto, solo K3 puede autoalojarse. Consulta esta guía para ejecutar Kimi K3 localmente.

¿Qué modelo es mejor para programar?

Todavía no hay evidencia independiente suficiente para responderlo con rigor. Ambos proveedores publican resultados sólidos en codificación agéntica, pero las evaluaciones usan condiciones propias y no existe una comparación directa bajo el mismo arnés.

La tabla de Alibaba muestra, por ejemplo, que Qwen 3.8-Max queda por detrás de Fable 5 en SWE-bench Pro. Eso indica que los resultados publicados incluyen pérdidas, pero no hace comparables directamente las tablas de distintos proveedores.

La recomendación es ejecutar ambos modelos contra tareas reales de tu repositorio:

  • corrección de errores;
  • generación de pruebas;
  • migraciones;
  • revisión de pull requests;
  • análisis de logs;
  • uso de herramientas y terminal.

¿Puedo usar ambos modelos en Claude Code?

Sí. Ambos exponen endpoints compatibles con Anthropic.

Para Qwen 3.8-Max, configura:

export ANTHROPIC_BASE_URL="https://<endpoint-anthropic-de-dashscope>"
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_API_KEY="<tu-clave>"
Enter fullscreen mode Exit fullscreen mode

Kimi K3 admite el mismo patrón mediante el endpoint de Moonshot. Esta compatibilidad compartida hace que una prueba A/B entre ambos sea relativamente económica de implementar.

¿Cuál es más barato para un agente típico?

Según el precio de lista, Qwen 3.8-Max:

  • entrada: $2/M frente a $3/M;
  • salida: $6/M frente a $15/M;
  • acierto de caché: $0.20/M frente a $0.30/M.

La ventaja más grande está en salida, donde Kimi K3 cuesta 2.5 veces más. Como los bucles de agentes suelen generar razonamiento, código, revisiones y reintentos, esa diferencia puede importar mucho.

Hay dos salvedades:

  1. Kimi K3 sigue siendo competitivo en cargas con mucha entrada y alta reutilización de caché.
  2. Qwen usa reasoning_effort=xhigh por defecto y factura los tokens de pensamiento como salida.

Modela tu mezcla real de tokens antes de elegir basándote únicamente en la tarifa publicada.

Top comments (0)