Julio de 2026 fue un mes decisivo para los modelos de frontera de pesos abiertos, con dos lanzamientos procedentes de China: Moonshot AI lanzó Kimi K3 el 16 de julio y Alibaba presentó Qwen 3.8-Max tres días después, con disponibilidad general a principios de agosto. Ambos son modelos MoE de escala billonaria, funcionan con arneses de agentes estilo Claude Code y compiten en precio con laboratorios de frontera de EE. UU. Sin embargo, difieren en aspectos prácticos: qué puedes descargar hoy, si admiten imágenes y cuánto cuesta operarlos a escala.
La similitud superficial oculta diferencias importantes para implementar: pesos disponibles, modalidades de entrada, contexto, protocolos compatibles y coste real por carga de trabajo. Para revisar las especificaciones del modelo de Alibaba antes de continuar, consulta esta explicación de Qwen 3.8-Max.
Nota de rigor: todavía no existe una evaluación independiente directa entre estos dos modelos. Los benchmarks citados proceden de las tablas publicadas por cada proveedor. Úsalos como señales iniciales, no como una decisión final de arquitectura.
La cronología: quién lanzó qué y cuándo
El orden de lanzamiento importa porque, a fecha del 3 de agosto de 2026, «pesos abiertos» no significa lo mismo para ambos modelos.
- Kimi K3 se lanzó el 16 de julio de 2026. Moonshot prometió los pesos en el lanzamiento y los publicó 11 días después, el 27 de julio, en Hugging Face. La versión disponible usa MXFP4 y ocupa 594 GB.
- Qwen 3.8-Max se previsualizó el 19 de julio y llegó a disponibilidad general en Alibaba Cloud Model Studio a principios de agosto, según la publicación oficial de Qwen. Sus pesos estaban prometidos para Hugging Face y ModelScope «la próxima semana», aproximadamente el 10 de agosto.
Decisión rápida
Si necesitas autoalojar un modelo ahora mismo por cumplimiento, privacidad, investigación o control de versiones, Kimi K3 es la única opción disponible en la práctica a fecha de esta comparación.
Parámetros: dos modelos MoE a escala de billones
Ambos utilizan una arquitectura de mezcla de expertos (Mixture of Experts, MoE). Esto significa que el total de parámetros no equivale directamente al coste por token: importa especialmente cuántos parámetros se activan durante la inferencia.
| Especificación | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Parámetros totales | 2.4T | 2.8T |
| Parámetros activos por token | 95B | 104B |
| Tasa de activación | ~4% | ~3.7% |
| Base de arquitectura | Qwen 3.5, MoE | MoE |
| Formato de pesos abiertos | Prometido (~10 de agosto) | MXFP4, 594 GB en Hugging Face |
Qwen 3.8-Max activa 95B parámetros por token, frente a los 104B de Kimi K3. Esta diferencia no determina por sí sola la calidad del modelo, pero sí puede influir en el coste de servirlo a gran escala.
Para autoalojamiento, el dato más relevante es el tamaño de descarga de Kimi K3: 594 GB en MXFP4. Añade memoria para caché KV, contexto largo, réplicas y margen operativo, y el despliegue entra rápidamente en territorio multinodo.
En la mayoría de los equipos, los endpoints alojados serán la opción predeterminada. El autoalojamiento suele reservarse para casos como:
- requisitos de residencia o soberanía de datos;
- auditoría de pesos y versiones;
- ajuste fino o cuantización propia;
- investigación y evaluación interna.
Apertura hoy: pesos disponibles frente a una promesa
Este es el eje donde el marketing de «modelo abierto» necesita más contexto.
Kimi K3
Los pesos de Kimi K3 ya son públicos. Eso permite:
- Descargar y fijar una versión concreta.
- Revisar la licencia antes de integrar el modelo.
- Ejecutar cuantizaciones comunitarias o propias.
- Probar ajuste fino.
- Evitar cambios silenciosos de comportamiento propios de un endpoint API.
Qwen 3.8-Max
Qwen 3.8-Max sería el primer modelo de clase Qwen-Max publicado con pesos abiertos. Es un cambio relevante frente a la estrategia anterior de Alibaba para la línea Max, pero los pesos no estaban disponibles a fecha del 3 de agosto.
Hasta que el repositorio esté activo, Qwen 3.8-Max debe tratarse como un modelo accesible mediante API con pesos anunciados, no como un modelo autoalojable.
Resultado actual: Kimi K3 gana este eje. Vuelve a comprobarlo alrededor del 10 de agosto, cuando la disponibilidad de pesos de Qwen podría igualar la comparación.
Modalidad: Qwen acepta imágenes; K3 es texto
Aquí la diferencia es clara.
Qwen 3.8-Max acepta texto e imágenes:
{
"input_modalities": ["text", "image"]
}
Alibaba también muestra demostraciones de comprensión de documentos largos y vídeo mediante gráficos de memoria. Sin embargo, conviene distinguir entre demostraciones de blog y tipos de entrada documentados en la API: la entrada de imagen sí está expuesta y disponible; las demás capacidades deben verificarse contra la documentación vigente del endpoint.
Kimi K3 es un modelo de texto. Si tu flujo incluye cualquiera de estos casos, necesitarás añadir un modelo de visión externo:
- análisis de capturas de pantalla;
- OCR sobre documentos escaneados;
- agentes que operan interfaces de usuario;
- extracción de datos desde PDFs visuales;
- validación visual de resultados.
Ese modelo adicional introduce código de integración, una llamada extra, más latencia y otro punto de fallo.
Regla práctica
- Para agentes de código y flujos puramente textuales: esta diferencia puede ser irrelevante.
- Para automatización documental, análisis visual o agentes de ordenador: Qwen 3.8-Max tiene una ventaja funcional inmediata.
Contexto, salida y superficie de API
Qwen 3.8-Max ofrece:
- ventana de contexto de 1.000.000 de tokens;
- salida máxima de 65.536 tokens;
- parámetro
reasoning_effortcon nivelesxhigh,mediumylow; - salida de razonamiento conservada por defecto;
- misma tarifa para modos de razonamiento y no razonamiento.
El acceso se realiza mediante Alibaba Cloud Model Studio. La plataforma ofrece URL base para Beijing, Singapur y US-Virginia, además de dos interfaces de protocolo:
- endpoint compatible con OpenAI;
- endpoint compatible con Anthropic.
Esto permite conectar Qwen 3.8-Max a herramientas compatibles con Claude Code sin reescribir el cliente:
export ANTHROPIC_BASE_URL="https://<endpoint-dashscope>"
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_API_KEY="<tu-clave>"
Consulta las regiones, modelos y endpoints actuales en la página de modelos de Model Studio.
Si trabajas con varias regiones, guarda cada URL base y clave como un entorno independiente. En herramientas como Apidog, esto permite cambiar de región sin editar manualmente las solicitudes.
Kimi K3 también expone un protocolo compatible con Anthropic y puede usarse con arneses estilo Claude Code. Para evitar depender de límites que pueden cambiar tras el lanzamiento, revisa la explicación de Kimi K3 antes de desplegarlo.
Precios: tarifa plana frente a salida más cara
Estas son las tarifas públicas por millón de tokens:
| Tarifa | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Entrada | $2.00 | $3.00 |
| Salida | $6.00 | $15.00 |
| Entrada por acierto de caché | $0.20 | $0.30 |
| Niveles | Plano hasta 1M de contexto | Según el calendario publicado de Moonshot |
Qwen 3.8-Max cobra $2 por millón de tokens de entrada y $6 por millón de tokens de salida, con tarifa plana hasta una ventana de contexto de un millón de tokens. Según la página de precios de Model Studio, la creación explícita de caché se factura al 125% de la entrada y los aciertos de caché al 10%.
También existe una cuota gratuita de 1M de tokens en Singapur, válida durante 90 días.
Cómo estimar el coste de una carga de trabajo
Usa esta fórmula básica:
coste_total =
(tokens_entrada / 1_000_000 × precio_entrada) +
(tokens_salida / 1_000_000 × precio_salida) +
(tokens_cache_hit / 1_000_000 × precio_cache_hit)
Ejemplo simplificado para una ejecución con Qwen 3.8-Max:
Entrada: 2M tokens
Salida: 500K tokens
Aciertos de caché: 1M tokens
Coste =
(2 × $2.00) +
(0.5 × $6.00) +
(1 × $0.20)
Coste total = $7.20
La diferencia principal aparece en cargas con mucha salida:
- Kimi K3: $15/M de salida.
- Qwen 3.8-Max: $6/M de salida.
Los bucles de agentes que generan razonamiento, código, correcciones y reintentos suelen ser intensivos en salida. En teoría, eso favorece a Qwen 3.8-Max.
Advertencia:
reasoning_effortusaxhighpor defecto en Qwen y los tokens de pensamiento se cobran como salida. No presupuestes únicamente los tokens visibles de la respuesta final.
Para estimaciones por tarea, consulta este desglose de precios de Qwen 3.8.
Comparativas: dos tablas de proveedores, sin árbitro
No hay una comparación independiente que evalúe Qwen 3.8-Max y Kimi K3 bajo el mismo arnés, configuración de muestreo y conjunto de tareas.
Lo que sí existe
- Alibaba publicó benchmarks de Qwen 3.8-Max frente a Claude Opus 4.8, Fable 5, GPT-5.6 Sol y Qwen 3.7-Max.
- Moonshot publicó benchmarks de Kimi K3 frente a una línea similar de modelos de frontera.
- Ambos conjuntos son ejecuciones de proveedores.
Lo que no existe
- Una tabla independiente con Qwen 3.8-Max y Kimi K3 bajo el mismo entorno.
- Números de Artificial Analysis para Qwen 3.8-Max en el momento de redacción.
- Una evaluación de Qwen por Moonshot o de Kimi K3 por Alibaba.
Resultados publicados por Alibaba:
| Referencia | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 |
| HLE | 43.6 | 45.7 | 53.3 | 47.2 |
Los propios resultados de Alibaba muestran pérdidas claras: Qwen 3.8-Max queda por detrás de Fable 5 en SWE-bench Pro y de todos los modelos listados en HLE. Sus mejores resultados publicados incluyen PaperBench, seguimiento de instrucciones y benchmarks multimodales.
Moonshot, por su parte, publicó resultados donde Kimi K3 superaba a Claude Opus 4.8 en varias filas destacadas, aunque quedaba por detrás de Fable 5 y GPT-5.6 Sol en términos generales. Puedes revisar esas afirmaciones y sus advertencias en esta comparación entre Kimi K3 y Claude Opus 4.8.
La conclusión útil no es que uno gane por una tabla. Es esta:
Ambos proveedores muestran resultados competitivos frente a modelos de frontera de EE. UU., pero ninguna de las dos tablas permite decidir honestamente cuál es mejor entre Qwen 3.8-Max y Kimi K3.
Para revisar con más detalle los límites de los números publicados por Alibaba, consulta este análisis de benchmarks de Qwen 3.8.
Ejecuta tu propia comparación directa en Apidog
La comparación más útil es ejecutar ambos modelos sobre tareas de tu producto, repositorio o flujo de agente.
Como ambos exponen endpoints compatibles con OpenAI, puedes crear una prueba repetible con dos entornos en Apidog.
1. Crea dos entornos
Configura un entorno por proveedor:
Qwen 3.8-Max
BASE_URL=https://<endpoint-dashscope>
MODEL=qwen3.8-max
API_KEY=<clave-de-alibaba>
Kimi K3
BASE_URL=https://<endpoint-moonshot>
MODEL=<id-del-modelo-k3>
API_KEY=<clave-de-moonshot>
2. Guarda una solicitud común
Usa una tarea real, no un acertijo de benchmark:
POST {{BASE_URL}}/v1/chat/completions
Authorization: Bearer {{API_KEY}}
Content-Type: application/json
{
"model": "{{MODEL}}",
"messages": [
{
"role": "system",
"content": "Eres un asistente de ingeniería. Responde con pasos verificables y código ejecutable cuando sea necesario."
},
{
"role": "user",
"content": "Analiza este error de producción y propone una corrección mínima: <pega aquí un caso real anonimizado>"
}
],
"temperature": 0.2
}
3. Alterna entre entornos
Envía exactamente la misma carga útil a ambos modelos. Registra:
- código de estado;
- latencia total;
- tokens de entrada y salida;
- coste estimado;
- calidad de la respuesta;
- uso de herramientas, si aplica;
- estabilidad del formato de salida.
4. Añade aserciones
Convierte la prueba manual en una evaluación mínima repetible:
- El código de estado debe ser 200.
- La respuesta debe incluir una causa probable.
- La respuesta debe incluir un plan de corrección.
- La latencia debe ser inferior al límite definido.
- La salida debe respetar el esquema esperado.
La depuración SSE también es útil si tu interfaz muestra tokens de razonamiento o si necesitas inspeccionar cómo transmite cada modelo la respuesta.
Descarga Apidog para ejecutar esta prueba. Diez prompts reales en ambos endpoints probablemente te darán una señal más útil que cualquier tabla de proveedor.
El marcador
| Eje | Ganador hoy | Advertencia |
|---|---|---|
| Parámetros totales/activos | Qwen 3.8-Max | Es más ligero: 2.4T/95B frente a 2.8T/104B. No implica mejor calidad por sí solo. |
| Pesos abiertos hoy | Kimi K3 | Disponible en Hugging Face, 594 GB MXFP4. Los pesos de Qwen se esperaban para ~10 de agosto. |
| Modalidad | Qwen 3.8-Max | Acepta texto e imagen. Las demostraciones de vídeo y documentos largos no equivalen necesariamente a tipos de entrada API documentados. |
| Ventana de contexto | Qwen 3.8-Max | Nivel plano de 1M y salida máxima de 65.536 tokens. Verifica los límites de K3 antes de implementar. |
| Precio | Qwen 3.8-Max | $2/$6 frente a $3/$15. El razonamiento xhigh puede incrementar el coste efectivo de salida. |
| Benchmarks | No determinable | Ambas tablas proceden de proveedores y no hay evaluación directa independiente. |
| Ecosistema de arneses | Empate | Ambos pueden integrarse mediante endpoints compatibles con Anthropic. |
| Historial de promesas | Kimi K3 | Entregó los pesos 11 días después del lanzamiento; la promesa de Qwen seguía pendiente. |
Cuál elegir y cuándo
Elige Kimi K3 si
- necesitas descargar y ejecutar pesos en tu propio hardware esta semana;
- tu postura de cumplimiento exige fijar y auditar una versión de modelo;
- necesitas cuantización o ajuste fino;
- tu carga de trabajo es exclusivamente textual;
- tus prompts tienen mucho contexto reutilizable y la caché domina tu coste.
Elige Qwen 3.8-Max si
- procesas imágenes, capturas de pantalla o documentos visuales;
- generas muchos tokens de salida, como en agentes de código;
- necesitas una ventana de contexto de 1M de tokens;
- quieres tarifas planas dentro de ese contexto;
- necesitas compatibilidad OpenAI y Anthropic desde la misma plataforma.
Espera si
Los pesos abiertos son el único criterio decisivo. Si los pesos de Qwen 3.8-Max se publican según lo anunciado, la decisión pasará a depender de licencia, modalidad, calidad de cuantización, precio y tus propias evaluaciones.
La conclusión práctica es simple: hay dos opciones de frontera compatibles con arneses de agente, con precios competitivos y separadas por apenas unas semanas. Antes de comprometer una hoja de ruta, ejecuta tus prompts reales contra ambos endpoints.
Preguntas frecuentes
¿Es Kimi K3 más abierto que Qwen 3.8-Max?
A fecha del 3 de agosto de 2026, sí. Los pesos de Kimi K3 están disponibles en Hugging Face desde el 27 de julio de 2026, en formato MXFP4 y con un tamaño de 594 GB. Los pesos de Qwen 3.8-Max estaban prometidos aproximadamente para el 10 de agosto, pero todavía no eran descargables.
Si Alibaba publica los pesos, ambos pasarán a ser modelos de frontera con pesos abiertos. Entonces la comparación dependerá de la licencia, la disponibilidad de cuantizaciones y el soporte comunitario. Mientras tanto, solo K3 puede autoalojarse. Consulta esta guía para ejecutar Kimi K3 localmente.
¿Qué modelo es mejor para programar?
Todavía no hay evidencia independiente suficiente para responderlo con rigor. Ambos proveedores publican resultados sólidos en codificación agéntica, pero las evaluaciones usan condiciones propias y no existe una comparación directa bajo el mismo arnés.
La tabla de Alibaba muestra, por ejemplo, que Qwen 3.8-Max queda por detrás de Fable 5 en SWE-bench Pro. Eso indica que los resultados publicados incluyen pérdidas, pero no hace comparables directamente las tablas de distintos proveedores.
La recomendación es ejecutar ambos modelos contra tareas reales de tu repositorio:
- corrección de errores;
- generación de pruebas;
- migraciones;
- revisión de pull requests;
- análisis de logs;
- uso de herramientas y terminal.
¿Puedo usar ambos modelos en Claude Code?
Sí. Ambos exponen endpoints compatibles con Anthropic.
Para Qwen 3.8-Max, configura:
export ANTHROPIC_BASE_URL="https://<endpoint-anthropic-de-dashscope>"
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_API_KEY="<tu-clave>"
Kimi K3 admite el mismo patrón mediante el endpoint de Moonshot. Esta compatibilidad compartida hace que una prueba A/B entre ambos sea relativamente económica de implementar.
¿Cuál es más barato para un agente típico?
Según el precio de lista, Qwen 3.8-Max:
- entrada: $2/M frente a $3/M;
- salida: $6/M frente a $15/M;
- acierto de caché: $0.20/M frente a $0.30/M.
La ventaja más grande está en salida, donde Kimi K3 cuesta 2.5 veces más. Como los bucles de agentes suelen generar razonamiento, código, revisiones y reintentos, esa diferencia puede importar mucho.
Hay dos salvedades:
- Kimi K3 sigue siendo competitivo en cargas con mucha entrada y alta reutilización de caché.
- Qwen usa
reasoning_effort=xhighpor defecto y factura los tokens de pensamiento como salida.
Modela tu mezcla real de tokens antes de elegir basándote únicamente en la tarifa publicada.
Top comments (0)