DEV Community

Cover image for ¿Qué es Kimi K3? El flagship abierto 2.8T de Moonshot
Roobia
Roobia

Posted on • Originally published at apidog.com

¿Qué es Kimi K3? El flagship abierto 2.8T de Moonshot

Moonshot AI lanzó Kimi K3 el 16 de julio de 2026 y lo presentó como “el primer modelo abierto de clase 3T del mundo”. K3 es un modelo Mixture-of-Experts de 2.8 billones de parámetros, con una ventana de contexto de 1 millón de tokens, una nueva pila de atención y precios orientados a equipos de desarrollo. Está disponible en Kimi.com, Kimi Work, Kimi Code y la API de Kimi. Moonshot prometió liberar los pesos completos antes del 27 de julio de 2026. Esta guía explica qué ofrece, cómo evaluarlo y cómo decidir si encaja en tu stack.

Prueba Apidog hoy

TL;DR: ¿qué es Kimi K3?

Kimi K3 es el modelo insignia de Moonshot AI. Sus especificaciones principales son:

  • 2.8 billones de parámetros totales mediante arquitectura MoE.
  • 16 expertos activos de 896 por token.
  • Ventana de contexto: 1,048,576 tokens.
  • ID de modelo en la API: kimi-k3.
  • API compatible con el SDK de OpenAI.
  • Precio de entrada con caché: $0.30 por 1M tokens.
  • Precio de entrada sin caché: $3.00 por 1M tokens.
  • Precio de salida: $15.00 por 1M tokens.
  • Artificial Analysis Intelligence Index: 57 puntos, puesto #4 de 189 modelos.
  • Pesos abiertos: previstos alrededor del 27 de julio de 2026.

Moonshot reconoce que K3 sigue por detrás de Claude Fable 5 y GPT-5.6 Sol. La forma correcta de evaluarlo es como un modelo abierto cercano a la frontera, no como el líder absoluto.

Por qué Kimi K3 importa ahora mismo

La propuesta relevante no es solo su puntuación en benchmarks. Es la combinación de:

  1. Calidad cercana a modelos de frontera.
  2. Coste bajo cuando reutilizas contexto mediante caché.
  3. Compatibilidad con clientes y flujos basados en OpenAI.
  4. Promesa de pesos abiertos para despliegue propio.

Si operas agentes de código, RAG sobre repositorios o automatizaciones que reenvían instrucciones y archivos repetidos, la diferencia entre entrada con caché y sin caché puede afectar directamente a tu factura.

Kimi K3

La pregunta práctica es: ¿puedes apuntar un cliente compatible con OpenAI a kimi-k3 sin reescribir tu aplicación?

Sí. Moonshot ofrece una API compatible con el SDK de OpenAI. Puedes probar solicitudes, streaming y llamadas a herramientas antes de tocar tu código de producción. Apidog permite enviar solicitudes compatibles con OpenAI, inspeccionar eventos SSE token a token y revisar las cargas útiles de llamadas a herramientas.

Para profundizar, consulta la guía de API de Kimi K3, el desglose de precios de Kimi K3 y el análisis de benchmarks de Kimi K3.

Comparativa de Kimi K3

La identidad: el modelo más capaz de Moonshot

Moonshot posiciona K3 como su modelo más capaz y como sucesor de la familia K2. Si ya trabajaste con Kimi K2 o Kimi K2.7 Code, K3 representa la siguiente generación, con una arquitectura de atención reconstruida.

Dos términos de la afirmación “modelo abierto de clase 3T” requieren contexto:

  • “Abierto”: no lo era el día del lanzamiento. Inicialmente, K3 está disponible mediante productos alojados y una API de pago. Moonshot prometió publicar los pesos completos antes del 27 de julio de 2026.
  • “Clase 3T”: se refiere a sus 2.8 billones de parámetros totales. Sin embargo, el modelo no activa todos esos parámetros en cada token.

La activación dispersa de expertos permite mantener una capacidad total enorme sin pagar el coste de inferencia de una red densa de 2.8T en cada generación.

Arquitectura: qué hay bajo el capó

K3 no es simplemente una versión más grande de K2. Moonshot describe varias decisiones arquitectónicas relevantes.

  • Kimi Delta Attention (KDA): un mecanismo de atención lineal híbrido diseñado para escalar contextos largos con menor crecimiento de memoria y cómputo.
  • Attention Residuals (AttnRes): reemplaza conexiones residuales estándar para recuperar selectivamente representaciones de capas previas.
  • Stable LatentMoE: la capa de enrutamiento MoE de K3. Tiene 896 expertos y activa 16 por token. Moonshot utiliza “Quantile Balancing” para estabilizar el enrutamiento durante el entrenamiento.

Moonshot también menciona Muón por Cabeza, SiTU, MLA Gated, pesos MXFP4 y activaciones MXFP8.

Para desarrolladores, la consecuencia principal es simple: K3 busca combinar contexto largo y gran capacidad con un coste de inferencia más manejable que un modelo denso de tamaño equivalente.

Especificaciones de Kimi K3

Especificación Kimi K3
Desarrollador Moonshot AI
Fecha de lanzamiento 16 de julio de 2026
Parámetros totales 2.8 billones, MoE
Expertos activos 16 de 896 por token
Ventana de contexto 1,048,576 tokens, 1M
ID de modelo de API kimi-k3
Slug de OpenRouter moonshotai/kimi-k3
Compatibilidad de API Compatible con OpenAI SDK
Entrada con acierto de caché $0.30 / 1M tokens
Entrada con fallo de caché $3.00 / 1M tokens
Salida $15.00 / 1M tokens
Velocidad de salida ~62 tokens/segundo
Tiempo hasta el primer token ~1.99 s
Índice de Inteligencia 57, puesto #4 de 189
Pesos abiertos Esperados alrededor del 27 de julio de 2026

Para calcular costes según tu volumen real de entrada, salida y reutilización de contexto, consulta la guía de precios de Kimi K3.

Contexto de 1M: por qué el caché importa más que el número

Una ventana de 1,048,576 tokens permite enviar repositorios completos, documentación extensa, historiales largos o corpus de investigación en una sola solicitud.

Sin embargo, el dato operativo más importante es el precio de entrada:

  • Con acierto de caché: $0.30 por 1M tokens.
  • Sin acierto de caché: $3.00 por 1M tokens.

La diferencia es de 10x.

Moonshot afirma que su infraestructura Mooncake supera el 90% de aciertos de caché en cargas de trabajo de codificación. Esto importa especialmente si tu aplicación reutiliza:

  • Un prompt de sistema largo.
  • Un árbol de archivos.
  • Instrucciones fijas de agente.
  • Contexto de repositorio.
  • Definiciones de herramientas.
  • Documentación compartida entre ejecuciones.

En un agente de código que reenvía el mismo contexto en cada iteración, la estrategia de caché puede ser más determinante para el coste que el precio nominal del modelo.

La contrapartida es la velocidad. Artificial Analysis mide aproximadamente 62 tokens de salida por segundo, frente a una mediana de 72.7 en su nivel de precios. El tiempo hasta el primer token, cercano a 1.99 segundos, es algo mejor que la mediana.

En la práctica:

  • Elige K3 si priorizas profundidad, contexto y coste de entrada reutilizado.
  • Compáralo con modelos más rápidos si tu restricción principal es la latencia de generación.

Posicionamiento honesto: fuerte, abierto, pero no el líder absoluto

El blog oficial de lanzamiento de Kimi K3 reconoce que K3 sigue por detrás de Claude Fable 5 y GPT-5.6 Sol, aunque Moonshot lo califica como un modelo de rendimiento de frontera.

Los datos independientes añaden contexto. En el Índice de Inteligencia de Artificial Analysis, K3 obtiene 57 puntos y ocupa el puesto #4 de 189 modelos.

Esto sugiere una evaluación razonable:

  • K3 es uno de los modelos abiertos más fuertes cerca de la frontera.
  • Puede ser especialmente atractivo cuando los pesos estén disponibles para autoalojamiento.
  • No debes presentarlo como el mejor modelo del mundo para razonamiento difícil.
  • Si necesitas rendimiento máximo absoluto, los modelos cerrados siguen por delante.
  • Si necesitas calidad cercana a la frontera, una ruta abierta y buen coste efectivo de entrada, K3 es un candidato serio.

Para comparativas directas, consulta Kimi K3 vs Claude Opus 4.8 y Kimi K3 vs GPT-5.6 Sol.

Dónde puedes usar Kimi K3

Superficie Qué ofrece
Kimi.com Aplicación de chat web con K3 como modelo predeterminado
Kimi Work Producto de espacio de trabajo para equipos
Kimi Code Agente de codificación basado en terminal
API de Kimi Acceso programático mediante kimi-k3
Aplicaciones móviles iOS, Android y HarmonyOS
Escritorio Kimi Work 3.1.0 y posteriores
OpenRouter Acceso mediante moonshotai/kimi-k3

Si trabajas desde terminal, Kimi Code es el punto de entrada para tareas de desarrollo asistido. El tutorial de CLI de Kimi Code cubre el patrón de configuración de la era K2, y el flujo de K3 es similar.

También puedes revisar:

Capacidades expuestas por la API

La API de K3 incluye características esperadas en un modelo orientado a agentes:

  • Almacenamiento en caché de contexto.
  • Llamadas a herramientas.
  • Restricciones de elección de herramientas.
  • Modo JSON y salida estructurada.
  • Modo parcial para finalizaciones controladas.
  • Búsqueda en internet.
  • Carga dinámica de herramientas.
  • Esfuerzo de razonamiento configurable, incluido un modo “máximo”.

Esto permite integrar K3 en:

  • Frameworks de agentes.
  • Pipelines de extracción estructurada.
  • Sistemas de llamada a funciones.
  • Herramientas internas sobre repositorios.
  • Flujos RAG con contexto reutilizable.

La API sigue un patrón compatible con OpenAI. Confirma la URL base actual en platform.kimi.ai antes de configurarla en producción.

Una integración inicial debería seguir estos pasos:

  1. Crea una clave de API en la consola de Kimi.
  2. Guarda la clave como variable de entorno.
  3. Configura el endpoint compatible con OpenAI.
  4. Usa kimi-k3 como valor de model.
  5. Prueba una solicitud básica sin streaming.
  6. Activa stream: true y valida tu parser SSE.
  7. Añade herramientas y valida el esquema de tool_calls.
  8. Mide coste, latencia y tasa de aciertos de caché con tus prompts reales.

Ejemplo de estructura con el SDK de OpenAI:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["KIMI_API_KEY"],
    base_url=os.environ["KIMI_BASE_URL"],  # Confirma la URL en platform.kimi.ai
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "Eres un asistente técnico conciso.",
        },
        {
            "role": "user",
            "content": "Resume los cambios de este pull request.",
        },
    ],
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Para implementar streaming, añade stream=True y procesa los fragmentos que devuelve el servidor:

stream = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "Explica este error paso a paso."}
    ],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Consulta el recorrido completo de solicitudes y respuestas en la guía de API de Kimi K3.

Prueba kimi-k3 antes de integrarlo

Antes de añadir K3 a un agente o servicio de producción, valida el comportamiento real de la API.

Comprueba al menos lo siguiente:

  1. Streaming: verifica el formato de los eventos y el ensamblado de deltas.
  2. Herramientas: revisa que tool_calls coincida con el esquema que espera tu agente.
  3. JSON estructurado: prueba respuestas inválidas, campos opcionales y casos límite.
  4. Contexto largo: mide coste y latencia con el tamaño de prompt que usarás en producción.
  5. Caché: reutiliza el mismo contexto en varias llamadas para observar el efecto económico.
  6. Razonamiento: compara la configuración predeterminada con el esfuerzo máximo según tu caso de uso.

Pruebas de API de Kimi K3

Apidog resulta útil para esta fase porque puedes:

  • Guardar la clave como variable de entorno.
  • Enviar solicitudes de chat compatibles con OpenAI.
  • Ejecutar solicitudes con stream: true.
  • Inspeccionar eventos enviados por el servidor.
  • Revisar respuestas tool_calls.
  • Validar argumentos antes de ejecutar código de agente.

Preguntas frecuentes

  • ¿Qué es Kimi K3?

    Kimi K3 es el modelo de lenguaje grande insignia de Moonshot AI, lanzado el 16 de julio de 2026. Es un modelo MoE de 2.8 billones de parámetros, con contexto de 1M de tokens y el ID de API kimi-k3.

  • ¿Cuántos parámetros tiene Kimi K3?

    Tiene 2.8 billones de parámetros totales. Activa 16 de 896 expertos por token. Moonshot no ha publicado un número exacto de parámetros activos, por lo que no conviene citar una cifra concreta como hecho.

  • ¿Cuánto cuesta la API de Kimi K3?

    Cuesta $0.30 por millón de tokens de entrada con acierto de caché, $3.00 sin caché y $15.00 por millón de tokens de salida. Consulta el desglose de precios para más detalle.

  • ¿Kimi K3 es de código abierto?

    No el día de su lanzamiento. Moonshot prometió liberar los pesos completos antes del 27 de julio de 2026. Hasta entonces, el acceso es mediante productos alojados y API de pago.

  • ¿Kimi K3 es mejor que Claude Fable 5 o GPT-5.6 Sol?

    No según la propia Moonshot. K3 está cerca de la frontera, pero la publicación de lanzamiento reconoce que sigue por detrás de esos modelos propietarios.

  • ¿Puedo usar Kimi K3 con el SDK de OpenAI?

    Sí. La API de Moonshot es compatible con el SDK de OpenAI. Confirma el endpoint en platform.kimi.ai, usa kimi-k3 como modelo y prueba tus solicitudes antes de desplegarlas. Puedes validar la integración con Apidog.

  • ¿Qué tan rápido es Kimi K3?

    Artificial Analysis mide aproximadamente 62 tokens de salida por segundo y un tiempo hasta el primer token de alrededor de 1.99 segundos. Prioriza profundidad sobre velocidad.

  • ¿Cómo se compara con Kimi K2.7 Code?

    K3 es el modelo insignia de nueva generación, con una pila de atención reconstruida y aproximadamente 2.5 veces mejor eficiencia de escalado que K2, según Moonshot. Consulta Kimi K3 vs Kimi K2.7 Code.

Top comments (0)