DEV Community

Cover image for Precios Kimi K3: Costos de API y el cálculo de aciertos de caché
Roobia
Roobia

Posted on • Originally published at apidog.com

Precios Kimi K3: Costos de API y el cálculo de aciertos de caché

Kimi K3 se lanzó el 16 de julio de 2026, y su tabla de precios parece sencilla hasta que observas que incluye dos tarifas de entrada. Moonshot AI lista $0.30 por millón de tokens para entrada con acierto de caché, $3.00 por millón para entrada con fallo de caché y $15.00 por millón para salida. La cifra que determina tu factura mensual no es solo el precio de lista: es la tasa de entrada combinada que pagas en la práctica. En cargas de trabajo de codificación, ese coste puede acercarse mucho más a $0.30 que a $3.00. Este artículo calcula el coste efectivo, resuelve un ejemplo por tarea y compara Kimi K3 con Claude Opus 4.8, GPT-5.6 Sol y DeepSeek V4.

Prueba Apidog hoy

TL;DR

Kimi K3 cuesta:

  • $0.30 por 1M tokens de entrada con acierto de caché.
  • $3.00 por 1M tokens de entrada con fallo de caché.
  • $15.00 por 1M tokens de salida.

Moonshot sirve el modelo mediante la arquitectura de inferencia desagregada Mooncake y reporta una tasa de acierto de caché superior al 90% en cargas de trabajo de codificación. Con ese porcentaje, el coste efectivo de entrada baja aproximadamente a $0.57 por millón de tokens.

La entrada puede ser barata si reutilizas contexto; la salida es la parte premium. Aprovecha la caché, limita las respuestas largas y mide tus tokens reales. Puedes inspeccionar el uso de tokens por respuesta en Apidog mientras pruebas el modelo.

Los precios de lista

Moonshot publica estas tarifas para el modelo kimi-k3:

Tipo de token Precio por 1M de tokens
Entrada con acierto de caché $0.30
Entrada con fallo de caché $3.00
Salida $15.00

La diferencia entre estas tarifas define la estrategia de coste:

  • La entrada con fallo de caché cuesta 10 veces más que la entrada con acierto.
  • La salida cuesta 5 veces más que la entrada con fallo.
  • La salida cuesta 50 veces más que la entrada con acierto.

No planifiques usando $3.00 como si fuera el coste de todos tus tokens de entrada. Tampoco trates la salida como un coste menor: en tareas con respuestas extensas, puede dominar la factura.

Para entender el modelo y su posición en el ecosistema actual, consulta la explicación de qué es Kimi K3. Para URLs base, configuración de solicitudes y SDK, revisa la guía de la API de Kimi K3.

Ilustración sobre precios de Kimi K3

Calcula tu coste efectivo de entrada

El almacenamiento en caché de prompts cambia el precio que ves en la tabla por el precio que realmente pagas.

Cuando envías una solicitud, el proveedor puede almacenar el prefijo tokenizado de tu prompt. Si una solicitud posterior reutiliza ese mismo prefijo, esos tokens se leen desde caché y se cobran a la tarifa de acierto, no a la tarifa de fallo.

Moonshot indica que Mooncake separa las fases de precarga y decodificación para reutilizar prefijos en caché de forma agresiva. La empresa reporta una tasa de acierto superior al 90% en tareas de codificación.

Usa esta fórmula:

coste_entrada_combinado =
  (tasa_acierto × precio_acierto) +
  ((1 - tasa_acierto) × precio_fallo)
Enter fullscreen mode Exit fullscreen mode

Con un acierto del 90%:

(0.90 × $0.30) + (0.10 × $3.00)
= $0.27 + $0.30
= $0.57 por 1M tokens de entrada
Enter fullscreen mode Exit fullscreen mode

Con un acierto del 95%:

(0.95 × $0.30) + (0.05 × $3.00)
= $0.285 + $0.15
= $0.435 por 1M tokens de entrada
Enter fullscreen mode Exit fullscreen mode

La tasa de acierto reportada por Moonshot corresponde a cargas de trabajo de codificación. Tu resultado dependerá de tus prompts:

  • Un agente que reutiliza el mismo repositorio, prompt de sistema y herramientas tiende a obtener más aciertos.
  • Un chatbot con instrucciones y contexto distintos en cada turno tiende a obtener menos aciertos.
  • Cambiar el orden, contenido o formato de un prefijo puede romper la reutilización de caché.

Mide tu tasa real antes de usar una estimación para presupuestos.

Ejemplo: coste de una tarea de codificación agéntica

Supón una sesión contra un repositorio de tamaño medio. Durante todas las iteraciones:

  • El modelo procesa 2,000,000 tokens de entrada.
  • El modelo genera 200,000 tokens de salida.

El volumen de entrada es alto porque el contexto puede reenviarse en cada iteración.

Escenario 1: sin almacenamiento en caché

Entrada:
2,000,000 × $3.00 / 1,000,000 = $6.00

Salida:
200,000 × $15.00 / 1,000,000 = $3.00

Total:
$9.00
Enter fullscreen mode Exit fullscreen mode

Escenario 2: 90% de acierto de caché

Entrada con acierto:
1,800,000 × $0.30 / 1,000,000 = $0.54

Entrada con fallo:
200,000 × $3.00 / 1,000,000 = $0.60

Subtotal de entrada:
$1.14

Salida:
200,000 × $15.00 / 1,000,000 = $3.00

Total:
$4.14
Enter fullscreen mode Exit fullscreen mode

El resultado:

Métrica Sin caché Con 90% de acierto
Coste de entrada $6.00 $1.14
Coste de salida $3.00 $3.00
Coste total $9.00 $4.14

La caché reduce el coste de la tarea de $9.00 a $4.14, un ahorro aproximado del 54%. Sin embargo, la salida se mantiene en $3.00: no puedes almacenar en caché texto que el modelo todavía no ha generado.

Optimiza la salida antes que la entrada

La salida cuesta $15.00 por millón de tokens:

  • 50 veces la tarifa de entrada con acierto de caché.
  • 5 veces la tarifa de entrada con fallo de caché.

Esto cambia qué debes optimizar.

Acciones que más reducen la factura

  1. Limita max_tokens

Define un límite adecuado para cada tarea:

   {
     "model": "kimi-k3",
     "max_tokens": 1200
   }
Enter fullscreen mode Exit fullscreen mode
  1. Pide respuestas específicas y concisas

En lugar de:

   Analiza este error y explica todas las posibles causas con detalle.
Enter fullscreen mode Exit fullscreen mode

usa:

   Identifica la causa más probable, propone un parche mínimo y devuelve solo el diff.
Enter fullscreen mode Exit fullscreen mode
  1. Mantén estable el prefijo del prompt

Reutiliza sin cambios:

  • El prompt del sistema.
  • La definición de herramientas.
  • El esquema JSON.
  • El bloque de contexto compartido.

Evita reordenar secciones o introducir cambios menores si quieres maximizar los aciertos de caché.

  1. Agrupa tareas relacionadas

Ejecuta llamadas relacionadas bajo el mismo contexto cálido en lugar de abrir una conversación o contexto nuevo para cada acción.

Qué suele ayudar menos

Recortar contexto de entrada puede parecer una optimización obvia, pero si ese contexto ya entra desde caché, el ahorro es limitado. Además, quitar información útil puede provocar:

  • Más preguntas aclaratorias.
  • Respuestas de salida más largas.
  • Más iteraciones.
  • Peor calidad en el resultado.

Para Kimi K3, normalmente conviene alimentar bien al modelo y controlar la longitud de la respuesta.

Comparativa de precios

Los precios de otros proveedores cambian, así que verifica las tarifas actuales antes de tomar una decisión de producción.

Modelo Entrada por 1M Salida por 1M Notas
Kimi K3 $0.30 con caché / $3.00 sin caché $15.00 Contexto de 1M; pesos abiertos cerca del 27 de julio
Claude Opus 4.8 $5.00 $25.00 Nivel premium; verificar precios actuales
GPT-5.6 Sol ~$5.00 ~$30.00 Nivel insignia; existen niveles GPT-5.6 más baratos
DeepSeek V4 Nivel de valor Nivel de valor Confirmar tarifas actuales

Kimi K3 vs. Claude Opus 4.8

Según los precios de Claude Opus 4.8, Opus cuesta $5.00 por millón de tokens de entrada y $25.00 de salida.

Para la tarea anterior:

Entrada:
2M × $5.00 / 1M = $10.00

Salida:
200K × $25.00 / 1M = $5.00

Total:
~$15.00
Enter fullscreen mode Exit fullscreen mode

Frente a los $4.14 de Kimi K3 con 90% de acierto de caché, Kimi K3 es una opción de menor coste. Anthropic también ofrece almacenamiento en caché de prompts, por lo que esta comparación es direccional, no una estimación final de producción.

Kimi K3 vs. GPT-5.6

Según los precios de GPT-5.6, GPT-5.6 Sol ronda los $5.00 de entrada y $30.00 de salida.

Kimi K3 es más barato que Sol en ambos lados. Sin embargo, GPT-5.6 también incluye los niveles Terra y Luna, que pueden resultar más baratos si aceptas la diferencia de capacidades.

Kimi K3 vs. DeepSeek V4

Según los precios de DeepSeek V4, DeepSeek V4 es otra alternativa de nivel de valor.

DeepSeek puede competir o superar a Kimi K3 en precio de salida bruto. Kimi K3 compensa con un contexto de 1M y una tarifa de entrada con caché muy baja. Si tu carga de trabajo reutiliza mucho contexto, Kimi K3 puede reducir o invertir la diferencia de coste.

Mide el uso de tokens con Apidog

Los cálculos solo sirven si puedes contrastarlos con tus datos reales. Cada respuesta de Kimi K3 devuelve un objeto de uso con los tokens de entrada, salida y aciertos de caché.

Uso de tokens de Kimi K3 en Apidog

Para medirlo:

  1. Configura Apidog contra el endpoint de Kimi K3.
  2. Usa la URL base, un token de portador y el modelo kimi-k3.
  3. Envía una solicitud representativa.
  4. Repite exactamente la misma solicitud.
  5. Compara los campos de uso de ambas respuestas.

Kimi K3 es compatible con OpenAI-SDK, por lo que la configuración sigue un patrón de API estilo OpenAI. La segunda solicitud debería mostrar un mayor recuento de aciertos de caché si el prefijo se reutiliza correctamente.

También puedes guardar la misma solicitud para kimi-k3 y tu modelo actual, comparar las respuestas y calcular el coste real con tus propios patrones de tráfico. Si trabajas desde el editor, consulta cómo usar Apidog dentro de VS Code. Puedes descargar Apidog para configurar la prueba.

Veredicto

Kimi K3 es barato de alimentar y premium para hablar.

La entrada con caché a $0.30, combinada con una tasa de acierto superior al 90% reportada por Moonshot para cargas de trabajo de codificación, puede reducir de forma significativa el coste efectivo de entrada. La salida a $15.00 es la parte que requiere disciplina.

Para controlar el gasto:

  1. Mantén estables los prefijos reutilizables.
  2. Agrupa tareas relacionadas.
  3. Limita max_tokens.
  4. Solicita respuestas breves y orientadas a la acción.
  5. Mide tu tasa real de acierto de caché.
  6. Calcula costes con tus propios datos de uso.

Kimi K3 supera a Claude Opus 4.8 en tarifas de lista y es más barato que GPT-5.6 Sol, mientras compite con DeepSeek V4 según el perfil de entrada y salida de tu tráfico. No representa la frontera absoluta: Moonshot lo sitúa por detrás de Claude Fable 5 y GPT-5.6 Sol en capacidad, y funciona algo más lento que la mediana de su nivel de precio. Aun así, para calidad cercana a la frontera, contexto de 1M y una economía favorable para cargas intensivas en entrada, es una opción relevante.

Antes de comprometer presupuesto, descarga Apidog, envía varias solicitudes representativas a kimi-k3 e inspecciona directamente la división entre aciertos y fallos de caché.

Preguntas frecuentes

¿Cuánto cuesta la API de Kimi K3?

Kimi K3 cuesta $0.30 por millón de tokens para entrada con acierto de caché, $3.00 por millón para entrada con fallo de caché y $15.00 por millón para salida en la API directa de Moonshot.

Listados de terceros como OpenRouter muestran una tarifa plana de $3.00 de entrada y $15.00 de salida sin un nivel separado para acierto de caché. Consulta la guía de la API de Kimi K3 para configurar solicitudes.

¿Qué es la tasa de acierto de caché y por qué importa?

La tasa de acierto de caché representa la proporción de tokens de entrada que el proveedor puede reutilizar desde un prefijo previamente procesado.

Moonshot informa una tasa superior al 90% en cargas de trabajo de codificación servidas con la inferencia desagregada de Mooncake. Importa porque los tokens en caché se cobran a $0.30 por millón en lugar de $3.00. Con un acierto del 90%, el coste combinado de entrada es aproximadamente $0.57 por millón de tokens.

¿Es Kimi K3 más barato que Claude Opus 4.8?

Sí, según precios de lista. Kimi K3 cobra $15.00 por millón de tokens de salida frente a $25.00 para Claude Opus 4.8, y sus tarifas de entrada también son inferiores.

En el ejemplo de 2M tokens de entrada y 200K de salida:

  • Kimi K3 con caché: aproximadamente $4.14.
  • Claude Opus 4.8 con tarifas de lista: aproximadamente $15.00.

Anthropic ofrece su propio almacenamiento en caché, así que usa la comparación como guía direccional. Consulta los precios de Claude Opus 4.8 y la comparación de Kimi K3 vs. Claude Opus 4.8.

¿Cómo se compara Kimi K3 con GPT-5.6 y DeepSeek V4?

Kimi K3 es más barato que GPT-5.6 Sol, cuyo nivel insignia ronda los $5.00 de entrada y $30.00 de salida. Sin embargo, GPT-5.6 ofrece niveles Terra y Luna más baratos que pueden superar a Kimi K3 en precio.

DeepSeek V4 es otra alternativa de valor y puede resultar más barato en salida bruta. Confirma las tarifas actuales en los precios de GPT-5.6 y los precios de DeepSeek V4.

¿Cómo puedo reducir mi factura de Kimi K3?

Prioriza la salida:

  • Limita max_tokens.
  • Pide respuestas breves.
  • Mantén estables el prompt del sistema y el prefijo de contexto.
  • Reutiliza el mismo esquema de herramientas.
  • Agrupa llamadas relacionadas.

Recortar la entrada suele ayudar menos si esos tokens ya se facturan desde caché a $0.30 por millón. Eliminar contexto útil incluso puede generar más salida, más iteraciones y mayor coste.

¿Cómo verifico mi tasa real de acierto de caché?

Inspecciona el objeto de uso devuelto por cada respuesta de Kimi K3. Debe incluir recuentos de tokens de entrada, salida y acierto de caché.

Envía la misma solicitud dos veces mediante Apidog y compara los recuentos. La segunda ejecución debería reflejar más tokens servidos desde caché si el prefijo se mantiene estable. Usa esa proporción para calcular tu coste combinado de entrada.

Top comments (0)