DEV Community

Cover image for Kimi K3 cobra $3 y $15 por millón de tokens: no es gratis servirlo
lu1tr0n
lu1tr0n

Posted on • Originally published at elsolitario.org

Kimi K3 cobra $3 y $15 por millón de tokens: no es gratis servirlo

Kimi K3, el modelo de pesos abiertos de Moonshot AI, cobra $3 por millón de tokens de entrada y $15 por millón de salida. Suena barato frente a los $5 y $30 de Sol, el modelo con el que lo compara Stratechery, pero esa comparación esconde una trampa: los pesos abiertos no eliminan el costo de inferencia, solo eliminan el costo de entrenar el modelo.

Ben Thompson lo explica en un análisis publicado el 20 de julio de 2026: el debate del fin de semana sobre Kimi K3 mezcló dos tipos de costo que no tienen relación entre sí, el R&D (fijo, hundido, independiente de los ingresos) y el COGS (variable, atado a cada consulta que responde el modelo). Separar esos dos conceptos cambia cómo se debería elegir un modelo de IA para producción.

TL;DR

  • Kimi K3 (Moonshot AI) cobra $3 por millón de tokens de entrada y $15 por millón de salida.
  • Sol, el modelo comparado en el análisis, cobra $5 de entrada y $30 de salida por millón de tokens.
  • El R&D es costo fijo, no depende de los ingresos; el COGS (costo de servir cada consulta) sí escala con el uso.
  • Los pesos abiertos ahorran el R&D de entrenar el modelo, pero no eliminan el COGS de la inferencia.
  • En la era de razonamiento, Kimi puede necesitar más tokens de cadena de pensamiento que Sol para la misma respuesta.
  • Nvidia (Jensen Huang) llama a sus GPU fábricas de tokens, pero el token no es la unidad fungible: la respuesta correcta sí lo es.
  • El COGS de la inteligencia depende de 4 factores: footprint del modelo, eficiencia de inferencia, memoria y servido.
  • El análisis es de Ben Thompson en Stratechery, publicado el 20 de julio de 2026.

Qué pasó

El fin de semana del 18 y 19 de julio de 2026, la conversación técnica en X giró en torno a un solo tema: Kimi K3, el nuevo modelo de pesos abiertos de Moonshot AI, se acerca al estado del arte en capacidades. Para muchos desarrolladores eso significó algo simple, un modelo casi tan bueno como el mejor modelo cerrado, disponible para descargar y correr donde uno quiera.

Ben Thompson, de Stratechery, respondió con un argumento incómodo para esa lectura optimista: la palabra gratis en pesos abiertos se refiere solo al dinero que no gastás en investigación y desarrollo. No dice nada del costo de servir el modelo a usuarios reales, que en contabilidad se llama COGS.

El ejemplo concreto es el precio de Kimi K3: $3 por millón de tokens de entrada y $15 por millón de tokens de salida. Es más barato que los $5 y $30 de Sol, pero según Thompson, comparar solo el precio por token es la métrica equivocada.

Contexto e historia

Thompson arranca su nota con una anécdota de su primer día en STRT-431, la materia introductoria obligatoria para todo alumno de primer año en la Kellogg School of Management. Le llamó la atención que no hubiera empresas de tecnología en el programa de lecturas. El profesor le explicó que el objetivo del curso no era estudiar industrias específicas, sino encontrar principios universales aplicables a cualquier empresa, de cualquier rubro.

A Thompson esa respuesta no lo convenció del todo. Para él, la naturaleza del software, con costos marginales de distribución cercanos a cero, hacía que la tecnología fuera fundamentalmente distinta. Esa observación se convirtió en la base de su Teoría de la Agregación: cuando el costo marginal es cero, las cadenas de valor se centralizan alrededor de quien controla la demanda, no de quien distribuye la oferta.

Lo que vuelve interesante a la IA, dice Thompson, es que esos viejos principios universales están de regreso. El software tradicional tiene costo marginal cero: publicar una copia extra de una app no cuesta nada. Correr una consulta extra en un modelo de lenguaje sí cuesta, en electricidad, en GPU, en memoria. Ese es el cambio de paradigma que reabre preguntas que llevaban dos décadas cerradas.

Cada token generado consume GPU, memoria y electricidad real, sin importar si el modelo es abierto o cerrado.

Detalles técnicos: el costo de inferencia real

La confusión más común sobre los modelos de pesos abiertos es tratarlos como gratis. Lo que en realidad te ahorrás es el R&D: la inversión fija en investigación y desarrollo que no depende de cuánto uses el modelo después. Si gastás $1 millón en entrenar un modelo, da igual si generás $100 mil o $100 millones de ingresos con él, ese millón ya se gastó.

El COGS (cost of goods sold) es distinto: escala con el uso. Thompson pone un ejemplo simple: si cuesta 50 centavos generar los tokens que producen $1 de ingreso, entonces $100 millones de ingreso implican $50 millones de COGS, y $100 mil de ingreso implican $50 mil de COGS. La proporción es la misma, pero el costo absoluto crece con cada consulta que atendés.

ModeloPrecio input / millón tokensPrecio output / millón tokensCuándo conviene

Kimi K3 (Moonshot AI)$3$15Cargas con respuestas cortas o donde podés auto-hospedar y controlar el COGS directamente
Sol$5$30Tareas de razonamiento donde menos tokens de cadena de pensamiento compensan el precio por token más alto

Ahí aparece el segundo error conceptual: tratar al token como una mercancía. Una mercancía es fungible, un galón de petróleo es igual a otro galón de petróleo. Un token de Kimi K3 no es igual a un token de Sol. Lo que sí es fungible es lo que se construye con esos tokens: la inteligencia, es decir, la respuesta correcta. Si dos modelos llegan a la misma respuesta correcta, esa respuesta es fungible, aunque uno haya necesitado el triple de tokens que el otro para llegar ahí.

💭 Clave: el precio por token no mide el costo real de una respuesta. Lo que importa es cuántos tokens necesita cada modelo para llegar a la respuesta correcta, no el precio de cada token individual.

Esto se nota especialmente en la era de razonamiento, la segunda etapa de la IA después del ChatGPT original centrado en entregar tokens directo al usuario. Los modelos de razonamiento generan una cadena de pensamiento larga antes de dar la respuesta final, y esa cadena varía mucho de un modelo a otro. Según Thompson, Kimi reportadamente necesita bastantes más tokens que Sol para llegar a la misma respuesta, lo que puede anular por completo la ventaja de precio por token.

Thompson identifica cuatro factores que determinan el costo de inferencia real de un modelo:

  • Footprint del modelo: los pesos y el estado de runtime determinan cuánta memoria costosa y cuántos aceleradores hacen falta para hospedar cada réplica de servicio.
  • Eficiencia de inferencia: decisiones de arquitectura como Mixture-of-Experts (MoE) reducen el cómputo necesario por cada token generado.
  • Eficiencia de memoria: decisiones de arquitectura que reducen los requisitos de KV cache permiten atender más solicitudes en simultáneo y aprovechar mejor cada GPU.
  • Eficiencia de servido: batching, scheduling y prefix caching, entre otras optimizaciones de inferencia, maximizan la utilización de cada acelerador.
flowchart TD
A["Precio por token"] --> E["COGS real de la inteligencia"]
B["Footprint del modelo"] --> E
C["Eficiencia de inferencia (MoE)"] --> E
D["Eficiencia de memoria (KV cache)"] --> E
F["Eficiencia de servido (batching, prefix caching)"] --> E
E --> G["Costo por respuesta correcta"]
Enter fullscreen mode Exit fullscreen mode

Ningún modelo aislado gana en los cuatro factores a la vez. Un modelo MoE puede tener menos cómputo por token pero más footprint de memoria porque necesita cargar más parámetros totales aunque solo active una fracción en cada pasada. Comparar dos modelos solo por precio de lista ignora esa mecánica.

Cómo probarlo: medí tu propio COGS

La mayoría de los proveedores de modelos, incluido Moonshot AI, exponen una API compatible con el formato de OpenAI. Eso significa que podés medir el consumo real de tokens con el mismo cliente en Windows, macOS o Linux, sin cambiar de herramienta.

Primero, instalá el cliente en cualquiera de los tres sistemas operativos:

# Windows (PowerShell), macOS y Linux: el mismo comando
pip install openai
Enter fullscreen mode Exit fullscreen mode

Después, hacé una consulta de prueba contra el endpoint compatible y fijate en el campo usage de la respuesta, ahí está el desglose real de tokens consumidos:

import openai

client = openai.OpenAI(
    api_key="TU_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

respuesta = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explica que es el COGS en una oracion."}]
)

tokens_entrada = respuesta.usage.prompt_tokens
tokens_salida = respuesta.usage.completion_tokens

costo_usd = (tokens_entrada / 1_000_000 * 3) + (tokens_salida / 1_000_000 * 15)
print(f"Tokens entrada: {tokens_entrada}, salida: {tokens_salida}, costo: ${costo_usd:.6f}")
Enter fullscreen mode Exit fullscreen mode

Ese script calcula el costo real de una sola consulta usando el precio público de Kimi K3. Corré la misma pregunta contra Sol u otro modelo con su propio precio por millón de tokens y vas a tener una comparación de COGS real, no solo de precio de lista.

💡 Tip: si tu caso de uso involucra razonamiento largo, sumá también los tokens de cadena de pensamiento al cálculo. Muchos proveedores los reportan por separado en usage.reasoning_tokens o un campo equivalente; ese número es el que suele inflar el COGS de los modelos de razonamiento más allá del precio por token publicado.

Para verificar que estás midiendo bien, sumá el costo de varias consultas reales de tu producto, no solo un hola mundo, y compará el total contra la facturación que te llega del proveedor a fin de mes. Si no coinciden, probablemente estás olvidando tokens de sistema, tokens de herramientas invocadas o reintentos.

El campo usage de la respuesta es la única fuente confiable para calcular el COGS real.

Impacto y análisis

Jensen Huang, CEO de Nvidia, describe lo que construye su empresa como fábricas de tokens. Desde la perspectiva de Nvidia esa metáfora tiene sentido: sus GPU son agnósticas al modelo, generan tokens de la forma más rápida y eficiente posible. De ahí salen métricas como tokens por segundo, tiempo al primer token, tokens por watt y costo por token, que Huang plantea como la base de cualquier decisión de infraestructura.

Esa forma de medir tenía sentido en el primer paradigma de la IA, la era de ChatGPT, cuando los tokens iban directo del modelo al usuario final. El segundo paradigma, la era de razonamiento, complica esa métrica: la cadena de pensamiento dispara la cantidad de tokens, y cada modelo necesita una cantidad distinta para llegar a la respuesta correcta. Los agentes agregan otra capa de la misma dinámica, porque algunos modelos son más eficientes que otros ejecutando flujos de trabajo agénticos con múltiples pasos.

⚠️ Ojo: elegir el modelo más barato por token sin medir cuántos tokens necesita para tu tarea específica puede terminar costando más caro que un modelo con precio de lista más alto pero más eficiente en tokens de razonamiento.

Para un equipo que evalúa qué modelo poner en producción, la conclusión práctica es que el precio por millón de tokens es apenas el punto de partida. Lo que hay que medir es el costo de inferencia por tarea completada: cuántos tokens de entrada, salida y razonamiento necesita cada modelo para resolver el mismo problema, multiplicado por su precio real. Ese número, no el precio de lista, define si un modelo abierto y barato termina siendo más económico que uno cerrado y caro por token.

Qué sigue

Si el costo de inferencia, y no el de entrenamiento, es el nuevo campo de batalla, es esperable que los laboratorios que publican pesos abiertos empiecen a competir también en eficiencia de razonamiento, no solo en benchmarks de capacidad. Un modelo que resuelve un problema con la mitad de tokens de cadena de pensamiento que otro modelo del mismo nivel de capacidad tiene una ventaja de COGS real, incluso si su precio de lista por token es más alto.

Eso también cambia qué mirar cuando sale un modelo nuevo: además del puntaje en un benchmark, conviene revisar cuántos tokens de razonamiento consume en tareas representativas de tu propio caso de uso, porque ese número varía por tipo de tarea y no siempre se reporta junto al benchmark principal.

Probalo vos: corré el script de la sección anterior contra la API compatible con OpenAI de Kimi K3 y compará el costo real de una consulta con razonamiento contra el precio de lista de la tabla de este artículo.

📖 Resumen en Telegram: Ver resumen

Preguntas frecuentes

¿Qué es Kimi K3?

Es el modelo de pesos abiertos más reciente de Moonshot AI, la empresa china que divide su asistente en las variantes work, code y claw. Se acerca al estado del arte en capacidades y se puede descargar y correr en infraestructura propia.

¿Kimi K3 es gratis?

No en el sentido de costo total. Los pesos abiertos eliminan el R&D, es decir lo que costó entrenarlo, pero correrlo sigue teniendo COGS: cada token de entrada y salida cuesta dinero real en GPU, memoria y electricidad. Su precio público es $3 por millón de tokens de entrada y $15 por millón de salida.

¿Qué es el COGS en el contexto de la IA?

COGS son las siglas de cost of goods sold, costo de los bienes vendidos. En IA es el costo variable de servir cada consulta: a diferencia del R&D, que es un gasto fijo ya hundido, el COGS crece proporcionalmente con cada token que el modelo genera.

¿Por qué Nvidia habla de fábricas de tokens?

Porque sus GPU son agnósticas al modelo: generan tokens de la forma más rápida posible, sin importar de qué modelo se trate. Esa métrica, tokens por segundo y costo por token, tiene sentido para Nvidia, pero no captura cuántos tokens necesita cada modelo para llegar a la respuesta correcta.

¿Los tokens de dos modelos distintos son comparables?

No directamente. Un token no es una mercancía fungible como un galón de petróleo. Lo que sí es fungible es la inteligencia, es decir, la respuesta correcta final. Dos modelos pueden necesitar cantidades muy distintas de tokens para llegar al mismo resultado.

¿Cómo elijo entre un modelo abierto y uno cerrado para producción?

Medí el costo de inferencia real por tarea completada, no solo el precio de lista por millón de tokens. Corré la misma tarea representativa contra ambos modelos, sumá los tokens de entrada, salida y razonamiento, y multiplicá por el precio de cada uno.

Referencias

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Top comments (1)

Collapse
 
976905690 profile image
FreyaLi

Yes,Threerouter