DEV Community

Cover image for Ben Thompson: los tokens no son un commodity, la inteligencia sí
lu1tr0n
lu1tr0n

Posted on • Originally published at elsolitario.org

Ben Thompson: los tokens no son un commodity, la inteligencia sí

Un ensayo publicado el 20 de julio de 2026 por Ben Thompson en Stratechery reabrió una discusión que parecía cerrada: los modelos de pesos abiertos chinos, como Kimi K3, no son gratuitos ni siquiera cuando el modelo en sí se descarga sin costo. El argumento central, que gira en torno al COGS de la IA, es que servir inferencia cuesta dinero real y ese costo está directamente ligado a cuánta gente usa el modelo.

Thompson lo resume con una distinción que cualquier equipo que factura por token debería tener clara: I+D es un costo fijo, pero el COGS (costo de los bienes vendidos) es variable y crece con cada consulta que se atiende.

TL;DR

  • Ben Thompson publicó el 20 de julio de 2026 en Stratechery un análisis sobre la economía de los modelos abiertos chinos.
  • Kimi K3 cobra 3 dólares por millón de tokens de entrada y 15 dólares por millón de salida, según el ensayo.
  • Sol cobra 5 dólares por millón de entrada y 30 dólares por millón de salida, más caro pero potencialmente más eficiente en tokens.
  • Thompson distingue COGS, costo variable ligado a ingresos, de I+D, costo fijo independiente del volumen de uso.
  • Jensen Huang, CEO de Nvidia, llama 'fábricas de tokens' a sus GPU, una métrica que Thompson considera insuficiente.
  • El argumento central: los tokens no son un commodity fungible, pero la respuesta correcta sí lo es.
  • Modelos con cadenas de razonamiento más largas pueden anular ventajas de precio por token, según el ensayo.

Introducción

La anécdota con la que arranca el ensayo de Thompson viene de su primer día en la Kellogg School of Management, cuando reclamó a un profesor por qué el programa de la materia introductoria para MBA no incluía casos de empresas tecnológicas. La respuesta fue que el objetivo no era estudiar industrias específicas, sino principios universales aplicables a cualquier compañía. Thompson no quedó conforme entonces: para él, que el software y la distribución tuvieran costo marginal cero era algo cualitativamente distinto, y de ahí nació buena parte de su Aggregation Theory.

Lo curioso de la inteligencia artificial, escribe, es que esos principios universales volvieron con fuerza. La discusión que detonó el ensayo fue un fin de semana de julio de 2026 en el que la comunidad tech discutió en X las implicaciones de Kimi K3, un modelo de pesos abiertos chino que se acerca al estado del arte en capacidades. La conclusión de Thompson: el costo marginal volvió a importar, tanto en el precio de corto plazo de los modelos gratuitos de última generación como en la estructura de largo plazo de la industria.

Qué pasó

El malentendido más común sobre los modelos de pesos abiertos es asumir que son baratos, incluso gratis, porque cualquiera puede descargar los pesos y saltarse el tiempo y el dinero que cuesta entrenar un modelo propio. Eso es cierto, pero ese "gratis" se refiere únicamente a investigación y desarrollo (I+D): un costo fijo, independiente de cuántos ingresos genere el producto. Si una empresa gasta 1 millón de dólares en I+D, ese número no cambia si factura 100 mil dólares o 100 millones, aunque sí cambia cuánto de esa inversión logra recuperar.

Lo que sí depende de los ingresos es el COGS. Correr inferencia sobre un modelo, sea Kimi o Sol, cuesta dinero, y ese costo está directamente correlacionado con cuánta gente lo usa. Kimi K3 cobra 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida: más barato que los 5 y 30 dólares de Sol, pero esa comparación de precio por token, advierte Thompson, puede no ser la métrica correcta.

Contexto e historia

Para entender por qué esto importa hay que remontarse a la primera ola de internet. Ahí, el costo marginal cero del software y la distribución llevó a la centralización: en un mundo donde controlar la demanda importaba más que distribuir la oferta, ganaban los agregadores. Esa es la tesis detrás de la Aggregation Theory que Thompson viene desarrollando desde hace más de una década.

La IA generativa parecía, al principio, seguir el mismo patrón: modelos cada vez más baratos, costo marginal tendiendo a cero, un ganador que se queda con casi todo el mercado. Pero la irrupción de modelos abiertos competitivos como Kimi K3 demostró que el COGS de la IA es real, de una forma que el software tradicional dejó de tener hace veinte años.

Cada token generado consume cómputo real, a diferencia del software de costo marginal cero.

Detalles técnicos: el COGS de la IA y los cuatro factores del costo por token

Thompson descompone el COGS de la IA en cuatro factores que cualquier equipo de infraestructura reconoce:

  • Huella del modelo (model footprint): los pesos y el estado de runtime determinan cuánta memoria cara y cuántos aceleradores hacen falta para hospedar cada réplica de servicio.
  • Eficiencia de inferencia: decisiones de arquitectura como Mixture-of-Experts (MoE) reducen el cómputo necesario por token generado.
  • Eficiencia de memoria: optimizar el KV cache permite atender más solicitudes concurrentes con la misma GPU.
  • Eficiencia de servicio: batching, scheduling y prefix caching maximizan la utilización real del hardware.

Nvidia, a través de su CEO Jensen Huang, describe lo que construye como 'token factories' (fábricas de tokens): desde la perspectiva de Nvidia, las GPU son agnósticas al modelo, simplemente generan tokens de la forma más rápida y eficiente posible. De ahí métricas como tokens por segundo, time-to-first-token, tokens por watt o costo por token, que Huang propone como base para tomar decisiones.

💭 Clave: el error de razonar solo en tokens por segundo o costo por token es que un token de un modelo no es intercambiable con un token de otro. Lo fungible, dice Thompson, es la respuesta correcta, no el token individual.

Esa distinción tiene consecuencias prácticas. En la primera era de la IA generativa, la de ChatGPT, los tokens se entregaban directo al usuario final, así que medir tokens por segundo tenía sentido. La segunda era, la del razonamiento, complica esa métrica: el razonamiento implica una explosión de tokens de cadena de pensamiento, y cada modelo necesita una cantidad distinta de esos tokens para llegar a la respuesta correcta. Kimi, según reporta el ensayo, usa significativamente más tokens que Sol para tareas equivalentes, lo que puede anular su ventaja de precio nominal por token.

flowchart TD
    A["Pesos del modelo"] --> B["Eficiencia de inferencia (MoE)"]
    B --> C["Memoria y KV cache"]
    C --> D["Serving: batching y prefix caching"]
    D --> E[("COGS final por token")]
Enter fullscreen mode Exit fullscreen mode

Este flujo resume por qué dos modelos con el mismo precio nominal por millón de tokens pueden tener un COGS real muy distinto una vez que se suman los cuatro factores.

Kimi K3 vs. Sol: precio publicado por millón de tokens

ModeloPrecio entrada (por millón de tokens)Precio salida (por millón de tokens)Nota

Kimi K33 USD15 USDPesos abiertos, publicado por Moonshot AI
Sol5 USD30 USDModelo cerrado, referencia usada por Thompson en el ensayo

La tabla muestra el precio nominal, pero no dice nada sobre cuántos tokens necesita cada modelo para resolver la misma tarea. Ese es exactamente el punto ciego que señala Thompson: comparar precio por token sin normalizar por la cantidad de tokens de razonamiento es comparar peras con manzanas.

Cómo probarlo: medí el COGS real de tu propio caso de uso

La forma más honesta de comparar modelos no es mirar el precio publicado, sino medir cuánto cuesta llegar a la respuesta correcta en tu propia carga de trabajo. Kimi K3 expone una API compatible con el formato de OpenAI, así que el primer paso es simplemente hacer una llamada de prueba.

Configurá la API key como variable de entorno según tu sistema operativo:

# Linux / macOS (bash o zsh)
export MOONSHOT_API_KEY="tu-api-key-aqui"

# Windows (PowerShell)
$env:MOONSHOT_API_KEY = "tu-api-key-aqui"

# Windows (cmd.exe)
set MOONSHOT_API_KEY=tu-api-key-aqui
Enter fullscreen mode Exit fullscreen mode

Con la variable definida, un primer request mínimo contra la API de Kimi K3 se ve así:

curl https://api.moonshot.ai/v1/chat/completions \
  -H "Authorization: Bearer $MOONSHOT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "Explica que es el COGS de la IA en dos oraciones."}]
  }'
Enter fullscreen mode Exit fullscreen mode

La respuesta incluye un objeto usage con prompt_tokens y completion_tokens: esos son los números que hay que multiplicar por el precio publicado para obtener el COGS real de esa consulta puntual.

Para comparar Kimi K3 contra Sol en una tarea repetible, un script corto automatiza el cálculo:

const PRICING = {
  "kimi-k3": { input: 3, output: 15 },
  "sol":     { input: 5, output: 30 },
};

function calcularCOGS(modelo, usage) {
  const precio = PRICING[modelo];
  const costoEntrada = (usage.prompt_tokens / 1_000_000) * precio.input;
  const costoSalida = (usage.completion_tokens / 1_000_000) * precio.output;
  return costoEntrada + costoSalida;
}

// Ejemplo con la respuesta real de la API
const usage = { prompt_tokens: 420, completion_tokens: 1830 };
console.log(calcularCOGS("kimi-k3", usage).toFixed(6));
Enter fullscreen mode Exit fullscreen mode

Corré ese mismo prompt contra ambos modelos, guardá el usage de cada respuesta y compará el resultado final de calcularCOGS. Si Kimi necesita muchos más tokens de razonamiento para llegar a la misma respuesta, el ahorro nominal por token puede desaparecer por completo, justo el fenómeno que describe el ensayo.

⚠️ Ojo: comparar solo el precio por millón de tokens sin correr el mismo prompt contra ambos modelos y medir el usage real es el error más común al elegir proveedor de inferencia.

El campo usage de la respuesta es el único dato confiable para calcular el COGS real.

Impacto y análisis

La consecuencia directa de este razonamiento es que la competencia entre modelos abiertos y cerrados no se define por quién regala más pesos, sino por quién logra el menor COGS de la IA por respuesta correcta. Eso favorece a las empresas que pueden invertir en los cuatro factores que menciona Thompson (huella, eficiencia de inferencia, de memoria y de servicio), no necesariamente a las que publican el precio por token más bajo.

También cambia qué deberían mirar los equipos de producto. Un modelo con precio por token 40% más barato pero que necesita el doble de tokens de razonamiento para la misma tarea puede terminar costando más por consulta resuelta. La métrica correcta no es dólares por millón de tokens: es dólares por respuesta correcta, y esa cifra depende de la eficiencia de razonamiento de cada modelo en cada tarea específica, no de una tabla de precios publicada.

Para Nvidia, el planteamiento de las 'fábricas de tokens' sigue siendo válido en su propio negocio, que vende cómputo, no inteligencia, pero Thompson advierte que ese mismo enfoque, aplicado por quien compra inferencia para construir un producto, lleva a decisiones equivocadas.

Qué sigue

La consecuencia lógica del argumento de Thompson es que las comparaciones de modelos deberían reportar el COGS de la IA por tarea resuelta, no solo precio por millón de tokens: sin ese dato, cualquier tabla de precios queda incompleta. Nvidia ya publica métricas como tokens por watt y time-to-first-token; falta que la industria adopte una métrica equivalente para expresar el costo en dólares por respuesta correcta, que es lo que un equipo de producto necesita para decidir entre Kimi K3, Sol o cualquier otro modelo.

Para desarrolladores en Latinoamérica que evalúan qué proveedor usar, la recomendación práctica que se desprende del ensayo es simple: correr el mismo conjunto de prompts representativos de tu producto contra cada modelo candidato, sumar el usage real de cada respuesta y comparar el COGS resultante, no el precio publicado.

📖 Resumen en Telegram: Ver resumen

Probalo vos: corré el script de calcularCOGS de este artículo contra tu propio prompt en la API de Kimi K3 y compará el resultado con lo que paga tu equipo hoy por Sol u otro modelo cerrado.

Preguntas frecuentes

¿Kimi K3 es realmente gratis de usar?

No. Los pesos se pueden descargar sin costo, pero servir inferencia sobre esos pesos cuesta dinero real. Moonshot AI cobra 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida en su API.

¿Qué diferencia hay entre COGS e I+D en el contexto de la IA?

I+D es el gasto fijo de entrenar el modelo: no cambia según cuánta gente lo use. El COGS es el costo variable de atender cada consulta, y crece de forma proporcional al volumen de uso.

¿Por qué Thompson dice que los tokens no son un commodity?

Porque un token de un modelo no es intercambiable con un token de otro: cada modelo necesita una cantidad distinta de tokens para llegar a una respuesta. Lo que sí es fungible, según su argumento, es la respuesta correcta en sí misma.

¿Cómo mido el COGS real de un modelo para mi propio caso de uso?

Corriendo el mismo prompt contra cada modelo candidato, tomando el campo usage (prompt_tokens y completion_tokens) de cada respuesta y multiplicándolo por el precio publicado de cada uno.

¿Qué es una 'fábrica de tokens' según Jensen Huang?

Es la forma en que el CEO de Nvidia describe el negocio de la compañía: GPU que generan tokens de la manera más rápida y eficiente posible, sin importar de qué modelo provengan.

Referencias

  • Stratechery: "Who's Afraid of Chinese Models?": el ensayo original de Ben Thompson que desarrolla el argumento del COGS de la IA y la distinción entre tokens e inteligencia.
  • Wikipedia: Marginal cost: definición del concepto de costo marginal que sostiene la comparación entre I+D y COGS.
  • Nvidia: la empresa cuyo CEO, Jensen Huang, acuñó el término 'token factories' para describir su negocio de GPU.
  • Moonshot AI: la compañía china detrás de Kimi K3, el modelo de pesos abiertos que originó la discusión.

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Top comments (0)