DEV Community

Cover image for Precio GLM-5.3-Flash: Costo antes y después del descuento de lanzamiento
Roobia
Roobia

Posted on Originally published at apidog.com

Precio GLM-5.3-Flash: Costo antes y después del descuento de lanzamiento

GLM-5.3-Flash: precios actuales, costos reales y cómo prepararte para septiembre

GLM-5.3-Flash está actualmente a mitad de precio. La promoción termina el 9 de septiembre de 2026; después, todas las proyecciones basadas en las tarifas actuales se duplicarán.

Prueba Apidog hoy

Esta guía explica cuánto cuesta el modelo ahora y después de la promoción, cómo se compara con las alternativas y cómo saber si la diferencia afecta a tu carga de trabajo. Todas las cifras fueron verificadas el 27 de agosto de 2026. Como las páginas de precios cambian, confirma los valores con tu proveedor antes de aprobar un presupuesto.

Tarifas de GLM-5.3-Flash

Concepto Precio promocional (hasta el 9 de septiembre de 2026) Precio de lista (después)
Entrada $0.075 / 1M tokens $0.15 / 1M tokens
Salida $0.25 / 1M tokens $0.50 / 1M tokens
Entrada en caché $0.015 / 1M tokens $0.03 / 1M tokens

Artificial Analysis publica un costo combinado de $0.10 por millón de tokens, calculado con una proporción de 7:2:1 entre aciertos de caché, entrada y salida. Es útil para comparar modelos, pero tu proporción real es la que determina la factura.

Costos prácticos

Estas son tres cargas de trabajo calculadas con el precio de lista, que es el valor relevante para presupuestar después del 9 de septiembre.

Clasificador de soporte

  • 100.000 tickets al mes.
  • 800 tokens de entrada y 100 de salida por ticket.
  • 80M tokens de entrada y 10M de salida.
  • Entrada: $12; salida: $5.
  • Total: $17 al mes.

Configura reasoning_effort en low para reducir todavía más el consumo de salida.

Asistente de codificación

  • 500 sesiones al día.
  • 15.000 tokens de entrada, en gran parte contexto de archivos repetido.
  • 2.000 tokens de salida por sesión.
  • 225M tokens de entrada y 30M de salida al mes.
  • Sin caché: $33.75 + $15 = $48.75.
  • Con un 70% de aciertos de caché: la entrada baja a unos $14.85 y el total queda en aproximadamente $30.

Pipeline de documentos con imágenes

  • 10.000 documentos al mes.
  • 40.000 tokens de entrada por documento, incluido el contenido visual.
  • 1.500 tokens de salida por documento.
  • 400M tokens de entrada y 15M de salida.
  • Entrada: $60; salida: $7.50.
  • Total: $67.50 al mes.

Estos costos no son elevados. Ese es precisamente el objetivo de este modelo.

La entrada en caché es la mayor palanca

A $0.03 por millón frente a $0.15 por millón de entrada nueva, los tokens en caché cuestan una quinta parte. Si tu carga de trabajo usa un prefijo estable —por ejemplo, un prompt de sistema, un documento consultado repetidamente o una base de código—, mantenlo idéntico entre llamadas.

El error más común es colocar contenido variable al principio del prompt. Una marca de tiempo, un ID de solicitud o un nombre de usuario en el prompt del sistema puede invalidar todo lo que sigue. Coloca primero el contenido estable y añade los valores variables al final.

Z.ai también ha ofrecido almacenamiento de entrada en caché gratuito durante un periodo limitado. Trátalo como una promoción: verifica los términos actuales antes de diseñar una arquitectura que dependa de ella.

La segunda palanca: el esfuerzo de razonamiento

El valor predeterminado de reasoning_effort es max, la opción más cara. Si no modificas el parámetro, ese es el nivel que utilizarás.

Los modos disponibles son:

  • low (bajo)
  • high (alto)
  • max (máximo)

Los tokens de razonamiento se facturan como salida. Por eso, una tarea que no necesita deliberación puede estar pagando por tokens que nadie ve. Para clasificación, extracción, enrutamiento y generación con formato, low puede reducir considerablemente el costo de salida.

Consulta la configuración en nuestra guía de la API. Es un cambio de una línea y el primer ajuste que conviene probar si la factura supera tus estimaciones.

Comparación con otros modelos

Al precio de lista, la comparación con su hermano es:

Modelo Costo combinado por 1M tokens
GLM-5.3-Flash $0.10
GLM-5.3 $0.90

La diferencia es de aproximadamente nueve veces por solo tres puntos en el Índice de Inteligencia de Artificial Analysis: 57 frente a 60. Nuestra comparación completa explica cuándo ese intercambio no conviene.

La respuesta corta: si transmites respuestas largas a una persona que está esperando, GLM-5.3 puede ser mejor opción porque genera casi el doble de rápido.

Frente a GLM-5.2, Z.ai afirma que GLM-5.3-Flash cuesta aproximadamente una décima parte, con un costo por tarea de $0.045. Nuestro desglose de precios de GLM-5.2 incluye la tabla necesaria para presupuestar una migración.

Frente a las alternativas multimodales económicas, GLM-5.3-Flash es competitivo en precio y poco común por su licencia MIT, que mantiene abierta la opción de autoalojamiento. Nuestra guía sobre Gemini 3.7 Flash cubre la comparación más cercana dentro del ecosistema de Google.

Los revendedores pueden cobrar tarifas distintas

Además de Z.ai, GLM-5.3-Flash está disponible mediante OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten e io.net.

No todos aplican el mismo precio. AIHubMix, por ejemplo, ha publicado tarifas cercanas a $0.113 para entrada y $0.394 para salida: valores situados entre la promoción y el precio de lista de Z.ai. Algunos proveedores aplican el descuento de lanzamiento y otros no.

Si utilizas un agregador, verifica su tarifa actual. No asumas que coincide con la de Z.ai. Una puerta de enlace unificada puede incluir un margen que, aunque pequeño en términos absolutos, cambia el costo final.

Cuándo conviene el autoalojamiento

Los pesos tienen licencia MIT, así que puedes ejecutar el modelo por tu cuenta. Sin embargo, el precio tan bajo de la API eleva el umbral de rentabilidad del autoalojamiento.

Como referencia, el servicio en precisión completa requiere un nodo de clase 8x H200, con un costo de entre $24 y $48 diarios en capacidad de nube alquilada. Si redondeamos a $1.000 mensuales, ese costo se acumula tanto si el nodo está ocupado como si está inactivo.

Al precio de lista de la API, $1.000 compran aproximadamente 6.7 mil millones de tokens de entrada. Necesitas un volumen enorme y sostenido antes de que el costo fijo del nodo sea inferior al de la API.

Para la mayoría de los equipos, autoalojar GLM-5.3-Flash tiene más que ver con control, residencia de datos o licencias que con ahorro.

La excepción es el nivel cuantificado. Hay cuantificaciones GGUF, y ejecutar un modelo cuantificado en hardware que ya posees cambia el cálculo: el costo marginal pasa a ser principalmente la electricidad. Nuestra guía para ejecutarlo localmente explica qué puede hacer cada nivel de hardware.

La alternativa del plan de codificación

Si utilizas Claude Code o Cline como desarrollador, en lugar de integrar el modelo mediante una aplicación propia, el precio por token puede no ser la métrica adecuada.

El Plan de Codificación GLM comienza alrededor de $18 al mes, incluye GLM-5.3-Flash y, según se informa, ofrece tres veces la cuota utilizable de GLM-5.3. La documentación de Z.ai también indica que las llamadas realizadas fuera de las horas punta consumen la mitad de los puntos estándar.

Para una persona que programa a diario, un plan fijo suele ser más barato y predecible que el acceso medido a la API. Nuestra guía de configuración explica cómo conectarlo. Nuestra comparación de planes de codificación lo sitúa frente a otras alternativas.

Controla el consumo de salida

La entrada suele recibir más atención porque representa un volumen mayor, pero la salida es donde los presupuestos pueden descontrolarse:

  1. La salida cuesta más de tres veces que la entrada: $0.50 frente a $0.15 por token.
  2. Los tokens de razonamiento se facturan como salida.
  3. Con reasoning_effort: max, el modelo puede generar varias veces más tokens internos que los visibles en la respuesta final.

Por eso, una aplicación con un prompt pequeño y respuestas extensas puede estar dominada por el costo de salida. La cifra combinada de $0.10 por millón supone una proporción 7:2:1 que muchas cargas reales no cumplen.

La solución es medir, no estimar. Cada respuesta de finalización incluye un objeto usage con el recuento de tokens de esa llamada. Registra y agrega esos valores, y compara la proporción real con la utilizada en tu presupuesto.

Si la salida supera aproximadamente el 15% de tus tokens totales, revisa primero reasoning_effort y después la longitud del prompt.

Qué hacer antes del 9 de septiembre

Mientras el descuento siga activo:

  • Mide tu mezcla real de tokens. La tarifa combinada supone una proporción 7:2:1. Si tu uso concentra más salida, el costo efectivo estará más cerca de $0.50 por millón que de $0.10.
  • Verifica la tasa de aciertos de caché. La diferencia de cinco veces entre la entrada nueva y la almacenada en caché es una de tus mayores oportunidades de ahorro.
  • Recalcula al precio de lista. Todo se duplica el 10 de septiembre. Si tu carga solo es rentable con la promoción, resuélvelo ahora.

Para medir el uso real, captura las respuestas de producción: el objeto usage de cada finalización contiene los tokens de entrada, salida y caché. Ejecuta llamadas representativas como una colección guardada en Apidog, usando el ID del modelo como variable de entorno. Así podrás repetir la misma suite contra GLM-5.3 y comparar facturas reales, no solo afirmaciones de marketing.

Preguntas frecuentes

¿GLM-5.3-Flash es gratuito?

No. Fue gratuito durante aproximadamente una semana, cuando se ejecutaba de forma anónima como ox-alpha, pero eso terminó con el anuncio. El descuento actual del 50% no equivale a uso gratuito.

¿Cuándo termina exactamente el descuento?

El 9 de septiembre de 2026. A partir del 10 de septiembre se aplicarán los precios de lista.

¿Por qué algunos sitios muestran precios diferentes?

Algunos citan la tarifa promocional, otros la de lista y los revendedores añaden sus propios márgenes. Verifica siempre el precio del proveedor al que realmente envías las llamadas.

¿Las imágenes tienen un costo adicional?

Las imágenes consumen tokens de contexto y se facturan como entrada. No existe un recargo separado por imagen, pero una imagen de alta resolución puede consumir una cantidad considerable de tokens.

¿Es más barato autoalojar el modelo?

Solo con un volumen sostenido muy alto o si ya dispones del hardware para ejecutar una versión cuantificada. A $0.15 por millón de tokens de entrada, alquilar un nodo 8x H200 es difícil de justificar únicamente por costo.

Top comments (0)