DEV Community

Cover image for ¿Qué es GLM-5.3-Flash? El primer modelo de pesos abiertos nativamente multimodal de Z.ai
Roobia
Roobia

Posted on Originally published at apidog.com

¿Qué es GLM-5.3-Flash? El primer modelo de pesos abiertos nativamente multimodal de Z.ai

Z.ai lanzó GLM-5.3-Flash el 26 de agosto de 2026: un modelo de mezcla de expertos de 320 mil millones de parámetros, con 18 mil millones activos, licencia MIT y entrada de imágenes nativa.

Prueba Apidog hoy

Muchos desarrolladores ya lo habían usado durante una semana bajo el nombre anónimo ox-alpha. Y, pese a su nombre, “Flash” no significa que sea especialmente rápido: su ventaja está en costo y memoria.

En resumen

  • Modelo: MoE abierto (MIT) 320B-A18B de Z.ai.
  • Novedad clave: admite texto, imágenes, video y archivos de forma nativa en una misma solicitud.
  • Contexto: 1,048,576 tokens.
  • Precio de lista: $0.15 por millón de tokens de entrada y $0.50 por millón de salida; aproximadamente una décima parte de GLM-5.2 según Z.ai.
  • Rendimiento: 48.7 tokens de salida por segundo según Artificial Analysis; tiempo hasta el primer token de 1.52 segundos.
  • Disponibilidad: API de Z.ai como glm-5.3-flash, OpenRouter, Cloudflare Workers AI, Vercel AI Gateway y otros proveedores. Los pesos están en Hugging Face.

Especificaciones

Propiedad Valor
Parámetros totales 320B
Parámetros activos 18B
Arquitectura Mezcla de expertos, atención híbrida lineal y dispersa
Licencia MIT
Ventana de contexto 1,048,576 tokens
Modalidades de entrada Texto, imagen, video, archivos
Salida Texto
Modos de razonamiento low, high, max — predeterminado: max
ID de API glm-5.3-flash
Hugging Face zai-org/GLM-5.3-Flash

El máximo de tokens de salida no está claro: OpenRouter indica 131,072 y la tarjeta de Hugging Face, 163,840. Z.ai no ha confirmado una cifra definitiva. Si necesita respuestas muy largas, valide el límite con su proveedor antes de depender de él.

Multimodalidad nativa

Las capacidades de visión anteriores de GLM requerían rutas o modelos separados, como GLM-5V-Turbo y GLM-4.6V. Con GLM-5.3-Flash, imágenes, video y archivos se envían como bloques de contenido dentro de la misma solicitud de chat que el texto.

Esto permite, por ejemplo, enviar una especificación extensa y una captura del resultado renderizado en un único prompt para pedirle al modelo que encuentre discrepancias. Z.ai orienta esta capacidad a agentes de programación que analizan interfaces, renderizados y retroalimentación de interacción.

Para el enfoque anterior de visión dedicada, consulta la guía de la API de GLM-5V-Turbo o GLM-OCR para comprensión de documentos.

Arquitectura y eficiencia

Z.ai construyó GLM-5.3-Flash sobre un nuevo modelo base, no mediante postentrenamiento de GLM-5.2.

  • Atención híbrida: combina atención lineal para dependencias locales y atención dispersa para tokens relevantes a nivel global. Z.ai afirma que reduce el cálculo de atención aproximadamente 3× frente a GLM-5.3 y reduce la caché KV alrededor de 4.4×.
  • Hiperconexiones con Restricciones de Variedad: término de Z.ai para su enfoque de eficiencia de escalado. Aún no hay suficiente detalle público para validar esta ventaja de forma independiente.

La caché KV más pequeña reduce la memoria necesaria para inferencia con contextos largos. Es la explicación práctica de cómo el modelo mantiene una ventana de 1M de tokens con un precio aproximado de una décima parte de GLM-5.2.

El entrenamiento utilizó un corpus de aproximadamente 30 billones de tokens multimodales, según Z.ai.

“Flash” no significa más velocidad

Artificial Analysis mide 48.7 tokens de salida por segundo para GLM-5.3-Flash. GLM-5.3 alcanza aproximadamente 86 tokens por segundo en la misma medición.

En otras palabras, GLM-5.3-Flash es cerca de la mitad de rápido al generar texto largo. Su punto fuerte es el tiempo hasta el primer [REDACTED CREDENTIAL] segundos**, frente a una mediana de 2.14 segundos para modelos abiertos.

Úselo para interacciones breves, visión multimodal o cargas sensibles al costo. Para generar documentos largos, GLM-5.3 puede ser más conveniente si prioriza velocidad.

Benchmarks

Los resultados publicados en el lanzamiento proceden de Z.ai, por lo que deben tratarse como afirmaciones del proveedor hasta que terceros los reproduzcan.

Artificial Analysis sitúa a GLM-5.3-Flash en 57 puntos en su Índice de Inteligencia v4.1.1. GLM-5.3 obtiene 60 y la mediana para modelos abiertos de tamaño comparable es 27.

Z.ai lo compara con Claude Opus 4.8 para programación y agentes, pero esa valoración procede de evaluaciones internas. La diferencia de tres puntos frente a GLM-5.3 en el Índice de Inteligencia aconseja prudencia.

Para más contexto, consulta el análisis de benchmarks de GLM-5.2.

La semana de Ox Alpha

El 20 de agosto, ox-alpha apareció en plataformas de inferencia de terceros: ofrecía 1M de tokens de contexto y precio cero. En pocos días se convirtió en uno de los modelos más utilizados; la comunidad lo identificó como Zhipu por sus características de salida.

El 26 de agosto, Z.ai confirmó que ox-alpha era GLM-5.3-Flash y que la semana gratuita había sido una prueba de carga.

Z.ai afirma que el tráfico de esa semana se atendió con aceleradores chinos domésticos y una pila basada en SGLang, con un costo por token comparable al hardware NVIDIA convencional. No existe verificación independiente disponible.

Este patrón ya apareció cuando Pony Alpha resultó ser un modelo DeepSeek o GLM: los lanzamientos anónimos en routers de terceros se están convirtiendo en una fase de evaluación previa al lanzamiento.

Cómo usar GLM-5.3-Flash

API alojada

La API de Z.ai es compatible con OpenAI. Configure su cliente con:

Base URL: https://api.z.ai/api/paas/v4/
Model: glm-5.3-flash
Enter fullscreen mode Exit fullscreen mode

La guía de la API de GLM-5.3-Flash cubre autenticación, entrada de imágenes y el parámetro de esfuerzo de razonamiento.

Proveedores de terceros

OpenRouter lo expone como:

z-ai/glm-5.3-flash
Enter fullscreen mode Exit fullscreen mode

También está disponible en Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten y io.net. Los precios pueden variar significativamente entre revendedores.

Agentes de programación

Flash está incluido en el Plan de Codificación GLM y, según se informa, ofrece tres veces la cuota utilizable de GLM-5.3. La documentación de Z.ai también indica que las llamadas fuera de horas pico consumen la mitad de los puntos estándar.

Autohospedaje

Los pesos MIT están disponibles en Hugging Face. vLLM, SGLang, TokenSpeed y KTransformers son compatibles; también existen cuantizaciones GGUF para equipos más pequeños.

Cuándo elegirlo

Elige GLM-5.3-Flash si necesitas:

  • Imágenes o video junto con texto en la misma llamada.
  • Reducir costo por token.
  • Pesos abiertos con licencia permisiva para autohospedaje.
  • Respuesta inicial rápida en interacciones cortas.

Elige GLM-5.3 si priorizas:

  • La máxima calidad de razonamiento.
  • Mayor velocidad de generación sostenida.
  • Respuestas largas.

Consulta la comparación GLM-5.3-Flash vs. GLM-5.3 y la guía Qué es GLM-5.3.

Cambiar entre ambos es una modificación de una línea en el ID del modelo dentro de un endpoint compatible con OpenAI. Pruebe ambos con su carga de trabajo real, especialmente las solicitudes multimodales.

Apidog permite guardar estas solicitudes como colecciones reutilizables con aserciones, para verificar que la estructura de la respuesta no cambia al pasar de GLM-5.3 a Flash antes de llegar a producción.

Preguntas frecuentes

¿GLM-5.3-Flash es gratuito?

No. La semana gratuita de Ox Alpha terminó con el anuncio oficial. Hay un descuento de lanzamiento del 50% hasta el 9 de septiembre de 2026; después se aplicarán los precios de lista.

¿Es más rápido que GLM-5.3?

No. Genera aproximadamente 49 tokens por segundo, frente a 86 de GLM-5.3. Sin embargo, responde antes: 1.52 segundos hasta el primer token.

¿Admite un millón de tokens?

Sí. La ventana configurada es de 1,048,576 tokens, confirmada por la configuración del modelo y Artificial Analysis. OpenRouter muestra 1,310,720, pero debe tratarse como una cifra del proveedor, no como especificación definitiva.

¿Acepta video?

Sí. La documentación de Z.ai enumera texto, imagen, video y archivos como entradas. Valide el comportamiento con sus propios medios antes de usar video en producción.

¿Qué licencia tienen los pesos?

MIT. Los pesos se publican en Hugging Face como zai-org/GLM-5.3-Flash.

Top comments (0)