DEV Community

Cover image for Cómo ejecutar GLM-5.3-Flash localmente
Roobia
Roobia

Posted on Originally published at apidog.com

Cómo ejecutar GLM-5.3-Flash localmente

GLM-5.3-Flash es un modelo de 320 mil millones de parámetros publicado bajo licencia MIT. Puedes ejecutarlo, modificarlo y redistribuirlo libremente, pero su tamaño exige planificar cuidadosamente el hardware.

Prueba Apidog hoy

Solo 18B de sus 320B parámetros están activos por token y ya existen compilaciones cuantificadas. Esto reduce la demanda de cómputo, aunque no elimina el principal obstáculo: todos los pesos deben residir en memoria.

Este artículo cubre desde el despliegue de precisión completa en producción hasta las variantes GGUF cuantificadas para estaciones de trabajo.

Qué estás cargando

Propiedad Valor
Parámetros totales 320B
Activos por token 18B
Arquitectura MoE, atención dispersa y lineal híbrida
Contexto 1.048.576 tokens
Licencia MIT
Pesos zai-org/GLM-5.3-Flash
Cuantificaciones GGUF unsloth/GLM-5.3-Flash-GGUF

La arquitectura de mezcla de expertos (MoE) hace viable el modelo: aunque los 320B parámetros deben estar en memoria, solo 18B participan por token. Por tanto, la memoria es la restricción principal, no los FLOPs.

Z.ai informa además de una caché KV aproximadamente 4,4 veces menor que la de GLM-5.3. Esto importa especialmente con contextos largos, donde la caché KV suele ser la causa real de los errores de memoria.

Nivel 1: precisión completa para producción

Para calidad completa y concurrencia real, usa un nodo 8x H200 de 141 GB por GPU, aproximadamente 1.128 GB en total. Un nodo 8x H20 también funciona.

Los pesos requieren aproximadamente 700–800 GB, según la precisión, más memoria para caché KV y sobrecarga del runtime. Un nodo alquilado de esta clase cuesta aproximadamente entre $24 y $48 al día.

Servir con vLLM

vLLM ofrece el soporte de ecosistema más amplio. Usa un tamaño de paralelismo tensorial que sea potencia de dos:

vllm serve zai-org/GLM-5.3-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --trust-remote-code
Enter fullscreen mode Exit fullscreen mode

Empieza con un valor menor de --max-model-len. Solicitar 1M de tokens desde el inicio reserva caché KV para toda esa ventana y puede provocar errores de memoria que parecen problemas de configuración.

Servir con SGLang

SGLang tuvo soporte desde el primer día, con recetas para H100, H200, B200, B300, GB200 y GB300, incluido servicio multimodal. Z.ai utilizó una pila basada en SGLang para su servicio previo al lanzamiento.

python -m sglang.launch_server \
  --model-path zai-org/GLM-5.3-Flash \
  --tp 8 \
  --context-length 1048576
Enter fullscreen mode Exit fullscreen mode

SGLang suele destacar en salida estructurada y cargas de agentes con alta concurrencia. Si sirves un agente de programación, compáralo con vLLM en tu carga real en lugar de elegir por defecto.

En ambos runtimes, configura el analizador de llamadas a herramientas correspondiente. Revisa la documentación de la versión instalada, ya que los nombres de estas opciones cambian entre versiones.

Nivel 2: cuantificación en hardware más pequeño

Las compilaciones GGUF de unsloth/GLM-5.3-Flash-GGUF incluyen formatos agresivos de 1 y 2 bits, como IQ1_S e IQ2_XXS. Una cuantificación de 2 bits puede llevar los pesos a un rango utilizable por una estación de trabajo con mucha memoria o varias GPU de consumo, especialmente con descarga a CPU.

Ten en cuenta dos limitaciones:

  • La cuantificación agresiva reduce la calidad. IQ1_S está lejos de la precisión completa. En un MoE de 320B la degradación puede ser más suave que en un modelo denso, pero debes evaluar tus tareas reales.
  • La documentación de Unsloth está en progreso. Confirma los formatos publicados y las configuraciones recomendadas antes de diseñar tu infraestructura.

Para configuraciones híbridas CPU/GPU, KTransformers está diseñado para mantener expertos MoE en la RAM del sistema y transferir a GPU solo lo necesario. Con 18B de parámetros activos por token, este enfoque encaja especialmente bien. TokenSpeed también figura entre los runtimes compatibles.

Consulta estas guías para la configuración local:

Calcula tu presupuesto de memoria

Evalúa dos componentes.

Pesos

En BF16, calcula aproximadamente 2 bytes por parámetro:

  • 320B en BF16: alrededor de 640 GB antes de sobrecarga.
  • FP8: aproximadamente la mitad.
  • 4 bits: alrededor de 160 GB.
  • 2 bits: menos memoria, pero con pérdida significativa de calidad.

Caché KV

La caché KV crece con la longitud de contexto y la concurrencia. Un servidor que funciona con 8K tokens puede fallar a 128K aunque los pesos sean idénticos.

La reducción de 4,4x reportada por Z.ai frente a GLM-5.3 ayuda, pero el crecimiento sigue siendo lineal en tokens. Dimensiona el sistema según el contexto que realmente necesitas, no según el máximo de 1M anunciado por el modelo.

Si seguiste la historia previa de pesos abiertos, nuestra publicación sobre el autoalojamiento de GLM-5.3 se escribió antes del lanzamiento. Los pesos Flash ya están disponibles bajo MIT, por lo que esta guía la reemplaza.

Ajuste fino

La licencia MIT permite ajuste fino y redistribución, una ventaja poco habitual para un modelo de este nivel.

El ajuste fino completo de 320B está fuera del alcance de la mayoría de los equipos. Usa métodos eficientes en parámetros, como LoRA. En MoE también debes decidir qué adaptar: el enrutador, los expertos o las capas de atención.

Para adaptación de dominio, prueba primero prompting y recuperación con el modelo base. Con una ventana de contexto de 1M tokens, incluir conocimiento de dominio en el prompt puede ser más barato y efectivo que entrenar.

Configuración de muestreo

Z.ai recomienda:

Caso de uso temperature top_p
General 1.0 0.95
Programación 0.95 1.0

El modelo también admite reasoning_effort con valores low, high y max; max es el valor predeterminado.

En hardware local, el razonamiento afecta directamente al tiempo de generación. Si tu equipo genera lentamente, usar low puede marcar la diferencia entre una experiencia utilizable y una que no lo es.

¿Es rentable autoalojarlo?

Normalmente no si solo comparas costos. Según el precio de lista, GLM-5.3-Flash cuesta $0.15 por millón de tokens de entrada. Un nodo 8x H200 de aproximadamente $1.000 al mes equivale a cerca de 6.700 millones de tokens de entrada mediante API.

Además, el nodo cuesta lo mismo esté activo o inactivo; la API factura solo el uso. El autoalojamiento tiene sentido cuando necesitas:

  • Residencia y privacidad de datos.
  • Ausencia de límites de tasa.
  • Garantías de disponibilidad independientes del proveedor.
  • Modificar, ajustar y redistribuir los pesos MIT.
  • Aprovechar GPU ya adquiridas e inactivas.

Nuestro desglose de precios analiza esta comparación con más detalle.

Verifica tu despliegue

vLLM y SGLang exponen endpoints compatibles con OpenAI. Puedes probar tu servidor local con:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'
Enter fullscreen mode Exit fullscreen mode

No te limites a una prueba de humo. Valida:

  • Contexto largo con la longitud que realmente usarás.
  • Entrada de imágenes si sirves el modelo multimodal.
  • Llamadas a herramientas con tus esquemas reales.
  • Rendimiento bajo concurrencia, no solo latencia de una solicitud.

Usa una colección de pruebas guardada en Apidog, define la URL base como variable de entorno y ejecuta la misma suite contra tu servidor local y Z.ai. Así podrás comprobar rápidamente si una compilación cuantificada sigue manejando los esquemas de herramientas de tu aplicación antes de llevarla a producción.

Preguntas frecuentes

¿Cuál es el hardware mínimo? Para precisión completa, un nodo de clase 8x H200. Para GGUF cuantificado, considerablemente menos, aunque la calidad disminuye con la cuantificación.

¿Necesito cargar los 320B parámetros en memoria? Sí. Solo 18B están activos por token, pero el conjunto completo debe residir en memoria.

¿Qué es mejor: vLLM o SGLang? SGLang tuvo soporte temprano, recetas multimodales publicadas y suele rendir bien con concurrencia y salida estructurada. vLLM tiene un ecosistema más amplio. Compara ambos con tu carga de trabajo.

¿Puedo usar una sola GPU? No con precisión completa. Con cuantificación agresiva, mucha RAM y descarga a CPU mediante KTransformers, una configuración de GPU única con mucha memoria es posible, pero será lenta.

¿La licencia es realmente MIT? Sí. Permite uso comercial, modificación y redistribución.

Top comments (0)