GLM-5.3-Flash, MIT lisansı altında yayınlanmış 320 milyar parametreli bir modeldir. Lisans, modeli istediğiniz gibi çalıştırmanıza izin verirken parametre sayısı ciddi donanım gerektirir.
İlginç nokta, 320 milyar parametrenin jeton başına yalnızca 18 milyarının aktif olması ve nicelenmiş derlemelerin bulunmasıdır. Bu sayede model, çoğu rehberde önerilen 8x H200 düğümünden çok daha küçük sistemlerde de çalıştırılabilir.
Bu yazı; tam hassasiyetli üretim düğümünden iş istasyonunda çalışan nicelenmiş derlemelere kadar donanım seçeneklerini, kurulumları ve kendi sunucunuzda barındırmanın ne zaman mantıklı olduğunu ele alır.
Gerçekte ne yüklüyorsunuz?
| Özellik | Değer |
|---|---|
| Toplam parametreler | 320B |
| Jeton başına aktif | 18B |
| Mimari | MoE, hibrit doğrusal ve seyrek dikkat |
| Bağlam | 1.048.576 jeton |
| Lisans | MIT |
| Ağırlıklar | zai-org/GLM-5.3-Flash |
| GGUF nicellemeleri | unsloth/GLM-5.3-Flash-GGUF |
Uzmanlar karışımı (MoE) mimarisi bunu mümkün kılar. Tüm 320B parametrenin bellekte tutulması gerekir; ancak her jetonda yalnızca 18B parametre etkinleştirilir. Bu nedenle hesaplama ihtiyacı toplam parametre sayısının düşündürdüğünden çok daha düşüktür. Temel kısıtlama FLOP değil, bellektir.
Z.ai, GLM-5.3'e kıyasla yaklaşık 4,4 kat daha küçük bir KV önbelleği bildirmektedir. Bu, uzun bağlamlı çalışmalarda önemlidir: bağlam büyüdükçe KV önbelleği de büyür ve 1M jetonluk pencerede genellikle darboğaz haline gelir.
Katman 1: Üretim düğümünde tam hassasiyet
Gerçek eşzamanlılık ve tam kalite için referans yapılandırma 8x H200 düğümüdür. Her H200 141 GB belleğe sahiptir; toplam kapasite yaklaşık 1.128 GB'tır. 8x H20 düğümü de kullanılabilir.
Yaklaşık bellek ihtiyacı:
- Ağırlıklar: Hassasiyete bağlı olarak 700–800 GB
- KV önbelleği ve çalışma zamanı: Ek boş alan gerektirir
- Bulut maliyeti: Yaklaşık günlük 24–48 dolar
vLLM
vLLM, en geniş ekosistem desteğine sahip yaygın varsayılandır. Tensör paralel boyutu ikinin kuvveti olmalıdır:
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--trust-remote-code
Kurulumu doğrularken daha küçük bir --max-model-len değeriyle başlayın. Doğrudan 1M jetonluk pencere istemek KV önbelleği için büyük bir alan ayırır; yapılandırma hatası bellek yetersizliği hatası gibi görünebilir.
SGLang
SGLang, model için ilk günden itibaren destek sundu. H100, H200, B200, B300, GB200 ve GB300 için yayınlanmış tariflerin yanı sıra çok modlu hizmet desteği de bulunur. Z.ai, lansman öncesi hizmetinde SGLang tabanlı bir yığın kullandı.
python -m sglang.launch_server \
--model-path zai-org/GLM-5.3-Flash \
--tp 8 \
--context-length 1048576
SGLang, yapılandırılmış çıktı ve yüksek eşzamanlılığa sahip ajanik iş yüklerinde genellikle daha iyi performans gösterir. Kodlama ajanı hizmeti sunuyorsanız vLLM ile karşılaştırmalı test yapın.
Her iki yığında da işlev çağrılarının düzgün çalışması için yapılandırılmış bir araç çağrısı ayrıştırıcısı gerekir. Ayrıştırıcı adları sürümlere göre değişebildiğinden güncel belgelerdeki bayrakları kullanın.
Katman 2: Daha küçük donanımda nicelenmiş çalıştırma
Bu katman, veri merkezi donanımına sahip olmayanlar için en pratik seçenektir.
Nicelenmiş GGUF derlemeleri unsloth/GLM-5.3-Flash-GGUF adresinde yayınlanmaktadır. IQ1_S ve IQ2_XXS gibi agresif 1-bit ve 2-bit formatlar da bulunur.
320B modelin 2-bit nicelenmesi, ağırlıkları yüksek bellekli bir iş istasyonuna veya çoklu GPU'lu tüketici sistemine sığabilecek düzeye getirir. CPU boşaltma kullanıldığında daha küçük sistemler de mümkün olabilir.
İki önemli uyarı:
Agresif niceleme kaliteyi düşürür. IQ1_S, tam hassasiyetten oldukça uzaktır. MoE mimarisindeki yedeklilik bozulmayı yoğun modellere kıyasla azaltabilir; ancak “çalışıyor” ile “iyi çalışıyor” aynı şey değildir. Karar vermeden önce kendi görevlerinizde test yapın.
Unsloth belgeleri bu model için hâlâ “geliştirilme aşamasında” durumundadır. Niceleme seçenekleri ve önerilen ayarlar değişebilir. Belirli bir formata göre dağıtım planlamadan önce güncel derlemelerin gerçekten yayınlandığını kontrol edin.
CPU ağırlıklı ve hibrit kurulumlar için KTransformers, MoE uzmanlarını sistem RAM'inde tutup yalnızca ihtiyaç duyulanları GPU'ya taşır. 18B aktif parametreli bir MoE modeli için bu yaklaşım oldukça uygundur. TokenSpeed de desteklenen çalışma zamanları arasında listelenmektedir.
Daha küçük bir modelle benzer kurulum için GLM-4.7-Flash'ı yerel olarak çalıştırma rehberine, genel yerel GLM kurulumu için GLM-5'i yerel olarak ücretsiz çalıştırma rehberine bakabilirsiniz.
Bellek bütçenizi hesaplayın
Bir yapılandırmanın uygunluğunu iki değer belirler.
Ağırlıklar
BF16'da parametre başına yaklaşık 2 bayt gerekir:
- 320B parametre ≈ 640 GB
- FP8: Yaklaşık yarısı
- 4-bit niceleme: Yaklaşık 160 GB
- 2-bit formatlar: Daha düşük bellek kullanımı, ancak belirgin kalite kaybı
KV önbelleği
KV önbelleği bağlam uzunluğu ve eşzamanlılıkla birlikte büyür. 8K bağlamda çalışan bir yapılandırma, ağırlıklar değil önbellek büyüdüğü için 128K'da başarısız olabilir.
Z.ai'nin GLM-5.3'e kıyasla bildirdiği 4,4 katlık azalma yardımcı olur; ancak ölçeklendirme hâlâ jeton sayısıyla yaklaşık doğrusal ilişkilidir.
Modelin teorik maksimum bağlamına göre değil, gerçek kullanımınıza göre boyutlandırma yapın. Çoğu uygulama 1M jetona ihtiyaç duymaz. Kullanmadığınız bir pencere için kaynak ayırmak, bu modeli gereksiz yere erişilemez gösterebilir.
GLM-5.3 kendi kendine barındırma yazımız, ağırlıklar yayınlanmadan önce hazırlanmıştı. Flash ağırlıkları artık MIT lisansıyla sunulduğu için güncel rehberlik bu yazının yerini almaktadır.
İnce ayar
MIT lisansı ince ayar ve yeniden dağıtıma izin verir. Bu, ağırlıkları kendiniz barındırmak için en güçlü nedenlerden biridir.
Bununla birlikte 320B modelin tam ince ayarı çoğu ekip için gerçekçi değildir. Pratik yaklaşım, LoRA gibi parametre verimli yöntemler kullanmaktır. MoE mimarisinde ayrıca yönlendiriciyi, uzmanları veya dikkat katmanlarını uyarlama kararı vermeniz gerekir. Bu alan, yoğun modellere kıyasla daha az yerleşik rehberliğe sahiptir.
Amacınız yeni bir yetenek kazandırmak değil alan uyarlaması yapmaksa önce temel modele karşı istem ve geri alma stratejilerinizi test edin. 1M jetonluk bağlam penceresine sahip bir modelde alan bilgisini isteme eklemek, çoğu durumda yeniden eğitmekten daha ucuz ve verimli olabilir.
Örnekleme ayarları
Z.ai, kullanım senaryosuna göre şu ayarları önerir:
| Kullanım durumu | temperature |
top_p |
|---|---|---|
| Genel | 1,0 | 0,95 |
| Kodlama | 0,95 | 1,0 |
Model ayrıca reasoning_effort üzerinden üç akıl yürütme modu sunar:
lowhighmax
Varsayılan değer max'tır. Yerel donanımda bu ayar daha önemlidir; çünkü akıl yürütme jetonlarının bedelini dolar yerine üretim süresiyle ödersiniz. Sisteminiz yavaşsa low, kullanılabilirlik açısından belirleyici olabilir.
Kendi sunucunuzda barındırmak finansal açıdan mantıklı mı?
Genellikle hayır. API fiyatlandırmasının temel avantajı budur.
Liste fiyatına göre GLM-5.3-Flash, milyon giriş jetonu başına 0,15 dolardır. Aylık yaklaşık 1.000 dolara kiralanan 8x H200 düğümü, aynı maliyetle yaklaşık 6,7 milyar giriş jetonuna karşılık gelir. Bununla birlikte düğümü sürekli yüksek kullanımda tutmak da operasyonel bir yük oluşturur.
Düğüm, boşta olsa da aynı maliyeti üretir; API ise yalnızca kullandığınız kadar ücretlendirir. Kullanımınız günün her saati yüksek değilse sabit maliyet dezavantajlıdır.
Kendi sunucunuzda barındırma nedenleri maliyet değil, kontrol ve bağımsızlıktır:
- Veri ikameti ve gizlilik: Veriler altyapınızdan çıkmaz.
- Hız sınırı yok: Kapasiteniz, sağlayıcının limitlerine bağlı değildir.
- Kullanılabilirlik garantileri: Satıcının çalışma süresine ve fiyatlandırma kararlarına bağımlı kalmazsınız.
- MIT lisansı: Modeli değiştirebilir, ince ayar yapabilir ve yeniden dağıtabilirsiniz.
- Mevcut donanım: GPU'lar zaten satın alınmış ve boşta ise marjinal maliyet elektriktir.
Fiyatlandırma dökümümüz, API tarafındaki karşılaştırmayı ayrıntılı olarak ele alıyor.
Dağıtımınızı doğrulayın
vLLM ve SGLang, OpenAI uyumlu uç noktalar sunar. Böylece aynı istek biçimini hem yerel sunucunuza hem de Z.ai'ye gönderebilirsiniz:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [{"role": "user", "content": "reply with OK"}]
}'
Basit bir OK yanıtıyla yetinmeyin. Şunları test edin:
- Gerçek kullanımınız için gereken uzunlukta uzun bağlam
- Çok modlu hizmet veriyorsanız görüntü girdileri
- Gerçek şemalarınızla araç çağırma
- Tek istek gecikmesi yerine eşzamanlılık altındaki iş hacmi
Kayıtlı bir test koleksiyonu burada çok işe yarar. Apidog'da hem yerel sunucunuzun hem de Z.ai uç noktasının temel URL'sini ortam değişkeni olarak tanımlayın. Aynı test paketini iki uç noktaya da çalıştırarak nicelenmiş derlemenizin uygulamanızın kullandığı araç şemalarını işleyip işlemediğini hızlıca doğrulayabilirsiniz.
SSS
Minimum donanım nedir?
Tam hassasiyet için 8x H200 sınıfı bir düğüm gerekir. Nicelenmiş GGUF derlemeleri daha az donanımda çalışabilir; ancak kalite, niceleme seviyesine bağlı olarak düşer.
Tüm 320B parametreyi bellekte tutmam gerekiyor mu?
Evet. Her jetonda yalnızca 18B parametre aktif olsa da tüm parametre seti bellekte kalıcı olarak bulunmalıdır. Temel kısıtlama bellektir.
vLLM mi, SGLang mı daha iyi?
SGLang, yayınlanmış çok modlu tariflere sahiptir ve eşzamanlılık ile yapılandırılmış çıktıda genellikle daha iyi performans gösterir. vLLM'nin ekosistem desteği daha geniştir. İş yükünüzde ikisini de karşılaştırın.
Tek bir GPU'da çalıştırabilir miyim?
Tam hassasiyette hayır. KTransformers, agresif niceleme, CPU boşaltma, yüksek bellekli tek GPU ve yeterli sistem RAM'iyle bunu makul hale getirebilir. Ancak üretim hızı düşük olacaktır.
Lisans gerçekten MIT mi?
Evet. Ağırlıklar MIT lisansıyla yayınlanmıştır; ticari kullanım, değiştirme ve yeniden dağıtım mümkündür.
Top comments (0)