Z.ai, GLM-5.3-Flash’i 26 Ağustos 2026’da yayınladı: MIT lisanslı, 320 milyar toplam ve 18 milyar aktif parametreli bir uzman karışımı (MoE) modeli. GLM-5 serisinde görüntüleri harici bir adaptör yerine yerel olarak işleyen ilk modeldir.
Model bir haftadır anonim ox-alpha adıyla bazı platformlarda test ediliyordu. “Flash” adına rağmen önceliği üretim hızı değil; maliyet, bellek verimliliği ve yerel çok modluluktur.
Özet
- Model: Z.ai tarafından 26 Ağustos 2026’da yayınlanan, MIT lisanslı 320B-A18B MoE modeli.
- Çok modluluk: Metin, görüntü, video ve dosyaları aynı sohbet tamamlama isteğinde işler.
- Bağlam: 1.048.576 token.
- Fiyat: Z.ai, GLM-5.2’ye göre yaklaşık onda bir maliyet belirtiyor: milyon giriş tokenı başına 0,15 dolar, milyon çıktı tokenı başına 0,50 dolar.
- Hız: Artificial Analysis’e göre saniyede 48,7 çıktı tokenı. İlk token süresi 1,52 saniye.
-
Model kimliği:
glm-5.3-flash - Sağlayıcılar: Z.ai API, OpenRouter, Cloudflare Workers AI, Vercel AI Gateway ve diğerleri. Ağırlıklar Hugging Face’te.
Teknik özellikler
| Özellik | Değer |
|---|---|
| Toplam parametre | 320B |
| Aktif parametre | 18B |
| Mimari | Uzman karışımı; hibrit doğrusal ve seyrek dikkat |
| Lisans | MIT |
| Bağlam penceresi | 1.048.576 token |
| Giriş modları | Metin, görüntü, video, dosya |
| Çıktı | Metin |
| Akıl yürütme modları |
düşük, yüksek, maks — varsayılan maks
|
| API model kimliği | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
Maksimum çıktı tokenı için kaynaklar çelişiyor: OpenRouter 131.072, Hugging Face model kartı ise 163.840 token listeliyor. Çok uzun tekil üretimlere ihtiyacınız varsa, uygulamayı oluşturmadan önce limiti kullandığınız sağlayıcıda doğrulayın.
Yerel çok modluluk
Önceki GLM görüntü yetenekleri ayrı modeller veya uç noktalar üzerinden sunuluyordu. Örneğin Z.ai, GLM-5V-Turbo ve GLM-4.6V’yi ayrı görüntü modelleri olarak yayınladı.
GLM-5.3-Flash’ta görüntü, video ve dosyalar metinle aynı sohbet tamamlama isteğinin içerik bloklarıdır. Bunun pratik sonucu:
- Tek model kimliği
- Tek faturalandırma satırı
- Görüntü ve metin için tek bağlam penceresi
- Uzun spesifikasyonları, ekran görüntülerini ve işlem sonuçlarını aynı istemde birlikte değerlendirebilme
Örneğin uzun bir ürün spesifikasyonunu ve oluşturulan arayüzün ekran görüntüsünü aynı isteğe ekleyerek modelden tutarsızlıkları bulmasını isteyebilirsiniz.
Önceki özel görüntü yaklaşımı için GLM-5V-Turbo API rehberine, belge işleme senaryoları için ise GLM-OCR belge anlama rehberine bakın.
Mimari ve maliyet avantajı
Z.ai, GLM-5.3-Flash’i GLM-5.2’nin eğitim sonrası güncellemesi olarak değil, yeni bir temel model olarak geliştirdi.
Hibrit dikkat mekanizması: Model, doğrusal dikkati seyrek dikkatle birleştirir. Doğrusal dikkat yerel bağımlılıkları düşük maliyetle işlerken, seyrek dikkat küresel olarak ilgili tokenlara erişir. Z.ai’ye göre sonuç:
- GLM-5.3’e kıyasla yaklaşık 3 kat daha az dikkat hesaplaması
- Yaklaşık 4,4 kat daha küçük KV önbelleği
Çok Yüzeyli Kısıtlı Hiper Bağlantılar: Z.ai’nin ölçekleme verimliliği yaklaşımı için kullandığı terimdir. Bağımsız teknik ayrıntılar henüz yeterli olmadığı için bunu doğrulanmış bir avantaj değil, satıcı tarafından belirtilen mimari özellik olarak değerlendirin.
KV önbelleğinin küçülmesi önemlidir: uzun bağlam çıkarımında belleğin başlıca maliyetlerinden biridir. Bu düşüş, modelin 1M token bağlam penceresini korurken GLM-5.2’nin yaklaşık onda biri maliyetle sunulabilmesini açıklıyor.
Eğitim verisi, Z.ai’nin tanımına göre yaklaşık 30 trilyon çok modlu tokenden oluşuyor.
“Flash” gerçekten hızlı mı?
Hayır—en azından uzun üretimlerde değil.
Artificial Analysis, GLM-5.3-Flash için saniyede 48,7 çıktı tokenı ölçüyor. Büyük kardeşi GLM-5.3 ise yaklaşık saniyede 86 token üretiyor. Yani Flash modeli, Flash olmayan sürümün yaklaşık yarı hızında akış yapıyor.
Buna karşılık ilk token süresi güçlü: 1,52 saniye. Açık ağırlıklı modellerde ortalama yaklaşık 2,14 saniye.
Buna göre seçim yapın:
- Çok sayıda kısa, etkileşimli yanıt için: ilk token süresi avantaj sağlar.
- Uzun belgeler veya büyük kod üretimleri için: GLM-5.3 daha yüksek üretim verimi sunar.
- Maliyet, bellek ve çok modluluk önemliyse: GLM-5.3-Flash uygundur.
Bu modelin verimliliği akış hızından değil, maliyet ve bellek tüketiminden gelir.
Kıyaslamalar
Z.ai’nin lansmanda paylaştığı kıyaslamaları, bağımsız olarak doğrulanana kadar satıcı iddiası olarak değerlendirin.
Artificial Analysis, GLM-5.3-Flash’i Intelligence Index v4.1.1’de 57 puanla konumlandırıyor. GLM-5.3 60 puan alıyor. Benzer boyuttaki açık ağırlıklı modellerin medyanı 27 olduğundan, 57 puan sınıfı için güçlü bir sonuçtur.
Z.ai, modelin kodlama ve ajan görevlerinde Claude Opus 4.8’e yaklaştığını söylüyor. Ancak bu ifade satıcının dahili değerlendirmesine dayanır; bağımsız üçüncü taraf sonucu değildir.
GLM değerlendirmelerinin önceki sürümlerdeki gelişimi için GLM-5.2 kıyaslama analizine bakın.
Ox Alpha yük testi
20 Ağustos’ta üçüncü taraf çıkarım platformlarında ox-alpha adlı anonim bir model ortaya çıktı. Model:
- 1M token bağlam penceresi sunuyordu.
- Ücretsizdi.
- Günler içinde en çok kullanılan modellerden biri oldu.
Topluluk, çıktı özelliklerinden bunun Zhipu’ya ait olduğunu yaklaşık 48 saat içinde tespit etti.
26 Ağustos’ta Z.ai, Ox Alpha’nın GLM-5.3-Flash olduğunu doğruladı. Ücretsiz hafta, kasıtlı bir yük testi olarak tasarlanmıştı.
Z.ai ayrıca tüm trafiğin SGLang tabanlı bir yığınla yerel Çin hızlandırıcılarında servis edildiğini ve token başına maliyetin ana akım NVIDIA donanımıyla karşılaştırılabilir olduğunu belirtti. Bu da bağımsız doğrulaması olmayan bir satıcı iddiasıdır.
Benzer anonim lansman modeli daha önce Pony Alpha’nın bir DeepSeek veya GLM modeli olduğunun anlaşılmasında görüldü. Üçüncü taraf yönlendiricilerdeki gizli lansmanlar, yayın öncesi değerlendirme verisi toplamak için yaygınlaşıyor.
Gerçekte nasıl kullanılır?
Barındırılan API
Z.ai uç noktası OpenAI uyumludur. Mevcut istemcinizi şu temel URL’ye yönlendirin:
https://api.z.ai/api/paas/v4/
Model kimliğini şu şekilde ayarlayın:
glm-5.3-flash
Kimlik doğrulama, görüntü yükü ve akıl yürütme parametreleri için GLM-5.3-Flash API rehberini izleyin.
Üçüncü taraf sağlayıcılar
OpenRouter model kimliği:
z-ai/glm-5.3-flash
Model ayrıca Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten ve io.net üzerinden sunuluyor. Bayiler arasında fiyatlar önemli ölçüde değişebilir.
Kodlama ajanları
Flash, GLM Kodlama Planı’na dahildir ve GLM-5.3’ün kullanılabilir kotasının üç katını sunduğu bildirilmektedir. Z.ai belgelerine göre yoğun olmayan saatlerde yapılan çağrılar standart puanların yarısını tüketir.
Kendi kendine barındırma
Ağırlıklar MIT lisanslıdır ve Hugging Face’te zai-org/GLM-5.3-Flash adıyla bulunur. Modeli şu altyapılar destekler:
- vLLM
- SGLang
- TokenSpeed
- KTransformers
Daha küçük donanımlar için GGUF nicelemeleri de mevcuttur.
Hangi modeli seçmelisiniz?
Aşağıdaki durumlarda GLM-5.3-Flash kullanın:
- Metinle aynı istekte görüntü veya video anlamlandırmanız gerekiyorsa
- Token başına maliyet önceliğinizse
- Daha küçük KV önbelleği ve daha düşük bellek kullanımı istiyorsanız
- MIT lisanslı açık ağırlıkları kendiniz barındırmak istiyorsanız
Aşağıdaki durumlarda GLM-5.3 kullanın:
- Akıl yürütme kalitesindeki son birkaç puan önemliyse
- Uzun üretimlerde token/saniye verimi fiyattan önemliyse
Detaylı seçim için GLM-5.3-Flash ve GLM-5.3 karşılaştırmasına ve GLM-5.3 açıklamasına bakın.
OpenAI uyumlu bir uç noktada model değişimi tek satırlık bir model kimliği güncellemesidir. Bu yüzden kıyaslama tablolarına güvenmek yerine iki modeli de kendi gerçek isteklerinizle test edin.
Apidog, gerçek API çağrılarını ve çok modlu istekleri doğrulayıcılarla birlikte yeniden kullanılabilir koleksiyonlar olarak kaydetmenizi sağlar. Böylece GLM-5.3’ten Flash’a geçtiğinizde yanıt biçimindeki değişiklikleri üretime çıkmadan doğrulayabilirsiniz.
Sıkça Sorulan Sorular
GLM-5.3-Flash ücretsiz mi?
Hayır. Ücretsiz Ox Alpha haftası, resmi duyuruyla sona erdi. 9 Eylül 2026’ya kadar %50 lansman indirimi uygulanıyor; ardından liste fiyatları geçerli olacak.
GLM-5.3’ten daha mı hızlı?
Hayır. GLM-5.3 yaklaşık saniyede 86 token üretirken, GLM-5.3-Flash yaklaşık 49 token üretir. Ancak Flash ilk tokena 1,52 saniyede ulaşır.
Gerçekten 1 milyon token bağlam işleyebilir mi?
Yapılandırılmış pencere 1.048.576 tokendir; model yapılandırmasında ve Artificial Analysis tarafından doğrulanmıştır. OpenRouter’ın 1.310.720 tokenlık listesi ise model özelliği değil, sağlayıcı tarafı listesi olarak değerlendirilmelidir.
Video kabul ediyor mu?
Evet. Z.ai belgeleri metin, görüntü, video ve dosya girişini listeler. Video desteği daha yeni olduğundan, üretimde kullanmadan önce kendi medya örneklerinizle test edin.
Ağırlıklar hangi lisans altında?
MIT. Ağırlıklar Hugging Face’te zai-org/GLM-5.3-Flash adıyla yayınlanmıştır.



Top comments (0)