DEV Community

Cover image for GLM-5.3 Kendi Sunucunuzda Barındırma: Açık Kaynak Ağırlıklar İçin Hazırlanın
Tobias Hoffmann
Tobias Hoffmann

Posted on Originally published at apidog.com

GLM-5.3 Kendi Sunucunuzda Barındırma: Açık Kaynak Ağırlıklar İçin Hazırlanın

Zhipu AI, GLM-5.3'ü 14 Ağustos 2026'da piyasaya sürdü ve lansman haberlerinde altyapı ekipleri için en önemli satır gizliydi: açık ağırlıklar yaklaşık iki hafta sonra, 28 Ağustos civarında, Zhipu'nun Hugging Face organizasyonuna geliyor. Bu boşluk bir hediye. Tek bir safetensor parçası kamuya açılmadan önce donanımı boyutlandırmanız, bir sunum yığını seçmeniz ve barındırılan API'ye karşı bir regresyon temelini yakalamanız için size zaman tanıyor.

Apidog'u bugün deneyin

Model bu ön çalışmayı hak ediyor. Zhipu'nun dahili değerlendirmeleri, kodlama yeteneğini GLM-5.2'nin %50 önüne koydu, Terminal-Bench 3.0 4.6'dan 28.3'e sıçradı ve şirket, lansman raporlarına göre ajan performansını "Claude Fable 5'e yaklaşıyor" olarak tanımlıyor. Sınır modellerinin hâlâ gerisinde kaldığı noktalar da dahil olmak üzere tüm kıyaslama hikayesi, GLM-5.3 açıklayıcımızda yer alıyor.

Bu makale tek bir soruya odaklanıyor: GLM-5.3'ü kendi başınıza sunabilmeniz için çıkış gününde nelerin hazır olması gerekiyor?

Açık olmak gerekirse: ağırlıklar bugün indirilemiyor. Aşağıdaki her şey yayın penceresini hedefliyor ve Zhipu'nun doğrulamadığı her şey bir beklenti olarak işaretleniyor, bir gerçek değil. Şu anda yapabileceğiniz şey bir temel oluşturmak ve bunu Apidog aracılığıyla yapmak: bu hafta barındırılan API yanıtlarının anlık görüntüsünü alın, ardından aynı koleksiyonu daha sonra yerel uç noktanıza karşı tekrar oynatın.

Özet

  • GLM-5.3, 14 Ağustos 2026'da piyasaya sürüldü. Zhipu, bugüne kadarki en kapsamlı risk incelemesinden sonra açık ağırlıkların yaklaşık iki hafta sonra, 28 Ağustos civarında geleceğini belirtiyor. Beklenen iniş noktası: huggingface.co/zai-org.
  • GLM-5 ailesi mimarisi, Z.ai belgelerine göre Uzman Karışımıdır (Mixture of Experts): toplam 744B parametre, pas başına yaklaşık 40B aktif parametre ve 200K bağlam. Temel model 5.3'te değişmedi; tüm kazanımlar ölçeklendirilmiş eğitim sonrası süreçten geliyor.
  • 744B parametre için basit bellek aritmetiği: ağırlıklar tek başına BF16'da yaklaşık 1.5 TB, FP8'de bunun yaklaşık yarısı kadar yer kaplar. Bu hesap KV önbelleğini içermez. Tam hassasiyetli kendi kendine barındırma, çoklu GPU sunucu alanıdır.
  • Önceki GLM-5 sürümleri Hugging Face'te eşleştirilmiş BF16 ve FP8 depoları olarak gönderildi. Bu nedenle ilk gün GLM-5.3 ve GLM-5.3-FP8 depolarını bekleyin; topluluk GGUF kuantları günler veya haftalar sonra gelebilir.
  • vLLM ve SGLang, gerçekçi ilk gün sunum yığınlarıdır. Her ikisi de OpenAI uyumlu uç noktalar sunar; bu nedenle Z.ai'nin barındırılan API'sine karşı yazılmış istemci kodu yalnızca base_url değişikliğiyle geçiş yapabilir.
  • Apidog'da şimdi barındırılan-yerel regresyon temeli oluşturun: bir koleksiyon, iki ortam ve hem yanıt şekli hem içerik için iddialar.

Zhipu neyi ve ne zaman yayınlıyor?

Zhipu, uluslararası olarak Z.ai markasıyla GLM-5.3 API lansmanını iki haftalık açık ağırlık vaadiyle birleştirdi: modelin 28 Ağustos 2026 civarında Hugging Face'e gitmesi bekleniyor.

Gecikme keyfi değil. Zhipu, bu sürüm için bugüne kadarki en kapsamlı risk inceleme sistemini kurduğunu belirtiyor. Bu, modelin CyberGym'de Claude Mythos 5 ve GPT-5.6 Sol'ün biraz üzerinde olan %84.5 puanı göz önüne alındığında dikkat çekici. Seeking Alpha, bu sürümü Zhipu'nun yıl boyunca DeepSeek ile el değiştirdiği açık model liderliğini sürdürme çabası olarak çerçeveliyor.

Kendi kendine barındırma açısından iki ayrıntı önemlidir:

  1. Temel model değişmedi. GLM-5.3, ölçeklendirilmiş eğitim sonrası süreçle geliştirilmiş bir GLM-5 tabanıdır. Sunum yığınınızın ihtiyaç duyduğu mimari, vLLM ve SGLang'ın GLM-5 ve GLM-5.2 için zaten kullandığı mimaridir. Yeni bir dikkat varyantı veya tokenleştirici sürprizi beklenmiyor.
  2. Yayın modeli belirlendi. Zhipu'nun Hugging Face organizasyonu GLM-5, GLM-5.1 ve GLM-5.2'yi barındırıyor; her birine FP8 deposu eşlik ediyor. Yalnızca GLM-5.2, 2.69M indirme gösteriyor. GLM-5.3 için de aynı yapıyı bekleyin: bir BF16 safetensor sürümü ve resmi bir FP8 varyantı.

GLM-5.3 için lisans koşulları lansman haberlerinde doğrulanmadı. Ticari bir ürüne dönüştürmeden önce depo görünür hâle geldiğinde model kartını kontrol edin.

Toplam 744B, aktif 40B'nin donanımınız için anlamı

GLM-5 ailesi bir Uzman Karışımı tasarımıdır. Z.ai belgelerine göre toplam 744B parametre, ileri besleme başına yaklaşık 40B aktif parametre ve 200K bağlam sunar. Hugging Face depoları, gömülü modelleri içeren biraz daha yüksek toplamlar listeleyebilir.

Bunlar GLM-5.3'e özel iddialar değil, aile spesifikasyonlarıdır. Ancak temel model değişmediği için doğru planlama sayılarıdır.

MoE tasarımı, bellek ve işlem arasında asimetri yaratır:

  • İşlem, 40B yoğun model gibi davranır. Belirteç başına yalnızca yönlendirilen uzmanlar etkinleşir. Model belleğe sığdığında GPU başına verim, 744B yoğun modelin ima ettiğinden çok daha iyi olabilir.
  • Bellek, 744B model gibi davranır. Her uzmanın adreslenebilir bir yerde bulunması gerekir. Parametre başına 2 baytla BF16 ağırlıklar yaklaşık 1.5 TB; parametre başına 1 baytla FP8 ağırlıklar yaklaşık 744 GB'tır. Bu, yayınlanan rakamlar üzerinden yapılan bir aritmetiktir; test edilmiş bir yapılandırma değildir ve KV önbelleğini içermez.
Hassasiyet Ağırlık kapladığı alan Gerçekçi konum
BF16 ~1.5 TB Çok düğümlü küme veya en büyük tek sunuculu GPU yapılandırmaları
FP8, resmi ~745 GB Yüksek performanslı, tek düğümlü çoklu GPU sunucusu
INT4 sınıfı topluluk kuantları ~370–400 GB Daha küçük çoklu GPU sistemleri; kalite raporlarını bekleyin

Bütçeniz tek bir tüketici GPU'su ise GLM-5.3'ün tam ağırlıkları hedefiniz değildir. Bu sorun değil:

  • Değerlendirme için GPU saatleri kiralayın.
  • Agresif topluluk kuantlarını bekleyin.
  • Daha küçük açık modelleri yerelde çalıştırırken ağır modeli barındırılan API'de tutun.

2026'daki en iyi yerel LLM'ler rehberimiz, bugün tek GPU ve iş istasyonu bütçelerine neyin uyduğunu kapsar.

200K bağlam penceresini de bir bellek kararı olarak değerlendirin. KV önbelleği, bağlam uzunluğu ve parti boyutuyla büyür. Bu nedenle, çıkış gününden önce modelin tavanına varsayılan olarak ayarlamak yerine her dağıtım katmanı için sunulan bağlamı sınırlayın.

Ağırlıklar gelmeden önce sunum yığınınızı seçin

Burada üç sunum yazılımı ailesi önemlidir ve hepsi aynı anda hazır olmayacaktır.

1. vLLM: varsayılan seçenek

vLLM bu ölçekte varsayılan yanıttır:

  • GLM-5 ailesi desteği
  • MoE yönlendirme
  • GPU'lar ve düğümler arasında tensör ve uzman paralelliği
  • Yerel OpenAI uyumlu sunucu

Depo yayınlandığında başlangıç komutunuz şu şablona benzeyebilir:

vllm serve zai-org/GLM-5.3-FP8 \
  --tensor-parallel-size 8 \
  --max-model-len 65536 \
  --served-model-name glm-5.3
Enter fullscreen mode Exit fullscreen mode

Bu bayrakları başlangıç şablonu olarak değerlendirin:

  • Depo adı, Zhipu'nun yayınlandığı andaki adlandırmasına bağlıdır.
  • --tensor-parallel-size, GPU sayınıza ve GPU belleğinize bağlıdır.
  • --max-model-len, KV önbelleği için ayırabileceğiniz belleğe göre seçilmelidir.

2. SGLang: paylaşılan önekler ve ajan iş yükleri

SGLang, güçlü MoE performansı ve radix-tree önek önbelleklemesi nedeniyle ana alternatiftir. Özellikle ajan iş yükleri uzun, ortak sistem istemlerini ve araç tanımlarını tekrar gönderiyorsa faydalıdır.

SGLang de OpenAI uyumlu uç nokta sağlar. Daha sonra vLLM ve SGLang arasında geçiş yapmanız gerekirse istemci kodunu değiştirmek zorunda kalmazsınız.

3. llama.cpp ailesi: GGUF bekleyen yol

llama.cpp, Ollama ve LM Studio, bir safetensor sürümünden günler veya haftalar sonra topluluk tarafından üretilen GGUF dönüşümlerine ihtiyaç duyar.

Bu yol sonunda modeli daha küçük donanımlara getirebilir. Ancak kalite seviyelerini körü körüne kabul etmeyin; her kuantı kendi barındırılan API temel çizginize göre doğrulayın.

Donanımınız varsa bu hafta GLM-5.2'nin genel ağırlıklarıyla yığınınızı kurun ve kuru çalıştırma yapın. Donanımınız yoksa daha küçük bir MoE modeli kullanın. 28 Ağustos'ta CUDA sürücülerini ayıklamak, kaçınılabilir bir hata modudur.

Barındırılan API'yi bugün temel çizginiz olarak kullanın

Çoğu ekibin atladığı hazırlık adımı şudur: bir modeli kendi kendinize barındırmadan önce referans uygulamanın ne ürettiğini kaydedin.

Zhipu'nun barındırılan API'si bu referanstır ve şu anda canlıdır. Yerel dağıtımınız farklı yanıt verdiğinde kaydedilmiş bir temel çizgi, farkın aşağıdakilerden hangisinden kaynaklandığını belirlemenizi sağlar:

  • Kuantizasyon seçimi
  • Sunum yığını hatası
  • Normal örnekleme varyansı
  • İstem veya yapılandırma farkı

Barındırılan API OpenAI uyumludur:

  • Uluslararası uç nokta: https://api.z.ai/api/paas/v4/chat/completions
  • Anakara Çin uç noktası: https://open.bigmodel.cn/api/paas/v4/chat/completions
  • Yetkilendirme: Authorization: Bearer <key>

Z.ai belgeleri bugün glm-5 modelini listeliyor. glm-5.3 aile kuralına uyar; yine de kesin model dizesini resmi belgelerde doğrulayın. Her iki bölge için tam kurulum, GLM-5.3 API hızlı başlangıç kılavuzumuzda yer alıyor.

Sıcaklık 0 ile sabit istemler kullanarak temel çizgileri yakalayın:

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "temperature": 0,
    "messages": [
      {
        "role": "user",
        "content": "Write a Python function that parses RFC 3339 timestamps and returns UTC datetimes. Include error handling for invalid input."
      }
    ]
  }' > baseline-rfc3339.json
Enter fullscreen mode Exit fullscreen mode

Gerçek iş yüklerinizi kapsayan 20 ila 50 temel senaryo oluşturun:

  • Kod üretme görevleri
  • Ajan araç çağrısı kalıpları
  • Uzun bağlam özetleme
  • Yapılandırılmış JSON çıktıları
  • Akış yanıtları

Sıcaklık 0, çıktıları mükemmel biçimde tekrarlanabilir yapmaz. Ancak kuantizasyon kaynaklı kalite düşüşlerinin belirginleşeceği kadar varyansı azaltır.

Regresyon test takımını Apidog'da oluşturun

Ham cURL betikleri, iki uç noktanız, üç kuantizasyon seviyeniz ve ekip arkadaşlarınız farklı yapılandırmaları denemeye başladığında yetersiz kalır. Yapılandırılmış bir test takımı daha iyi ölçeklenir.

Bu, QA mühendisleri için API test kılavuzumuzda ele alınan disiplinle aynı standart API regresyon problemidir.

Apidog kurulumu

  1. Tek koleksiyon oluşturun.

    Her temel istem için sohbet tamamlama yoluna bir istek ekleyin. OpenAI uyumlu şema sayesinde OpenAI tarzı bir spesifikasyonu içe aktarabilir ve istek şeklini doğrulayabilirsiniz.

  2. İki ortam tanımlayın: hosted ve local.

    hosted ortamı:

   base_url = https://api.z.ai/api/paas/v4
   GLM_API_KEY = <barındırılan-api-anahtarı>
Enter fullscreen mode Exit fullscreen mode

local ortamı:

   base_url = http://localhost:8000/v1
   GLM_API_KEY = local-serving
Enter fullscreen mode Exit fullscreen mode

Her istekte hedef URL'yi şu biçimde kullanın:

   {{base_url}}/chat/completions
Enter fullscreen mode Exit fullscreen mode

Böylece hedef değiştirmek tek bir ortam seçimi olur.

  1. Önce yanıt şeklini, sonra içeriği doğrulayın. En az şu iddiaları ekleyin:
  • HTTP durum kodu 200
  • choices[0].message.content boş değil
  • usage bloğu mevcut ve mantıklı
  • Kod üretme senaryolarında yanıt def içeriyor
  • Yanıt datetime ifadesinden bahsediyor
  • Yanıt bir try deseni içeriyor
  1. Barındırılan yanıtları örnek olarak kaydedin.

    Bunlar referans donanımlarınız olur. Yayın günü koleksiyonu local ortamına karşı tekrar çalıştırır ve farkları kontrol edersiniz.

  2. Koleksiyonu CLI üzerinden çalıştırın.

    Apidog'un çalıştırıcısı koleksiyonları başsız biçimde yürütür. Böylece her kuantizasyon seviyesi, sunum yığını veya yapılandırma değişikliği için karşılaştırmayı senaryolaştırabilirsiniz.

28 Ağustos'a kadar hedefiniz, “dağıtımım barındırılan model gibi davranıyor mu?” sorusuna hissiyat yerine istem başına geçme/kalma sonucu veren tek komutluk bir yanıt üretmektir.

İstemci kodunuz değişmez

OpenAI uyumlu sözleşmenin getirisi şudur: barındırılan API'ye karşı yazılmış uygulamalar, yeniden yazım gerektirmeden kendi kendine barındırılan uç noktanıza taşınır.

Hedefi yalnızca bir ortam değişkeniyle kontrol edin:

import os
from openai import OpenAI

# Hosted: GLM_BASE_URL=https://api.z.ai/api/paas/v4
# Local:  GLM_BASE_URL=http://localhost:8000/v1
client = OpenAI(
    base_url=os.environ["GLM_BASE_URL"],
    api_key=os.environ.get("GLM_API_KEY", "local-serving"),
)

response = client.chat.completions.create(
    model="glm-5.3",
    temperature=0,
    messages=[
        {
            "role": "user",
            "content": "Refactor this function to remove the nested loops: ...",
        },
    ],
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

vLLM ve SGLang, sunum sırasında tanımladığınız model adını kabul eder. Örneğin:

--served-model-name glm-5.3
Enter fullscreen mode Exit fullscreen mode

Bu sayede model dizesini barındırılan API kimliğiyle aynı tutabilirsiniz.

Akış, araç çağrıları ve JSON modu aynı yüzeyde çalışır. Ancak özellikle araç çağrısını regresyon testine dahil edin: yerel yığınların barındırılan davranıştan en sık ayrıldığı alanlardan biri budur.

Maliyet çerçevesi: barındırılan API'ye karşı kendi GPU'larınız

Zhipu, lansman sırasında GLM-5.3'e özel API fiyatlandırmasını yayınlamamıştı. Maliyet modellemeden önce güncel rakamlar için resmi fiyatlandırma sayfasını kontrol edin.

Bu nedenle buradaki karşılaştırma belirteç başına değil, yapısaldır.

744B sınıfı bir MoE'yi kendi kendine barındırmak, belirteç akışı olsun veya olmasın GPU kapasitesi için ödeme yapmak anlamına gelir. Bu yaklaşım genellikle üç durumda anlamlıdır:

  1. Belirteç başına ücretlerin amorti edilmiş donanım veya kiralama maliyetini aşacağı kadar yüksek ve sürdürülebilir kullanım varsa.
  2. İstemleri ve çıktıları ağınızda tutmanızı gerektiren veri yönetimi ihtiyaçlarınız varsa.
  3. Paylaşılan bir API'nin garanti edemediği gecikme veya kullanılabilirlik kontrolüne ihtiyacınız varsa.

Bu koşulların altında barındırılan çözümler maliyet açısından daha avantajlı olabilir. Değerlendirme için GPU saatleri kiralamak, doğrulanmamış bir model için donanım satın almaktan daha güvenlidir.

Ayrıca bir korunma argümanı vardır. Sağlayıcı fiyatlandırması değişebilir. DeepSeek'in 2026'daki artışı, lansman oranlarına dayalı birim ekonomisi oluşturan ekipleri etkiledi. Bu konuyu DeepSeek API fiyat artışı analizimizde ele almıştık.

Açık ağırlıklar bu riski sınırlar: barındırılan fiyatlandırma değişirse kendi kendine barındırma yolunuz zaten kanıtlanmış olur.

Yayın günü kontrol listesi

  1. Erişebileceğiniz donanıma göre hedef hassasiyet seviyenizi doğrulayın: BF16, FP8 veya topluluk kuantlarını bekleme.
  2. vLLM veya SGLang'i kurun; GLM-5.2'nin genel ağırlıkları ya da başka bir MoE modeliyle kuru çalıştırma yapın.
  3. Bir Z.ai API anahtarı oluşturun ve tam GLM-5.3 model kimliğini canlı belgelerde doğrulayın.
  4. Barındırılan API'den sıcaklık 0 ile 20 ila 50 temel yanıt yakalayın.
  5. hosted ve local ortamlarını, yanıt şekli iddialarını ve içerik kontrollerini içeren bir Apidog koleksiyonu oluşturun.
  6. Dağıtım katmanı başına maksimum sunulan bağlam uzunluğunu belirleyin.
  7. Yayınlandığında GLM-5.3 ve GLM-5.3-FP8 depoları için huggingface.co/zai-org sayfasını izleyin. Ticari dağıtımdan önce model kartı lisansını okuyun.
  8. Ağırlıkları indirin, sunucuyu başlatın ve local ortamını bu sunucuya yönlendirin.
  9. Apidog koleksiyonunu çalıştırın; yerel yanıtları barındırılan temel çizgilerle karşılaştırın.
  10. Trafiği ölçeklemeden önce içerik düzeyindeki farkları araştırın.
  11. Yalnızca bundan sonra optimizasyona başlayın: kuantizasyon seviyesi, paralellik düzeni, önek önbellekleme ve bağlam limitleri.

Sıkça Sorulan Sorular

GLM-5.3 ağırlıklarını şu anda indirebilir miyim?

Hayır. 14 Ağustos 2026 itibarıyla yalnızca barındırılan API canlıdır. Zhipu, açık ağırlıkların yayınlandıktan yaklaşık iki hafta sonra, 28 Ağustos civarında geleceğini belirtiyor. Beklenen hedef, GLM-5, GLM-5.1 ve GLM-5.2'nin zaten bulunduğu zai-org Hugging Face sayfasıdır.

GLM-5.3 tek bir tüketici GPU'sunda çalışır mı?

Tam ağırlıklarla hayır. Ailenin toplam 744B parametresi, KV önbelleği öncesinde FP8'de yaklaşık 744 GB'tır. Bu, tek bir kartın çok ötesindedir; INT4 sınıfı kuantlar bile çoklu GPU alanına girer.

Tek GPU bütçeleri için daha küçük açık modelleri yerelde çalıştırın ve GLM-5.3'ü barındırılan API'de tutun. Yerel LLM derlememiz neyin uyduğunu listeler.

GLM-5.3 için hangi sunum çerçevesini kullanmalıyım?

vLLM en güvenli varsayılandır: GLM-5 ailesi desteği, MoE farkındalıklı paralellik ve OpenAI uyumlu bir sunucu sunar.

SGLang, iş yükünüz uzun paylaşılan önekleri tekrar gönderiyorsa — örneğin ajan döngülerinde — güçlü bir alternatiftir. llama.cpp ve Ollama yolu ise topluluk GGUF dönüşümleri ortaya çıktıktan sonra açılır.

Mevcut OpenAI SDK kodum kendi kendine barındırılan bir GLM-5.3'e karşı çalışır mı?

Evet. OpenAI uyumlu sözleşmenin amacı budur. SDK'nın base_url değerini https://api.z.ai/api/paas/v4 yerine vLLM veya SGLang sunucunuza yönlendirin ve aynı istek şeklini koruyun.

Özellikle araç çağırma ve akışı test edin; yerel yığınların ara sıra farklılık gösterdiği noktalar bunlardır.

Kendi kendime barındırmayı planlıyorsam neden barındırılan API ile uğraşayım?

Çünkü bu sizin referans uygulamanızdır. Barındırılan temel çizgiler olmadan, garip bir yerel çıktının kuantizasyonunuzun çok agresif olduğu anlamına mı geldiğini yoksa modelin her yerde aynı davranışı mı gösterdiğini anlayamazsınız.

GLM-5.3 API hızlı başlangıç kılavuzundaki kurulumu kullanarak barındırılan uç noktadan şimdi temel çizgileri yakalayın. Böylece yayın günü tahminde bulunmak yerine fark kontrolü yaparsınız.

GLM-5.3 yığınınızda nerede yer alıyor?

GLM-5.3, yılın şimdiye kadarki en güçlü açık ağırlık kodlama duyurusudur: Terminal-Bench 3.0 ve Agents' Last Exam'de açık modeller arasında birinci, iki sınır modelinden daha yüksek bir CyberGym puanı ve kamuya açık bir programa göre gelen ağırlıklar.

İlk haftada değer elde edecek ekipler en büyük GPU bütçelerine sahip olanlar olmayacak. İki haftalık pencereyi hazırlık için kullanan ekipler öne çıkacak:

  • Sunum yığını kurulu
  • Hassasiyet seviyesi seçilmiş
  • Barındırılan temel çizgiler yakalanmış
  • Regresyon test takımı hazır

Yukarıdaki kontrol listesiyle başlayın. Bu hafta barındırılan temel çizgilerinizi yakalayın ve bunları saklamak için Apidog'u indirin: bir koleksiyon, bir hosted ve bir local ortamı, ayrıca her kuantizasyon seviyesi veya sunum bayrağı değişikliğinde yeniden çalıştırabileceğiniz geçme/kalma iddiaları oluşturun.

Top comments (0)