GLM-5.3-Flash Fiyatlandırması: İndirim Bitmeden Önce Bilmeniz Gerekenler
GLM-5.3-Flash şu anda yarı fiyatına sunuluyor. Bu fırsat 9 Eylül 2026'da sona erecek. Sonrasında, bugünkü oranlarla yapılan maliyet tahminleri iki katına çıkacak.
Bu yazıda modelin mevcut maliyetini, indirim sonrası fiyatını, alternatiflerle karşılaştırmasını ve fiyat farkının iş yükünüz için önemli olup olmadığını ele alıyoruz. Tüm rakamlar 27 Ağustos 2026'da doğrulandı. Fiyatlandırma sayfaları değişebileceği için bütçenizi onaylamadan önce sağlayıcınızın güncel fiyatlarını kontrol edin.
Fiyat kartı
| Lansman fiyatı (9 Eylül 2026'ya kadar) |
Liste fiyatı (9 Eylül sonrası) |
|
|---|---|---|
| Girdi | $0.075 / 1M token | $0.15 / 1M token |
| Çıktı | $0.25 / 1M token | $0.50 / 1M token |
| Önbelleğe alınmış girdi | $0.015 / 1M token | $0.03 / 1M token |
Yapay Analiz, 7:2:1 önbellek isabeti ile girdi ve çıktı oranlarını kullanarak milyon token başına $0.10 karma bir oran yayınlıyor. Karşılaştırma için kullanışlı olsa da gerçek faturanızı kendi token dağılımınız belirler.
Gerçek iş yüklerinde maliyet
Milyon token başına fiyatları somutlaştırmak için aşağıdaki hesaplamalar liste fiyatı üzerinden yapılmıştır.
Destek sınıflandırıcısı
Ayda 100.000 bilet, bilet başına yaklaşık 800 girdi tokenı ve 100 çıktı tokenı:
- 80M girdi tokenı: $12.00
- 10M çıktı tokenı: $5.00
- Toplam: aylık $17
Sınıflandırma gibi görevlerde reasoning_effort değerini low yapmak çıktı miktarını daha da azaltabilir.
Kodlama asistanı
Günde 500 oturum, oturum başına yaklaşık 15.000 girdi tokenı ve 2.000 çıktı tokenı:
- Aylık 225M girdi tokenı
- Aylık 30M çıktı tokenı
- Önbellekleme olmadan: $33.75 + $15.00 = $48.75/ay
- Girdinin %70'i önbelleğe alındığında: yaklaşık $30/ay
Görüntülü belge işlem hattı
Ayda 10.000 belge, belge başına görüntü içeriği dahil yaklaşık 40.000 girdi tokenı ve 1.500 çıktı tokenı:
- 400M girdi tokenı: $60.00
- 15M çıktı tokenı: $7.50
- Toplam: aylık $67.50
Bunlar büyük rakamlar değil. GLM-5.3-Flash'ın hedefi de düşük maliyetli, yüksek hacimli iş yükleri.
En büyük kaldıraç: önbelleğe alınmış girdi
Önbelleğe alınmış tokenlar milyon başına $0.03 ile yeni girdinin $0.15 fiyatının beşte birine mal oluyor.
Aşağıdaki içerikleri çağrılar arasında sabit tutabiliyorsanız önbelleklemeden yararlanın:
- Sistem komutları
- Sabit ön ekler
- Tekrar tekrar sorgulanan belgeler
- Kod tabanı bağlamı
Önbellek isabet oranını bozan yaygın hata, istemin başına değişken veri eklemektir. Sistem istemindeki zaman damgası, istek kimliği veya kullanıcı adı, kendisinden sonraki içeriğin tamamını geçersiz kılabilir.
Sabit içeriği önce, değişken içeriği sona koyun.
Z.ai ayrıca önbelleğe alınmış girdi depolamasını sınırlı bir süre için ücretsiz olarak listeledi. Bunu kalıcı bir garanti değil, geçici bir promosyon olarak değerlendirin ve güncel şartları doğrulamadan buna dayalı mimari kurmayın.
İkinci kaldıraç: akıl yürütme çabası
reasoning_effort varsayılan olarak max değerindedir. Parametreyi değiştirmezseniz en pahalı ayarı kullanırsınız.
Desteklenen modlar:
lowhighmax
Akıl yürütme tokenları çıktı olarak faturalandırılır. Bu nedenle sınıflandırma, çıkarma, yönlendirme ve biçimlendirme gibi görevlerde low kullanmak çıktı maliyetini önemli ölçüde azaltabilir.
Kurulum ayrıntıları API kılavuzumuzda yer alıyor. Faturanız yukarıdaki hesaplamalardan yüksek görünüyorsa kontrol etmeniz gereken ilk ayarlardan biri budur.
Alternatiflerle karşılaştırma
GLM-5.3-Flash ve kardeş modeli GLM-5.3 için liste fiyatına göre yaklaşık karma oranlar:
| Model | 1M token başına karma oran |
|---|---|
| GLM-5.3-Flash | $0.10 |
| GLM-5.3 | $0.90 |
Yapay Analiz Zeka Endeksi'nde 57'ye karşı 60 puanla yalnızca üç puanlık fark olmasına rağmen arada yaklaşık dokuz katlık fiyat farkı var.
GLM-5.3-Flash ve GLM-5.3 karşılaştırmamız, bu takasın ne zaman tersine dönebileceğini ele alıyor. Kısa cevap: Bir insanın beklediği ve uzun yanıtların akışla iletilmesi gereken durumlarda GLM-5.3 neredeyse iki kat daha hızlı üretim yapıyor.
GLM-5.2 ile karşılaştırıldığında Z.ai, GLM-5.3-Flash'ın yaklaşık onda bir fiyatına sunulduğunu ve görev başına maliyetin yaklaşık $0.045 olduğunu belirtiyor. Geçiş planı yapıyorsanız GLM-5.2 fiyatlandırma dökümümüze göz atabilirsiniz.
Diğer sağlayıcıların düşük maliyetli çok modlu modelleriyle karşılaştırıldığında GLM-5.3-Flash, rekabetçi fiyatına ek olarak MIT lisansına sahip olmasıyla ayrışıyor. Bu da kendi kendine barındırma seçeneğini açık tutuyor. Google tarafındaki en yakın karşılaştırma için Gemini 3.7 Flash fiyatlandırma yazımıza bakabilirsiniz.
Sağlayıcı fiyatlarını ayrıca kontrol edin
Model doğrudan Z.ai üzerinden ve aşağıdaki platformlarda kullanılabiliyor:
- OpenRouter
- Cloudflare Workers AI
- Vercel AI Gateway
- DeepInfra
- Novita
- GMICloud
- Baseten
- io.net
Bu sağlayıcıların tamamı aynı fiyatı uygulamıyor. Örneğin AIHubMix, Z.ai'nin promosyon ve liste fiyatları arasında kalan yaklaşık şu oranları listeledi:
- Girdi: $0.113 / 1M token
- Çıktı: $0.394 / 1M token
Bazı sağlayıcılar lansman indirimini yansıtırken bazıları yansıtmıyor. Bir toplayıcı üzerinden yönlendirme yapıyorsanız güncel oranı doğrudan kontrol edin. Birleşik ağ geçitlerinin kolaylığı bazen ek marjla birlikte gelir.
Kendi kendine barındırma ne zaman mantıklı?
Ağırlıklar MIT lisanslı olduğu için modeli kendi altyapınızda çalıştırmak mümkün. Ancak API fiyatları bu kadar düştüğünde, yalnızca maliyet açısından başa baş noktasına ulaşmak zorlaşıyor.
Kabaca bir hesapla tam hassasiyetli servis, kiralık bulut kapasitesinde günde yaklaşık $24–$48 maliyetli 8x H200 sınıfı bir düğüm gerektirebilir. Aylık sabit maliyeti yaklaşık $1.000 kabul edersek:
- Liste API fiyatıyla $1.000 yaklaşık 6,7 milyar girdi tokenı satın alır.
- Düğümün sabit maliyetini aşmak için çok yüksek ve sürekli bir hacim gerekir.
- Çoğu ekip için kendi kendine barındırma maliyetten çok kontrol, veri ikametgahı ve lisanslama nedeniyle tercih edilir.
İstisna, nicemlenmiş modellerdir. GGUF nicemlemeleri mevcut olduğundan, zaten sahip olduğunuz donanımda nicemlenmiş bir model çalıştırmak hesabı değiştirir. Bu senaryoda marjinal maliyet çoğunlukla elektriktir.
Donanım seçenekleri için yerel çalıştırma kılavuzumuza bakabilirsiniz.
Kodlama planı alternatifi
Kullanımınız API çağrıları yapan bir uygulama yerine Claude Code veya Cline üzerinde çalışan bir geliştiriciyse token başına fiyatlandırma sizin için doğru model olmayabilir.
GLM Kodlama Planı:
- Aylık yaklaşık $18'dan başlar.
- GLM-5.3-Flash'ı içerir.
- Bildirildiğine göre GLM-5.3 planının üç katı kullanılabilir kota sağlar.
- Z.ai belgelerine göre yoğun olmayan saatlerde çağrılar standart puanların yarısını tüketir.
Her gün kod yazan tek bir geliştirici için sabit fiyatlı plan, ölçülü API kullanımından daha ucuz ve daha öngörülebilir olabilir.
Kurulum için Claude Code ve Cline kılavuzumuzu, alternatifleri karşılaştırmak için kodlama planları karşılaştırmamızı inceleyin.
Çıktı tokenlarını izleyin
Girdi fiyatları daha yüksek token hacimleri nedeniyle öne çıkar; ancak bütçeler çoğu zaman çıktı tarafında aşılır:
- Çıktı tokenları girdi tokenlarından üç kattan daha pahalıdır: $0.50 karşısında $0.15.
- Akıl yürütme tokenları çıktı olarak faturalandırılır.
-
maxakıl yürütme ayarı, nihai yanıtta görünenden birkaç kat fazla token üretebilir.
Bu nedenle mütevazı istemlere konuşkan yanıtlar veren bir uygulama, kağıt üzerinde girdi ağırlıklı görünse bile gerçekte çıktı ağırlıklı olabilir. $0.10 karma oranı, birçok iş yükünün uymadığı 7:2:1 dağılımını varsayar.
Tahmin yerine ölçüm yapın. Her tamamlamanın usage nesnesi çağrıya ait token sayılarını taşır. Bu veriyi kaydedip topladıktan sonra gerçek dağılımınızı bütçenizdeki varsayımla karşılaştırın.
Çıktı, toplam token kullanımınızın yaklaşık %15'ini aşıyorsa önce reasoning_effort ayarını, ardından istem uzunluğunu kontrol edin.
9 Eylül'den önce yapılacaklar
İndirim sona ermeden önce şu üç adımı uygulayın:
- Gerçek token dağılımınızı ölçün. Karma oran 7:2:1'i varsayar. Kullanımınız çıktı ağırlıklıysa gerçek maliyetiniz $0.10 karma orandan çok $0.50 çıktı oranına yaklaşır.
- Önbellek isabet oranınızı kontrol edin. Önbelleğe alınmış ve yeni girdi arasında beş kat fiyat farkı var.
- Bütçeyi liste fiyatıyla yeniden hesaplayın. 10 Eylül'de liste fiyatları geçerli olacak ve maliyetler yaklaşık iki katına çıkacak. İş yükünüz yalnızca promosyon fiyatıyla sürdürülebiliyorsa sorunu şimdiden çözün.
Gerçek token kullanımını izlemek için her tamamlamadaki usage nesnesinden girdi, çıktı ve önbelleğe alınmış token sayılarını kaydedin. Temsili çağrıları Apidog üzerinde kaydedilmiş bir koleksiyon olarak çalıştırıp model kimliğini ortam değişkeniyle değiştirebilirsiniz. Böylece faturaları pazarlama tahminleriyle değil, aynı paketi GLM-5.3 üzerinde yeniden çalıştırarak karşılaştırabilirsiniz.
Sıkça Sorulan Sorular
GLM-5.3-Flash ücretsiz mi?
Hayır. Model, lansmandan önce yaklaşık bir hafta boyunca ox-alpha adıyla anonim olarak ücretsiz çalışıyordu; bu duyuruyla birlikte dönem sona erdi. Mevcut %50 indirim ücretsiz kullanım anlamına gelmez.
İndirim tam olarak ne zaman sona eriyor?
9 Eylül 2026'da sona eriyor. Liste fiyatları bu tarihten itibaren geçerli olacak.
Neden farklı siteler farklı fiyatlar belirtiyor?
Bazı siteler promosyon oranını, bazıları liste fiyatını gösterir. Ayrıca sağlayıcılar kendi marjlarını belirler. Gerçek kullanım sağlayıcınızın güncel fiyatını kontrol edin.
Görüntü girişi ek ücrete tabi mi?
Görüntüler bağlam tokenı tüketir ve girdi olarak faturalandırılır. Ayrı bir görüntü ek ücreti yoktur; ancak yüksek çözünürlüklü bir görüntü önemli miktarda token tüketebilir.
Kendi kendine barındırmak daha mı ucuz?
Yalnızca çok yüksek ve sürekli hacimlerde veya zaten sahip olduğunuz donanımda nicemlenmiş bir model çalıştırıyorsanız. Milyon girdi tokenı başına $0.15 fiyatla 8x H200 düğümünü yalnızca maliyet açısından haklı çıkarmak zordur.
Top comments (0)