GLM-5.3-Flash adalah model 320 miliar parameter berlisensi MIT. Artinya, Anda bebas menjalankannya dan memodifikasinya—tetapi ukuran modelnya tetap menuntut perangkat keras serius.
Kabar baiknya, hanya 18 miliar dari 320 miliar parameter yang aktif per token. Ditambah bobot terkuantisasi, model ini dapat dijalankan pada konfigurasi yang lebih kecil daripada node produksi 8x H200—meski dengan kompromi kualitas dan kecepatan.
Apa yang Anda muat
| Properti | Nilai |
|---|---|
| Total parameter | 320B |
| Aktif per token | 18B |
| Arsitektur | MoE, perhatian hibrida linear dan sparse |
| Konteks | 1.048.576 token |
| Lisensi | MIT |
| Bobot | zai-org/GLM-5.3-Flash |
| Kuantisasi GGUF | unsloth/GLM-5.3-Flash-GGUF |
Arsitektur mixture-of-experts (MoE) membuat kebutuhan komputasi lebih rendah karena hanya 18B parameter yang aktif untuk setiap token. Namun, seluruh 320B parameter tetap harus berada di memori. Jadi, batas utamanya adalah memori, bukan FLOPs.
Z.ai juga melaporkan cache KV sekitar 4,4 kali lebih kecil dibandingkan GLM-5.3. Ini penting untuk konteks panjang karena cache KV bertambah seiring panjang konteks dan jumlah permintaan paralel.
Tier 1: Presisi penuh untuk produksi
Untuk kualitas penuh dan konkurensi nyata, gunakan node 8x H200 dengan total sekitar 1.128GB VRAM. Node 8x H20 juga dapat digunakan.
Bobot model membutuhkan sekitar 700–800GB, tergantung presisi, sebelum cache KV dan overhead runtime. Kapasitas cloud untuk node ini kira-kira $24–$48 per hari.
Jalankan dengan vLLM
vLLM adalah pilihan umum dengan dukungan ekosistem luas. Gunakan ukuran tensor parallel pangkat dua:
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--trust-remote-code
Mulai dengan --max-model-len lebih kecil, misalnya 8K atau 32K. Meminta konteks 1 juta token langsung akan mengalokasikan cache KV besar dan dapat memicu kehabisan memori.
Jalankan dengan SGLang
SGLang menyediakan dukungan awal untuk model ini, termasuk resep H100, H200, B200, B300, GB200, GB300, dan penyajian multimodal. Z.ai menggunakan stack berbasis SGLang untuk penyajian pra-peluncurannya.
python -m sglang.launch_server \
--model-path zai-org/GLM-5.3-Flash \
--tp 8 \
--context-length 1048576
SGLang sering unggul untuk output terstruktur, agen, dan beban kerja dengan konkurensi tinggi. Bandingkan SGLang dan vLLM pada workload aktual Anda sebelum menentukan default.
Keduanya memerlukan parser panggilan alat agar function calling bekerja dengan benar. Periksa dokumentasi runtime yang Anda gunakan karena nama flag parser dapat berubah antar-rilis.
Tier 2: Kuantisasi untuk perangkat keras lebih kecil
Versi GGUF tersedia di unsloth/GLM-5.3-Flash-GGUF, termasuk format agresif seperti IQ1_S dan IQ2_XXS.
Kuantisasi 2-bit dapat membawa bobot model 320B ke kisaran workstation dengan RAM besar atau rig multi-GPU konsumen, terutama jika Anda menggunakan CPU offload.
Perhatikan dua hal berikut:
- Kuantisasi agresif menurunkan kualitas. IQ1_S jauh dari presisi penuh. MoE mungkin mempertahankan kualitas lebih baik dibanding model dense pada tingkat kuantisasi sama, tetapi tetap uji dengan data dan tugas Anda sendiri.
- Dokumentasi Unsloth masih dalam pengembangan. Format yang tersedia dan konfigurasi rekomendasi dapat berubah. Verifikasi artefak yang benar-benar dipublikasikan sebelum merancang deployment.
Untuk deployment CPU-heavy atau hibrida, gunakan KTransformers. Runtime ini menyimpan pakar MoE di RAM sistem dan hanya memindahkan pakar yang diperlukan ke GPU. Ini cocok untuk model MoE dengan 18B parameter aktif per token. TokenSpeed juga tercantum sebagai runtime yang didukung.
Panduan menjalankan GLM-4.7-Flash secara lokal membahas alur kerja lokal untuk model yang lebih kecil. Untuk dasar setup GLM lokal, lihat menjalankan GLM-5 secara lokal secara gratis.
Hitung anggaran memori
Dua komponen menentukan apakah deployment Anda muat.
1. Bobot model
- BF16: sekitar 2 byte per parameter, atau sekitar 640GB untuk 320B parameter sebelum overhead.
- FP8: kira-kira setengah dari BF16.
- Kuantisasi 4-bit: sekitar 160GB.
- Kuantisasi 2-bit: lebih kecil lagi, dengan penurunan kualitas yang nyata.
2. Cache KV
Cache KV bertambah sesuai panjang konteks dan konkurensi. Deployment yang lancar pada 8K token bisa gagal di 128K token, meski bobot modelnya sama.
Gunakan panjang konteks aktual aplikasi Anda, bukan maksimum 1 juta token yang diiklankan. Menyediakan cache untuk konteks yang tidak pernah digunakan adalah cara tercepat membuat deployment terlihat tidak terjangkau.
Jika Anda mengikuti pembahasan sebelumnya, panduan self-hosting GLM-5.3 ditulis sebelum rilis. Bobot GLM-5.3-Flash kini tersedia di bawah lisensi MIT, sehingga panduan ini menggantikannya.
Fine-tuning
Lisensi MIT mengizinkan fine-tuning dan redistribusi. Ini adalah alasan kuat untuk menyimpan bobot sendiri.
Namun, fine-tuning penuh model 320B berada di luar jangkauan sebagian besar tim. Gunakan metode hemat parameter seperti LoRA.
Pada model MoE, Anda perlu memutuskan lapisan mana yang diadaptasi:
- router,
- pakar,
- lapisan perhatian,
- atau kombinasi beberapa komponen.
Jika kebutuhan Anda hanya adaptasi domain, uji prompting dan retrieval terlebih dahulu. Dengan konteks hingga 1 juta token, memasukkan pengetahuan domain ke prompt sering kali lebih murah daripada melatih model.
Pengaturan sampling
Z.ai merekomendasikan pengaturan berikut:
| Kasus penggunaan | temperature |
top_p |
|---|---|---|
| Umum | 1.0 | 0.95 |
| Pengkodean | 0.95 | 1.0 |
Model juga mendukung reasoning_effort dengan nilai low, high, dan max.
max adalah default. Pada hardware lokal, gunakan low jika kecepatan generasi menjadi masalah. Token penalaran berarti waktu inferensi tambahan yang Anda tanggung sendiri.
Apakah self-hosting lebih murah?
Biasanya tidak.
Dengan harga daftar, GLM-5.3-Flash berharga $0,15 per juta token input. Node 8x H200 sewaan sekitar $1.000 per bulan setara dengan sekitar 6,7 miliar token input API.
Self-hosting masuk akal jika Anda membutuhkan:
- kedaulatan dan privasi data;
- tidak ada batas tarif;
- kontrol atas ketersediaan;
- kemampuan memodifikasi, fine-tune, dan mendistribusikan ulang model;
- penggunaan GPU yang sudah dimiliki dan menganggur.
Jika hardware sudah tersedia, biaya marginal utamanya adalah listrik. Untuk membandingkan biaya API lebih lanjut, lihat analisis harga GLM-5.3-Flash.
Verifikasi deployment
vLLM dan SGLang menyediakan endpoint yang kompatibel dengan OpenAI. Uji server lokal Anda dengan permintaan berikut:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [{"role": "user", "content": "reply with OK"}]
}'
Jangan berhenti pada smoke test. Uji juga:
- konteks panjang pada ukuran yang benar-benar digunakan;
- input gambar bila Anda melayani multimodal;
- tool calling dengan schema produksi;
- throughput di bawah konkurensi;
- kualitas versi terkuantisasi pada dataset evaluasi Anda.
Gunakan Apidog untuk menyimpan koleksi pengujian, lalu arahkan URL dasar melalui environment variable ke server lokal dan endpoint Z.ai. Jalankan suite yang sama pada keduanya untuk menemukan regresi pada schema alat, output terstruktur, atau perilaku konteks panjang sebelum masuk produksi.
FAQ
Apa hardware minimum?
Untuk presisi penuh, gunakan node kelas 8x H200. Untuk GGUF terkuantisasi, kebutuhan jauh lebih rendah, tetapi kualitas menurun seiring kuantisasi.
Apakah seluruh 320B parameter harus ada di memori?
Ya. Hanya 18B aktif per token, tetapi seluruh bobot harus tersedia di memori.
Mana yang lebih baik: vLLM atau SGLang?
SGLang mendukung model ini sejak awal, termasuk multimodal, dan sering unggul pada konkurensi serta output terstruktur. vLLM memiliki ekosistem lebih luas. Uji keduanya pada workload Anda.
Bisakah dijalankan pada satu GPU?
Tidak untuk presisi penuh. Dengan kuantisasi agresif dan CPU offload melalui KTransformers, satu GPU dengan VRAM besar dan RAM sistem besar mungkin dapat menjalankannya, tetapi generasinya akan lambat.
Apakah lisensinya benar-benar MIT?
Ya. Bobotnya dirilis dengan lisensi MIT, yang mengizinkan penggunaan komersial, modifikasi, dan redistribusi.
Top comments (0)