GLM-5.3-Flash saat ini tersedia dengan harga setengah. Promo berakhir pada 9 September 2026; setelah itu, semua proyeksi biaya berdasarkan tarif hari ini akan berlipat ganda.
Artikel ini membahas tarif saat ini dan setelah promo, perbandingannya dengan alternatif lain, serta cara menentukan apakah selisih harga tersebut penting untuk beban kerja Anda. Semua angka diverifikasi pada 27 Agustus 2026. Harga dapat berubah, jadi konfirmasikan kembali kepada penyedia sebelum menetapkan anggaran.
Kartu tarif
| Jenis token | Harga peluncuran hingga 9 September 2026 | Harga daftar setelah promo |
|---|---|---|
| Masukan | $0.075 / 1 juta token | $0.15 / 1 juta token |
| Keluaran | $0.25 / 1 juta token | $0.50 / 1 juta token |
| Masukan dalam cache | $0.015 / 1 juta token | $0.03 / 1 juta token |
Artificial Analysis menerbitkan angka gabungan $0.10 per satu juta token berdasarkan rasio cache-hit terhadap input terhadap output sebesar 7:2:1. Angka ini berguna untuk perbandingan, tetapi tagihan Anda ditentukan oleh rasio penggunaan yang sebenarnya.
Contoh biaya nyata
Tarif per juta token sulit dibayangkan. Berikut tiga contoh menggunakan harga daftar, yaitu angka yang relevan untuk perencanaan setelah 9 September.
Pengklasifikasi dukungan
- 100.000 tiket per bulan
- 800 token masukan dan 100 token keluaran per tiket
- Total: 80 juta token masukan dan 10 juta token keluaran
- Biaya: $12.00 masukan + $5.00 keluaran = $17 per bulan
Gunakan reasoning_effort: low untuk mengurangi penggunaan token keluaran.
Asisten pengkodean
- 500 sesi per hari
- 15.000 token masukan per sesi, termasuk konteks file yang berulang
- 2.000 token keluaran per sesi
- Total bulanan: 225 juta token masukan dan 30 juta token keluaran
Tanpa caching:
- Masukan: $33.75
- Keluaran: $15.00
- Total: $48.75 per bulan
Jika 70% masukan menggunakan cache, biaya masukan turun menjadi sekitar $14.85 dan totalnya menjadi sekitar $30 per bulan.
Pipeline dokumen dengan gambar
- 10.000 dokumen per bulan
- 40.000 token per dokumen, termasuk konten gambar
- 1.500 token keluaran per dokumen
- Total: 400 juta token masukan dan 15 juta token keluaran
- Biaya: $60.00 masukan + $7.50 keluaran = $67.50 per bulan
Ketiga skenario ini relatif murah. Itulah tujuan GLM-5.3-Flash.
Pengungkit biaya terbesar: caching
Setelah promo, token dalam cache berharga $0.03 per juta, sedangkan token baru berharga $0.15 per juta. Artinya, token yang di-cache hanya berharga seperlima dari token baru.
Untuk beban kerja dengan prompt sistem, dokumen, atau basis kode yang stabil:
- Letakkan konten yang stabil di awal prompt.
- Letakkan konten dinamis di bagian akhir.
- Pastikan awalan prompt identik di setiap panggilan.
- Hindari menempatkan stempel waktu, ID permintaan, atau nama pengguna di awal prompt.
Perubahan kecil di bagian depan prompt dapat membatalkan caching untuk seluruh bagian setelahnya.
Z.ai juga mencantumkan caching input sebagai gratis untuk periode terbatas. Anggap ini sebagai promosi dan verifikasi syarat terbaru sebelum membangun arsitektur yang bergantung padanya.
Pengungkit kedua: upaya penalaran
reasoning_effort secara default diatur ke max, yaitu opsi paling mahal. Jika parameter ini tidak diubah, model akan menggunakan pengaturan tersebut.
Mode yang tersedia:
lowhighmax
Token penalaran ditagih sebagai token keluaran. Untuk klasifikasi, ekstraksi, routing, dan pemformatan, low sering kali sudah memadai dan dapat mengurangi biaya keluaran secara signifikan.
Lihat pengaturan lengkapnya di panduan API GLM-5.3-Flash. Mengubah parameter ini hanya membutuhkan satu baris kode dan merupakan langkah pertama jika tagihan lebih tinggi dari perkiraan.
Perbandingan harga
Dibandingkan GLM-5.3
| Model | Harga gabungan per 1 juta token |
|---|---|
| GLM-5.3-Flash | $0.10 |
| GLM-5.3 | $0.90 |
Selisihnya sekitar sembilan kali lipat, sementara perbedaan Artificial Analysis Intelligence Index hanya tiga poin: 57 berbanding 60.
Perbandingan lengkap GLM-5.3-Flash dan GLM-5.3 membahas kapan pertukaran ini tidak sepadan. Jawaban singkatnya: ketika Anda melakukan streaming respons panjang kepada manusia yang menunggu, karena GLM-5.3 menghasilkan respons hampir dua kali lebih cepat.
Dibandingkan GLM-5.2
Menurut Z.ai, GLM-5.3-Flash memiliki harga sekitar sepersepuluh GLM-5.2, selain angka biaya per tugas sebesar $0.045.
Gunakan rincian harga GLM-5.2 sebagai referensi jika Anda sedang menganggarkan migrasi.
Dibandingkan model multimodal murah lainnya
GLM-5.3-Flash kompetitif dalam harga dan memiliki lisensi MIT, sehingga opsi self-hosting tetap terbuka. Pembahasan harga Gemini 3.7 Flash membahas alternatif Google yang paling dekat.
Harga reseller dapat berbeda jauh
Selain Z.ai, GLM-5.3-Flash tersedia melalui:
- OpenRouter
- Cloudflare Workers AI
- Vercel AI Gateway
- DeepInfra
- Novita
- GMICloud
- Baseten
- io.net
Harga setiap penyedia tidak selalu sama. AIHubMix, misalnya, mencantumkan sekitar $0.113 untuk masukan dan $0.394 untuk keluaran—di antara harga promosi dan harga daftar Z.ai.
Beberapa penyedia meneruskan diskon peluncuran, sedangkan penyedia lain tidak. Jika menggunakan agregator, periksa tarif aktualnya. Gateway terpadu mungkin mengenakan margin, tetapi pada tingkat harga ini, mark-up persentase kecil sering kali masih dapat diterima demi kenyamanan.
Kapan self-hosting lebih unggul?
Bobot model berlisensi MIT, sehingga self-hosting merupakan pilihan yang nyata. Namun, harga API yang rendah membuat titik impas self-hosting menjadi lebih sulit dicapai.
Sebagai gambaran kasar:
- Serving presisi penuh memerlukan node kelas H200 8x.
- Biaya cloud sewaan berkisar $24–$48 per hari.
- Dengan asumsi biaya tetap sekitar $1.000 per bulan, biaya tersebut berlaku baik saat node sibuk maupun menganggur.
Dengan harga daftar API, $1.000 dapat membeli sekitar 6,7 miliar token masukan. Anda memerlukan volume yang sangat besar dan stabil sebelum biaya tetap sebuah node lebih murah daripada API.
Bagi sebagian besar tim, self-hosting GLM-5.3-Flash lebih berkaitan dengan:
- Kontrol infrastruktur
- Residensi data
- Persyaratan lisensi
- Kepatuhan
Pengecualiannya adalah model terkuantisasi. Build GGUF tersedia, dan menjalankan model terkuantisasi pada perangkat keras yang sudah dimiliki mengubah perhitungannya karena biaya marginalnya hanya listrik. Panduan menjalankan GLM-5.3-Flash secara lokal menjelaskan kemampuan setiap tingkat perangkat keras.
Alternatif: paket pengkodean
Jika Anda menggunakan model ini sebagai developer di Claude Code atau Cline, bukan sebagai aplikasi yang melakukan panggilan API, harga per token mungkin bukan pilihan yang tepat.
Paket Pengkodean GLM dimulai sekitar $18 per bulan dan mencakup GLM-5.3-Flash. Paket ini dilaporkan memberikan tiga kali lipat kuota yang dapat digunakan dibandingkan GLM-5.3. Dokumentasi Z.ai juga menyebutkan bahwa panggilan di luar jam sibuk mengonsumsi setengah poin standar.
Untuk developer tunggal yang melakukan coding setiap hari, paket flat-rate biasanya lebih murah dan lebih mudah diprediksi daripada API berbasis penggunaan.
- Panduan menghubungkan GLM-5.3-Flash ke Claude Code dan Cline
- Perbandingan Claude Code, Codex, Cursor, MiniMax Plan, dan GLM Plan
Jangan abaikan biaya keluaran
Biaya masukan mendapat banyak perhatian karena volumenya biasanya lebih besar. Namun, biaya keluaran sering menjadi sumber pembengkakan anggaran karena dua alasan:
- Token keluaran berharga lebih dari tiga kali token masukan: $0.50 berbanding $0.15 per juta token.
- Token penalaran juga ditagih sebagai keluaran.
Model dengan reasoning_effort: max dapat menghasilkan beberapa kali lebih banyak token daripada jawaban akhirnya. Semua token tersebut tetap dibebankan pada tarif keluaran.
Akibatnya, aplikasi dengan prompt sederhana tetapi respons panjang dapat didominasi biaya keluaran meskipun terlihat berat di sisi masukan. Angka gabungan $0.10 per juta token menggunakan rasio 7:2:1 yang mungkin tidak sesuai dengan beban kerja Anda.
Gunakan pengukuran nyata, bukan estimasi:
- Ambil objek
usagedari setiap respons penyelesaian. - Catat token masukan, keluaran, dan cache.
- Agregasikan berdasarkan model, fitur, atau pengguna.
- Bandingkan rasio aktual dengan asumsi anggaran.
Jika token keluaran melebihi sekitar 15% dari total token, periksa reasoning_effort terlebih dahulu, lalu panjang prompt.
Checklist sebelum 9 September
- Ukur campuran token aktual. Rasio harga gabungan 7:2:1 mungkin tidak cocok dengan penggunaan Anda.
- Periksa tingkat cache hit. Selisih harga antara input baru dan input cache adalah 5x.
- Hitung ulang biaya menggunakan harga daftar. Tarif akan berlipat ganda mulai 10 September.
- Uji beban kerja yang paling banyak menggunakan token keluaran.
- Bandingkan tarif reseller dengan tarif penyedia langsung.
- Evaluasi paket flat-rate jika penggunaan utama Anda adalah coding.
Untuk mengukur penggunaan secara konsisten, jalankan panggilan representatif sebagai koleksi tersimpan di Apidog, lalu gunakan ID model sebagai variabel lingkungan. Anda dapat melihat penggunaan per permintaan dan menjalankan rangkaian yang sama terhadap GLM-5.3 untuk membandingkan tagihan aktual, bukan klaim pemasaran.
FAQ
Apakah GLM-5.3-Flash gratis?
Tidak. Model ini sempat gratis selama sekitar seminggu ketika berjalan secara anonim sebagai “ox-alpha” sebelum peluncuran, tetapi periode tersebut sudah berakhir. Diskon 50% tidak sama dengan gratis.
Kapan diskon berakhir?
Pada 9 September 2026. Harga daftar berlaku mulai tanggal tersebut.
Mengapa situs yang berbeda mencantumkan harga berbeda?
Sebagian situs menggunakan tarif promosi, sebagian menggunakan harga daftar, dan reseller menetapkan margin sendiri. Selalu periksa penyedia yang benar-benar Anda gunakan.
Apakah input gambar dikenakan biaya tambahan?
Gambar mengonsumsi token konteks dan ditagih sebagai input. Tidak ada biaya gambar terpisah, tetapi gambar beresolusi tinggi dapat menggunakan token dalam jumlah besar.
Apakah self-hosting lebih murah?
Hanya pada volume berkelanjutan yang sangat besar, atau jika Anda sudah memiliki perangkat keras untuk menjalankan build terkuantisasi. Dengan harga $0.15 per juta token masukan, menyewa node H200 8x sulit dibenarkan hanya berdasarkan biaya.
Top comments (0)