Zhipu AI, laboratorium Tiongkok yang beroperasi secara internasional sebagai Z.ai, merilis GLM-5.3 pada 14 Agustus 2026. Sorotan utamanya adalah kemampuan pengkodean: evaluasi internal menunjukkan peningkatan 50% dibandingkan GLM-5.2, skor Terminal-Bench 3.0 naik dari 4.6 menjadi 28.3, dan Zhipu menyebut kemampuan coding serta agen model ini “mendekati Claude Fable 5”, menurut laporan peluncuran BigGo. Bobot terbuka akan menyusul sekitar dua minggu kemudian. Untuk rincian kemampuan dan tabel benchmark, baca apa itu GLM-5.3; artikel ini berfokus pada implementasi API.
Dalam panduan ini, Anda akan mendapatkan kunci API, menjalankan request pertama dengan cURL, menggunakan Python dan Node.js melalui OpenAI SDK, melakukan streaming token, mengatur parameter penting, serta menguji request di Apidog. API Z.ai kompatibel dengan OpenAI, sehingga kode berbasis endpoint OpenAI-style umumnya hanya membutuhkan perubahan base_url dan ID model.
GLM-5.3 baru dirilis dan dokumentasi Zhipu dapat berubah cepat setelah peluncuran. Contoh di bawah menggunakan informasi yang tersedia saat penulisan. Selalu verifikasi ID model, harga, kuota, dan batas laju di dokumentasi resmi sebelum deployment produksi.
Intisari
- GLM-5.3 dirilis pada 14 Agustus 2026. Evaluasi internal Zhipu melaporkan peningkatan kemampuan pengkodean 50% dibandingkan GLM-5.2 dan skor Terminal-Bench 3.0 naik dari 4.6 menjadi 28.3.
- API kompatibel dengan OpenAI. Endpoint internasional:
POST https://api.z.ai/api/paas/v4/chat/completions
Endpoint Tiongkok daratan:
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
- Autentikasi menggunakan header:
Authorization: Bearer $GLM_API_KEY
- Saat penulisan, dokumentasi GLM-5 mencantumkan
glm-5sebagai ID model. Konvensi keluarga menunjukkanglm-5.3kemungkinan menjadi ID spesifik rilis, tetapi jangan hardcode sebelum mengonfirmasi. - Zhipu belum mempublikasikan harga khusus GLM-5.3 saat peluncuran. Halaman harga resmi mencantumkan GLM-5.2 sebesar $1.40 per 1 juta token input dan $4.40 per 1 juta token output.
- Bobot terbuka direncanakan tersedia di Hugging Face sekitar 28 Agustus 2026.
- Uji request di Apidog sebelum menulis kode aplikasi: gunakan environment terpisah untuk setiap wilayah, variabel untuk model ID, dan fixture respons untuk mengurangi konsumsi token.
Mengapa GLM-5.3 penting
Model dasar keluarga GLM-5 tidak berubah. Peningkatan GLM-5.3 berasal dari post-training scaling di atas GLM-5. Zhipu melaporkan skor Terminal-Bench 3.0 naik dari 4.6 menjadi 28.3, atau sekitar 6.2x, serta peningkatan besar pada SWE-Marathon.
Untuk keamanan, Zhipu melaporkan CyberGym sebesar 84.5% dan ExploitBench 54.4%. Klaim peningkatan coding 50% dan skor benchmark ini berasal dari evaluasi vendor, jadi gunakan sebagai sinyal untuk evaluasi internal Anda sendiri, bukan sebagai keputusan produksi tanpa pengujian.
Menurut dokumentasi Z.ai, keluarga GLM-5 menggunakan arsitektur Mixture of Experts dengan total 744B parameter, sekitar 40B parameter aktif per forward pass, dan context window 200K token. Ini adalah spesifikasi keluarga GLM-5, bukan klaim khusus GLM-5.3.
Zhipu juga menyatakan bobot terbuka GLM-5.3 akan tersedia sekitar dua minggu setelah peluncuran, menurut liputan Pandaily. Jika Anda mempertimbangkan self-hosting, gunakan API saat ini untuk membuat baseline kualitas, latensi, dan biaya. Lihat juga panduan persiapan self-hosting GLM-5.3.
Dapatkan kunci API
Zhipu menyediakan dua platform berdasarkan wilayah.
Z.ai untuk penggunaan internasional
Daftar di z.ai, buka konsol API, lalu buat kunci API. Dokumentasi tersedia di docs.z.ai.
Gunakan endpoint internasional jika aplikasi atau pengguna Anda berada di luar Tiongkok daratan.
Bigmodel.cn untuk Tiongkok daratan
Platform domestik Zhipu tersedia di open.bigmodel.cn. Format API dan autentikasinya sama, tetapi host dan penagihannya terpisah.
Simpan API key di environment variable, bukan di source code:
export GLM_API_KEY="your-key-from-the-console"
Jika Anda menggunakan GLM Coding Plan, perhatikan bahwa kuota diatur ulang untuk seluruh pengguna pada 14 Agustus.
Endpoint dan autentikasi
Endpoint chat completion internasional:
POST https://api.z.ai/api/paas/v4/chat/completions
Untuk Tiongkok daratan, gunakan host berikut:
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Tambahkan header autentikasi:
Authorization: Bearer $GLM_API_KEY
Format request mengikuti pola OpenAI Chat Completions:
modelmessagestemperaturemax_tokensstream
Respons menggunakan struktur OpenAI-style seperti:
choiceschoices[0].message.contentfinish_reasonusage
Jika Anda sudah memiliki integrasi dengan provider OpenAI-compatible, Anda biasanya cukup mengganti host dan model ID. Pola integrasinya sama seperti pada API DeepSeek V4 Pro.
Catatan tentang ID model
Pada saat penulisan, halaman dokumentasi GLM-5 masih mencantumkan glm-5. Karena halaman harga sudah mencantumkan glm-5.1 dan glm-5.2, ID glm-5.3 adalah asumsi yang masuk akal, tetapi tetap perlu diverifikasi.
Praktik aman:
- Simpan model ID dalam environment variable atau konfigurasi.
- Gunakan
glm-5.3hanya setelah tersedia di wilayah Anda. - Jika muncul error model tidak ditemukan, coba
glm-5dan cek dokumentasi terbaru.
Contoh:
export GLM_MODEL="glm-5.3"
Permintaan pertama dengan cURL
Jalankan smoke test berikut:
curl "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "system",
"content": "Anda adalah peninjau kode. Tandai masalah sebagai pemblokir atau tidak pemblokir."
},
{
"role": "user",
"content": "Tinjau skrip shell ini untuk keamanan:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
}
],
"temperature": 0.3,
"max_tokens": 1024
}'
Periksa field berikut pada respons:
{
"choices": [
{
"message": {
"content": "..."
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 0,
"completion_tokens": 0
}
}
Untuk tugas coding, debugging, atau agen multi-langkah, aktifkan mode penalaran dengan parameter berikut:
"thinking": {
"type": "enabled"
}
Gunakan thinking untuk tugas yang membutuhkan perencanaan atau analisis bertahap. Untuk ekstraksi singkat atau klasifikasi sederhana, nonaktifkan fitur ini untuk mengurangi token dan latensi.
Panduan cepat Python
Instal OpenAI SDK:
pip install --upgrade openai
Gunakan base_url Z.ai saat membuat client:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model=os.getenv("GLM_MODEL", "glm-5.3"),
messages=[
{
"role": "system",
"content": "Anda adalah peninjau kode. Tandai masalah sebagai pemblokir atau tidak pemblokir.",
},
{
"role": "user",
"content": (
"Tinjau rute Flask ini untuk masalah keamanan:\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
),
},
],
temperature=0.3,
max_tokens=2048,
)
print(response.choices[0].message.content)
print("token masukan:", response.usage.prompt_tokens)
print("token keluaran:", response.usage.completion_tokens)
Catat usage sejak awal. Karena harga API khusus GLM-5.3 belum dipublikasikan saat peluncuran, data token dari workload Anda adalah dasar terbaik untuk memperkirakan biaya nanti.
Panduan cepat Node.js
Instal paket openai bila belum tersedia:
npm install openai
Kemudian arahkan client ke endpoint Z.ai:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.GLM_API_KEY,
baseURL: "https://api.z.ai/api/paas/v4",
});
const response = await client.chat.completions.create({
model: process.env.GLM_MODEL || "glm-5.3",
messages: [
{
role: "system",
content:
"Anda adalah agen otomatisasi terminal. Kembalikan setiap langkah sebagai perintah shell dengan penjelasan satu baris.",
},
{
role: "user",
content:
"Layanan Node pada port 3000 berhenti merespons setelah deployment. Beri saya urutan diagnostik.",
},
],
temperature: 0.3,
max_tokens: 2048,
});
console.log(response.choices[0].message.content);
console.log(response.usage);
Jika codebase Anda sudah menggunakan OpenAI, Anda tidak memerlukan SDK paralel. Buat instance OpenAI kedua dengan baseURL Z.ai, lalu pilih provider berdasarkan jenis tugas. Pendekatan ini memudahkan A/B test antara GLM-5.3 dan model lain tanpa menulis ulang lapisan aplikasi.
Streaming
API mendukung streaming dengan flag stream.
Contoh Python:
stream = client.chat.completions.create(
model=os.getenv("GLM_MODEL", "glm-5.3"),
messages=[
{
"role": "user",
"content": "Jelaskan masalah kueri N+1 dengan contoh ORM yang konkret.",
}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
Pada HTTP mentah, tambahkan:
"stream": true
Respons akan dikirim sebagai Server-Sent Events. Setiap baris data: membawa delta dalam format chunk OpenAI.
Hal yang perlu diperhatikan:
- Data penggunaan token biasanya tersedia pada atau setelah chunk terakhir.
- Jangan menghitung biaya final sebelum stream ditutup.
- Jika
thinkingaktif, waktu menuju token pertama dapat lebih lama karena model melakukan penalaran sebelum menghasilkan jawaban.
Parameter yang penting
| Parameter | Tipe | Fungsi |
|---|---|---|
max_tokens |
integer | Batas maksimum token keluaran. Ini adalah pengungkit biaya utama. |
temperature |
number | Gunakan 0.2–0.4 untuk coding dan ekstraksi. Gunakan 0.7+ untuk penulisan bebas. |
thinking |
object |
{"type": "enabled"} untuk mengaktifkan mode penalaran pada tugas multi-langkah. |
stream |
boolean | Mengirim respons sebagai event streaming, bukan satu body respons. |
messages |
array | Array pesan dengan role system, user, dan assistant. |
Tentang biaya: Zhipu belum mempublikasikan harga API GLM-5.3 saat peluncuran. Gunakan halaman harga resmi sebagai sumber kebenaran.
Saat penulisan:
- GLM-5.2: $1.40 per 1 juta token input dan $4.40 per 1 juta token output.
- GLM-5: $1.00 per 1 juta token input dan $3.20 per 1 juta token output.
Input cache pada model GLM berbayar mendapat diskon sekitar 80–85%. Karena itu, pertahankan system prompt yang berulang dan stabil agar cache dapat dimanfaatkan. Untuk strategi optimasi biaya API, lihat analisis kenaikan harga DeepSeek.
Uji GLM-5.3 di Apidog sebelum menulis kode aplikasi
Mengubah prompt langsung di script aplikasi membuat iterasi lambat: edit, jalankan ulang, baca output, lalu ulangi. Karena Z.ai kompatibel dengan OpenAI, Anda dapat menggunakan Apidog untuk mengeksplorasi request dan memvalidasi respons sebelum mengintegrasikannya ke aplikasi.
- Buat request chat completion. Tambahkan endpoint:
POST /chat/completions
Gunakan body OpenAI-style berisi model dan messages.
-
Buat dua environment regional.
Buat environment
zai-international:
https://api.z.ai/api/paas/v4
Dan environment bigmodel-mainland:
https://open.bigmodel.cn/api/paas/v4
Simpan API key sebagai variabel environment:
Authorization: Bearer {{GLM_API_KEY}}
- Gunakan variabel untuk ID model. Contoh:
{{GLM_MODEL}}
Nilai awal:
glm-5.3
Jika dokumentasi atau ketersediaan model berubah, Anda cukup memperbarui satu variabel.
-
Bandingkan
thinkingaktif dan nonaktif.
Duplikat request yang sama. Aktifkanthinkingpada satu request, lalu bandingkan:- kualitas jawaban,
- latensi,
-
usage, - konsistensi output.
Uji endpoint streaming.
Aktifkanstream: trueuntuk melihat waktu ke token pertama dan perilaku SSE yang akan dialami pengguna aplikasi Anda.Simpan respons yang baik sebagai contoh atau fixture.
Gunakan fixture untuk pengujian berikutnya agar iterasi prompt tidak selalu memanggil API langsung dan mengonsumsi token.
Setelah request stabil, tambahkan assertion untuk:
-
finish_reason, - struktur respons,
- skema JSON,
- jumlah token,
- respons error.
Dengan begitu, smoke test dapat berkembang menjadi regression suite. Lihat juga panduan pengujian API untuk insinyur QA.
Penanganan error dan batas laju
Harapkan format error gaya OpenAI:
{
"error": {
"message": "...",
"type": "...",
"code": "..."
}
}
Status yang umum:
| Status | Penyebab umum | Tindakan |
|---|---|---|
401 |
API key hilang, salah, atau dicabut | Periksa GLM_API_KEY dan header Authorization. |
400 |
JSON tidak valid, parameter salah, atau model ID tidak tersedia | Validasi body dan cek ID model di dokumentasi. |
429 |
Rate limit atau concurrency limit | Terapkan retry dengan exponential backoff dan jitter. |
5xx |
Gangguan server sementara | Retry terbatas dengan backoff; jangan retry tanpa batas. |
Contoh helper retry Python:
import random
import time
from openai import APIStatusError
def create_completion_with_retry(client, payload, max_attempts=4):
for attempt in range(max_attempts):
try:
return client.chat.completions.create(**payload)
except APIStatusError as error:
retryable = error.status_code == 429 or error.status_code >= 500
if not retryable or attempt == max_attempts - 1:
raise
delay = (2 ** attempt) + random.uniform(0, 0.5)
time.sleep(delay)
Praktik produksi yang disarankan:
- Bungkus request dalam retry helper dengan exponential backoff dan jitter untuk error
429dan5xx. - Jangan mengarang angka rate limit. Periksa concurrency dan tier terbaru di dokumentasi Zhipu.
- Simpan model ID di konfigurasi agar rollback ke
glm-5.2cukup dilakukan melalui perubahan konfigurasi. - Catat request ID, status code, durasi, model ID, dan
usageuntuk debugging serta kontrol biaya.
Alur debugging yang sama seperti pada API Grok juga dapat diterapkan di sini karena keduanya menggunakan pola API kompatibel dengan OpenAI.
FAQ
Apa ID model untuk API GLM-5.3?
Harapkan glm-5.3, mengikuti konvensi glm-5.1 dan glm-5.2. Namun, saat penulisan, halaman model masih mencantumkan glm-5. Konfirmasikan melalui docs.z.ai sebelum hardcode di produksi.
Gunakan konfigurasi seperti ini:
export GLM_MODEL="glm-5.3"
Dengan demikian, perubahan ID model tidak memerlukan deployment ulang.
Apakah API GLM-5.3 berfungsi dengan OpenAI SDK?
Ya. Gunakan package openai resmi untuk Python atau Node.js, lalu set base_url ke:
https://api.z.ai/api/paas/v4
Untuk Tiongkok daratan:
https://open.bigmodel.cn/api/paas/v4
Format request, respons, dan streaming mengikuti pola Chat Completions OpenAI.
Berapa biaya API GLM-5.3?
Zhipu belum mempublikasikan harga khusus GLM-5.3 saat peluncuran pada 14 Agustus 2026. Halaman harga resmi mencantumkan GLM-5.2 sebesar $1.40 per 1 juta token input dan $4.40 per 1 juta token output sebagai titik referensi.
Jangan mengandalkan tebakan harga dari reseller. Catat token input dan output aplikasi Anda sekarang agar estimasi biaya dapat diperbarui segera setelah harga resmi tersedia.
Bagaimana perbandingan GLM-5.3 dengan Claude dan GPT?
Evaluasi Zhipu menyebut kemampuan coding dan agen GLM-5.3 “mendekati Claude Fable 5”. Zhipu juga melaporkan CyberGym 84.5%, sedikit di atas Claude Mythos 5 dan GPT-5.6 Sol, tetapi ExploitBench 54.4% masih tertinggal.
Angka tersebut adalah klaim vendor sampai direproduksi secara independen. Untuk konteks perbandingan model, baca Grok 4.6 vs GPT-5.6 vs Claude Fable 5.
Bisakah saya menjalankan GLM-5.3 secara lokal?
Belum pada saat peluncuran. Zhipu menyatakan bobot terbuka akan tersedia sekitar 28 Agustus 2026 melalui organisasi Hugging Face.
Dengan desain MoE 744B parameter, self-hosting adalah workload kelas server, bukan laptop. Gunakan API hosted terlebih dahulu untuk membangun baseline prompt, kualitas output, latensi, dan biaya sebelum mengevaluasi deployment lokal.
Di mana GLM-5.3 sesuai dalam stack Anda
GLM-5.3 layak dievaluasi jika Anda menjalankan workflow agen, automation terminal, code review, debugging, atau tugas coding multi-langkah. Kompatibilitas OpenAI membuat evaluasinya sederhana: request dan SDK tetap sama, sementara perubahan utama berada pada endpoint dan model ID.
Urutan implementasi yang praktis:
- Buat API key.
- Jalankan request cURL.
- Validasi format respons dan
usage. - Uji prompt di Apidog dengan environment per wilayah.
- Bandingkan
thinkingaktif dan nonaktif pada prompt nyata. - Simpan model ID sebagai konfigurasi.
- Port request yang sudah stabil ke Python atau Node.js.
- Tambahkan logging, retry, dan assertion regresi sebelum deployment.
Unduh Apidog untuk menyiapkan environment regional, menyimpan request, membandingkan respons, dan membangun regression suite sebelum GLM-5.3 masuk ke jalur aplikasi produksi.

Top comments (0)