DEV Community

Cover image for Cara Menggunakan API GLM-5.3
Walse
Walse

Posted on Originally published at apidog.com

Cara Menggunakan API GLM-5.3

Zhipu AI, laboratorium Tiongkok yang beroperasi secara internasional sebagai Z.ai, merilis GLM-5.3 pada 14 Agustus 2026. Sorotan utamanya adalah kemampuan pengkodean: evaluasi internal menunjukkan peningkatan 50% dibandingkan GLM-5.2, skor Terminal-Bench 3.0 naik dari 4.6 menjadi 28.3, dan Zhipu menyebut kemampuan coding serta agen model ini “mendekati Claude Fable 5”, menurut laporan peluncuran BigGo. Bobot terbuka akan menyusul sekitar dua minggu kemudian. Untuk rincian kemampuan dan tabel benchmark, baca apa itu GLM-5.3; artikel ini berfokus pada implementasi API.

Coba Apidog hari ini

Dalam panduan ini, Anda akan mendapatkan kunci API, menjalankan request pertama dengan cURL, menggunakan Python dan Node.js melalui OpenAI SDK, melakukan streaming token, mengatur parameter penting, serta menguji request di Apidog. API Z.ai kompatibel dengan OpenAI, sehingga kode berbasis endpoint OpenAI-style umumnya hanya membutuhkan perubahan base_url dan ID model.

GLM-5.3 baru dirilis dan dokumentasi Zhipu dapat berubah cepat setelah peluncuran. Contoh di bawah menggunakan informasi yang tersedia saat penulisan. Selalu verifikasi ID model, harga, kuota, dan batas laju di dokumentasi resmi sebelum deployment produksi.

Intisari

  • GLM-5.3 dirilis pada 14 Agustus 2026. Evaluasi internal Zhipu melaporkan peningkatan kemampuan pengkodean 50% dibandingkan GLM-5.2 dan skor Terminal-Bench 3.0 naik dari 4.6 menjadi 28.3.
  • API kompatibel dengan OpenAI. Endpoint internasional:
  POST https://api.z.ai/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Endpoint Tiongkok daratan:

  POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode
  • Autentikasi menggunakan header:
  Authorization: Bearer $GLM_API_KEY
Enter fullscreen mode Exit fullscreen mode
  • Saat penulisan, dokumentasi GLM-5 mencantumkan glm-5 sebagai ID model. Konvensi keluarga menunjukkan glm-5.3 kemungkinan menjadi ID spesifik rilis, tetapi jangan hardcode sebelum mengonfirmasi.
  • Zhipu belum mempublikasikan harga khusus GLM-5.3 saat peluncuran. Halaman harga resmi mencantumkan GLM-5.2 sebesar $1.40 per 1 juta token input dan $4.40 per 1 juta token output.
  • Bobot terbuka direncanakan tersedia di Hugging Face sekitar 28 Agustus 2026.
  • Uji request di Apidog sebelum menulis kode aplikasi: gunakan environment terpisah untuk setiap wilayah, variabel untuk model ID, dan fixture respons untuk mengurangi konsumsi token.

Mengapa GLM-5.3 penting

Model dasar keluarga GLM-5 tidak berubah. Peningkatan GLM-5.3 berasal dari post-training scaling di atas GLM-5. Zhipu melaporkan skor Terminal-Bench 3.0 naik dari 4.6 menjadi 28.3, atau sekitar 6.2x, serta peningkatan besar pada SWE-Marathon.

Untuk keamanan, Zhipu melaporkan CyberGym sebesar 84.5% dan ExploitBench 54.4%. Klaim peningkatan coding 50% dan skor benchmark ini berasal dari evaluasi vendor, jadi gunakan sebagai sinyal untuk evaluasi internal Anda sendiri, bukan sebagai keputusan produksi tanpa pengujian.

Benchmark GLM-5.3

Menurut dokumentasi Z.ai, keluarga GLM-5 menggunakan arsitektur Mixture of Experts dengan total 744B parameter, sekitar 40B parameter aktif per forward pass, dan context window 200K token. Ini adalah spesifikasi keluarga GLM-5, bukan klaim khusus GLM-5.3.

Zhipu juga menyatakan bobot terbuka GLM-5.3 akan tersedia sekitar dua minggu setelah peluncuran, menurut liputan Pandaily. Jika Anda mempertimbangkan self-hosting, gunakan API saat ini untuk membuat baseline kualitas, latensi, dan biaya. Lihat juga panduan persiapan self-hosting GLM-5.3.

Dapatkan kunci API

Zhipu menyediakan dua platform berdasarkan wilayah.

Z.ai untuk penggunaan internasional

Daftar di z.ai, buka konsol API, lalu buat kunci API. Dokumentasi tersedia di docs.z.ai.

Gunakan endpoint internasional jika aplikasi atau pengguna Anda berada di luar Tiongkok daratan.

Bigmodel.cn untuk Tiongkok daratan

Platform domestik Zhipu tersedia di open.bigmodel.cn. Format API dan autentikasinya sama, tetapi host dan penagihannya terpisah.

Simpan API key di environment variable, bukan di source code:

export GLM_API_KEY="your-key-from-the-console"
Enter fullscreen mode Exit fullscreen mode

Jika Anda menggunakan GLM Coding Plan, perhatikan bahwa kuota diatur ulang untuk seluruh pengguna pada 14 Agustus.

Endpoint dan autentikasi

Endpoint chat completion internasional:

POST https://api.z.ai/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Untuk Tiongkok daratan, gunakan host berikut:

POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Tambahkan header autentikasi:

Authorization: Bearer $GLM_API_KEY
Enter fullscreen mode Exit fullscreen mode

Format request mengikuti pola OpenAI Chat Completions:

  • model
  • messages
  • temperature
  • max_tokens
  • stream

Respons menggunakan struktur OpenAI-style seperti:

  • choices
  • choices[0].message.content
  • finish_reason
  • usage

Jika Anda sudah memiliki integrasi dengan provider OpenAI-compatible, Anda biasanya cukup mengganti host dan model ID. Pola integrasinya sama seperti pada API DeepSeek V4 Pro.

Catatan tentang ID model

Pada saat penulisan, halaman dokumentasi GLM-5 masih mencantumkan glm-5. Karena halaman harga sudah mencantumkan glm-5.1 dan glm-5.2, ID glm-5.3 adalah asumsi yang masuk akal, tetapi tetap perlu diverifikasi.

Praktik aman:

  1. Simpan model ID dalam environment variable atau konfigurasi.
  2. Gunakan glm-5.3 hanya setelah tersedia di wilayah Anda.
  3. Jika muncul error model tidak ditemukan, coba glm-5 dan cek dokumentasi terbaru.

Contoh:

export GLM_MODEL="glm-5.3"
Enter fullscreen mode Exit fullscreen mode

Permintaan pertama dengan cURL

Jalankan smoke test berikut:

curl "https://api.z.ai/api/paas/v4/chat/completions" \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "system",
        "content": "Anda adalah peninjau kode. Tandai masalah sebagai pemblokir atau tidak pemblokir."
      },
      {
        "role": "user",
        "content": "Tinjau skrip shell ini untuk keamanan:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
      }
    ],
    "temperature": 0.3,
    "max_tokens": 1024
  }'
Enter fullscreen mode Exit fullscreen mode

Periksa field berikut pada respons:

{
  "choices": [
    {
      "message": {
        "content": "..."
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 0,
    "completion_tokens": 0
  }
}
Enter fullscreen mode Exit fullscreen mode

Untuk tugas coding, debugging, atau agen multi-langkah, aktifkan mode penalaran dengan parameter berikut:

"thinking": {
  "type": "enabled"
}
Enter fullscreen mode Exit fullscreen mode

Gunakan thinking untuk tugas yang membutuhkan perencanaan atau analisis bertahap. Untuk ekstraksi singkat atau klasifikasi sederhana, nonaktifkan fitur ini untuk mengurangi token dan latensi.

Panduan cepat Python

Instal OpenAI SDK:

pip install --upgrade openai
Enter fullscreen mode Exit fullscreen mode

Gunakan base_url Z.ai saat membuat client:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GLM_API_KEY"],
    base_url="https://api.z.ai/api/paas/v4",
)

response = client.chat.completions.create(
    model=os.getenv("GLM_MODEL", "glm-5.3"),
    messages=[
        {
            "role": "system",
            "content": "Anda adalah peninjau kode. Tandai masalah sebagai pemblokir atau tidak pemblokir.",
        },
        {
            "role": "user",
            "content": (
                "Tinjau rute Flask ini untuk masalah keamanan:\n\n"
                "@app.route('/user/<id>')\n"
                "def get_user(id):\n"
                "    return db.execute(f'SELECT * FROM users WHERE id = {id}')"
            ),
        },
    ],
    temperature=0.3,
    max_tokens=2048,
)

print(response.choices[0].message.content)
print("token masukan:", response.usage.prompt_tokens)
print("token keluaran:", response.usage.completion_tokens)
Enter fullscreen mode Exit fullscreen mode

Catat usage sejak awal. Karena harga API khusus GLM-5.3 belum dipublikasikan saat peluncuran, data token dari workload Anda adalah dasar terbaik untuk memperkirakan biaya nanti.

Panduan cepat Node.js

Instal paket openai bila belum tersedia:

npm install openai
Enter fullscreen mode Exit fullscreen mode

Kemudian arahkan client ke endpoint Z.ai:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.GLM_API_KEY,
  baseURL: "https://api.z.ai/api/paas/v4",
});

const response = await client.chat.completions.create({
  model: process.env.GLM_MODEL || "glm-5.3",
  messages: [
    {
      role: "system",
      content:
        "Anda adalah agen otomatisasi terminal. Kembalikan setiap langkah sebagai perintah shell dengan penjelasan satu baris.",
    },
    {
      role: "user",
      content:
        "Layanan Node pada port 3000 berhenti merespons setelah deployment. Beri saya urutan diagnostik.",
    },
  ],
  temperature: 0.3,
  max_tokens: 2048,
});

console.log(response.choices[0].message.content);
console.log(response.usage);
Enter fullscreen mode Exit fullscreen mode

Jika codebase Anda sudah menggunakan OpenAI, Anda tidak memerlukan SDK paralel. Buat instance OpenAI kedua dengan baseURL Z.ai, lalu pilih provider berdasarkan jenis tugas. Pendekatan ini memudahkan A/B test antara GLM-5.3 dan model lain tanpa menulis ulang lapisan aplikasi.

Streaming

API mendukung streaming dengan flag stream.

Contoh Python:

stream = client.chat.completions.create(
    model=os.getenv("GLM_MODEL", "glm-5.3"),
    messages=[
        {
            "role": "user",
            "content": "Jelaskan masalah kueri N+1 dengan contoh ORM yang konkret.",
        }
    ],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Pada HTTP mentah, tambahkan:

"stream": true
Enter fullscreen mode Exit fullscreen mode

Respons akan dikirim sebagai Server-Sent Events. Setiap baris data: membawa delta dalam format chunk OpenAI.

Hal yang perlu diperhatikan:

  • Data penggunaan token biasanya tersedia pada atau setelah chunk terakhir.
  • Jangan menghitung biaya final sebelum stream ditutup.
  • Jika thinking aktif, waktu menuju token pertama dapat lebih lama karena model melakukan penalaran sebelum menghasilkan jawaban.

Parameter yang penting

Parameter Tipe Fungsi
max_tokens integer Batas maksimum token keluaran. Ini adalah pengungkit biaya utama.
temperature number Gunakan 0.2–0.4 untuk coding dan ekstraksi. Gunakan 0.7+ untuk penulisan bebas.
thinking object {"type": "enabled"} untuk mengaktifkan mode penalaran pada tugas multi-langkah.
stream boolean Mengirim respons sebagai event streaming, bukan satu body respons.
messages array Array pesan dengan role system, user, dan assistant.

Tentang biaya: Zhipu belum mempublikasikan harga API GLM-5.3 saat peluncuran. Gunakan halaman harga resmi sebagai sumber kebenaran.

Saat penulisan:

  • GLM-5.2: $1.40 per 1 juta token input dan $4.40 per 1 juta token output.
  • GLM-5: $1.00 per 1 juta token input dan $3.20 per 1 juta token output.

Input cache pada model GLM berbayar mendapat diskon sekitar 80–85%. Karena itu, pertahankan system prompt yang berulang dan stabil agar cache dapat dimanfaatkan. Untuk strategi optimasi biaya API, lihat analisis kenaikan harga DeepSeek.

Uji GLM-5.3 di Apidog sebelum menulis kode aplikasi

Mengubah prompt langsung di script aplikasi membuat iterasi lambat: edit, jalankan ulang, baca output, lalu ulangi. Karena Z.ai kompatibel dengan OpenAI, Anda dapat menggunakan Apidog untuk mengeksplorasi request dan memvalidasi respons sebelum mengintegrasikannya ke aplikasi.

  1. Buat request chat completion. Tambahkan endpoint:
   POST /chat/completions
Enter fullscreen mode Exit fullscreen mode

Gunakan body OpenAI-style berisi model dan messages.

  1. Buat dua environment regional. Buat environment zai-international:
   https://api.z.ai/api/paas/v4
Enter fullscreen mode Exit fullscreen mode

Dan environment bigmodel-mainland:

   https://open.bigmodel.cn/api/paas/v4
Enter fullscreen mode Exit fullscreen mode

Simpan API key sebagai variabel environment:

   Authorization: Bearer {{GLM_API_KEY}}
Enter fullscreen mode Exit fullscreen mode
  1. Gunakan variabel untuk ID model. Contoh:
   {{GLM_MODEL}}
Enter fullscreen mode Exit fullscreen mode

Nilai awal:

   glm-5.3
Enter fullscreen mode Exit fullscreen mode

Jika dokumentasi atau ketersediaan model berubah, Anda cukup memperbarui satu variabel.

  1. Bandingkan thinking aktif dan nonaktif.

    Duplikat request yang sama. Aktifkan thinking pada satu request, lalu bandingkan:

    • kualitas jawaban,
    • latensi,
    • usage,
    • konsistensi output.
  2. Uji endpoint streaming.

    Aktifkan stream: true untuk melihat waktu ke token pertama dan perilaku SSE yang akan dialami pengguna aplikasi Anda.

  3. Simpan respons yang baik sebagai contoh atau fixture.

    Gunakan fixture untuk pengujian berikutnya agar iterasi prompt tidak selalu memanggil API langsung dan mengonsumsi token.

Setelah request stabil, tambahkan assertion untuk:

  • finish_reason,
  • struktur respons,
  • skema JSON,
  • jumlah token,
  • respons error.

Dengan begitu, smoke test dapat berkembang menjadi regression suite. Lihat juga panduan pengujian API untuk insinyur QA.

Penanganan error dan batas laju

Harapkan format error gaya OpenAI:

{
  "error": {
    "message": "...",
    "type": "...",
    "code": "..."
  }
}
Enter fullscreen mode Exit fullscreen mode

Status yang umum:

Status Penyebab umum Tindakan
401 API key hilang, salah, atau dicabut Periksa GLM_API_KEY dan header Authorization.
400 JSON tidak valid, parameter salah, atau model ID tidak tersedia Validasi body dan cek ID model di dokumentasi.
429 Rate limit atau concurrency limit Terapkan retry dengan exponential backoff dan jitter.
5xx Gangguan server sementara Retry terbatas dengan backoff; jangan retry tanpa batas.

Contoh helper retry Python:

import random
import time
from openai import APIStatusError

def create_completion_with_retry(client, payload, max_attempts=4):
    for attempt in range(max_attempts):
        try:
            return client.chat.completions.create(**payload)
        except APIStatusError as error:
            retryable = error.status_code == 429 or error.status_code >= 500

            if not retryable or attempt == max_attempts - 1:
                raise

            delay = (2 ** attempt) + random.uniform(0, 0.5)
            time.sleep(delay)
Enter fullscreen mode Exit fullscreen mode

Praktik produksi yang disarankan:

  • Bungkus request dalam retry helper dengan exponential backoff dan jitter untuk error 429 dan 5xx.
  • Jangan mengarang angka rate limit. Periksa concurrency dan tier terbaru di dokumentasi Zhipu.
  • Simpan model ID di konfigurasi agar rollback ke glm-5.2 cukup dilakukan melalui perubahan konfigurasi.
  • Catat request ID, status code, durasi, model ID, dan usage untuk debugging serta kontrol biaya.

Alur debugging yang sama seperti pada API Grok juga dapat diterapkan di sini karena keduanya menggunakan pola API kompatibel dengan OpenAI.

FAQ

Apa ID model untuk API GLM-5.3?

Harapkan glm-5.3, mengikuti konvensi glm-5.1 dan glm-5.2. Namun, saat penulisan, halaman model masih mencantumkan glm-5. Konfirmasikan melalui docs.z.ai sebelum hardcode di produksi.

Gunakan konfigurasi seperti ini:

export GLM_MODEL="glm-5.3"
Enter fullscreen mode Exit fullscreen mode

Dengan demikian, perubahan ID model tidak memerlukan deployment ulang.

Apakah API GLM-5.3 berfungsi dengan OpenAI SDK?

Ya. Gunakan package openai resmi untuk Python atau Node.js, lalu set base_url ke:

https://api.z.ai/api/paas/v4
Enter fullscreen mode Exit fullscreen mode

Untuk Tiongkok daratan:

https://open.bigmodel.cn/api/paas/v4
Enter fullscreen mode Exit fullscreen mode

Format request, respons, dan streaming mengikuti pola Chat Completions OpenAI.

Berapa biaya API GLM-5.3?

Zhipu belum mempublikasikan harga khusus GLM-5.3 saat peluncuran pada 14 Agustus 2026. Halaman harga resmi mencantumkan GLM-5.2 sebesar $1.40 per 1 juta token input dan $4.40 per 1 juta token output sebagai titik referensi.

Jangan mengandalkan tebakan harga dari reseller. Catat token input dan output aplikasi Anda sekarang agar estimasi biaya dapat diperbarui segera setelah harga resmi tersedia.

Bagaimana perbandingan GLM-5.3 dengan Claude dan GPT?

Evaluasi Zhipu menyebut kemampuan coding dan agen GLM-5.3 “mendekati Claude Fable 5”. Zhipu juga melaporkan CyberGym 84.5%, sedikit di atas Claude Mythos 5 dan GPT-5.6 Sol, tetapi ExploitBench 54.4% masih tertinggal.

Angka tersebut adalah klaim vendor sampai direproduksi secara independen. Untuk konteks perbandingan model, baca Grok 4.6 vs GPT-5.6 vs Claude Fable 5.

Bisakah saya menjalankan GLM-5.3 secara lokal?

Belum pada saat peluncuran. Zhipu menyatakan bobot terbuka akan tersedia sekitar 28 Agustus 2026 melalui organisasi Hugging Face.

Dengan desain MoE 744B parameter, self-hosting adalah workload kelas server, bukan laptop. Gunakan API hosted terlebih dahulu untuk membangun baseline prompt, kualitas output, latensi, dan biaya sebelum mengevaluasi deployment lokal.

Di mana GLM-5.3 sesuai dalam stack Anda

GLM-5.3 layak dievaluasi jika Anda menjalankan workflow agen, automation terminal, code review, debugging, atau tugas coding multi-langkah. Kompatibilitas OpenAI membuat evaluasinya sederhana: request dan SDK tetap sama, sementara perubahan utama berada pada endpoint dan model ID.

Urutan implementasi yang praktis:

  1. Buat API key.
  2. Jalankan request cURL.
  3. Validasi format respons dan usage.
  4. Uji prompt di Apidog dengan environment per wilayah.
  5. Bandingkan thinking aktif dan nonaktif pada prompt nyata.
  6. Simpan model ID sebagai konfigurasi.
  7. Port request yang sudah stabil ke Python atau Node.js.
  8. Tambahkan logging, retry, dan assertion regresi sebelum deployment.

Unduh Apidog untuk menyiapkan environment regional, menyimpan request, membandingkan respons, dan membangun regression suite sebelum GLM-5.3 masuk ke jalur aplikasi produksi.

Top comments (0)