DEV Community

Cover image for Cara Menggunakan GLM-5.3-Flash di Claude Code dan Cline
Walse
Walse

Posted on Originally published at apidog.com

Cara Menggunakan GLM-5.3-Flash di Claude Code dan Cline

Menghubungkan GLM-5.3-Flash ke Claude Code dan Cline

Jika Anda sudah berlangganan GLM Coding Plan, GLM-5.3-Flash layak dipertimbangkan: model ini dilaporkan memberikan tiga kali lipat kuota dibandingkan GLM-5.3 pada paket yang sama. Imbalannya, skor Artificial Analysis Intelligence Index berada di angka 57, bukan 60.

Coba Apidog hari ini

Untuk coding rutin, pertukaran ini cukup masuk akal. Panduan ini membahas cara menghubungkan Flash ke Claude Code dan Cline, kapan menggunakan GLM-5.3, serta konfigurasi yang paling sering menimbulkan masalah.

Persiapan

Anda memerlukan:

  • Langganan GLM Coding Plan dari z.ai, mulai sekitar $18 per bulan.
  • Kunci API dari dasbor Z.ai.
  • Claude Code atau Cline yang sudah terinstal.

Sebelum membuat rencana berdasarkan angka kuota, verifikasi pengganda dan tingkatan paket di z.ai. Ketentuan paket dapat berubah lebih cepat daripada spesifikasi model, dan angka 3x berasal dari dokumentasi Z.ai.

Menggunakan GLM-5.3-Flash dengan Claude Code

Z.ai menyediakan endpoint yang kompatibel dengan Anthropic. Claude Code dapat menggunakannya dengan dua variabel lingkungan.

Konfigurasi cepat

Gunakan helper resmi:

npx @z_ai/coding-helper
Enter fullscreen mode Exit fullscreen mode

Masukkan kunci API Anda ketika diminta. Jika konfigurasi berhasil, lanjutkan ke bagian pemilihan model.

Konfigurasi manual

Tambahkan URL dasar dan token ke profil shell:

export ANTHROPIC_BASE_URL="https://api.z.ai/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="your-z-ai-key"
Enter fullscreen mode Exit fullscreen mode

Kemudian jalankan Claude Code seperti biasa. Semua permintaan akan diarahkan ke Z.ai, bukan Anthropic.

Perhatikan dua hal berikut:

  • ANTHROPIC_API_KEY berbeda dari ANTHROPIC_AUTH_TOKEN. Jika ada kunci Anthropic lama yang masih diekspor, batalkan pengaturannya. Mendefinisikan keduanya dapat menyebabkan error autentikasi yang terlihat seperti kunci salah.
  • Variabel lingkungan harus tersedia pada proses Claude Code. Jika Anda menambahkannya ke .zshrc tetapi menjalankan Claude Code dari editor atau launcher yang tidak melakukan source profil shell, variabel tersebut tidak akan terbaca. Uji dari konteks yang sama:
echo $ANTHROPIC_BASE_URL
Enter fullscreen mode Exit fullscreen mode

Memilih model

Setelah terhubung, pilih glm-5.3-flash. Jika Anda menggunakan file pengaturan, masukkan ID model berikut:

{
  "model": "glm-5.3-flash"
}
Enter fullscreen mode Exit fullscreen mode

Untuk konteks panjang, naikkan timeout. Jendela konteks 1 juta token membuat sebagian permintaan membutuhkan waktu lebih lama:

export API_TIMEOUT_MS=3000000
Enter fullscreen mode Exit fullscreen mode

Nilai ini berasal dari pengaturan GLM-5.2 dan sebaiknya disesuaikan dengan pengalaman Anda. Panduan harness GLM-5.2 kami membahas generasi sebelumnya.

Menggunakan GLM-5.3-Flash dengan Cline

Cline terhubung melalui penyedia yang kompatibel dengan OpenAI, bukan endpoint Anthropic.

  1. Buka pengaturan Cline.
  2. Pilih OpenAI Compatible sebagai penyedia API.
  3. Atur URL dasar ke:
   https://api.z.ai/api/coding/paas/v4
Enter fullscreen mode Exit fullscreen mode
  1. Masukkan kunci API Z.ai.
  2. Pilih Custom Model dan masukkan:
   glm-5.3-flash
Enter fullscreen mode Exit fullscreen mode

Pastikan URL dasar yang digunakan benar. Endpoint Coding Plan:

https://api.z.ai/api/coding/paas/v4
Enter fullscreen mode Exit fullscreen mode

berbeda dari endpoint API standar:

https://api.z.ai/api/paas/v4
Enter fullscreen mode Exit fullscreen mode

Endpoint standar digunakan untuk panggilan API langsung seperti pada panduan API kami. Menggunakan endpoint standar dengan kunci Coding Plan merupakan penyebab umum kegagalan otorisasi. Verifikasi URL tersebut terhadap dokumentasi Z.ai, karena jalurnya pernah berubah.

Atur jendela konteks secara manual

Cline tidak selalu mendeteksi jendela konteks model kustom dengan benar. Jika bekerja dengan basis kode besar dan konteks terpotong terlalu cepat, atur ukurannya secara manual ke 1.000.000.

Masalah yang sama pernah terjadi pada GLM-5.2: Cline menghapus konteks file lebih awal, meskipun model sebenarnya mampu menanganinya.

Mengapa menggunakan Flash untuk coding agentik?

Berikut angka benchmark dari Z.ai:

Benchmark GLM-5.3-Flash GLM-5.2
Terminal-Bench 2.1 84.3 Tidak dapat dibandingkan langsung
DeepSWE 63.4 46.2
AutomationBench 48.8 26.2

Terminal-Bench dievaluasi terhadap Claude Code 2.1.207, sehingga relevan dengan harness yang digunakan banyak pengembang. Namun, perlakukan angka tersebut sebagai klaim vendor sampai tersedia reproduksi independen.

Pengukuran independen Artificial Analysis menunjukkan Intelligence Index sebesar 57 untuk Flash, dibandingkan 60 untuk GLM-5.3.

Dukungan input gambar

Fitur baru yang penting untuk coding harness adalah input gambar asli. Flash dapat menerima tangkapan layar sebagai blok konten dalam permintaan yang sama dengan kode.

Dalam pekerjaan front-end, Anda dapat menempelkan tangkapan layar layout yang rusak lalu meminta model menganalisis hasil rendering, tanpa harus mendeskripsikannya secara manual. Panduan visi kami membahas kemampuan ini lebih lanjut.

Trade-off kecepatan

GLM-5.3-Flash menghasilkan sekitar 49 token per detik, sedangkan GLM-5.3 sekitar 86 token per detik. Perbedaannya terasa saat harness melakukan streaming penulisan ulang file panjang.

Waktu hingga token pertama hampir sama:

  • GLM-5.3-Flash: 1,52 detik
  • GLM-5.3: 1,57 detik

Jadi, Flash mulai merespons hampir secepat GLM-5.3. Perbedaan utama muncul pada output panjang.

Ringkasnya: kuota sekitar 3x, tetapi kecepatan generasi kira-kira setengahnya. Flash cocok untuk edit singkat, pemanggilan alat, dan pekerjaan berulang. Untuk permintaan seperti “tulis ulang file 800 baris ini”, GLM-5.3 lebih nyaman digunakan.

Strategi routing yang praktis

Anda tidak harus memilih satu model saja:

  • Gunakan Flash sebagai default untuk eksplorasi, membaca kode, menjalankan perintah, edit kecil, dan pekerjaan yang melibatkan gambar.
  • Gunakan GLM-5.3 untuk keputusan arsitektur, refactoring panjang, atau masalah yang sebelumnya gagal diselesaikan Flash.

Beralih model cukup dengan mengganti ID model pada pengaturan harness. Dengan Coding Plan, strategi ini mempertahankan sebagian besar volume pada model dengan kuota 3x dan menyimpan GLM-5.3 untuk pekerjaan yang benar-benar membutuhkannya.

Z.ai juga menyebutkan bahwa permintaan di luar jam sibuk hanya mengonsumsi setengah poin standar. Menjadwalkan pekerjaan agen batch atau latar belakang pada waktu tersebut dapat memperpanjang masa pakai paket.

Pemecahan masalah

Semua permintaan menghasilkan 401 atau 403

Penyebab paling umum:

  • URL dasar tidak sesuai dengan jenis kunci API.
  • ANTHROPIC_API_KEY lama menimpa atau mengganggu ANTHROPIC_AUTH_TOKEN.

Uji endpoint secara langsung sebelum mengubah konfigurasi harness.

Model tidak ditemukan

Periksa ID model secara tepat:

glm-5.3-flash
Enter fullscreen mode Exit fullscreen mode

ID ini menggunakan titik pada versi dan tanda hubung sebelum flash. Di OpenRouter, model tersebut ditulis sebagai z-ai/glm-5.3-flash, yang berbeda dari ID asli Z.ai.

Konteks terpotong terlalu cepat

Atur jendela konteks Cline secara manual ke 1.000.000. Deteksi otomatis untuk model kustom tidak selalu akurat.

Permintaan besar mengalami timeout

Naikkan API_TIMEOUT_MS. Permintaan dengan konteks sangat panjang dapat melampaui timeout klien default meskipun tidak ada masalah pada model atau kredensial.

Kuota habis lebih cepat

reasoning_effort secara default adalah max, dan token penalaran ikut dihitung. Jika harness mendukung pengaturan ini, gunakan low untuk pekerjaan rutin agar konsumsi kuota berkurang.

Pemanggilan alat gagal atau formatnya salah

Pastikan harness dan endpoint menggunakan format tool call yang sama. Bagian ini paling sensitif terhadap perbedaan versi dan dapat rusak setelah pembaruan di salah satu sisi.

Harness lain

Dua pola koneksi berikut mencakup sebagian besar alat:

  • Alat yang kompatibel dengan Anthropic—seperti Claude Code dan beberapa framework agen—menggunakan:
  https://api.z.ai/api/anthropic
Enter fullscreen mode Exit fullscreen mode

dengan ANTHROPIC_AUTH_TOKEN.

  • Alat yang kompatibel dengan OpenAI—seperti Cline, Roo, Kilo, OpenCode, Codex, dan opsi model kustom Cursor—menggunakan:
  https://api.z.ai/api/coding/paas/v4
Enter fullscreen mode Exit fullscreen mode

dengan kunci pada field API key standar dan glm-5.3-flash sebagai ID model kustom.

Panduan sebelumnya membahas pola serupa pada model lama:

Memverifikasi koneksi

Uji endpoint secara langsung sebelum mempercayai konfigurasi harness:

curl https://api.z.ai/api/coding/paas/v4/chat/completions \
  -H "[REDACTED CREDENTIAL] $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'
Enter fullscreen mode Exit fullscreen mode

Jika perintah tersebut menghasilkan respons, tetapi harness masih gagal, masalahnya kemungkinan berada pada konfigurasi harness, bukan kredensial.

Untuk pengujian berulang, Apidog lebih praktis daripada riwayat shell. Simpan endpoint Coding Plan dan endpoint standar secara berdampingan, lalu simpan kunci sebagai variabel lingkungan. Saat terjadi error otorisasi, Anda dapat memeriksa dalam satu klik apakah masalahnya ada pada endpoint atau alat yang salah.

FAQ

Apakah saya memerlukan Coding Plan, atau kredit API juga bisa digunakan?

Keduanya bisa digunakan. Coding Plan biasanya lebih ekonomis bagi pengembang yang melakukan coding setiap hari, sedangkan API terukur lebih sesuai untuk aplikasi. Posting harga kami membandingkan keduanya.

Apakah Flash benar-benar memberikan kuota 3x GLM-5.3?

Itu adalah angka yang disebutkan Z.ai. Verifikasi di z.ai/subscribe sebelum membuat perencanaan berdasarkan angka tersebut.

Mengapa Cline memotong konteks?

Atur jendela konteks secara manual ke 1.000.000. Cline tidak selalu mendeteksi ukuran tersebut untuk model kustom.

URL dasar mana yang harus digunakan?

  • Claude Code: https://api.z.ai/api/anthropic
  • Alat OpenAI-compatible pada Coding Plan: https://api.z.ai/api/coding/paas/v4
  • Panggilan API langsung: https://api.z.ai/api/paas/v4

Bisakah saya menempelkan tangkapan layar ke Claude Code dengan Flash?

Model ini mendukung input gambar asli. Namun, apakah versi harness Anda mengekspos fitur tersebut adalah hal terpisah. Uji integrasi Anda sebelum menjadikannya bagian dari workflow.

Top comments (0)