DEV Community

Cover image for วิธีใช้ GLM-5.3 API
Thanawat Wongchai
Thanawat Wongchai

Posted on Originally published at apidog.com

วิธีใช้ GLM-5.3 API

Zhipu AI ห้องปฏิบัติการจากจีนที่ทำตลาดต่างประเทศภายใต้ชื่อ Z.ai เปิดตัว GLM-5.3 เมื่อวันที่ 14 สิงหาคม 2026 โดย Zhipu รายงานว่าความสามารถด้านการเขียนโค้ดดีขึ้น 50% จาก GLM-5.2 และคะแนน Terminal-Bench 3.0 เพิ่มจาก 4.6 เป็น 28.3 ตามรายงานการเปิดตัวจาก BigGo บทความนี้เน้นการเริ่มใช้ API: รับคีย์, เรียกผ่าน cURL, ใช้กับ Python/Node.js, สตรีมผลลัพธ์ และตั้งค่าการทดสอบใน Apidog สำหรับรายละเอียดความสามารถและตารางเปรียบเทียบ ดู GLM-5.3 คืออะไร

ลองใช้ Apidog วันนี้

API ของ Z.ai เข้ากันได้กับ OpenAI ดังนั้นหากโปรเจกต์ของคุณใช้ OpenAI-compatible endpoint อยู่แล้ว การย้ายมาใช้ GLM ส่วนใหญ่คือการเปลี่ยน base_url และ model เท่านั้น

หมายเหตุ: GLM-5.3 เพิ่งเปิดตัว และเอกสารอาจเปลี่ยนเร็วในวันเปิดตัว ข้อมูลที่เอกสารทางการยังไม่ยืนยันจะระบุไว้ตามแบบแผนของตระกูล GLM-5 ให้ตรวจสอบ เอกสาร GLM-5 ก่อนนำไปใช้จริง

TL;DR

  • Zhipu รายงานว่า GLM-5.3 ปรับปรุงความสามารถด้านโค้ด 50% จาก GLM-5.2 และ Terminal-Bench 3.0 เพิ่มจาก 4.6 เป็น 28.3
  • International endpoint:
  POST https://api.z.ai/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode
  • Mainland China endpoint:
  POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode
  • ใช้ header:
  Authorization: Bearer $GLM_API_KEY
Enter fullscreen mode Exit fullscreen mode
  • เอกสารในขณะเขียนระบุ model ID เป็น glm-5 ขณะที่หน้าราคาแสดง glm-5.2 และ glm-5.1 แยกกัน ตัวอย่างนี้ใช้ glm-5.3 แต่ควรยืนยันก่อน hardcode
  • ราคาของ GLM-5.3 ยังไม่ประกาศอย่างเป็นทางการ ดูข้อมูลล่าสุดที่ หน้าราคา Z.ai
  • ทดสอบ request และเก็บ response fixture ใน Apidog ก่อนเชื่อมเข้ากับแอปจริง

เหตุใด GLM-5.3 จึงน่าสนใจสำหรับงานโค้ด

Zhipu ระบุว่าการพัฒนารุ่นนี้มาจาก post-training บนฐาน GLM-5 เดิม ไม่ใช่การเปลี่ยนโมเดลพื้นฐาน โดยรายงานว่า Terminal-Bench 3.0 เพิ่มขึ้น 6.2 เท่า จาก 4.6 เป็น 28.3 และ SWE-Marathon เพิ่มขึ้นเกือบสองเทียบกับ GLM-5.2

ตัวเลขเหล่านี้เป็นการประเมินจากผู้ให้บริการ จึงควรใช้เป็นจุดเริ่มต้นในการทดสอบกับ workload ของคุณเอง ไม่ใช่ข้อสรุปสุดท้าย

ผลการประเมิน GLM-5.3

ตามเอกสารของ Z.ai ตระกูล GLM-5 ใช้สถาปัตยกรรม Mixture of Experts มีพารามิเตอร์รวม 744B, เปิดใช้งานประมาณ 40B ต่อ forward pass และรองรับ context window 200K tokens ข้อมูลนี้เป็นคุณสมบัติระดับตระกูล ไม่ใช่ข้อยืนยันเฉพาะ GLM-5.3

Zhipu ระบุว่า open weights จะตามมาประมาณสองสัปดาห์หลังเปิดตัว หรือราววันที่ 28 สิงหาคม 2026 ตามรายงานของ Pandaily หากคุณวางแผน self-hosting ให้เริ่มเก็บ baseline จาก hosted API ตั้งแต่ตอนนี้ และดูแนวทางเตรียมระบบได้จากคู่มือการโฮสต์ GLM-5.3 ด้วยตัวเอง

1. รับ API key

Zhipu แยกแพลตฟอร์มตามภูมิภาค เลือกให้ตรงกับจุดที่ระบบของคุณรันอยู่

Z.ai สำหรับผู้ใช้นอกจีนแผ่นดินใหญ่

สมัครที่ z.ai เปิด API console แล้วสร้าง API key เอกสารอยู่ที่ docs.z.ai

Bigmodel.cn สำหรับจีนแผ่นดินใหญ่

ใช้ open.bigmodel.cn ซึ่งใช้รูปแบบ API และการรับรองความถูกต้องแบบเดียวกัน แต่ใช้ host และระบบเรียกเก็บเงินแยกกัน

เก็บคีย์ไว้ใน environment variable ไม่ใส่ลง Git หรือ source code:

export GLM_API_KEY="your-key-from-the-console"
Enter fullscreen mode Exit fullscreen mode

หากใช้ GLM Coding Plan แทน pay-as-you-go API โปรดทราบว่าโควตาถูกรีเซ็ตสำหรับผู้ใช้ทุกคนเมื่อวันที่ 14 สิงหาคม

2. Endpoint และการรับรองความถูกต้อง

International endpoint:

POST https://api.z.ai/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Mainland China endpoint:

POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

ส่ง API key ผ่าน header เดียว:

Authorization: Bearer $GLM_API_KEY
Enter fullscreen mode Exit fullscreen mode

Request และ response ใช้รูปแบบ OpenAI Chat Completions:

  • Request: model และ messages
  • Response: choices, message, finish_reason, usage
  • Streaming: ตั้งค่า stream: true

เรื่อง model ID: ตัวอย่างต่อไปนี้ใช้ glm-5.3 ตามแบบแผนของรุ่น glm-5.1 และ glm-5.2 แต่เอกสาร GLM-5อาจยังแสดง glm-5 อยู่ หากเจอ 404 ให้ลองใช้ glm-5 และเก็บ model ID ไว้ใน config เสมอ

3. ส่งคำขอแรกด้วย cURL

เริ่มจาก smoke test ที่ตรวจงาน shell script:

curl "https://api.z.ai/api/paas/v4/chat/completions" \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "system",
        "content": "You are a code reviewer. Flag issues as blocking or non-blocking."
      },
      {
        "role": "user",
        "content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
      }
    ],
    "temperature": 0.3,
    "max_tokens": 1024
  }'
Enter fullscreen mode Exit fullscreen mode

อ่านผลลัพธ์จาก:

choices[0].message.content
Enter fullscreen mode Exit fullscreen mode

และบันทึก token usage จาก:

usage.prompt_tokens
usage.completion_tokens
Enter fullscreen mode Exit fullscreen mode

สำหรับงาน coding และ agent ที่มีหลายขั้นตอน สามารถเปิดโหมด reasoning ได้:

"thinking": { "type": "enabled" }
Enter fullscreen mode Exit fullscreen mode

ใช้ thinking กับงานวิเคราะห์หรือวางแผนหลายขั้นตอน แต่ปิดไว้สำหรับงานสั้นที่ต้องการ latency และต้นทุนต่ำกว่า

4. ใช้ GLM-5.3 กับ Python

ติดตั้ง OpenAI SDK:

pip install --upgrade openai
Enter fullscreen mode Exit fullscreen mode

จากนั้นเปลี่ยน base_url ให้ชี้ไปที่ Z.ai:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GLM_API_KEY"],
    base_url="https://api.z.ai/api/paas/v4",
)

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {
            "role": "system",
            "content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
        },
        {
            "role": "user",
            "content": (
                "Review this Flask route for security issues:\n\n"
                "@app.route('/user/<id>')\n"
                "def get_user(id):\n"
                "    return db.execute(f'SELECT * FROM users WHERE id = {id}')"
            ),
        },
    ],
    temperature=0.3,
    max_tokens=2048,
)

print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)
Enter fullscreen mode Exit fullscreen mode

บันทึก usage ตั้งแต่เริ่มต้น โดยเฉพาะเมื่อราคาของ GLM-5.3 ยังไม่มีประกาศทางการ จำนวน token จริงของ workload จะช่วยประเมินต้นทุนได้ดีกว่าการเดาราคา

5. ใช้ GLM-5.3 กับ Node.js

ติดตั้งแพ็กเกจ:

npm install openai
Enter fullscreen mode Exit fullscreen mode

เรียก API ผ่าน OpenAI SDK:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.GLM_API_KEY,
  baseURL: "https://api.z.ai/api/paas/v4",
});

const response = await client.chat.completions.create({
  model: "glm-5.3",
  messages: [
    {
      role: "system",
      content:
        "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
    },
    {
      role: "user",
      content:
        "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
    },
  ],
  temperature: 0.3,
  max_tokens: 2048,
});

console.log(response.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

หากแอปของคุณเรียก OpenAI อยู่แล้ว ให้สร้าง OpenAI client อีกตัวด้วย baseURL ของ Z.ai แล้ว route request ตามประเภทงาน วิธีนี้ช่วยทำ A/B test ระหว่างโมเดลเดิมกับ GLM-5.3 โดยไม่ต้องเขียน integration ใหม่

รูปแบบการพอร์ตนี้เหมือนกับแนวทางสำหรับAPI ของ DeepSeek V4 Pro

6. สตรีม token แบบเรียลไทม์

ตั้งค่า stream=True ใน Python:

stream = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {
            "role": "user",
            "content": "Explain the N+1 query problem with a concrete ORM example.",
        }
    ],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

สำหรับ raw HTTP ให้เพิ่มค่านี้ใน request body:

"stream": true
Enter fullscreen mode Exit fullscreen mode

จากนั้น parse Server-Sent Events (SSE) ที่ส่งมาในบรรทัด data: ข้อควรระวังในการใช้งานจริง:

  1. usage มักมาในหรือหลัง chunk สุดท้าย จึงสรุปจำนวน token ได้เมื่อ stream จบแล้ว
  2. เมื่อเปิด thinking เวลาไปยัง token แรกที่ผู้ใช้เห็นอาจนานขึ้น เพราะโมเดลใช้ token สำหรับ reasoning ก่อนตอบ

7. พารามิเตอร์ที่ควรตั้งค่า

พารามิเตอร์ ประเภท การใช้งาน
max_tokens จำนวนเต็ม จำกัดความยาว output และควบคุมต้นทุน
temperature ตัวเลข ใช้ 0.2-0.4 สำหรับโค้ด/การแยกข้อมูล และ 0.7+ สำหรับงานเขียนปลายเปิด
thinking ออบเจกต์ ใช้ {"type": "enabled"} สำหรับ reasoning หลายขั้นตอน
stream บูลีน รับผลลัพธ์แบบ SSE แทน response เดียว
messages อาร์เรย์ รองรับบทบาท system, user, assistant แบบ OpenAI

เรื่องต้นทุน ให้ดูหน้าราคาอย่างเป็นทางการเป็นหลัก ในขณะเขียน หน้านี้ระบุราคา GLM-5.2 ที่ $1.40 ต่อ 1M input tokens และ $4.40 ต่อ 1M output tokens ส่วน GLM-5 อยู่ที่ $1.00 และ $3.20

สำหรับโมเดล GLM แบบเสียเงิน เอกสารระบุว่าสามารถลดต้นทุน input ที่ cache ได้ 80-85% ดังนั้นควรทำ system prompt ที่ใช้ซ้ำให้คงที่เพื่อลดค่าใช้จ่าย ดูแนวคิดควบคุมต้นทุนเพิ่มเติมได้จากการวิเคราะห์กรณีราคา DeepSeek เพิ่มขึ้น

8. ทดสอบ GLM-5.3 ใน Apidog ก่อนเขียนโค้ดแอป

แทนที่จะแก้ prompt ในสคริปต์แล้วรันซ้ำทุกครั้ง ให้ตั้งค่า request ใน Apidog เพื่อเปรียบเทียบผลลัพธ์, ความหน่วง และ token usage ได้เร็วขึ้น

ตั้งค่าตามขั้นตอนนี้:

  1. สร้าง request POST /chat/completions

    กำหนด body ด้วย model และ messages แบบ OpenAI Chat Completions

  2. สร้างสอง environment

    • zai-international: https://api.z.ai/api/paas/v4
    • bigmodel-mainland: https://open.bigmodel.cn/api/paas/v4

เก็บ authorization ไว้ใน environment:

   Authorization: Bearer {{GLM_API_KEY}}
Enter fullscreen mode Exit fullscreen mode
  1. เก็บ model ID เป็นตัวแปร

    เช่น {{GLM_MODEL_ID}} ที่ตั้งค่าเป็น glm-5.3 เพื่อให้สลับไป glm-5 หรือ glm-5.2 ได้โดยไม่ต้องแก้ทุก request

  2. ทำ request สองชุดเพื่อเทียบ thinking

    ชุดแรกปิด reasoning และอีกชุดเปิด:

   "thinking": { "type": "enabled" }
Enter fullscreen mode Exit fullscreen mode

เปรียบเทียบ output, latency และ usage ด้วย prompt เดียวกัน

  1. ทดสอบ streaming

    ตรวจเวลาจนถึง token แรก เพื่อประเมินประสบการณ์ผู้ใช้จริง

  2. บันทึก response ที่ผ่านการตรวจสอบเป็น example/fixture

    การทดสอบรอบต่อไปจะใช้ fixture แทนการเรียก API จริง ช่วยประหยัด token ระหว่างพัฒนา

ต่อด้วย test scenario ที่ตรวจสอบ finish_reason, response schema และ token count เพื่อเปลี่ยน smoke test ให้เป็น regression suite ดู workflow การทดสอบ API เพิ่มเติมได้ในคู่มือการทดสอบ API สำหรับวิศวกร QA

9. จัดการข้อผิดพลาดและ rate limit

คาดหวัง error รูปแบบ OpenAI ที่มี message, type และ code

สถานะ สาเหตุที่พบบ่อย แนวทางแก้
401 คีย์หาย ถูกเพิกถอน หรือใช้ผิดแพลตฟอร์ม ตรวจ GLM_API_KEY และ region
400 request body ผิด หรือ model ID ไม่ถูกต้อง ตรวจ JSON และลอง glm-5 หาก glm-5.3 ยังไม่พร้อม
429 เกิน rate limit retry ด้วย exponential backoff + jitter
5xx ปัญหาชั่วคราวฝั่งเซิร์ฟเวอร์ retry แบบมีขีดจำกัด และบันทึก error

ตัวอย่าง retry helper ใน Python:

import random
import time
from openai import APIStatusError

def create_with_retry(request_fn, max_retries=5):
    for attempt in range(max_retries):
        try:
            return request_fn()
        except APIStatusError as error:
            retryable = error.status_code == 429 or error.status_code >= 500

            if not retryable or attempt == max_retries - 1:
                raise

            delay = min(30, 2 ** attempt) + random.random()
            time.sleep(delay)
Enter fullscreen mode Exit fullscreen mode

แนวทางที่ควรใช้ตั้งแต่วันแรก:

  • retry เฉพาะ 429 และ 5xx
  • อ่าน rate limit ล่าสุดจากเอกสาร Z.ai แทนการอ้างตัวเลขจากบทความ
  • เก็บ model ID ใน config เพื่อ rollback ได้โดยไม่ต้อง deploy ใหม่
  • ใช้ workflow การ debug แบบเดียวกับการทดสอบและดีบัก Grok API เพราะทั้งคู่ใช้รูปแบบ OpenAI-compatible

คำถามที่พบบ่อย

Model ID สำหรับ GLM-5.3 API คืออะไร?

คาดว่าจะเป็น glm-5.3 ตามรูปแบบ glm-5.1 และ glm-5.2 แต่ในขณะเขียน เอกสารยังอาจระบุ glm-5 อยู่ ตรวจสอบที่docs.z.aiก่อนใช้งานจริง และกำหนด model ID ผ่าน environment variable หรือ config

GLM-5.3 API ใช้กับ OpenAI SDK ได้หรือไม่?

ได้ ใช้ SDK openai สำหรับ Python และ Node.js แล้วตั้งค่า:

base_url=https://api.z.ai/api/paas/v4
Enter fullscreen mode Exit fullscreen mode

หรือใช้ endpoint ของ bigmodel.cn สำหรับจีนแผ่นดินใหญ่ รูปแบบ request, response และ streaming สอดคล้องกับ OpenAI Chat Completions

GLM-5.3 API มีค่าใช้จ่ายเท่าไร?

Zhipu ยังไม่ได้เผยแพร่ราคาสำหรับ GLM-5.3 โดยเฉพาะ ณ เวลาเปิดตัว ดูราคาล่าสุดจากหน้าราคาอย่างเป็นทางการ ซึ่งระบุ GLM-5.2 ที่ $1.40 ต่อ 1M input tokens และ $4.40 ต่อ 1M output tokens

GLM-5.3 เปรียบเทียบกับ Claude และ GPT อย่างไร?

Zhipu รายงานว่าความสามารถด้านโค้ดและ agent “ใกล้เคียงกับ Claude Fable 5” และรายงานคะแนน CyberGym 84.5% กับ ExploitBench 54.4% อย่างไรก็ตาม ตัวเลขเหล่านี้เป็น vendor evaluation จึงควรทดสอบกับชุดงานจริงของคุณเอง ดูกรอบเปรียบเทียบเพิ่มเติมได้จากการเปรียบเทียบ Grok 4.6 vs GPT-5.6 vs Claude Fable 5

รัน GLM-5.3 บนเครื่องตัวเองแทน API ได้หรือไม่?

ยังไม่ได้ในขณะเปิดตัว Zhipu ระบุว่า open weights จะเผยแพร่ประมาณวันที่ 28 สิงหาคม 2026 บนHugging Face org ด้วยสถาปัตยกรรม MoE ขนาด 744B การ deploy ในเครื่องเป็นงานระดับเซิร์ฟเวอร์มากกว่าระดับแล็ปท็อป

สรุป

หากคุณมี workload แบบ coding, terminal automation หรือ agent loop ให้เริ่มประเมิน GLM-5.3 ด้วย request จริงของระบบคุณเอง ลำดับที่แนะนำคือ:

  1. สร้าง API key
  2. รัน cURL smoke test
  3. ตั้งค่า request ใน Apidog
  4. เปรียบเทียบ thinking เปิด/ปิดด้วย prompt เดียวกัน
  5. เก็บ response เป็น fixture และสร้าง regression test
  6. พอร์ต integration ไปยัง Python หรือ Node.js ด้วย OpenAI SDK

ดาวน์โหลด Apidog เพื่อแยก environment ตามภูมิภาค, เก็บ model ID เป็นตัวแปร และทดสอบ request ก่อนเชื่อมเข้ากับแอปพลิเคชันจริง

Top comments (0)