DEV Community

Cover image for Cách sử dụng API GLM-5.3
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Cách sử dụng API GLM-5.3

Zhipu AI, phòng thí nghiệm Trung Quốc hoạt động quốc tế dưới tên Z.ai, đã phát hành GLM-5.3 vào ngày 14 tháng 8 năm 2026. Theo báo cáo ra mắt từ BigGo, các đánh giá nội bộ cho thấy khả năng lập trình tăng 50% so với GLM-5.2, điểm Terminal-Bench 3.0 tăng từ 4.6 lên 28.3, và Zhipu mô tả năng lực lập trình/tác nhân là “tiệm cận Claude Fable 5”. Trọng số mở dự kiến được công bố trong khoảng hai tuần. Để xem chi tiết khả năng và benchmark, hãy đọc GLM-5.3 là gì; bài viết này tập trung vào cách gọi API.

Dùng thử Apidog ngay hôm nay

Bạn sẽ thực hiện các bước sau:

  • Tạo khóa API.
  • Gọi API lần đầu bằng cURL.
  • Dùng OpenAI SDK với Python và Node.js.
  • Stream token.
  • Cấu hình temperature, max_tokens, thinking.
  • Kiểm thử yêu cầu trong Apidog trước khi tích hợp vào ứng dụng.

API của Z.ai tương thích với OpenAI. Nếu bạn đã dùng endpoint theo chuẩn OpenAI, phần lớn cấu trúc request sẽ quen thuộc.

Lưu ý: GLM-5.3 vừa được phát hành và tài liệu Zhipu có thể thay đổi nhanh trong ngày ra mắt. Các thông tin dưới đây dựa trên tài liệu chính thức tại thời điểm kiểm tra. Những phần chưa được tài liệu xác nhận rõ được ghi chú theo quy ước của dòng GLM-5.

TL;DR

  • GLM-5.3 ra mắt ngày 14 tháng 8 năm 2026. Zhipu báo cáo khả năng lập trình tăng 50% so với GLM-5.2 và Terminal-Bench 3.0 tăng từ 4.6 lên 28.3.
  • Endpoint quốc tế:
  POST https://api.z.ai/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Endpoint Trung Quốc Đại lục:

  POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode
  • Xác thực dùng header:
  Authorization: Bearer $GLM_API_KEY
Enter fullscreen mode Exit fullscreen mode
  • Tài liệu GLM-5 hiện liệt kê glm-5. Theo quy ước phiên bản, ID của bản mới có thể là glm-5.3, nhưng hãy xác nhận trước khi hard-code.
  • Zhipu chưa công bố giá API riêng cho 5.3. Trang giá chính thức hiện liệt kê GLM-5.2 ở mức 1.40 USD/1 triệu token đầu vào và 4.40 USD/1 triệu token đầu ra.
  • Trọng số mở dự kiến xuất hiện trên Hugging Face khoảng ngày 28 tháng 8 năm 2026.
  • Nên kiểm thử trong Apidog trước: tách môi trường theo khu vực, đặt model ID trong biến và lưu phản hồi làm fixture.

Tại sao GLM-5.3 quan trọng

Theo Zhipu, GLM-5.3 vẫn dùng mô hình cơ sở GLM-5; các cải tiến đến từ scaled post-training. Điểm Terminal-Bench 3.0 tăng từ 4.6 lên 28.3, tương đương khoảng 6.2 lần. Zhipu cũng cho biết mô hình đứng đầu nhóm mã nguồn mở trên Terminal-Bench 3.0 và Agents’ Last Exam, trong khi SWE-Marathon gần gấp đôi GLM-5.2.

Về bảo mật, CyberGym đạt 84.5%, cao hơn nhẹ Claude Mythos 5 và GPT-5.6 Sol theo số liệu được nêu; ExploitBench đạt 54.4%, vẫn thấp hơn các mô hình tiên tiến. Đây là các số liệu do nhà cung cấp báo cáo, nên cần chờ tái tạo độc lập trước khi dùng làm tiêu chí quyết định duy nhất.

Biểu đồ benchmark GLM-5.3

Theo tài liệu Z.ai, dòng GLM-5 dùng kiến trúc Mixture of Experts (MoE), có tổng 744 tỷ tham số, khoảng 40 tỷ tham số hoạt động trên mỗi forward pass và cửa sổ ngữ cảnh 200K token. Đây là thông số của dòng GLM-5, không nhất thiết là tuyên bố riêng cho 5.3.

Zhipu cho biết trọng số mở GLM-5.3 sẽ được phát hành khoảng hai tuần sau ngày ra mắt, cùng hệ thống đánh giá rủi ro mở rộng, theo Pandaily. Nếu bạn có kế hoạch self-host, hãy dùng các request API hiện tại làm regression baseline. Tham khảo thêm hướng dẫn chuẩn bị tự host GLM-5.3.

Lấy khóa API

Zhipu có hai nền tảng theo khu vực.

Z.ai: quốc tế

Đăng ký tại z.ai, mở API console và tạo khóa. Tài liệu có tại docs.z.ai.

Đây là lựa chọn mặc định cho người dùng ngoài Trung Quốc Đại lục.

Bigmodel.cn: Trung Quốc Đại lục

Nền tảng nội địa là open.bigmodel.cn. API có cấu trúc và cơ chế xác thực tương tự, nhưng dùng host và thanh toán riêng.

Sau khi tạo khóa, lưu nó trong biến môi trường:

export GLM_API_KEY="your-key-from-the-console"
Enter fullscreen mode Exit fullscreen mode

Không đưa API key vào source code hoặc commit vào repository.

Nếu dùng GLM Coding Plan thay vì tính phí theo mức dùng API, hạn mức đã được đặt lại cho tất cả người dùng vào ngày 14 tháng 8.

Endpoint và xác thực

Endpoint chat completions quốc tế:

POST https://api.z.ai/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Endpoint Trung Quốc Đại lục:

POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Header xác thực:

Authorization: Bearer $GLM_API_KEY
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode

API hỗ trợ định dạng OpenAI Chat Completions:

  • Request dùng modelmessages.
  • Response trả về choices, message, finish_reasonusage.
  • OpenAI SDK hoạt động khi đổi base_url sang endpoint của Z.ai.

Quy trình này tương tự cách gọi API DeepSeek V4 Pro.

Kiểm tra model ID trước khi triển khai

Tại thời điểm bài viết được tạo, tài liệu GLM-5 vẫn dùng model ID glm-5. Dựa trên quy ước glm-5.1glm-5.2, các ví dụ dưới đây sử dụng glm-5.3.

Tuy nhiên, trước khi chạy production:

  1. Kiểm tra model ID trong tài liệu chính thức.
  2. Đặt model ID trong biến môi trường hoặc file cấu hình.
  3. Nếu glm-5.3 trả về 404, thử glm-5 cho đến khi tài liệu khu vực được cập nhật.

Ví dụ:

export GLM_MODEL="glm-5.3"
Enter fullscreen mode Exit fullscreen mode

Yêu cầu đầu tiên bằng cURL

Chạy request sau để kiểm tra kết nối:

curl "https://api.z.ai/api/paas/v4/chat/completions" \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "system",
        "content": "You are a code reviewer. Flag issues as blocking or non-blocking."
      },
      {
        "role": "user",
        "content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
      }
    ],
    "temperature": 0.3,
    "max_tokens": 1024
  }'
Enter fullscreen mode Exit fullscreen mode

Đọc nội dung phản hồi tại:

choices[0].message.content
Enter fullscreen mode Exit fullscreen mode

Theo dõi token ở:

usage.prompt_tokens
usage.completion_tokens
Enter fullscreen mode Exit fullscreen mode

Để bật chế độ suy luận cho tác vụ nhiều bước, thêm:

"thinking": {
  "type": "enabled"
}
Enter fullscreen mode Exit fullscreen mode

Dùng thinking cho tác vụ lập trình, phân tích nhiều bước hoặc agent loop. Bỏ qua nó cho tác vụ ngắn như phân loại hoặc trích xuất trường dữ liệu để giảm token và độ trễ.

Khởi động nhanh Python

Cài OpenAI SDK:

pip install --upgrade openai
Enter fullscreen mode Exit fullscreen mode

Gọi GLM-5.3 bằng Python:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GLM_API_KEY"],
    base_url="https://api.z.ai/api/paas/v4",
)

response = client.chat.completions.create(
    model=os.getenv("GLM_MODEL", "glm-5.3"),
    messages=[
        {
            "role": "system",
            "content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
        },
        {
            "role": "user",
            "content": (
                "Review this Flask route for security issues:\n\n"
                "@app.route('/user/<id>')\n"
                "def get_user(id):\n"
                "    return db.execute(f'SELECT * FROM users WHERE id = {id}')"
            ),
        },
    ],
    temperature=0.3,
    max_tokens=2048,
)

print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)
Enter fullscreen mode Exit fullscreen mode

Ghi log usage ngay từ đầu. Vì giá GLM-5.3 chưa được công bố tại thời điểm ra mắt, số token là dữ liệu cần thiết để ước lượng chi phí khi bảng giá chính thức xuất hiện.

Khởi động nhanh Node.js

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.GLM_API_KEY,
  baseURL: "https://api.z.ai/api/paas/v4",
});

const response = await client.chat.completions.create({
  model: process.env.GLM_MODEL || "glm-5.3",
  messages: [
    {
      role: "system",
      content:
        "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
    },
    {
      role: "user",
      content:
        "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
    },
  ],
  temperature: 0.3,
  max_tokens: 2048,
});

console.log(response.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

Nếu ứng dụng của bạn đã gọi OpenAI, không cần tạo kiến trúc client riêng. Khởi tạo thêm một OpenAI client với baseURL của Z.ai, sau đó định tuyến request theo tác vụ. Cách này giúp A/B test GLM-5.3 với model hiện tại mà không phải viết lại business logic.

Streaming

Bật streaming bằng stream=True trong Python:

stream = client.chat.completions.create(
    model=os.getenv("GLM_MODEL", "glm-5.3"),
    messages=[
        {
            "role": "user",
            "content": "Explain the N+1 query problem with a concrete ORM example.",
        }
    ],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Với HTTP thuần, thêm vào request body:

"stream": true
Enter fullscreen mode Exit fullscreen mode

Server sẽ trả Server-Sent Events (SSE). Mỗi dòng data: chứa delta theo chunk format của OpenAI.

Lưu ý khi triển khai:

  • Token usage thường chỉ đầy đủ ở hoặc sau chunk cuối.
  • Chỉ tính chi phí sau khi stream kết thúc.
  • Khi bật thinking, thời gian đến token đầu tiên có thể tăng do model thực hiện suy luận trước khi trả lời.
  • Cần xử lý trường hợp client đóng kết nối giữa chừng.

Các tham số quan trọng

Tham số Kiểu Cách dùng
max_tokens số nguyên Giới hạn độ dài đầu ra; là đòn bẩy chi phí chính.
temperature số Dùng 0.20.4 cho code, review và extraction; 0.7+ cho nội dung sáng tạo.
thinking đối tượng {"type": "enabled"} để bật suy luận cho tác vụ nhiều bước.
stream boolean Trả SSE thay vì một response duy nhất.
messages mảng Dùng vai trò chuẩn: system, user, assistant.

Ví dụ request có thinking:

{
  "model": "glm-5.3",
  "messages": [
    {
      "role": "user",
      "content": "Find the likely race condition in this concurrent worker design."
    }
  ],
  "temperature": 0.2,
  "max_tokens": 2048,
  "thinking": {
    "type": "enabled"
  }
}
Enter fullscreen mode Exit fullscreen mode

Kiểm soát chi phí

Zhipu chưa công bố giá GLM-5.3 khi ra mắt. Không nên dùng các dự đoán giá từ bên thứ ba làm cơ sở vận hành.

Theo trang giá chính thức, tại thời điểm viết bài:

  • GLM-5.2: 1.40 USD/1 triệu token đầu vào và 4.40 USD/1 triệu token đầu ra.
  • GLM-5: 1.00 USD/1 triệu token đầu vào và 3.20 USD/1 triệu token đầu ra.

Đầu vào cache của các model GLM trả phí được giảm giá 80–85%. Để tận dụng cache:

  1. Giữ system prompt ổn định.
  2. Đưa nội dung biến động xuống cuối prompt.
  3. Không tạo nhiều phiên bản gần giống nhau của system prompt.
  4. Log prompt_tokenscompletion_tokens cho từng loại tác vụ.
  5. Đặt max_tokens theo giới hạn thực tế của UI hoặc workflow.

Tham khảo thêm các mẫu kiểm soát chi phí trong bài phân tích tăng giá DeepSeek.

Kiểm tra GLM-5.3 trong Apidog trước khi viết mã ứng dụng

Lặp prompt trực tiếp trong script thường chậm, khó so sánh và tốn token. Vì API Z.ai tương thích OpenAI, bạn có thể dùng Apidog để chuẩn hóa request trước.

1. Tạo request chat completions

Tạo request:

POST /chat/completions
Enter fullscreen mode Exit fullscreen mode

Request body cơ bản:

{
  "model": "{{GLM_MODEL}}",
  "messages": [
    {
      "role": "user",
      "content": "Review this code."
    }
  ],
  "temperature": 0.3,
  "max_tokens": 1024
}
Enter fullscreen mode Exit fullscreen mode

2. Tạo môi trường theo khu vực

Tạo hai môi trường:

  • zai-international
  • bigmodel-mainland

Cấu hình:

Biến zai-international bigmodel-mainland
BASE_URL https://api.z.ai/api/paas/v4 https://open.bigmodel.cn/api/paas/v4
GLM_API_KEY Khóa Z.ai Khóa Bigmodel
GLM_MODEL glm-5.3 glm-5.3 hoặc ID được tài liệu xác nhận

Dùng header:

Authorization: Bearer {{GLM_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Và URL:

{{BASE_URL}}/chat/completions
Enter fullscreen mode Exit fullscreen mode

Nhờ vậy, đổi khu vực chỉ là đổi environment; API key không nằm trong request đã lưu.

3. Đặt model ID trong biến

Không hard-code glm-5.3 trong mọi request. Dùng:

{{GLM_MODEL}}
Enter fullscreen mode Exit fullscreen mode

Cách này hữu ích khi:

  • ID chính thức thay đổi.
  • Bạn cần fallback về glm-5.
  • Bạn muốn A/B test với glm-5.2.
  • Bạn cần rollback nhanh khi prompt có thay đổi hành vi.

4. So sánh bật/tắt thinking

Nhân bản request thành hai phiên bản:

  • Bản A: không có thinking.
  • Bản B: thêm "thinking": { "type": "enabled" }.

Giữ nguyên prompt, sau đó so sánh:

  • Độ trễ.
  • Chất lượng đầu ra.
  • finish_reason.
  • usage.prompt_tokens.
  • usage.completion_tokens.

Đây là cách thực tế để quyết định tác vụ nào cần token suy luận.

5. Kiểm thử streaming

Tạo request với:

"stream": true
Enter fullscreen mode Exit fullscreen mode

Theo dõi SSE để kiểm tra thời gian đến token đầu tiên và hành vi UI khi response được trả dần.

6. Lưu phản hồi làm fixture

Lưu các phản hồi tốt làm example hoặc fixture. Khi phát triển test suite, dùng fixture thay vì gọi API mỗi lần để giảm chi phí token.

Sau đó, nối các request thành test scenario và thêm assertions cho:

  • finish_reason.
  • Response schema.
  • Các field bắt buộc trong choices.
  • Giới hạn token.
  • Nội dung hoặc cấu trúc đầu ra mong đợi.

Tham khảo workflow tổng quát trong hướng dẫn kiểm thử API dành cho kỹ sư QA.

Xử lý lỗi và giới hạn tần suất

Hãy xử lý lỗi theo kiểu OpenAI:

{
  "error": {
    "message": "Error description",
    "type": "error_type",
    "code": "error_code"
  }
}
Enter fullscreen mode Exit fullscreen mode

Các mã lỗi cần xử lý:

Nguyên nhân thường gặp Hành động
400 Request body sai hoặc model ID không hợp lệ Kiểm tra JSON, endpoint và model.
401 API key thiếu, sai hoặc bị thu hồi Kiểm tra biến môi trường và console.
429 Vượt rate limit Retry với exponential backoff có jitter.
5xx Lỗi máy chủ tạm thời Retry có giới hạn số lần.

Ví dụ retry helper trong Python:

import random
import time
from openai import APIStatusError

def call_with_retry(fn, max_attempts=5):
    for attempt in range(max_attempts):
        try:
            return fn()
        except APIStatusError as error:
            retryable = error.status_code == 429 or error.status_code >= 500

            if not retryable or attempt == max_attempts - 1:
                raise

            delay = min(30, 2 ** attempt) + random.uniform(0, 1)
            time.sleep(delay)
Enter fullscreen mode Exit fullscreen mode

Nguyên tắc triển khai:

  • Retry với 4295xx.
  • Không retry vô điều kiện với 400 hoặc 401.
  • Dùng exponential backoff có jitter để tránh retry đồng thời.
  • Đọc hạn mức hiện tại trực tiếp từ tài liệu Z.ai, không hard-code các con số từ blog.
  • Đặt model ID trong cấu hình để rollback về glm-5.2 chỉ cần đổi config.

Quy trình debug tương tự cũng áp dụng cho các API tương thích OpenAI khác, như trong hướng dẫn kiểm thử và debug Grok API.

Câu hỏi thường gặp

ID mô hình cho API GLM-5.3 là gì?

Hãy dự kiến glm-5.3, dựa trên quy ước glm-5.1glm-5.2. Tuy nhiên, tại thời điểm viết bài, tài liệu vẫn liệt kê glm-5. Hãy xác nhận trên docs.z.ai trước khi đưa vào production và luôn dùng biến cấu hình.

API GLM-5.3 có hoạt động với OpenAI SDK không?

Có. Đặt base_url thành:

https://api.z.ai/api/paas/v4
Enter fullscreen mode Exit fullscreen mode

Hoặc dùng endpoint Bigmodel tương ứng tại Trung Quốc Đại lục. OpenAI SDK cho Python và Node.js có thể dùng với API key Z.ai và schema chat completions, bao gồm cả streaming.

API GLM-5.3 có giá bao nhiêu?

Zhipu chưa công bố giá riêng cho GLM-5.3 tại thời điểm ra mắt ngày 14 tháng 8 năm 2026. Trang giá chính thức liệt kê GLM-5.2 ở mức 1.40 USD/1 triệu token đầu vào và 4.40 USD/1 triệu token đầu ra. Đây là điểm tham chiếu phù hợp cho đến khi Zhipu cập nhật giá 5.3.

GLM-5.3 so với Claude và GPT như thế nào?

Theo đánh giá nội bộ của Zhipu, năng lực lập trình và tác nhân của GLM-5.3 “tiệm cận Claude Fable 5”. CyberGym đạt 84.5%, cao hơn nhẹ Claude Mythos 5 và GPT-5.6 Sol theo số liệu được nêu, nhưng ExploitBench đạt 54.4% và vẫn thấp hơn một số model tiên tiến.

Hãy xem đây là tuyên bố của nhà cung cấp cho đến khi có benchmark độc lập. Tham khảo thêm so sánh Grok 4.6 vs GPT-5.6 vs Claude Fable 5.

Tôi có thể chạy GLM-5.3 cục bộ thay vì dùng API không?

Chưa tại thời điểm phát hành API. Zhipu cho biết trọng số mở dự kiến được phát hành khoảng ngày 28 tháng 8 năm 2026 tại tổ chức Hugging Face.

Thiết kế MoE 744 tỷ tham số cho thấy self-hosting cần hạ tầng máy chủ cấp doanh nghiệp, không phù hợp với máy tính xách tay thông thường. Hãy dùng API hosted trước, lưu request và benchmark làm baseline, rồi so sánh lại khi triển khai self-host.

GLM-5.3 phù hợp ở đâu trong stack của bạn

GLM-5.3 đáng để đánh giá nếu bạn chạy agent loop, workflow terminal hoặc tác vụ lập trình. API tương thích OpenAI giúp quá trình thử nghiệm đơn giản: đổi base URL, API key và model ID.

Trình tự triển khai thực tế:

  1. Tạo API key.
  2. Chạy smoke test bằng cURL.
  3. Xác nhận model ID theo tài liệu chính thức.
  4. Tạo request trong Apidog.
  5. Tách môi trường quốc tế và Trung Quốc Đại lục.
  6. So sánh thinking bật/tắt trên prompt thật.
  7. Lưu response làm fixture và thêm regression tests.
  8. Chuyển request đã xác nhận sang Python hoặc Node.js.

Tải Apidog để thiết lập môi trường khu vực, quản lý biến model và kiểm thử request trước khi đưa GLM-5.3 vào ứng dụng.

Top comments (0)