GLM-5.3-Flash hiện được giảm giá 50%. Ưu đãi kết thúc vào ngày 9 tháng 9 năm 2026; sau đó, mọi dự báo chi phí dựa trên giá hiện tại sẽ tăng gấp đôi.
Bài viết này phân tích giá hiện tại, giá niêm yết sau ưu đãi, các lựa chọn thay thế và cách xác định mức chênh lệch có ảnh hưởng thực tế đến khối lượng công việc của bạn hay không. Các số liệu được xác minh ngày 27 tháng 8 năm 2026. Giá nhà cung cấp có thể thay đổi, vì vậy hãy kiểm tra lại trước khi cam kết ngân sách.
Biểu giá
| Giá ra mắt (đến hết 9 tháng 9, 2026) | Giá niêm yết (sau đó) | |
|---|---|---|
| Đầu vào | $0.075 / 1M tokens | $0.15 / 1M tokens |
| Đầu ra | $0.25 / 1M tokens | $0.50 / 1M tokens |
| Đầu vào được lưu trữ (cache) | $0.015 / 1M tokens | $0.03 / 1M tokens |
Artificial Analysis công bố mức trung bình $0.10 cho mỗi triệu token, dựa trên tỷ lệ cache-input-output là 7:2:1. Đây là một con số hữu ích để so sánh, nhưng tỷ lệ token thực tế của bạn mới quyết định hóa đơn.
Chi phí thực tế
Giá trên mỗi triệu token khó hình dung, vì vậy dưới đây là ba ví dụ sử dụng giá niêm yết—mức cần dùng để lập kế hoạch sau ngày 9 tháng 9.
Bộ phân loại hỗ trợ
- 100.000 yêu cầu mỗi tháng.
- Mỗi yêu cầu: khoảng 800 token đầu vào và 100 token đầu ra.
- Tổng cộng: 80 triệu token đầu vào và 10 triệu token đầu ra.
- Chi phí: $12 đầu vào + $5 đầu ra = $17 mỗi tháng.
Đặt reasoning_effort thành low có thể tiếp tục giảm chi phí đầu ra.
Trợ lý lập trình
- 500 phiên mỗi ngày.
- Mỗi phiên: khoảng 15.000 token đầu vào, chủ yếu là ngữ cảnh tệp lặp lại, và 2.000 token đầu ra.
- Tổng hàng tháng: 225 triệu token đầu vào và 30 triệu token đầu ra.
- Không dùng cache: $33,75 + $15 = $48,75 mỗi tháng.
- Nếu 70% đầu vào được cache: chi phí đầu vào giảm còn khoảng $14,85, đưa tổng chi phí xuống khoảng $30 mỗi tháng.
Hệ thống xử lý tài liệu có hình ảnh
- 10.000 tài liệu mỗi tháng.
- Mỗi tài liệu: khoảng 40.000 token đầu vào, bao gồm nội dung hình ảnh, và 1.500 token đầu ra.
- Tổng cộng: 400 triệu token đầu vào và 15 triệu token đầu ra.
- Chi phí: $60 + $7,50 = $67,50 mỗi tháng.
Không có con số nào quá lớn. Đó chính là mục tiêu của mô hình này.
Cache là đòn bẩy lớn nhất
Với giá $0,03 cho mỗi triệu token so với $0,15 cho đầu vào mới, token được cache chỉ tốn một phần năm chi phí.
Các khối lượng công việc có những thành phần ổn định như:
- Tiền tố lời nhắc.
- System prompt.
- Tài liệu được truy vấn lặp lại.
- Cơ sở mã luôn nằm trong ngữ cảnh.
nên được cấu trúc sao cho phần tiền tố này giữ nguyên giữa các lần gọi.
Sai lầm phổ biến làm giảm tỷ lệ cache là đặt nội dung thay đổi ở đầu lời nhắc. Một dấu thời gian, request ID hoặc tên người dùng trong system prompt có thể làm mất hiệu lực cache của mọi nội dung phía sau.
Quy tắc thực tế: đặt nội dung ổn định trước, nội dung thay đổi ở cuối.
Z.ai cũng từng niêm yết cache input miễn phí trong một khoảng thời gian giới hạn. Hãy xem đây là chương trình khuyến mãi và xác minh điều khoản hiện tại, thay vì xây dựng kiến trúc phụ thuộc vào nó.
Đòn bẩy thứ hai: nỗ lực suy luận
reasoning_effort mặc định trên mô hình này là max—chế độ tốn kém nhất. Nếu không thiết lập tham số, bạn sẽ dùng mức này.
Ba chế độ hiện có:
lowhighmax
Token suy luận được tính phí như token đầu ra. Vì vậy, một tác vụ không cần suy nghĩ nhiều vẫn có thể phát sinh chi phí cho những token mà người dùng không nhìn thấy.
Đối với phân loại, trích xuất, định tuyến và định dạng, low thường là lựa chọn đầu tiên nên thử. Đây là thay đổi chỉ cần một dòng code và có thể giảm đáng kể chi phí đầu ra.
Xem cách thiết lập trong hướng dẫn API của chúng tôi.
So sánh với các mô hình khác
So với mô hình “anh em” GLM-5.3, giá niêm yết trung bình là:
| Mô hình | Trung bình trên 1 triệu token |
|---|---|
| GLM-5.3-Flash | $0,10 |
| GLM-5.3 | $0,90 |
GLM-5.3 đắt hơn khoảng chín lần cho chênh lệch ba điểm trên Chỉ số Trí tuệ của Artificial Analysis: 57 so với 60.
Bài so sánh đầy đủ của chúng tôi phân tích khi nào mức đánh đổi này không phù hợp. Tóm lại: GLM-5.3 có thể đáng chọn khi bạn truyền phản hồi dài đến người dùng đang chờ, vì tốc độ tạo token gần như nhanh gấp đôi.
So với GLM-5.2, Z.ai tuyên bố GLM-5.3-Flash có chi phí chỉ bằng khoảng một phần mười, với chi phí mỗi tác vụ là $0,045. Phân tích giá GLM-5.2 của chúng tôi cung cấp biểu giá cũ nếu bạn đang lập ngân sách cho việc di chuyển.
So với các mô hình đa phương thức giá rẻ từ nhà cung cấp khác, GLM-5.3-Flash có giá cạnh tranh và nổi bật nhờ giấy phép MIT, khiến tùy chọn tự host vẫn khả thi. Bài viết về giá Gemini 3.7 Flash đề cập đến lựa chọn tương đương gần nhất từ Google.
Giá giữa các nhà phân phối có thể khác nhau
GLM-5.3-Flash được cung cấp trực tiếp qua Z.ai, cũng như:
- OpenRouter
- Cloudflare Workers AI
- Vercel AI Gateway
- DeepInfra
- Novita
- GMICloud
- Baseten
- io.net
Các nhà cung cấp này không áp dụng cùng một mức giá. Ví dụ, AIHubMix niêm yết khoảng $0,113 cho đầu vào và $0,394 cho đầu ra—nằm giữa giá khuyến mãi và giá niêm yết của Z.ai. Một số nhà cung cấp có ưu đãi ra mắt, số khác thì không.
Nếu định tuyến qua một aggregator, hãy kiểm tra bảng giá của chính aggregator đó thay vì mặc định rằng nó phản ánh giá Z.ai. Cổng thống nhất có thể đi kèm biên lợi nhuận, và ở mức giá thấp như hiện nay, phần tăng thêm rất dễ bị bỏ qua.
Khi nào tự host có lợi?
Weights của mô hình được cấp phép MIT, vì vậy tự chạy mô hình là một lựa chọn thực tế. Tuy nhiên, giá API thấp khiến điểm hòa vốn khó đạt hơn.
Một ước tính sơ bộ:
- Full-precision serving cần một node lớp H200 với 8 GPU.
- Chi phí thuê cloud khoảng $24–$48 mỗi ngày.
- Tương đương khoảng $1.000 mỗi tháng, bất kể node đang bận hay rảnh.
Với giá API niêm yết, $1.000 có thể mua khoảng 6,7 tỷ token đầu vào. Bạn cần khối lượng sử dụng rất lớn và liên tục trước khi chi phí cố định của một node vượt qua mức này.
Với phần lớn đội nhóm, tự host GLM-5.3-Flash phù hợp hơn vì:
- Kiểm soát hạ tầng.
- Yêu cầu lưu trú dữ liệu.
- Điều kiện cấp phép.
Ngoại lệ là các phiên bản lượng tử hóa. GGUF đã có sẵn, và nếu chạy mô hình lượng tử hóa trên phần cứng bạn sở hữu, chi phí biên chủ yếu chỉ còn tiền điện. Hướng dẫn chạy cục bộ của chúng tôi phân tích khả năng của từng cấp phần cứng.
Lựa chọn khác: gói lập trình
Nếu bạn dùng mô hình với Claude Code hoặc Cline thay vì gọi API từ ứng dụng, định giá theo token có thể không phải mô hình phù hợp.
GLM Coding Plan bắt đầu từ khoảng $18 mỗi tháng, bao gồm GLM-5.3-Flash và được cho là cung cấp gấp ba hạn mức sử dụng so với GLM-5.3. Tài liệu Z.ai cũng cho biết các cuộc gọi ngoài giờ cao điểm tiêu thụ một nửa số điểm tiêu chuẩn.
Với một nhà phát triển sử dụng hàng ngày, gói cố định thường rẻ hơn và dễ dự đoán hơn API tính theo mức sử dụng.
Theo dõi chi phí đầu ra
Đầu vào thường thu hút nhiều chú ý hơn vì số lượng token lớn, nhưng đầu ra mới là nơi ngân sách dễ vượt dự kiến:
- Đầu ra có giá cao hơn ba lần đầu vào: $0,50 so với $0,15 cho mỗi triệu token.
- Token suy luận cũng được tính như đầu ra.
Một mô hình ở chế độ max có thể tạo ra nhiều token suy luận hơn đáng kể so với phần câu trả lời cuối cùng mà người dùng nhìn thấy. Vì vậy, ứng dụng có prompt ngắn nhưng phản hồi dài có thể phát sinh phần lớn chi phí từ đầu ra.
Mức trung bình $0,10 cho mỗi triệu token giả định tỷ lệ 7:2:1, nhưng nhiều khối lượng công việc thực tế không tuân theo tỷ lệ này.
Hãy đo lường thay vì ước tính. Mỗi phản hồi hoàn thành có đối tượng usage chứa số token của lần gọi đó. Bạn nên:
- Ghi lại dữ liệu
usage. - Tổng hợp theo ngày hoặc theo khối lượng công việc.
- So sánh tỷ lệ thực tế với giả định ngân sách.
- Điều chỉnh
reasoning_effortvà độ dài prompt dựa trên dữ liệu.
Nếu đầu ra chiếm khoảng 15% tổng số token, hãy kiểm tra reasoning_effort trước, sau đó tối ưu độ dài lời nhắc.
Việc cần làm trước ngày 9 tháng 9
1. Đo hỗn hợp token thực tế
Mức trung bình được giả định là 7:2:1. Nếu khối lượng công việc của bạn nặng về đầu ra, chi phí hiệu dụng sẽ gần $0,50 cho mỗi triệu token hơn là mức trung bình $0,10.
2. Kiểm tra tỷ lệ cache
Chênh lệch giá giữa input mới và input được cache là 5 lần. Đây là một trong những nơi có tiềm năng tiết kiệm lớn nhất.
3. Tính lại ngân sách theo giá niêm yết
Từ ngày 10 tháng 9, các mức giá sẽ tăng gấp đôi. Nếu một khối lượng công việc chỉ có lợi nhuận ở mức giá khuyến mãi, hãy xử lý vấn đề ngay bây giờ.
Để thu thập dữ liệu thực tế, hãy chạy các lệnh gọi đại diện dưới dạng collection đã lưu trong Apidog, sử dụng model ID từ biến môi trường. Đối tượng usage của mỗi phản hồi sẽ cung cấp số lượng token đầu vào, đầu ra và cache, đồng thời cho phép bạn chạy lại cùng một bộ kiểm thử với GLM-5.3 để so sánh hóa đơn thực tế thay vì chỉ dựa vào thông tin quảng cáo.
Câu hỏi thường gặp
GLM-5.3-Flash có miễn phí không?
Không. Mô hình từng miễn phí khoảng một tuần khi chạy ẩn danh dưới tên “ox-alpha” trước khi ra mắt, nhưng chương trình đó đã kết thúc. Mức giảm giá 50% hiện tại không đồng nghĩa với miễn phí.
Chương trình giảm giá kết thúc chính xác khi nào?
Ngày 9 tháng 9 năm 2026. Giá niêm yết sẽ được áp dụng từ thời điểm đó.
Vì sao các website niêm yết giá khác nhau?
Một số hiển thị giá khuyến mãi, một số hiển thị giá niêm yết, còn các nhà phân phối tự đặt biên lợi nhuận. Hãy kiểm tra đúng nhà cung cấp mà ứng dụng của bạn thực sự gọi.
Đầu vào hình ảnh có tốn thêm phí không?
Hình ảnh tiêu thụ token ngữ cảnh và được tính như đầu vào. Không có phụ phí hình ảnh riêng, nhưng hình ảnh độ phân giải cao có thể tiêu thụ đáng kể token.
Tự host có rẻ hơn không?
Chỉ khi bạn có khối lượng sử dụng rất lớn và liên tục, hoặc chạy phiên bản lượng tử hóa trên phần cứng sẵn có. Với giá $0,15 cho mỗi triệu token đầu vào, việc thuê node H200 8 GPU rất khó biện minh chỉ dựa trên chi phí.
Top comments (0)