GLM-5.3-Flash: mô hình đa phương thức 320B với chi phí thấp
Z.ai phát hành GLM-5.3-Flash vào ngày 26 tháng 8 năm 2026. Đây là mô hình mixture-of-experts 320 tỷ tham số, trong đó 18 tỷ tham số được kích hoạt, phát hành theo giấy phép MIT. Đây cũng là mô hình đầu tiên trong dòng GLM-5 xử lý hình ảnh tự nhiên thay vì dùng bộ chuyển đổi thị giác gắn thêm.
Nhiều nhà phát triển đã sử dụng mô hình này trong một tuần mà không biết danh tính thật của nó. Tuy nhiên, “Flash” trong tên gọi không có nghĩa là mô hình tạo token nhanh.
Tóm tắt nhanh
- Mô hình: mixture-of-experts 320B-A18B, trọng số mở, giấy phép MIT.
- Nhà phát hành: Z.ai, ngày 26 tháng 8 năm 2026.
- Đa phương thức: nhận văn bản, hình ảnh, video và tệp trong cùng một yêu cầu.
- Ngữ cảnh: 1.048.576 token, tương đương GLM-5.3.
- Giá niêm yết: 0,15 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra, xấp xỉ một phần mười GLM-5.2.
- Tốc độ: 48,7 token đầu ra mỗi giây; không nhanh so với kích thước mô hình.
- Thời gian tạo token đầu tiên: 1,52 giây, tốt hơn mức trung bình 2,14 giây của các mô hình mã nguồn mở.
-
API:
glm-5.3-flash. - Nhà cung cấp: Z.ai, OpenRouter, Cloudflare Workers AI, Vercel AI Gateway và các nền tảng khác.
- Tự lưu trữ: trọng số có trên Hugging Face.
Thông số kỹ thuật
| Thuộc tính | Giá trị |
|---|---|
| Tổng tham số | 320B |
| Tham số hoạt động | 18B |
| Kiến trúc | Mixture of experts, chú ý tuyến tính và chú ý thưa lai |
| Giấy phép | MIT |
| Cửa sổ ngữ cảnh | 1.048.576 token |
| Đầu vào | Văn bản, hình ảnh, video, tệp |
| Đầu ra | Văn bản |
| Chế độ suy luận |
thấp, cao, tối đa (mặc định tối đa) |
| ID mô hình API | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
Giới hạn token đầu ra chưa thống nhất
OpenRouter liệt kê tối đa 131.072 token, trong khi thẻ mô hình Hugging Face chỉ ra 163.840 token. Z.ai chưa công bố con số chính thức để giải quyết khác biệt này.
Nếu ứng dụng cần các lần sinh văn bản rất dài, hãy kiểm tra giới hạn với nhà cung cấp thực tế trước khi triển khai.
Đa phương thức tự nhiên là thay đổi quan trọng nhất
Trước đây, khả năng thị giác trong dòng GLM nằm ở các mô hình hoặc điểm cuối riêng biệt. Z.ai phát hành GLM-5V-Turbo và GLM-4.6V như các mô hình thị giác chuyên dụng. GLM-5.2 chỉ xử lý văn bản, còn GLM-5.3 dùng bộ chuyển đổi riêng cho thị giác.
GLM-5.3-Flash đưa hình ảnh, video và tệp vào cùng một yêu cầu chat với văn bản. Điều này tạo ra:
- Một ID mô hình duy nhất.
- Một dòng thanh toán duy nhất.
- Một cửa sổ ngữ cảnh có thể chứa cả hình ảnh và hàng triệu token văn bản.
Bạn có thể gửi một tài liệu đặc tả dài cùng ảnh chụp màn hình giao diện đã render, sau đó yêu cầu mô hình đối chiếu hai nguồn này trong cùng một prompt. Z.ai mô tả mô hình có thể quan sát “giao diện, kết quả hiển thị và phản hồi tương tác”, phù hợp với tác nhân lập trình hơn là chỉ chú thích ảnh.
Nếu cần mô hình thị giác chuyên dụng, hãy xem hướng dẫn API GLM-5V-Turbo hoặc GLM-OCR cho việc hiểu tài liệu.
Kiến trúc và hiệu quả phục vụ
Z.ai xây dựng GLM-5.3-Flash trên một mô hình cơ sở mới thay vì hậu huấn luyện GLM-5.2. Hai lựa chọn kiến trúc chính là:
Chú ý lai (Hybrid attention). Mô hình kết hợp chú ý tuyến tính và chú ý thưa:
- Chú ý tuyến tính xử lý các phụ thuộc cục bộ với chi phí thấp.
- Chú ý thưa tập trung vào các token có liên quan trên toàn cục.
Theo công bố, chi phí tính toán cho attention thấp hơn khoảng ba lần so với GLM-5.3, còn bộ nhớ đệm KV nhỏ hơn khoảng 4,4 lần.
Siêu kết nối ràng buộc đa tạp (Manifold-Constrained Hyper-Connections). Đây là thuật ngữ Z.ai dùng cho các kỹ thuật tối ưu hiệu quả mở rộng. Hiện chưa có đủ chi tiết công khai để đánh giá độc lập, vì vậy nên xem đây là đặc điểm kiến trúc do nhà cung cấp mô tả, chưa phải lợi thế đã được chứng minh.
Bộ nhớ đệm KV là một trong những nguyên nhân chính khiến suy luận ngữ cảnh dài tốn nhiều bộ nhớ. Việc giảm kích thước bộ nhớ đệm 4,4 lần giúp giải thích cách mô hình duy trì cửa sổ 1M token với mức giá thấp hơn đáng kể.
Quá trình huấn luyện sử dụng kho ngữ liệu đa phương thức mà Z.ai mô tả là khoảng 30 nghìn tỷ token.
“Flash” không có nghĩa là nhanh hơn
Artificial Analysis đo được GLM-5.3-Flash ở mức 48,7 token đầu ra mỗi giây. GLM-5.3 đạt khoảng 86 token mỗi giây trong cùng phép đo, tức phiên bản Flash chỉ có tốc độ gần bằng một nửa.
Điểm mạnh của Flash là thời gian tạo token đầu tiên:
- GLM-5.3-Flash: 1,52 giây.
- Trung bình các mô hình mã nguồn mở: 2,14 giây.
- GLM-5.3: tốc độ tạo token cao hơn đáng kể.
Vì vậy:
- Chọn Flash cho các tác vụ gồm nhiều lượt tương tác ngắn, nơi phản hồi ban đầu quan trọng.
- Chọn GLM-5.3 nếu cần sinh tài liệu dài với tốc độ streaming cao.
- Đừng chọn Flash chỉ vì tên gọi “Flash”.
Lợi thế thực tế của mô hình nằm ở chi phí và bộ nhớ, không phải thông lượng sinh token. Bộ nhớ đệm KV nhỏ hơn và chi phí attention thấp hơn giúp giảm giá mỗi token cùng dấu chân phục vụ, nhưng không khiến mô hình truyền phát nhanh hơn.
Điểm chuẩn
Các số liệu dưới đây do Z.ai công bố khi ra mắt, nên được xem là tuyên bố của nhà cung cấp cho đến khi có bên thứ ba tái tạo.
Artificial Analysis xếp GLM-5.3-Flash ở mức 57 trên Chỉ số thông minh v4.1.1. GLM-5.3 đạt 60 điểm, còn mức trung bình của các mô hình mã nguồn mở có kích thước tương tự là 27.
Z.ai định vị mô hình này gần Claude Opus 4.8 trong các tác vụ lập trình và tác nhân. Đây là đặc tính hóa dựa trên đánh giá nội bộ của nhà cung cấp, không phải kết quả đo lường độc lập. Khoảng cách ba điểm so với GLM-5.3 cũng cho thấy cần thận trọng khi diễn giải tuyên bố này.
Để xem các tiêu chuẩn GLM thay đổi như thế nào qua từng phiên bản, hãy đọc phân tích điểm chuẩn GLM-5.2.
Tuần lễ Ox Alpha
Ngày 20 tháng 8, mô hình ẩn danh ox-alpha xuất hiện trên các nền tảng suy luận bên thứ ba với cửa sổ ngữ cảnh 1M token và giá bằng không. Trong vài ngày, đây là một trong những mô hình được sử dụng nhiều nhất trên các nền tảng đó.
Cộng đồng xác định mô hình thuộc Zhipu trong khoảng 48 giờ dựa trên đặc điểm đầu ra.
Ngày 26 tháng 8, Z.ai xác nhận Ox Alpha chính là GLM-5.3-Flash, còn tuần lễ miễn phí là một thử nghiệm tải có chủ đích.
Z.ai cũng cho biết toàn bộ lưu lượng trong tuần đó được phục vụ trên các bộ tăng tốc nội địa Trung Quốc sử dụng ngăn xếp dựa trên SGLang. Nhà cung cấp tuyên bố chi phí phục vụ mỗi token có thể so sánh với phần cứng NVIDIA thông thường, nhưng chưa có xác minh độc lập.
Mẫu hình này từng xuất hiện với Pony Alpha, sau đó được xác định là mô hình DeepSeek hoặc GLM. Một mô hình ẩn danh có năng lực đặc biệt, cửa sổ ngữ cảnh “tròn trịa” và giá bất thường thường là phiên bản chưa phát hành đang được dùng để thu thập dữ liệu đánh giá.
Cách sử dụng GLM-5.3-Flash
API tương thích OpenAI
Điểm cuối của Z.ai tương thích với OpenAI. Bạn chỉ cần đổi base URL và model ID trong ứng dụng hiện có:
-
Base URL:
https://api.z.ai/api/paas/v4/ -
Model:
glm-5.3-flash
Để triển khai đầu vào hình ảnh và tham số nỗ lực suy luận, xem hướng dẫn API GLM-5.3-Flash.
Nhà cung cấp bên thứ ba
OpenRouter cung cấp mô hình với tên z-ai/glm-5.3-flash. Mô hình cũng có mặt trên:
- Cloudflare Workers AI
- Vercel AI Gateway
- DeepInfra
- Novita
- GMICloud
- Baseten
- io.net
Giá và giới hạn có thể khác nhau đáng kể giữa các nhà phân phối.
Coding agents
GLM-5.3-Flash nằm trong Gói Lập trình GLM và được báo cáo có hạn mức sử dụng gấp ba lần GLM-5.3. Đây có thể là lý do thực tế để người đăng ký chuyển sang Flash.
Tài liệu Z.ai cũng cho biết các cuộc gọi ngoài giờ cao điểm tiêu thụ một nửa số điểm tiêu chuẩn.
Tự lưu trữ
Trọng số được cấp phép MIT và có trên Hugging Face tại zai-org/GLM-5.3-Flash.
Các công cụ hỗ trợ gồm:
- vLLM
- SGLang
- TokenSpeed
- KTransformers
- Các bản lượng tử hóa GGUF cho hệ thống nhỏ hơn
Có nên sử dụng GLM-5.3-Flash?
Hãy chọn GLM-5.3-Flash nếu bạn:
- Cần xử lý hình ảnh hoặc video cùng văn bản trong một yêu cầu.
- Tối ưu chi phí trên mỗi token.
- Muốn tự lưu trữ trọng số theo giấy phép MIT.
- Xây dựng tác nhân lập trình cần phản hồi ban đầu nhanh.
Hãy chọn GLM-5.3 nếu bạn:
- Cần chất lượng suy luận cao hơn một chút.
- Cần thông lượng sinh token cao hơn.
- Không bị giới hạn nghiêm ngặt bởi chi phí.
Xem so sánh trực tiếp GLM-5.3-Flash và GLM-5.3 để phân tích chi tiết hơn. Bài viết GLM-5.3 là gì trình bày riêng về mô hình cơ sở.
Với API tương thích OpenAI, việc thử nghiệm chỉ yêu cầu thay đổi một dòng model ID. Hãy kiểm tra cả hai mô hình trên khối lượng công việc thực tế thay vì chỉ dựa vào bảng điểm chuẩn.
Khi đánh giá thay đổi mô hình, nên gửi các yêu cầu thật và kiểm tra phản hồi thật, bao gồm cả các yêu cầu đa phương thức khó mô phỏng bằng curl. Apidog cho phép lưu các lệnh gọi thành collection có thể tái sử dụng kèm assertion. Nhờ đó, bạn có thể xác nhận cấu trúc phản hồi vẫn tương thích trước khi chuyển từ GLM-5.3 sang Flash trong môi trường production.
Câu hỏi thường gặp
GLM-5.3-Flash còn miễn phí không?
Không. Tuần lễ Ox Alpha miễn phí đã kết thúc khi mô hình được công bố chính thức. Chương trình giảm giá ra mắt 50% kéo dài đến hết ngày 9 tháng 9 năm 2026; sau đó áp dụng giá niêm yết.
GLM-5.3-Flash có nhanh hơn GLM-5.3 không?
Không. Flash tạo khoảng 49 token mỗi giây, so với 86 token mỗi giây của GLM-5.3. Tuy nhiên, Flash bắt đầu phản hồi nhanh hơn với thời gian tạo token đầu tiên 1,52 giây.
Mô hình có thực sự hỗ trợ một triệu token không?
Cửa sổ được cấu hình là 1.048.576 token, được xác nhận trong cấu hình mô hình và bởi Artificial Analysis. OpenRouter liệt kê 1.310.720 token, nhưng nên xem đây là thông tin từ nhà cung cấp chứ không phải thông số kỹ thuật chuẩn của mô hình.
Mô hình có nhận video không?
Tài liệu Z.ai liệt kê văn bản, hình ảnh, video và tệp là các loại đầu vào. Vì hỗ trợ video mới hơn và ít được sử dụng rộng rãi, hãy kiểm thử với dữ liệu thực tế trước khi phụ thuộc vào tính năng này.
Trọng số sử dụng giấy phép nào?
MIT. Trọng số được công bố trên Hugging Face tại zai-org/GLM-5.3-Flash.


Top comments (0)