Originally published on NextFuture
Z.ai vừa phát hành weights của GLM-5.3: 756 GB file model trải trên 141 shard Safetensors. Con số đó quyết định gần hết mọi thứ với dev Việt Nam.
Bài này bóc tách ba thứ trước khi bạn đưa GLM-5.3 vào stack: bản release thực sự có gì, tự host tốn gì, và điều khoản license chặn ai.
Bản release có gì
Gói phát hành gồm 756 GB file model trên 141 shard Safetensors, hỗ trợ sẵn vLLM và SGLang. Cấu hình kiến trúc là 256 routed expert, 8 expert kích hoạt cho mỗi token, chạy trên cửa sổ ngữ cảnh một triệu token.
Hỗ trợ vLLM và SGLang ngay từ ngày đầu là chi tiết đáng giá: bạn không phải chờ cộng đồng port serving stack.
Sức mạnh đến từ post-training, không phải pretrain
Đây là chi tiết kỹ thuật quan trọng nhất trong release notes. Z.ai giữ nguyên phần base foundation của GLM-5.2 — công ty không chạy cụm pretraining lớn hơn, cũng không đổi cấu trúc tham số bên dưới.
Bước nhảy hiệu năng đến từ post-training: môi trường reinforcement learning, harness kiểm chứng tác vụ, và dữ liệu chuyên ngành cho software engineering lẫn vulnerability hunting.
Z.ai công bố các mức tăng sau: Terminal-Bench 3.0 đi từ 4,6 lên 28,3; DeepSWE từ 46,2 lên 66,9; ExploitBench từ 24,4 lên 54,4.
Đọc kỹ phần chân trang trước khi tin con số. Theo phân tích trên Dev.to, đây là các bài đánh giá do chính vendor chạy, dưới cấu hình harness cụ thể — bao gồm 400.000 token ngữ cảnh và timeout 10 giờ cho mỗi rollout. Tác giả nói thẳng rằng chỉ khi có bên thứ ba tái lập trên nhiều serving stack khác nhau thì mới thấy được độ dao động thật khi vận hành.
Ý nghĩa thực tế cho người xây agent: năng lực agent ngày càng do scaffolding và vòng lặp verification trong post-training quyết định, chứ không phải quy mô pretraining thô. Một model hiểu execution nhiều lượt và phản hồi từ sandbox hành xử khác hẳn model chỉ đoán token code tiếp theo giỏi.
Tự host: phép tính không có cửa cho laptop
756 GB weights đẩy việc self-host bản gốc chưa lượng tử hoá vào địa hạt multi-GPU datacenter. Ngay cả khi lượng tử hoá FP8, theo bài phân tích, đây vẫn không phải thứ chạy được trên một workstation của dev hay một node homelab khiêm tốn.
Nói cách khác: "open weights" ở đây không có nghĩa là bạn tải về rồi chạy. Với phần lớn team ở Việt Nam, đường đi chính vẫn sẽ là hosted endpoint.
Giá gọi API: mốc tham chiếu từ Cloudflare
Cloudflare đưa GLM-5.3 lên Workers AI ngay lúc launch, với mức giá công bố:
Loại tokenGiá mỗi triệu token
Input1,40 USD
Input đã cache0,26 USD
Output4,40 USD
Chênh lệch giữa input thường và input đã cache là hơn năm lần. Nếu workload của bạn lặp lại system prompt hoặc cùng một khối code, thiết kế để hit cache là đòn bẩy chi phí lớn nhất ở đây.
Tỷ lệ output đắt hơn input hơn ba lần cũng đáng lưu ý: agent sinh nhiều code sẽ đội hoá đơn nhanh hơn agent chỉ đọc và trả lời ngắn. Mức giá này cho phép thử năng lực coding và vulnerability triage mà không phải dựng cụm H100 riêng.
Giấy phép: cổng chặn ở mốc mười tỷ đô
Z.ai dùng một license open-weight tự soạn, cấp quyền rộng để chạy, sửa đổi, phân phối và thương mại hoá weights. Ai nhúng tính năng model vào sản phẩm đều chạy được thoải mái.
Nhưng license kèm một điều kiện thương mại cụ thể: công ty vận hành nền tảng Model-as-a-Service với doanh thu hợp nhất toàn tập đoàn vượt mười tỷ USD phải qua vòng security review của Z.ai trước khi mở API inference hoặc fine-tuning có kiểm soát.
Điều này chia phân phối mở thành hai tầng. Dev độc lập, startup giai đoạn đầu, hay doanh nghiệp chạy tự động hoá nội bộ đều có toàn quyền truy cập, không cần xin phép. AWS, Microsoft Azure hay Google Cloud muốn bán endpoint GLM-5.3 trực tiếp cho khách thì phải ngồi vào bàn review.
Hệ quả cho cách gọi tên: đây không phải license được OSI phê duyệt, và gọi nó là "không ràng buộc" là sai. Bài phân tích mô tả đây là cơ chế phòng vệ nhắm đúng các nền tảng cloud — chặn việc họ ăn trọn biên lợi nhuận từ một model mở mà không đóng góp lại compute hay doanh thu license.
Với đội ngũ ở Việt Nam, tầng chặn này gần như không chạm tới bạn. Nó chỉ quan trọng nếu bạn định bán lại inference GLM-5.3 dưới danh nghĩa một tập đoàn rất lớn.
Nếu tự host: bạn nhận luôn phần rủi ro
Open weights đẩy trách nhiệm vận hành về phía người triển khai. Khi một model có năng lực phát hiện lỗ hổng mạnh chạy bên trong hạ tầng của bạn, phải tự kiểm chứng network segmentation, kiểm soát egress và quyền của tool ngay trên host của mình.
Bài phân tích chốt bằng một câu đáng dán lên tường phòng kỹ thuật: vendor cung cấp weights, còn bán kính thiệt hại là của bạn.
Định tuyến request: giữ gì trong nhà
Nếu bạn dùng endpoint hosted cho phần nặng, vẫn nên có luật rõ ràng cho phần còn lại. Một bài phân tích local-first gateway trên Dev.to đề xuất ba tiêu chí định tuyến: ngưỡng chịu độ trễ, độ nhạy cảm của dữ liệu, và mức đồng thời.
Áp vào tình huống GLM-5.3: prompt chứa code nội bộ hoặc dữ liệu khách hàng là ứng viên giữ lại cho model nhỏ chạy local, còn tác vụ agent dài và chạy song song nhiều luồng thì đẩy lên endpoint. Tác giả bài đó lưu ý laptop chỉ kham được khoảng hai lệnh song song, trong khi worker hosted kham hàng chục.
Chốt lại và theo dõi tiếp
Nếu bạn đang cân GLM-5.3 cho agent coding: bắt đầu bằng endpoint hosted, đo chi phí thật trên chính workload của mình, và thiết kế prompt để tận dụng mức giá cache 0,26 USD.
Thứ cần chờ là kết quả tái lập độc lập trên các serving stack khác nhau. Ba con số benchmark ở trên do vendor chạy; đến khi có số của bên thứ ba, hãy coi chúng là giới hạn trên, không phải mức bạn sẽ đạt được trong production.
This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.
Top comments (0)