DEV Community

BeanBean
BeanBean

Posted on Originally published at nextfuture.io.vn

Giá model AI Trung Quốc 2026: chọn tier để không đốt tiền

Originally published on NextFuture

Hoá đơn API tháng này gấp mấy lần tháng trước, trong khi tính năng vẫn thế. Bạn mở dashboard: mọi request đều đi vào model flagship, kể cả job phân loại text ngắn.

Một guide developer vừa công bố bảng giá tháng 9/2026 của bảy lab model Trung Quốc. Lấy nó làm mốc, đây là chỗ tiền thật sự chảy đi và cách chặn lại.

Bảy lab, giá sàn $0.08 / 1M input token

Guide liệt kê bảy lab đáng tích hợp: DeepSeek, Alibaba (Qwen), Moonshot (Kimi), Zhipu (GLM), MiniMax, Xiaomi (Mimo), Tencent (Hunyuan). Bảng giá bên dưới là platform rate per 1M token mà guide công bố tại tháng 9/2026 — chính tác giả nhắc "treat them as a shape, not a promise", nên hãy kiểm tra lại trước khi chốt ngân sách.

ModelInput / 1MOutput / 1MContext

Mimo V2.5$0.08$0.24128K
DeepSeek V4 Flash$0.14$0.42128K
Qwen 3.7$0.20$0.60128K
DeepSeek V4 Pro$0.28$0.84128K
GLM-5$0.30$1.00128K
Kimi K3$0.50$2.00256K
MiniMax M3$0.80$2.40128K
Hunyuan HY3$1.00$4.00256K

Guide dẫn một điểm neo về năng lực: DeepSeek V4 Flash ở $0.14 input/1M và đạt 82.7 trên Terminal Bench 2.1 — một benchmark agentic coding mà theo guide, nhiều model đắt gấp năm mươi lần lại chấm thấp hơn. Đây là số của guide, không phải kết quả đo độc lập.

Ba thứ quyết định hoá đơn hơn cả việc chọn model

Guide nói thẳng: khác biệt giữa hoá đơn $50 và $500 một tháng thường không nằm ở chọn model nào, mà ở việc output token có bị cap không, prompt prefix có cache được không, và có phải mọi request đều bị đẩy lên model flagship trong khi tier rẻ đã đủ dùng.

  • Output đắt gấp 3-10 lần input. Nhìn cột output trong bảng trên là thấy. Một lần generate không giới hạn không chỉ là rủi ro latency, nó là rủi ro chi phí không trần. Luôn set max_tokens.

  • Context caching cắt khoảng 90% chi phí input lặp lại. Điều kiện là prefix phải byte-stable: cùng system prompt, cùng instruction, cùng khối few-shot. Tức là đừng nhét timestamp hay user ID vào đầu prompt.

  • Route theo loại request. Guide gợi ý mặc định: classification/extraction khối lượng lớn dùng Mimo V2.5 hoặc DeepSeek V4 Flash; coding và agentic tool loop dùng DeepSeek V4 Flash hoặc Qwen 3.7; reasoning phức tạp dùng DeepSeek V4 Pro; tài liệu dài dùng Kimi K3 hoặc Hunyuan HY3 với cửa sổ 256K.

Open weights mua được gì — và không mua được gì

Guide kết luận: với đa số team, bản open-weight là phương án dự phòng và lá bài đàm phán, không phải môi trường production. Self-host nghĩa là GPU, quantisation, serving stack, autoscaling và người trực khi endpoint treo; trừ khi utilisation cao và đều, chi phí mỗi token thường vượt giá API hosted — chưa tính công kỹ sư.

Ma sát còn lại: số điện thoại

Với hầu hết các lab trong danh sách, guide ghi cùng một rào cản khi đăng ký trực tiếp: cần số điện thoại đại lục cộng phương thức thanh toán nội địa. Guide cũng ghi nhận mọi model trong danh sách đều gọi được qua endpoint OpenAI-compatible, nên đi vòng qua một aggregator là đường thực tế nếu bạn không có số đại lục.

Đừng lấy số trong slide làm cơ sở thiết kế

Một bài audit khác trong tuần mô tả một startup ra mắt với 40 triệu USD và tuyên bố rẻ hơn 444 lần các model đang dùng — mà câu hỏi "benchmark độc lập ở đâu" thì không ai trả lời được. Tác giả bài đó nói rõ lập luận của mình không phải sản phẩm là giả, mà "right shape" và "proven 444x" là hai tuyên bố khác nhau đội chung một tiêu đề.

Việc cần làm tuần này: lấy một mẫu request thật từ log production, chạy qua hai hoặc ba ứng viên trong bảng trên, đo chi phí thực và chất lượng thực. Con số của bạn là con số duy nhất bạn được phép thiết kế dựa trên đó.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)