Tháng 7 năm 2026 chứng kiến cuộc đua giữa hai mô hình biên có trọng số mở từ Trung Quốc: Kimi K3 của Moonshot AI (ra mắt ngày 16/7) và Qwen 3.8-Max của Alibaba (được giới thiệu ngày 19/7, khả dụng rộng rãi đầu tháng 8). Cả hai đều là mô hình mixture-of-experts (MoE) quy mô nghìn tỷ tham số, có thể tích hợp vào các khung tác nhân kiểu Claude Code và cạnh tranh về giá với các phòng thí nghiệm tiên phong của Hoa Kỳ. Tuy nhiên, khác biệt thực tế nằm ở trọng số có thể tải xuống, khả năng đa phương thức và chi phí vận hành.
Bài viết này so sánh các thông tin có thể kiểm chứng tính đến ngày 3/8/2026. Để xem thông số chi tiết của Alibaba, hãy đọc bài giải thích về Qwen 3.8-Max.
Lưu ý: chưa có bảng đánh giá độc lập đặt Kimi K3 và Qwen 3.8-Max trong cùng điều kiện thử nghiệm. Các số liệu hiệu năng dưới đây đến từ nhà cung cấp và chỉ nên dùng làm tín hiệu ban đầu.
Dòng thời gian phát hành
Thứ tự phát hành quan trọng vì “trọng số mở” có trạng thái khác nhau ở hai mô hình.
- Kimi K3 ra mắt ngày 16/7/2026. Moonshot phát hành trọng số sau 11 ngày, vào ngày 27/7, dưới dạng MXFP4 dung lượng 594 GB trên Hugging Face. Bạn có thể tải xuống, lượng tử hóa và tự chạy mô hình ngay hôm nay.
- Qwen 3.8-Max được giới thiệu ngày 19/7 và phát hành rộng rãi qua Alibaba Cloud Model Studio vào đầu tháng 8, theo bài đăng chính thức của Qwen. Alibaba hứa phát hành trọng số trên Hugging Face và ModelScope vào khoảng ngày 10/8.
Nếu tự lưu trữ là yêu cầu bắt buộc, Kimi K3 hiện là lựa chọn duy nhất có trọng số sẵn sàng tải xuống.
Tham số và kiến trúc MoE
Cả hai là mô hình MoE thưa thớt. Vì vậy, tổng số tham số không phản ánh trực tiếp chi phí suy luận; số tham số được kích hoạt trên mỗi token quan trọng hơn.
| Thông số | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Tổng số tham số | 2.4T | 2.8T |
| Tham số hoạt động mỗi token | 95B | 104B |
| Tỷ lệ kích hoạt | ~4% | ~3.7% |
| Kiến trúc nền tảng | Qwen 3.5, MoE | MoE |
| Trọng số mở | Đã hứa hẹn, khoảng 10/8 | MXFP4, 594 GB trên Hugging Face |
Qwen 3.8-Max nhỏ hơn cả về tổng tham số lẫn tham số hoạt động. Nếu các yếu tố khác tương đương, 95B tham số hoạt động mỗi token sẽ có chi phí vận hành thấp hơn 104B.
Với tự lưu trữ, cần nhìn vào kích thước tệp thực tế: Kimi K3 ở MXFP4 đã là 594 GB, chưa tính bộ đệm KV cho ngữ cảnh dài. Đây là khối lượng công việc đa nút đối với nhiều đội. Phần lớn nhóm phát triển sẽ phù hợp hơn với endpoint được lưu trữ, chỉ tự host khi có yêu cầu tuân thủ hoặc nghiên cứu.
Độ mở: trọng số tải được so với cam kết phát hành
Kimi K3 hiện có lợi thế rõ ràng:
- Trọng số đã công khai.
- Có thể kiểm tra kho lưu trữ và giấy phép.
- Có thể tự host, lượng tử hóa và tinh chỉnh.
- Có thể ghim một phiên bản mô hình cụ thể để tránh thay đổi ngầm từ nhà cung cấp.
Qwen 3.8-Max là mô hình thuộc lớp Qwen-Max đầu tiên Alibaba cam kết phát hành trọng số mở. Đây là thay đổi quan trọng so với các phiên bản Max trước đây chỉ có API. Nhưng tính đến ngày 3/8/2026, Qwen 3.8-Max vẫn là mô hình API có thông báo phát hành trọng số trong tương lai.
Kết luận hiện tại: nếu cần trọng số mở ngay hôm nay, chọn Kimi K3. Hãy kiểm tra lại sau khoảng ngày 10/8 khi Alibaba phát hành tệp trọng số và điều khoản giấy phép.
Phương thức: Qwen có thị giác, K3 chỉ văn bản
Đây là khác biệt lớn nhất về khả năng đầu vào.
Qwen 3.8-Max
Qwen 3.8-Max nhận đầu vào văn bản và hình ảnh:
{
"input_modalities": ["text", "image"]
}
Alibaba cũng trình diễn:
- Hiểu tài liệu PDF dài hơn 200 trang.
- Hiểu video dài tới 100 giờ bằng biểu đồ bộ nhớ.
- OCR và các tác vụ suy luận đa phương thức.
Tuy nhiên, hãy phân biệt rõ:
- Đầu vào hình ảnh là khả năng API được tài liệu hóa.
- Các tuyên bố về video và tài liệu cực dài là demo trong blog, không nhất thiết là kiểu đầu vào API đã được mô tả đầy đủ.
Kimi K3
Kimi K3 là mô hình văn bản. Nếu pipeline của bạn cần xử lý:
- Ảnh chụp màn hình
- Tài liệu quét
- Giao diện người dùng
- OCR
- Computer-use agent
…bạn cần ghép K3 với một mô hình thị giác riêng. Điều này thêm độ trễ, chi phí và mã tích hợp.
Chọn Qwen 3.8-Max nếu workload cần hình ảnh hoặc hiểu tài liệu trực quan.
Kimi K3 vẫn phù hợp nếu workload hoàn toàn là văn bản, mã nguồn hoặc tác nhân dòng lệnh.
Ngữ cảnh, đầu ra và API
Qwen 3.8-Max cung cấp:
- Cửa sổ ngữ cảnh: 1.000.000 token
- Đầu ra tối đa: 65.536 token
- Tham số suy luận:
reasoning_effort-
xhighlà mặc định - Có thêm
mediumvàlow
-
- Token suy nghĩ được giữ lại theo mặc định.
- Chế độ suy nghĩ và không suy nghĩ có cùng mức giá niêm yết.
Qwen được truy cập qua Alibaba Cloud Model Studio với các URL cơ sở theo khu vực:
- Bắc Kinh
- Singapore
- US-Virginia
Model Studio cung cấp cả hai giao thức:
- Endpoint tương thích OpenAI
- Endpoint tương thích Anthropic
Nhờ đó, bạn có thể tích hợp Qwen vào các công cụ kiểu Claude Code bằng biến môi trường:
export ANTHROPIC_BASE_URL="https://<dashscope-anthropic-endpoint>"
export ANTHROPIC_MODEL="qwen3.8-max"
Xem danh sách model và khu vực tại trang mô hình Model Studio. Nếu cần kiểm thử nhiều khu vực, bạn có thể lưu từng base URL thành environment trong Apidog để chuyển đổi mà không sửa request.
Kimi K3 cũng hỗ trợ giao thức Anthropic và có thể dùng trong các khung tác nhân kiểu Claude Code. Xem thông tin endpoint và giới hạn hiện tại trong bài giải thích về Kimi K3.
Giá API: Qwen rẻ hơn ở đầu ra
Giá công bố trên mỗi triệu token:
| Mức giá | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Đầu vào | $2.00 | $3.00 |
| Đầu ra | $6.00 | $15.00 |
| Lượt truy cập bộ đệm | $0.20 | $0.30 |
| Phân tầng | Cố định toàn bộ ngữ cảnh 1M | Theo lịch trình Moonshot |
Theo trang giá chính thức của Model Studio, Qwen 3.8-Max có giá cố định:
Input: $2 / 1M token
Output: $6 / 1M token
Cache hit: $0.20 / 1M token
Qwen cũng áp dụng:
- Tạo cache: 125% giá đầu vào.
- Cache hit: 10% giá đầu vào.
- Hạn mức miễn phí 1M token tại khu vực Singapore trong 90 ngày.
Kimi K3 có giá:
Input: $3 / 1M token
Output: $15 / 1M token
Cache hit: $0.30 / 1M token
Cách ước tính chi phí thực tế
Đừng chỉ nhìn giá đầu vào. Với tác nhân lập trình, token đầu ra thường chiếm phần lớn chi phí do mô hình tạo:
- Lập luận
- Kế hoạch
- Gọi công cụ
- Mã nguồn
- Phản hồi sau nhiều vòng lặp
Trong workload nặng đầu ra, Qwen có lợi thế rõ rệt: $6 so với $15 cho mỗi triệu token đầu ra.
Tuy nhiên, Qwen mặc định dùng reasoning_effort=xhigh; token suy nghĩ được tính như đầu ra. Vì vậy, hãy đo usage thực tế thay vì chỉ nhân input/output theo ước lượng đơn giản.
Để lập mô hình chi phí trước khi triển khai, xem phân tích giá Qwen 3.8.
Điểm chuẩn: chưa thể kết luận mô hình nào mạnh hơn
Hiện có hai loại dữ liệu:
Có sẵn:
- Bảng benchmark do Alibaba thực hiện cho Qwen 3.8-Max.
- Bảng benchmark do Moonshot thực hiện cho Kimi K3.
Chưa có:
- Đánh giá độc lập chạy cả hai mô hình trong cùng framework, cùng prompt, cùng cấu hình tool và cùng phương pháp chấm điểm.
- Bảng đối đầu trực tiếp giữa Qwen 3.8-Max và Kimi K3.
Các số liệu Alibaba công bố:
| Điểm chuẩn | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 |
| HLE | 43.6 | 45.7 | 53.3 | 47.2 |
Ngay trong bảng của Alibaba, Qwen 3.8-Max vẫn có điểm yếu:
- Thấp hơn Fable 5 trên SWE-bench Pro.
- Thấp hơn toàn bộ các mô hình được liệt kê trên HLE.
- Mạnh hơn ở PaperBench, IFBench và nhóm benchmark đa phương thức.
Moonshot cũng công bố Kimi K3 cạnh tranh với các mô hình tiên phong, nhưng đây vẫn là benchmark do Moonshot thực hiện. Xem thêm cảnh báo và số liệu trong bài so sánh Kimi K3 vs Claude Opus 4.8.
Tóm lại: các bảng benchmark cho thấy cả hai mô hình đều cạnh tranh trong tác vụ tác nhân, nhưng không chứng minh được mô hình nào tốt hơn mô hình còn lại.
Để xem chi tiết các số liệu phía Alibaba, đọc phân tích benchmark Qwen 3.8.
Tự chạy so sánh trực tiếp trong Apidog
Benchmark hữu ích nhất là benchmark trên workload thật của bạn.
Cả hai mô hình đều cung cấp endpoint hoàn thành hội thoại tương thích OpenAI, nên bạn có thể thiết lập kiểm thử A/B trong Apidog.
1. Tạo hai environment
Ví dụ:
Environment: Qwen
BASE_URL=https://<dashscope-endpoint>
MODEL=qwen3.8-max
API_KEY=<your-qwen-key>
Environment: Kimi
BASE_URL=https://<moonshot-endpoint>
MODEL=<kimi-k3-model-id>
API_KEY=<your-kimi-key>
2. Lưu một request dùng biến môi trường
POST {{BASE_URL}}/v1/chat/completions
Authorization: Bearer {{API_KEY}}
Content-Type: application/json
{
"model": "{{MODEL}}",
"messages": [
{
"role": "system",
"content": "Bạn là trợ lý lập trình. Trả lời ngắn gọn, có mã khi cần."
},
{
"role": "user",
"content": "Phân tích lỗi trong đoạn mã sau và đề xuất bản vá tối thiểu."
}
]
}
3. Dùng prompt thực tế
Không dùng câu đố benchmark. Hãy kiểm thử bằng dữ liệu gần với sản phẩm của bạn:
- Một lỗi từ repository thật.
- Pull request cần review.
- Tài liệu kỹ thuật dài.
- Yêu cầu chuyển đổi API.
- Quy trình tác nhân nhiều bước.
- Ảnh chụp màn hình hoặc PDF nếu đang đánh giá Qwen.
4. Thêm assertion
Ví dụ, kiểm tra:
- HTTP status thành công.
- Schema JSON hợp lệ.
- Độ trễ dưới ngưỡng.
- Có trường hoặc từ khóa bắt buộc.
- Không tạo mã ngoài phạm vi thay đổi.
Sau đó chạy cùng request trên cả hai environment và so sánh:
- Chất lượng đầu ra
- Độ trễ
- Token usage
- Chi phí
- Độ ổn định qua nhiều lần chạy
- Hành vi streaming/SSE
- Khả năng tuân thủ format
Tải Apidog miễn phí và chạy ít nhất 10 prompt qua cả hai endpoint trước khi chọn mô hình cho roadmap.
Thẻ điểm
| Tiêu chí | Người thắng hôm nay | Lưu ý |
|---|---|---|
| Tổng/tham số hoạt động | Qwen 3.8-Max | 2.4T/95B so với 2.8T/104B; chủ yếu ảnh hưởng chi phí vận hành |
| Trọng số mở hiện tại | Kimi K3 | Có trên Hugging Face, 594 GB MXFP4 |
| Phương thức | Qwen 3.8-Max | Hỗ trợ văn bản và hình ảnh |
| Cửa sổ ngữ cảnh | Qwen 3.8-Max | 1M token, đầu ra tối đa 65.536 |
| Giá | Qwen 3.8-Max | $2/$6 so với $3/$15 |
| Điểm chuẩn | Chưa thể kết luận | Cả hai bảng đều do nhà cung cấp thực hiện |
| Hệ sinh thái framework | Hòa | Cả hai hỗ trợ endpoint tương thích Anthropic |
| Lịch sử thực hiện cam kết mở | Kimi K3 | Trọng số phát hành 11 ngày sau ra mắt |
Chọn mô hình nào?
Chọn Kimi K3 nếu
- Bạn cần tự host ngay trong tuần này.
- Yêu cầu tuân thủ buộc bạn phải ghim và kiểm tra trọng số.
- Workload chỉ dùng văn bản.
- Workload nặng đầu vào và tận dụng cache tốt.
- Bạn muốn kiểm soát quá trình lượng tử hóa hoặc tinh chỉnh.
Chọn Qwen 3.8-Max nếu
- Workload cần hiểu hình ảnh, OCR hoặc tài liệu trực quan.
- Bạn chạy agent loop tạo nhiều token đầu ra.
- Bạn cần ngữ cảnh 1M token với giá cố định.
- Bạn muốn tích hợp nhanh qua endpoint tương thích OpenAI hoặc Anthropic.
Chờ thêm nếu
- Trọng số mở là tiêu chí quyết định.
- Bạn cần đánh giá giấy phép Qwen sau khi trọng số được phát hành.
- Bạn chưa chạy A/B test trên prompt sản phẩm thật.
Video: tạo tài liệu API công khai bằng Apidog
Câu hỏi thường gặp
Kimi K3 có mở hơn Qwen 3.8-Max không?
Tính đến ngày 3/8/2026, có. Trọng số Kimi K3 đã có trên Hugging Face từ ngày 27/7/2026 dưới dạng MXFP4 594 GB. Trọng số Qwen 3.8-Max được hứa hẹn vào khoảng ngày 10/8 nhưng chưa thể tải xuống.
Nếu Alibaba phát hành như cam kết, cả hai sẽ là mô hình biên có trọng số mở. Khi đó, quyết định sẽ phụ thuộc nhiều hơn vào giấy phép, chất lượng lượng tử hóa và hệ sinh thái cộng đồng. Nếu cần tự host K3, xem hướng dẫn chạy K3 cục bộ.
Mô hình nào viết mã tốt hơn?
Chưa thể trả lời trung thực bằng dữ liệu hiện có. Cả hai nhà cung cấp đều công bố benchmark mạnh cho coding agent, nhưng các bài đánh giá được chạy trong điều kiện khác nhau và chưa có benchmark độc lập trực tiếp.
Cách đúng là chạy cả hai trên:
- Issue thật trong repository.
- Nhiệm vụ sửa lỗi.
- Review pull request.
- Viết test.
- Refactor nhiều tệp.
- Luồng tool calling trong CI/CD.
Tôi có thể dùng cả hai với Claude Code không?
Có. Cả hai cung cấp endpoint tương thích Anthropic.
Với Qwen 3.8-Max:
export ANTHROPIC_BASE_URL="https://<dashscope-anthropic-endpoint>"
export ANTHROPIC_MODEL="qwen3.8-max"
Kimi K3 hỗ trợ cùng kiểu tích hợp qua endpoint Moonshot. Điều này giúp thiết lập A/B test khá đơn giản.
Mô hình nào rẻ hơn cho agent workload?
Theo giá niêm yết, Qwen 3.8-Max rẻ hơn:
Qwen 3.8-Max: Input $2 / Output $6
Kimi K3: Input $3 / Output $15
Khoảng cách đặc biệt lớn ở token đầu ra, nơi Kimi K3 đắt hơn 2,5 lần. Tuy nhiên:
- Cache hit của K3 vẫn cạnh tranh cho workload nặng đầu vào.
- Qwen mặc định
reasoning_effort=xhigh. - Token suy nghĩ của Qwen được tính như output token.
Vì vậy, hãy đo token mix, độ dài reasoning và tỷ lệ cache hit trên workload thật trước khi kết luận.
Top comments (0)