Giá Qwen 3.8-Max: cách ước tính chi phí API cho ngữ cảnh 1M token
Alibaba phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026 với giá chính thức là 2 USD/1M token đầu vào và 6 USD/1M token đầu ra. Theo trang giá Model Studio, đây là mức giá cố định cho toàn bộ cửa sổ ngữ cảnh đến 1M token, không có phụ phí khi prompt vượt ngưỡng ngữ cảnh.
Điểm quan trọng nhất: gửi 5.000 hay 900.000 token đầu vào vẫn tính theo mức 2 USD/1M token. Điều này giúp các workload như RAG, phân tích tài liệu dài và agent xử lý codebase lớn dễ dự báo ngân sách hơn.
Bài viết này hướng dẫn bạn:
- Đọc bảng giá Qwen 3.8-Max.
- Tính chi phí theo token đầu vào, đầu ra và reasoning.
- Tận dụng context cache.
- So sánh giá với Qwen 3.7-Max, Kimi K3, Claude Opus 5 và GPT-5.6 Terra.
- Đo usage thực tế trước khi triển khai production.
Để xem tổng quan mô hình trước, hãy đọc Qwen 3.8 là gì và tại sao nó lại quan trọng.
Lưu ý: bảng giá chỉ là điểm bắt đầu. Qwen 3.8-Max mặc định dùng
reasoning_effort: xhigh; token suy nghĩ được tính như token đầu ra. Hãy đousagetừ request thực tế thay vì chỉ ước lượng theo độ dài prompt. Apidog giúp xem usage token của từng response khi bạn kiểm thử API.
Giá GA: 2 USD đầu vào, 6 USD đầu ra
Theo bảng giá Model Studio được xác minh vào ngày 3 tháng 8 năm 2026, qwen3.8-max có các mức sau:
| Mục | Giá mỗi 1M token |
|---|---|
| Đầu vào | $2.00 |
| Đầu ra, bao gồm token suy nghĩ | $6.00 |
| Đầu vào cache hit | 10% giá đầu vào |
| Tạo cache rõ ràng | 125% giá đầu vào |
| Ngữ cảnh | Một mức giá từ 0 đến 1M token |
| Thinking và non-thinking | Cùng mức giá |
Ba điểm cần đưa vào mô hình chi phí:
- Không có tier giá cho prompt dài: toàn bộ cửa sổ 1M token dùng chung một mức giá.
- Reasoning không có giá riêng: nhưng token suy nghĩ vẫn là token đầu ra, vì vậy được tính 6 USD/1M token.
-
Đầu ra tối đa là 65.536 token/request: nếu response đạt giới hạn này, riêng chi phí đầu ra xấp xỉ
65,536 × 6 / 1,000,000 = $0.39.
Thông báo chính thức của Qwen 3.8 mô tả đây là mô hình mạnh nhất của Alibaba tại thời điểm đó, với 2.4T tham số tổng cộng, 95B tham số hoạt động, ngữ cảnh 1M token và đầu vào đa phương thức.
Vì sao giá cố định đến 1M token đáng chú ý?
Nhiều nhà cung cấp áp dụng giá theo tier ngữ cảnh: khi input vượt một ngưỡng token, giá mỗi token tăng. Điều này tạo ra chi phí khó dự đoán cho workload dài.
Alibaba cũng dùng cách định giá này cho một số model khác. Trên trang giá Model Studio, các model như qwen3-max và qwen3-coder-plus có giá tăng theo độ dài ngữ cảnh.
Với qwen3.8-max, cách tính đơn giản hơn:
chi phí input = input_tokens / 1_000_000 × $2
chi phí output = output_tokens / 1_000_000 × $6
tổng chi phí = chi phí input + chi phí output
Điều này đặc biệt hữu ích khi bạn xây dựng:
- Pipeline RAG đưa hàng trăm nghìn token tài liệu vào prompt.
- Agent phân tích repository hoặc tài liệu kỹ thuật lớn.
- Workflow truy xuất dữ liệu có context thay đổi theo từng request.
So sánh với Qwen 3.7-Max
Qwen 3.8-Max có giá niêm yết thấp hơn phiên bản trước:
- Qwen 3.7-Max: $2.50 input / $7.50 output cho 1M token.
- Qwen 3.8-Max: $2.00 input / $6.00 output cho 1M token.
Đây là mức giảm 20% ở cả input và output, trong khi model mới có ngữ cảnh lớn hơn, hỗ trợ đa phương thức và các cải tiến cho tác vụ agent.
Tuy nhiên, Qwen 3.7-Max đang có khuyến mãi 50%, đưa giá xuống $1.25 input / $3.75 output. Trong thời gian khuyến mãi, model cũ có thể phù hợp hơn nếu workload của bạn không cần ngữ cảnh 1M token hoặc các khả năng mới của Qwen 3.8-Max.
Nếu cần tối ưu chi phí hơn nữa, Qwen 3.7-Plus có giá niêm yết $0.40 input / $1.60 output, kèm chương trình khuyến mãi 20% tại thời điểm được đề cập.
Token suy nghĩ được tính phí như token đầu ra
Đây là phần cần kiểm tra kỹ trước khi ước tính ngân sách.
Qwen 3.8-Max hỗ trợ:
reasoning_effort: xhigh | medium | low
Mức mặc định là xhigh. Khi reasoning được bật, model tạo token suy luận nội bộ trước khi trả về câu trả lời cuối. Các token này được tính theo giá output: 6 USD/1M token.
Ví dụ, response hiển thị cho người dùng chỉ dài 800 token, nhưng model có thể tạo thêm vài nghìn token suy nghĩ. Vì vậy, không nên tính chi phí chỉ bằng số token nhìn thấy trong nội dung trả về.
Cách giảm chi phí reasoning
-
Dùng
mediumhoặclowcho tác vụ đơn giản:- Phân loại.
- Trích xuất dữ liệu.
- Chuẩn hóa/định dạng JSON.
- Tóm tắt ngắn.
-
Giữ
xhighcho tác vụ cần suy luận sâu:- Lập kế hoạch nhiều bước.
- Phân tích code phức tạp.
- Agent gọi tool nhiều vòng.
- Giải bài toán nhiều ràng buộc.
Đọc trường
usagetrong mọi response và lưu lại theo loại tác vụ.
Ví dụ payload:
{
"model": "qwen3.8-max",
"reasoning_effort": "medium",
"messages": [
{
"role": "user",
"content": "Trích xuất các trường quan trọng từ tài liệu này."
}
]
}
Context cache: cache hit chỉ bằng 10% giá input
Nếu ứng dụng gửi lại cùng một tiền tố prompt nhiều lần, context cache có thể giảm chi phí đáng kể.
Các mức giá:
- Cache hit: $0.20/1M token, bằng 10% giá input thông thường.
- Tạo cache rõ ràng: $2.50/1M token, bằng 125% giá input thông thường.
Nói cách khác:
- Input thông thường:
$2.00/1M. - Ghi cache:
$2.50/1M. - Đọc từ cache:
$0.20/1M.
Cache phù hợp cho các phần lặp lại giữa nhiều request:
- System prompt dài.
- Tài liệu sản phẩm ổn định.
- Tool definitions.
- Schema API.
- Hướng dẫn agent.
- Policy hoặc knowledge base dùng lại nhiều lần.
Công thức hòa vốn
Bạn trả thêm 25% khi tạo cache, nhưng các lần đọc sau tiết kiệm 90%.
Vì vậy, nếu một tiền tố được tái sử dụng từ hai lần trở lên, cache thường đã có lợi về chi phí.
Hạn mức miễn phí: 1M token, Singapore, 90 ngày
Model Studio có hạn mức miễn phí cho qwen3.8-max, với các điều kiện:
- Dung lượng: 1M token.
- Khu vực: chỉ Singapore.
- Endpoint:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
- Thời hạn: 90 ngày kể từ ngày kích hoạt.
Hạn mức này không áp dụng cho Bắc Kinh hoặc US-Virginia. Token suy nghĩ cũng bị trừ vào quota như token output thông thường.
Nếu mục tiêu của bạn là thử model với chi phí thấp nhất, xem thêm bài cách sử dụng Qwen 3.8 miễn phí.
So sánh giá Qwen 3.8-Max với các model khác
| Model | Input/1M token | Output/1M token | Ghi chú |
|---|---|---|---|
| Qwen 3.8-Max | $2.00 | $6.00 | Cố định đến 1M context; cache hit 10% |
| Qwen 3.7-Max | $2.50 | $7.50 | Khuyến mãi 50%: $1.25/$3.75 |
| Qwen 3.7-Plus | $0.40 | $1.60 | Khuyến mãi 20% |
| Kimi K3 | $3.00 | $15.00 | Cache hit $0.30 |
| Claude Opus 5 | $5.00 | $25.00 | — |
| GPT-5.6 Terra | $2.00 | $12.00 | — |
Cách đọc bảng:
- So với Kimi K3, Qwen 3.8-Max rẻ hơn khoảng một phần ba ở input và rẻ hơn 60% ở output. Cache hit cũng thấp hơn: $0.20 so với $0.30. Xem thêm hướng dẫn API Kimi K3.
- So với Claude Opus 5, Qwen rẻ hơn 60% ở input và 76% ở output.
- So với GPT-5.6 Terra, input có cùng giá $2/1M token, nhưng output của Qwen chỉ bằng một nửa.
Giá không phản ánh toàn bộ chất lượng hoặc mức độ phù hợp với workload. Tuy nhiên, xét riêng giá niêm yết, Qwen 3.8-Max có mức giá thấp trong nhóm model flagship được liệt kê.
Ví dụ tính chi phí thực tế
Ví dụ 1: một phiên agent 50K token
Giả sử một phiên agent dùng:
- 38.000 token input.
- 12.000 token output hiển thị.
Tính chi phí:
Input = 38,000 × $2 / 1,000,000 = $0.076
Output = 12,000 × $6 / 1,000,000 = $0.072
Tổng = $0.148
Chi phí xấp xỉ $0.15 mỗi phiên.
Nếu reasoning xhigh phát sinh thêm 8.000 token suy nghĩ:
Output mới = 12,000 + 8,000 = 20,000 token
Output = 20,000 × $6 / 1,000,000 = $0.12
Tổng = $0.076 + $0.12 = $0.196
Tổng chi phí tăng lên khoảng $0.20 mỗi phiên. Đây là lý do cần đo usage thực tế theo từng loại tác vụ.
Ví dụ 2: phân tích tài liệu 800K token
Giả sử bạn gửi 800.000 token tài liệu và yêu cầu bản tóm tắt 5.000 token:
Input = 800,000 × $2 / 1,000,000 = $1.60
Output = 5,000 × $6 / 1,000,000 = $0.03
Tổng = $1.63
Chi phí xấp xỉ $1.63 cho mỗi lượt chạy.
Với Qwen 3.8-Max, toàn bộ 800K token input vẫn được tính theo cùng mức $2/1M token.
Ví dụ 3: cache system prompt 100K token, 50 request/ngày
Giả sử mỗi request đều gửi lại:
- 100.000 token system prompt.
- Tài liệu sản phẩm.
- Tool definitions.
Không dùng cache:
100,000 × $2 / 1,000,000 = $0.20/request
$0.20 × 50 request = $10.00/ngày
Dùng explicit cache:
Tạo cache:
100,000 × $2.50 / 1,000,000 = $0.25
49 cache hit:
49 × (100,000 × $0.20 / 1,000,000) = $0.98
Tổng/ngày = $0.25 + $0.98 = $1.23
Kết quả: khoảng $1.23/ngày, thay vì $10/ngày, tương đương giảm khoảng 88% chi phí cho phần tiền tố lặp lại.
Quy trình đo và dự báo chi phí
Đừng xây dựng mô hình chi phí chỉ từ giả định. Hãy đo token từ các request đại diện cho production.
Bước 1: xác định nhóm tác vụ
Ví dụ:
- Chat hỗ trợ khách hàng.
- Trích xuất dữ liệu.
- Tóm tắt tài liệu.
- Agent gọi tool.
- Phân tích code.
- RAG với context dài.
Bước 2: kiểm thử mỗi nhóm với nhiều mức reasoning
Gửi cùng một loại request với:
reasoning_effort: low
reasoning_effort: medium
reasoning_effort: xhigh
Bước 3: lưu usage thực tế
Theo dõi số token input, output và reasoning trong trường usage của response.
Bước 4: tính trung bình theo workload
Dùng công thức:
chi phí trung bình/request =
(avg_input_tokens × $2 / 1,000,000) +
(avg_output_tokens × $6 / 1,000,000)
Bước 5: nhân với lưu lượng dự kiến
chi phí tháng =
chi phí trung bình/request × request/ngày × số ngày
Trong Apidog, bạn có thể lưu các base URL theo environment, chạy cùng request với các mức reasoning_effort khác nhau và kiểm tra token usage trực tiếp trong response. Bạn cũng có thể A/B test cùng prompt với qwen3.7-max hoặc Kimi K3 trong một workspace.
Tải Apidog để kiểm thử request và tạo số liệu chi phí dựa trên dữ liệu thực tế.
Kết luận
Qwen 3.8-Max có giá niêm yết $2/1M token input và $6/1M token output, cố định trên toàn bộ cửa sổ ngữ cảnh 1M token. Mức giá này thấp hơn giá niêm yết của Qwen 3.7-Max, bằng một nửa giá output của GPT-5.6 Terra và thấp hơn đáng kể so với Claude Opus 5.
Để kiểm soát chi phí khi triển khai:
- Đo
usagetừ request thực tế. - Chọn
reasoning_efforttheo độ khó của tác vụ. - Dùng cache cho prompt hoặc context lặp lại.
- Không lập ngân sách dài hạn dựa trên giá khuyến mãi.
- Kiểm tra khu vực endpoint nếu dùng hạn mức miễn phí.
Các câu hỏi thường gặp
Qwen 3.8 có tốn nhiều chi phí hơn cho prompt dài không?
Không. Bảng giá chính thức liệt kê một mức giá từ 0 đến 1M token. Prompt 900K token vẫn dùng giá input $2/1M token, không tăng tier theo độ dài context.
Điều này khác với các model có pricing theo tier, bao gồm một số model trong danh sách model của Model Studio.
Token suy nghĩ có tốn thêm chi phí trên Qwen 3.8 không?
Không có giá riêng cho thinking mode. Tuy nhiên, token suy nghĩ được tính là token output ở mức $6/1M token. Vì reasoning_effort mặc định là xhigh, request cần suy luận sâu có thể tốn nhiều hơn dự đoán dựa trên nội dung hiển thị.
Hãy giảm reasoning_effort cho tác vụ đơn giản và kiểm tra usage trong từng response.
Có thể dùng thử Qwen 3.8 miễn phí không?
Có. Model Studio có hạn mức miễn phí 1M token trong 90 ngày, chỉ áp dụng trên endpoint Singapore. Qwen Chat cũng cung cấp quyền truy cập miễn phí qua trình duyệt.
Xem chi tiết trong bài cách sử dụng Qwen 3.8 miễn phí.
Chương trình “giá xem trước 10%” còn khả dụng không?
Không. Đây là chương trình khuyến mãi trong giai đoạn preview được nhắc đến vào tháng 7 năm 2026. Khi phát hành rộng rãi, model chuyển sang giá tiêu chuẩn $2 input / $6 output. Hãy dùng trang giá Model Studio làm nguồn tham khảo chính.
Top comments (0)