Claude Opus 5 ra mắt vào ngày 24 tháng 7 năm 2026 với giá 5 đô la cho mỗi triệu token đầu vào và 25 đô la cho mỗi triệu token đầu ra. Đây là mức giá tương tự mà Anthropic đã tính cho Opus 4.8, và chính xác bằng một nửa chi phí của Fable 5. Tất cả các bài đưa tin về sự kiện ra mắt đều chạy với tiêu đề đó, và điều này là chính xác cho đến thời điểm hiện tại.
Những gì bài đưa tin bỏ qua là phần quyết định hóa đơn của bạn: ghi vào bộ nhớ đệm, truy cập bộ nhớ đệm, tỷ lệ xử lý theo lô, chế độ nhanh, hệ số nhân theo khu vực và những thay đổi về hành vi làm thay đổi số lượng token một cách âm thầm.
Hướng dẫn này cung cấp bảng giá đầy đủ, sau đó tính chi phí theo các hình dạng yêu cầu thực tế để bạn có thể ước tính ngân sách trước khi triển khai. Để kiểm tra các con số này với lưu lượng truy cập của riêng bạn, hãy gửi yêu cầu từ Apidog và đọc khối usage trong mỗi phản hồi.
Bảng giá đầy đủ của Claude Opus 5
Mỗi mức giá dưới đây đều lấy từ tài liệu định giá của Anthropic và áp dụng cho ID mô hình claude-opus-5.
| Danh mục token | Giá trên mỗi triệu token |
|---|---|
| Đầu vào (tiêu chuẩn) | $5.00 |
| Đầu ra (tiêu chuẩn) | $25.00 |
| Ghi bộ nhớ đệm prompt, TTL 5 phút | $6.25 |
| Ghi bộ nhớ đệm prompt, TTL 1 giờ | $10.00 |
| Truy cập và làm mới bộ nhớ đệm | $0.50 |
| Đầu vào Batch API | $2.50 |
| Đầu ra Batch API | $12.50 |
| Đầu vào chế độ nhanh | $10.00 |
| Đầu ra chế độ nhanh | $50.00 |
Một vài điều cần lưu ý:
- Truy cập bộ nhớ đệm có chi phí bằng một phần mười đầu vào tiêu chuẩn. Đây là đòn bẩy lớn nhất trong bảng.
- Việc ghi bộ nhớ đệm 5 phút có mức phí cao hơn 1,25 lần so với đầu vào tiêu chuẩn; việc ghi 1 giờ cao hơn 2 lần.
- Batch API được giảm giá cố định 50% cho cả đầu vào và đầu ra.
- Chế độ nhanh có giá chính xác gấp 2 lần giá tiêu chuẩn để đạt tốc độ đầu ra nhanh hơn 2,5 lần. Đây là bản xem trước nghiên cứu, chỉ dành cho API bên thứ nhất — không áp dụng cho Bedrock, Google Cloud hoặc Microsoft Foundry — và không kết hợp với Batch API.
- Không có phí cao cấp cho ngữ cảnh dài. Cửa sổ ngữ cảnh 1 triệu token là mặc định và tối đa; token vượt bất kỳ ngưỡng nào vẫn được tính cùng mức $5. Một số mô hình cạnh tranh tăng giá khi vượt cấp ngữ cảnh, nhưng Opus 5 thì không.
Điểm cuối cùng đặt ra giới hạn cứng cho một yêu cầu duy nhất. Cuộc gọi API Messages đắt nhất có thể là 1 triệu token đầu vào cộng với tối đa 128k token đầu ra:
Đầu vào: 1.000.000 / 1.000.000 × $5.00 = $5.00
Đầu ra: 128.000 / 1.000.000 × $25.00 = $3.20
Tổng: $8.20
Trên Batch API, nơi đầu ra tối đa tăng lên 300k với tiêu đề beta output-300k-2026-03-24, phần đầu ra được giới hạn ở $3.75.
Điểm mốc: giống 4.8, bằng một nửa Fable 5
Đây là vị trí của Opus 5 so với các mô hình mà bạn có nhiều khả năng so sánh nhất.
| Mô hình | Đầu vào / Triệu token | Đầu ra / Triệu token |
|---|---|---|
| Claude Opus 5 | $5.00 | $25.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Sonnet 5 (giới thiệu, đến hết 31 tháng 8 năm 2026) | $2.00 | $10.00 |
| Claude Sonnet 5 (từ 1 tháng 9 năm 2026) | $3.00 | $15.00 |
Hai cách đọc bảng này có ý nghĩa quan trọng:
Nâng cấp từ Opus 4.8 không tốn thêm chi phí mỗi token. Mức giá giữ nguyên qua các phiên bản 4.5, 4.6, 4.7, 4.8 và 5. Thay đổi ID mô hình không ảnh hưởng đến kinh tế đơn vị, nhưng có thể ảnh hưởng đến tổng lượng token sử dụng. Phân tích giá Opus 4.8 vẫn phù hợp nếu bạn còn chạy ID cũ.
Opus 5 có giá bằng một nửa Fable 5. Theo số liệu do Anthropic công bố trong bài đăng ra mắt Opus 5, Opus 5 đạt khoảng 0,5% hiệu suất cao nhất của Fable 5 trên CursorBench 3.2, vượt qua nó trên OSWorld 2.0 và có chi phí mỗi tác vụ bằng khoảng một phần ba. Đây là tuyên bố của nhà cung cấp, chưa được tái tạo độc lập tính đến ngày 25 tháng 7 năm 2026. Hãy coi chúng là tuyên bố, không phải kết quả đã được xác nhận.
Xem so sánh Opus 5 và Fable 5 để đánh giá khi nào chênh lệch giá là hợp lý, hoặc xem trang giá Fable 5 để biết chi tiết về cấp cao hơn.
Ví dụ thực tế 1: một yêu cầu duy nhất
Bắt đầu với hình dạng đơn giản nhất: một lệnh tóm tắt có 8.000 token đầu vào và 1.200 token đầu ra.
Đầu vào: 8.000 / 1.000.000 × $5.00 = $0.040
Đầu ra: 1.200 / 1.000.000 × $25.00 = $0.030
Tổng: $0.070 mỗi cuộc gọi
Với 10.000 cuộc gọi mỗi tháng:
Opus 5: $0.070 × 10.000 = $700/tháng
Fable 5: $0.140 × 10.000 = $1.400/tháng
Sonnet 5 (giá giới thiệu): $0.028 × 10.000 = $280/tháng
Lưu ý rằng đầu ra chiếm 43% hóa đơn dù số token đầu vào gần gấp bảy lần đầu ra. Nguyên nhân là chi phí đầu ra cao gấp năm lần đầu vào.
Điều này quan trọng hơn trên Opus 5 so với 4.8 vì token suy nghĩ được tính phí như đầu ra, trong khi tính năng suy nghĩ thích ứng hiện được bật theo mặc định.
Ví dụ thực tế 2: phiên agentic dài có bộ nhớ đệm
Đây là nơi tiết kiệm đáng kể nhất. Giả sử một agent viết mã sử dụng:
- Prompt hệ thống và ngữ cảnh kho lưu trữ: 120.000 token
- Số lượt trong phiên: 40
- Ngữ cảnh hội thoại mới mỗi lượt: 1.500 token
- Đầu ra mỗi lượt: 2.500 token
Không dùng bộ nhớ đệm prompt
Nếu bạn gửi lại toàn bộ ngữ cảnh trong mỗi lượt:
| Mục | Token | Tỷ lệ | Chi phí |
|---|---|---|---|
Đầu vào: 120.000 × 40 + 60.000
|
4.860.000 | $5.00 | $24.30 |
Đầu ra: 2.500 × 40
|
100.000 | $25.00 | $2.50 |
| Tổng cộng | $26.80 |
Dùng bộ nhớ đệm prompt TTL 5 phút
Lưu tiền tố 120.000 token một lần, sau đó đọc lại trong các lượt tiếp theo:
| Mục | Token | Tỷ lệ | Chi phí |
|---|---|---|---|
| Ghi bộ nhớ đệm, một lần | 120.000 | $6.25 | $0.75 |
| Đọc bộ nhớ đệm, 39 lượt | 4.680.000 | $0.50 | $2.34 |
Đầu vào mới: 1.500 × 40
|
60.000 | $5.00 | $0.30 |
Đầu ra: 2.500 × 40
|
100.000 | $25.00 | $2.50 |
| Tổng cộng | $5.89 |
Đó là giảm 78%. Sau khi dùng bộ nhớ đệm đúng cách, đầu ra chiếm 42% hóa đơn thay vì 9%, vì vậy tối ưu hóa đầu ra là bước tiếp theo.
Chọn TTL phù hợp
Đọc bộ nhớ đệm sẽ làm mới TTL. Nếu các lượt cách nhau dưới 5 phút, phiên sẽ duy trì trạng thái ấm chỉ với một lần ghi.
Nếu agent có thể không hoạt động quá 5 phút, hãy dùng TTL 1 giờ:
Chi phí ghi cache 1 giờ:
120.000 / 1.000.000 × $10.00 = $1.20
Tổng phiên:
$1.20 + $2.34 + $0.30 + $2.50 = $6.34
Mức này vẫn thấp hơn 76% so với không dùng cache.
Ví dụ thực tế 3: xử lý theo lô
Với công việc không cần phản hồi đồng bộ, Batch API giảm cố định 50%.
Giả sử bạn xử lý 50.000 tài liệu, mỗi tài liệu có:
- 1.200 token đầu vào
- 150 token đầu ra
| Cách thức | Chi phí đầu vào | Chi phí đầu ra | Tổng cộng |
|---|---|---|---|
| Tiêu chuẩn | 60 triệu token × $5.00 = $300.00 | 7,5 triệu token × $25.00 = $187.50 | $487.50 |
| Theo lô | 60 triệu token × $2.50 = $150.00 | 7,5 triệu token × $12.50 = $93.75 | $243.75 |
Cùng số token, cùng mô hình, tiết kiệm $243.75.
Sự đánh đổi là độ trễ, không phải chất lượng. Hãy chuyển sang Batch API cho các tác vụ như:
- Phân loại nội dung
- Làm giàu dữ liệu
- Đánh giá mô hình
- Tóm tắt hàng đêm
- Backfill dữ liệu
Nếu công việc chấp nhận xử lý không đồng bộ, chạy qua điểm cuối tiêu chuẩn sẽ bỏ lỡ một nửa ngân sách có thể tiết kiệm.
Ví dụ thực tế 4: chi phí thực tế của chế độ nhanh
Chế độ nhanh tăng gấp đôi giá lên $10 / $50 để đạt tốc độ đầu ra nhanh hơn khoảng 2,5 lần.
Áp dụng cho ví dụ đầu tiên:
Đầu vào: 8.000 / 1.000.000 × $10.00 = $0.080
Đầu ra: 1.200 / 1.000.000 × $50.00 = $0.060
Tổng: $0.140 mỗi cuộc gọi
Đây chính xác là gấp đôi mức tiêu chuẩn.
Về thực tế, bạn đang trả mức giá tương đương Fable 5 tiêu chuẩn để đổi lấy độ trễ thấp hơn, không phải để tăng khả năng mô hình. Chế độ này phù hợp với giao diện tương tác nơi người dùng đang chờ token xuất hiện, nhưng khó biện minh cho công việc nền.
Lưu ý: chế độ nhanh không kết hợp với Batch API.
Bốn đòn bẩy thực sự thay đổi hóa đơn
1. Giảm yêu cầu tối thiểu cho bộ nhớ đệm prompt xuống 512 token
Trên Opus 4.8, prompt cần tối thiểu 1.024 token để được lưu cache. Trên Opus 5, ngưỡng là 512 token.
Điều này cho phép cache nhiều prompt hệ thống, tiền tố RAG và hướng dẫn dùng lại mà không cần thay đổi cấu trúc ứng dụng ngoài việc thêm cấu hình cache control.
Điểm hòa vốn:
- TTL 5 phút: hòa vốn sau 1,3 yêu cầu; bạn có lợi từ cuộc gọi thứ hai.
- TTL 1 giờ: hòa vốn sau 2,1 yêu cầu; bạn có lợi từ cuộc gọi thứ ba.
Ví dụ, prompt hệ thống 700 token tái sử dụng qua 1.000 cuộc gọi:
Không cache:
700 × 1.000 / 1.000.000 × $5.00 = $3.50
Cache TTL 5 phút:
Ghi: 700 / 1.000.000 × $6.25 = $0.0044
Đọc: 700 × 999 / 1.000.000 × $0.50 = $0.3497
Tổng: khoảng $0.354
Prompt này không đủ dài để cache trên Opus 4.8, nhưng đủ điều kiện trên Opus 5.
2. Xử lý theo lô với mức giảm 50%
Hãy kiểm tra chính xác khối lượng công việc nào thực sự cần phản hồi đồng bộ.
Các ứng viên phù hợp cho Batch API gồm:
- Chạy đánh giá
- Backfill dữ liệu
- Tóm tắt theo lịch
- Phân loại nội dung
- Trích xuất dữ liệu hàng loạt
Nếu không cần người dùng chờ kết quả ngay, Batch API là đòn bẩy tiết kiệm trực tiếp nhất.
3. Kiểm thử output_config.effort
output_config.effort kiểm soát mức độ mô hình suy nghĩ. Token suy nghĩ được tính như token đầu ra, với giá $25 mỗi triệu token.
Opus 5 hiệu chỉnh lại các cấp độ nỗ lực. Anthropic cho biết low và medium mạnh hơn đáng kể so với các mô hình Opus trước. Mặc định là high; xhigh vẫn là lựa chọn khởi đầu được khuyến nghị cho công việc viết mã và agentic.
Ví dụ minh họa:
xhigh: 8.000 token suy nghĩ
low: 1.500 token suy nghĩ
Chênh lệch: 6.500 token đầu ra
Tiết kiệm mỗi tác vụ:
6.500 / 1.000.000 × $25.00 = $0.1625
100.000 tác vụ:
$0.1625 × 100.000 = $16.250
Đây chỉ là ví dụ. Chênh lệch thực tế phụ thuộc prompt, công cụ và loại tác vụ của bạn.
Cách triển khai đúng là chạy đánh giá riêng cho từng cấp độ effort thay vì sao chép cấu hình từ Opus 4.8. Hướng dẫn tham số effort trình bày chi tiết quy trình kiểm tra.
Một cạm bẫy quan trọng: giảm effort làm giảm token suy nghĩ, không nhất thiết làm ngắn phản hồi hiển thị. Nếu cần câu trả lời ngắn hơn, hãy chỉ định rõ trong prompt:
Trả lời tối đa 5 gạch đầu dòng.
Không giải thích quy trình suy luận.
Giới hạn phản hồi dưới 200 từ.
4. Giảm chi phí phụ trội của prompt hệ thống khi dùng công cụ
Khi gửi định nghĩa công cụ, API sẽ chèn một prompt hệ thống mà bạn phải trả phí.
Trên Opus 5, chi phí phụ trội này là 286 token cho lựa chọn công cụ auto hoặc none:
| Mô hình | Token phụ trội |
|---|---|
| Opus 5 | 286 |
| Opus 4.8 | 290 |
| Opus 4.7 | 675 |
So với Opus 4.8, chênh lệch 4 token là khoảng $20 trên một triệu yêu cầu — không đáng kể.
So với Opus 4.7, chênh lệch là 389 token:
389 / 1.000.000 × $5.00 = $0.001945 mỗi yêu cầu
1.000.000 yêu cầu = $1.945
Nếu bạn vẫn chạy Opus 4.7, đây là khoản tiết kiệm đáng kể. Nếu đã chạy 4.8, đây chỉ là sai số làm tròn.
Đối với các kỹ thuật áp dụng cho toàn bộ dòng Claude, xem hướng dẫn cắt giảm hóa đơn API Claude.
Hai mục thường bị bỏ qua
Hệ số nhân inference_geo: "us" là 1,1 lần
Ghim suy luận vào cơ sở hạ tầng chỉ ở Hoa Kỳ để tuân thủ hoặc lưu trữ dữ liệu sẽ nhân mọi danh mục token với 1,1:
| Danh mục | Giá tiêu chuẩn | Giá khi inference_geo: "us"
|
|---|---|---|
| Đầu vào | $5.00 | $5.50 |
| Đầu ra | $25.00 | $27.50 |
| Đọc cache | $0.50 | $0.55 |
| Batch input | $2.50 | $2.75 |
| Batch output | $12.50 | $13.75 |
Khối lượng công việc $700/tháng trong ví dụ đầu tiên sẽ tăng lên $770/tháng.
Với hóa đơn $50.000, đây là khoản tăng $5.000. Hãy xác nhận yêu cầu ghim khu vực trước khi cấu hình.
Priority Tier không được hỗ trợ trên Opus 5
Opus 4.8 vẫn giữ Priority Tier. Nếu kế hoạch năng lực của bạn phụ thuộc vào cam kết Priority Tier, đây là hạn chế thực sự khi chuyển đổi.
Xem hướng dẫn di chuyển từ Opus 4.8 sang Opus 5 để biết thêm các thay đổi API có thể gây phá vỡ.
Những thay đổi hành vi xuất hiện trên hóa đơn
Giá mỗi token chỉ là một nửa hóa đơn. Nửa còn lại là khối lượng token. Ba thay đổi hành vi của Opus 5 có thể làm tăng mức sử dụng nếu bạn không kiểm soát chúng.
Tính năng suy nghĩ được bật theo mặc định.
Trên Opus 4.8, yêu cầu không có trườngthinkingsẽ chạy mà không suy nghĩ. Trên Opus 5, cùng yêu cầu đó chạy suy nghĩ thích ứng và token này được tính như đầu ra. Vìmax_tokensgiới hạn tổng token suy nghĩ cộng phản hồi, một số khối lượng công việc có thể bắt đầu bị cắt ngắn.Opus 5 ủy quyền cho subagent dễ dàng hơn.
Mỗi subagent có bộ token riêng được tính phí. Với luồng công việc nhạy cảm chi phí, hãy giới hạn số agent hoặc xác định rõ phạm vi ủy quyền.Opus 5 tự kiểm tra công việc mà không cần nhắc.
Nếu prompt vẫn chứa hướng dẫn như “kiểm tra lại công việc của bạn”, hướng dẫn prompt của Anthropic khuyến nghị loại bỏ chúng. Kiểm tra dư thừa sẽ tiêu tốn token.
Không điều nào trong số này thay đổi giá mỗi token. Tất cả đều thay đổi số token mà bạn phải trả.
Xác nhận chi phí thực tế bằng Apidog
Cách nhanh nhất để ngừng ước đoán là đọc đối tượng usage trong mọi phản hồi.
Các trường quan trọng gồm:
{
"usage": {
"input_tokens": 8000,
"output_tokens": 1200,
"cache_creation_input_tokens": 120000,
"cache_read_input_tokens": 4680000
}
}
Các giá trị này cho bạn đúng dữ liệu cần thiết để tính chi phí thực tế theo từng loại token.
Apidog là nền tảng phát triển và kiểm thử API. Để kiểm tra chi phí Opus 5:
- Tạo yêu cầu đến điểm cuối Messages với model
claude-opus-5. - Sao chép yêu cầu đã lưu cho từng cấp độ effort và so sánh token sử dụng trên cùng một prompt.
- Xác nhận
usage.cache_read_input_tokens > 0để phát hiện cache bị hỏng trước khi nó trở thành hóa đơn bất ngờ. - Lưu API key dưới dạng biến môi trường thay vì đặt trực tiếp trong request body.
- Theo dõi luồng SSE để xem token đầu ra tăng ở đâu trong các thế hệ dài.
Ví dụ request body:
{
"model": "claude-opus-5",
"max_tokens": 4096,
"messages": [
{
"role": "user",
"content": "Tóm tắt tài liệu này trong 5 gạch đầu dòng."
}
],
"output_config": {
"effort": "medium"
}
}
Tải xuống Apidog để chạy các kiểm tra này, đồng thời xem hướng dẫn API Opus 5 để biết cách cấu hình chi tiết.
Những gì bạn thực sự đang mua với giá $5 / $25
Opus 5 có vị trí mạnh về tỷ lệ giá trên khả năng, nhưng không phải là đỉnh của bộ sản phẩm Claude.
Fable 5 vẫn là mô hình phát hành rộng rãi có khả năng nhất của Anthropic. Opus 5 vẫn kém Mythos 5 về khai thác an ninh mạng và nghiên cứu sinh học tự động. Anthropic tuyên bố rõ cả hai điều này.
Cách nhìn nhận thực tế là: khả năng cấp tiên phong với một nửa giá cấp tiên phong, nhưng vẫn có giới hạn được đặt tên ở phía trên. Giải thích về mô hình lớp Mythos đề cập đến những gì nằm trên ranh giới đó.
Với hầu hết nhóm phát triển, câu hỏi thực tế không phải là Opus 5 so với giới hạn cao nhất. Câu hỏi là liệu khối lượng công việc có thật sự cần Opus hay Sonnet 5, với giá $2 / $10 và tăng lên $3 / $15 vào ngày 1 tháng 9 năm 2026, có thể hoàn thành công việc với 40% chi phí hay không.
Hãy chạy cả hai trên bộ đánh giá của riêng bạn trước khi cam kết ngân sách. Xem tổng quan Claude Opus 5 hoặc tổng quan mô hình của Anthropic để biết thông số kỹ thuật và khả năng sẵn có.
Câu hỏi thường gặp
Claude Opus 5 có giá bao nhiêu?
$5 cho mỗi triệu token đầu vào và $25 cho mỗi triệu token đầu ra trên API tiêu chuẩn. Truy cập bộ nhớ đệm có giá $0.50, Batch API có giá $2.50 / $12.50 và chế độ nhanh có giá $10 / $50.
Claude Opus 5 có đắt hơn Opus 4.8 không?
Theo mỗi token thì không: các mức giá giống hệt nhau. Hóa đơn vẫn có thể tăng vì suy nghĩ được bật theo mặc định và phản hồi mặc định dài hơn. Hãy đo lường khối lượng token thay vì giả định ngang bằng.
Có phụ phí ngữ cảnh dài trên cửa sổ 1 triệu token không?
Không. Cửa sổ ngữ cảnh 1 triệu token vừa là mặc định vừa là tối đa, và không có cấp giá cao hơn cho đầu vào dài.
Cách rẻ nhất để chạy Claude Opus 5 là gì?
Chủ động dùng cache — ngưỡng 512 token giúp hầu hết tiền tố tái sử dụng đủ điều kiện — chạy công việc không khẩn cấp qua Batch API để nhận giảm giá cố định 50%, và kiểm tra các mức effort để tìm mức thấp nhất vẫn vượt qua đánh giá của bạn. Hướng dẫn miễn phí và cách rẻ nhất có thêm thông tin.
Việc ghim khu vực có tốn thêm chi phí không?
Có. Đặt inference_geo: "us" áp dụng hệ số nhân 1,1 lần cho mọi danh mục token, bao gồm cả truy cập bộ nhớ đệm và xử lý theo lô.


Top comments (0)