DEV Community

Cover image for Giá Claude Fable 5.1: Phân Tích Chi Phí Đầy Đủ (2026)
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Giá Claude Fable 5.1: Phân Tích Chi Phí Đầy Đủ (2026)

Giá Claude Fable 5.1: Cách tính chi phí API và tối ưu prompt caching

Claude Fable 5.1 có giá $10 cho mỗi triệu token đầu vào$50 cho mỗi triệu token đầu ra, giống Fable 5. Điểm thay đổi lớn là đọc prompt cache: chỉ $0.25 cho mỗi triệu token, giảm từ $1 trên Fable 5 và bằng một nửa mức $0.50 của Opus 5. Anthropic ước tính các workload thông thường rẻ hơn khoảng 25%, còn workload thiên về tác nhân có thể rẻ hơn tới 45% so với Fable 5.

Thử Apidog ngay hôm nay

Bài viết này tổng hợp bảng giá chính thức, tái hiện hai tuyên bố 25% và 45%, đưa ra ba ví dụ chi phí thực tế, đồng thời liệt kê các yếu tố có thể làm thay đổi hóa đơn. Nếu cần tìm hiểu tổng quan trước, hãy đọc Claude Fable 5.1 là gì.

Giá Claude Fable 5.1

Bảng giá Claude Fable 5.1

Mức giá Claude Fable 5.1
Đầu vào cơ bản $10 / triệu token
Đầu ra $50 / triệu token
Ghi bộ đệm 5 phút $12.50 / triệu token — 1.25 lần giá đầu vào
Ghi bộ đệm 1 giờ $20 / triệu token — 2 lần giá đầu vào
Đọc bộ đệm — cache hit hoặc refresh $0.25 / triệu token — 0.025 lần giá đầu vào
Đầu vào Batch API $5 / triệu token
Đầu ra Batch API $25 / triệu token
Phí cao cấp cho ngữ cảnh dài Không; toàn bộ cửa sổ 1M token dùng giá tiêu chuẩn
inference_geo: "us" 1.1 lần cho mọi loại token
Fast mode Không khả dụng; chỉ có trên Opus 5 và Opus 4.8
Priority Tier Không được hỗ trợ
Web search $10 / 1.000 lượt tìm kiếm, cộng thêm chi phí token

Claude Mythos 5.1 có mức giá tương tự. Chiết khấu Batch API và hệ số cache được cộng dồn, vì vậy một lượt đọc bộ đệm theo lô có giá:

$0.25 × 0.5 = $0.125 / triệu token
Enter fullscreen mode Exit fullscreen mode

So sánh giá đọc bộ đệm

Mô hình Đầu vào cơ bản Đọc bộ đệm Tỷ lệ đọc / đầu vào
Claude Fable 5.1 $10 $0.25 2.5%
Claude Fable 5 $10 $1.00 10%
Claude Opus 5 $5 $0.50 10%
Claude Opus 4.8 $5 $0.50 10%
Claude Sonnet 5 $2 $0.20 10%
Claude Haiku 4.5 $1 $0.10 10%

Các mô hình Claude khác đều tính một lượt cache hit bằng 10% giá đầu vào cơ bản. Fable 5.1 chỉ tính 2.5%.

Điều này tạo ra một tình huống đáng chú ý:

  • Đầu vào chưa được lưu vào bộ đệm của Fable 5.1 đắt gấp đôi Opus 5.
  • Một lượt đọc bộ đệm trên Fable 5.1 chỉ bằng một nửa Opus 5.
  • Với workload mà phần lớn token đầu vào là tiền tố ổn định được lưu cache, chi phí đầu vào hiệu dụng của Fable 5.1 có thể thấp hơn Opus 5.

Một lưu ý về Sonnet 5: sau khi so sánh Opus 5 và Sonnet 5 đề cập đến khả năng tăng giá vào tháng 9, Anthropic đã hủy thay đổi đó. Sonnet 5 vẫn giữ mức $2 đầu vào$10 đầu ra.

Tái hiện tuyên bố tiết kiệm 25% và 45%

Anthropic không công bố chính xác thành phần workload dùng để tạo ra hai ước tính này. Vì vậy, phép tính dưới đây chỉ nhằm suy ra tỷ lệ cache hit mà các con số đó ngụ ý.

Giả sử:

  • U: triệu token đầu vào chưa được cache
  • C: triệu token đầu vào đã được cache
  • O: triệu token đầu ra

Chi phí cho mỗi request:

Fable 5   = 10U + 1.0C + 50O
Fable 5.1 = 10U + 0.25C + 50O
Enter fullscreen mode Exit fullscreen mode

Khoản tiết kiệm là:

0.75C
Enter fullscreen mode Exit fullscreen mode

Tỷ lệ tiết kiệm:

0.75C / (10U + C + 50O)
Enter fullscreen mode Exit fullscreen mode

Workload trò chuyện thông thường

Giả sử mỗi request có:

  • 20.000 token đã cache
  • 2.000 token chưa cache
  • 1.500 token đầu ra

Chi phí trên Fable 5:

10(0.002) + 1.0(0.02) + 50(0.0015)
= $0.02 + $0.02 + $0.075
= $0.115
Enter fullscreen mode Exit fullscreen mode

Chi phí trên Fable 5.1:

$0.02 + $0.005 + $0.075 = $0.100
Enter fullscreen mode Exit fullscreen mode

Mức tiết kiệm chỉ khoảng 13%.

Để đạt mức 25%, phần tiền tố được cache phải lớn hơn đáng kể so với phần đầu ra. Ví dụ, với 60.000 token cache và cùng 1.500 token đầu ra:

Fable 5   = $0.155
Fable 5.1 = $0.110
Enter fullscreen mode Exit fullscreen mode

Mức tiết kiệm là khoảng 29%.

Một vòng lặp tác nhân

Giả sử một tác nhân:

  • Đọc lại tiền tố 150.000 token trên mỗi lượt gọi công cụ
  • Thực hiện 40 lượt gọi công cụ
  • Thêm 1.000 token chưa cache mỗi lượt
  • Tạo 800 token đầu ra mỗi lượt

Chi phí mỗi lượt trên Fable 5:

10(0.001) + 1.0(0.15) + 50(0.0008)
= $0.01 + $0.15 + $0.04
= $0.20
Enter fullscreen mode Exit fullscreen mode

Chi phí mỗi lượt trên Fable 5.1:

$0.01 + $0.0375 + $0.04 = $0.0875
Enter fullscreen mode Exit fullscreen mode

Mức tiết kiệm là 56% mỗi lượt, chưa tính một lần ghi bộ đệm ban đầu.

Trong 40 lượt:

Fable 5   = $8.00
Fable 5.1 = $3.50
Enter fullscreen mode Exit fullscreen mode

Sau khi cộng thêm các lượt ghi cache và các token bị cache miss trong workload thực tế, mức tiết kiệm “lên tới 45%” của Anthropic nằm trong phạm vi hợp lý.

Quy tắc thực tế

Mức tiết kiệm tỷ lệ thuận với tỷ lệ:

token đầu vào đã cache / token đầu ra
Enter fullscreen mode Exit fullscreen mode
  • Workload nặng về đầu ra — tạo văn bản dài từ prompt ngắn — ít được hưởng lợi.
  • Workload nặng về tiền tố — tác nhân, RAG với ngữ cảnh lớn ổn định, chatbot đa lượt — được hưởng lợi rõ rệt.

Ba ví dụ chi phí thực tế cho mỗi tác vụ

Các ví dụ dưới đây dùng giá tiêu chuẩn của Fable 5.1 và giả định lượt ghi cache 5 phút chỉ phát sinh một lần.

1. Một lần review code

Giả sử:

  • 30.000 token đầu vào gồm diff và system prompt
  • 4.000 token đầu ra
  • Không có cache
Đầu vào: 30.000 × $10 / 1M = $0.30
Đầu ra:  4.000 × $50 / 1M  = $0.20
Tổng:                           $0.50
Enter fullscreen mode Exit fullscreen mode

Cùng workload trên Opus 5 có giá khoảng $0.25. Đây là trường hợp Fable 5.1 đắt gấp đôi vì không có token nào được cache.

2. Hội thoại hỗ trợ 25 lượt

Giả sử:

  • System prompt ổn định 12.000 token, ghi cache một lần
  • Mỗi lượt thêm 300 token chưa cache
  • Mỗi lượt tạo 250 token đầu ra
  • Tiền tố được đọc từ cache

Chi phí:

Ghi cache:
12.000 × $12.50 / 1M = $0.15

Đầu vào chưa cache:
25 × 300 = 7.500 token
7.500 × $10 / 1M = $0.075

Đọc cache:
25 × 12.000 = 300.000 token
300.000 × $0.25 / 1M = $0.075

Đầu ra:
25 × 250 = 6.250 token
6.250 × $50 / 1M = $0.3125
Enter fullscreen mode Exit fullscreen mode

Tổng cộng khoảng $0.61.

Trên Fable 5, riêng chi phí đọc cache đã là $0.30, nâng tổng chi phí lên gần $0.84.

3. Tác vụ xây dựng tác nhân kéo dài hai giờ

Giả sử:

  • 120 lượt gọi công cụ
  • Tiền tố tăng từ 20.000 lên 200.000 token, trung bình 110.000 token được cache
  • 1.500 token chưa cache mỗi lượt
  • 1.200 token đầu ra mỗi lượt
  • Khoảng sáu lần refresh cache khi tiền tố tăng

Chi phí trên Fable 5.1:

Đọc cache:
120 × 110.000 = 13.2M token
13.2M × $0.25 = $3.30

Đầu vào chưa cache:
120 × 1.500 = 180.000 token
180.000 × $10 / 1M = $1.80

Đầu ra:
120 × 1.200 = 144.000 token
144.000 × $50 / 1M = $7.20

Ghi cache:
Khoảng 660.000 token
660.000 × $12.50 / 1M = $8.25

Tổng: $3.30 + $1.80 + $7.20 + $8.25 = $20.55
Enter fullscreen mode Exit fullscreen mode

Trên Fable 5, đọc cache có giá $13.20 thay vì $3.30, nâng tổng chi phí lên gần $30.45. Đây là mức tiết kiệm khoảng 33%, dù đầu ra vẫn là khoản chi lớn nhất.

Ví dụ này cũng cho thấy mặt trái của việc đọc cache giá rẻ: một lần cache miss có thể đắt gấp 40 lần một lần cache hit. Các thay đổi làm reset cache giữa phiên — xây dựng lại system prompt, chỉnh sửa các lượt trước hoặc thay đổi mảng tools — sẽ làm chi phí tăng mạnh.

Các yếu tố ảnh hưởng đến hóa đơn

1. Điều chỉnh effort

output_config.effort là yếu tố lớn nhất ảnh hưởng đến số token đầu ra, vốn có giá $50 cho mỗi triệu token.

Hướng dẫn của Anthropic cho Fable 5.1 là bắt đầu với mức high. Theo Anthropic:

  • medium có chất lượng gần Fable 5 nhưng chi phí thấp hơn.
  • low thường cạnh tranh với Opus và Sonnet về chi phí trên mỗi tác vụ.

Hãy chạy benchmark riêng trên workload của bạn. Chế độ beta effort theo từng message cho phép dùng low ở các lượt thông thường và tăng effort cho các lượt khó mà không cần reset cache.

2. Giữ cache ổn định

Prompt caching là yếu tố giúp Fable 5.1 giảm chi phí đáng kể.

Với giá đọc cache $0.25 và ghi cache 5 phút $12.50, điểm hòa vốn của TTL 5 phút là khoảng một lần cache hit. Trong thời gian không hoạt động từ 5 đến 60 phút, gửi một request duy trì kết nối với max_tokens: 0 trên TTL 5 phút thường rẻ hơn trả mức ghi cache gấp đôi cho TTL 1 giờ.

Để bảo toàn cache:

  • Không xây dựng lại system hoặc tools giữa phiên.
  • Đặt thay đổi giữa cuộc hội thoại vào system message.
  • Đặt hướng dẫn thay đổi theo từng lượt vào user message.
  • Chỉ append nội dung thay vì xây dựng lại toàn bộ prompt.

Quy tắc append-only này cũng giúp bảo toàn các khối tư duy trên mô hình.

3. Dùng Batch API cho tác vụ có thể chờ

Batch API giảm một nửa mọi chi phí:

  • Đầu vào Fable 5.1: $5 / triệu token
  • Đầu ra Fable 5.1: $25 / triệu token

Đây là lựa chọn phù hợp cho:

  • Đánh giá hàng loạt
  • Data backfill
  • Xử lý tài liệu ban đêm
  • Các tác vụ không yêu cầu phản hồi tức thời

Fallback bị từ chối trong batch, vì vậy các mục bị từ chối phải được gửi lại thủ công.

4. Chọn model theo từng route

Tài liệu Anthropic khuyên bắt đầu với Opus 5, sau đó chuyển sang Fable 5.1 nếu Opus 5 ở mức effort cao hơn vẫn chưa đáp ứng yêu cầu.

Ngược lại, nếu Opus 5 đã vượt qua benchmark của bạn, việc dùng Opus trên route đó có thể khiến bạn trả gấp đôi mà không nhận thêm giá trị. So sánh Fable 5.1 và Opus 5 giúp phân tích lựa chọn này theo từng loại workload.

5. Đo chi phí của tools

Mọi request có tools đều kèm một system prompt ẩn dành cho việc sử dụng công cụ.

Anthropic đã công bố con số 286 token cho Opus 5 nhưng chưa công bố con số tương ứng cho Fable 5.1. Bạn có thể đo bằng endpoint đếm token.

Ước tính bổ sung:

  • Browser tool: khoảng 6.600 token mỗi request
  • Computer tool: khoảng 4.500 token mỗi request

Các token này được cache sau lần gửi đầu tiên.

6. Từ chối không mất phí, retry thì có

Một lần từ chối phân loại trước khi sinh output sẽ không bị tính phí. Tuy nhiên:

  • Server-side fallback tính phí theo giá của model fallback.
  • Anthropic sẽ hoàn lại chi phí cache khi chuyển đổi bằng fallback credit.
  • Nên theo dõi tỷ lệ từ chối riêng để biết bao nhiêu workload Fable 5.1 thực tế đang được xử lý bởi Opus 5.

Các kỹ thuật trong hướng dẫn cắt giảm hóa đơn Claude API vẫn áp dụng; chỉ có công thức đọc cache là có lợi hơn trên Fable 5.1.

Những tính năng không có trên Fable 5.1

Fast mode

Fast mode chỉ có trên Opus 5 và Opus 4.8, với giá lần lượt là $10 và $50. Không có tùy chọn trả thêm tiền để tăng tốc output của Fable 5.1.

Priority Tier

Priority Tier không được hỗ trợ trên Fable 5.1 hoặc Mythos 5.1, trong khi Fable 5 vẫn hỗ trợ. Do đó, kế hoạch năng lực doanh nghiệp phụ thuộc Priority Tier phải tiếp tục dùng Fable 5 hoặc chuyển sang Opus 5.

Zero data retention

Zero data retention chỉ khả dụng khi Anthropic cấp quyền rõ ràng. Một tổ chức đã bật ZDR nhưng chưa được cấp quyền sẽ nhận lỗi 400 cho mỗi request.

Kiểm tra chi phí thực tế bằng Apidog

Cách đáng tin cậy nhất để biết chi phí của một request là đọc đối tượng usage. Cách nhanh để kiểm tra là tạo một collection test trong Apidog:

  1. Lưu production system prompt dưới dạng một request có bật cache_control.
  2. Gửi request hai lần.
  3. Xác nhận lần gửi đầu có usage.cache_creation_input_tokens.
  4. Xác nhận lần gửi thứ hai có usage.cache_read_input_tokens.
  5. Thêm post-response script để nhân từng trường usage với đơn giá tương ứng.
  6. Ghi lại tổng chi phí của mỗi request.

Chạy collection mỗi khi thay đổi prompt hoặc định nghĩa tools. Bạn sẽ phát hiện việc làm mất cache trước khi nó ảnh hưởng đến hóa đơn. Tải Apidog và xem hướng dẫn Claude Fable 5.1 API chi tiết để biết các request cần thiết.

Giá Fable 5.1 trong ứng dụng Claude

API tính phí theo token; ứng dụng Claude tính phí theo gói:

  • Gói Max bao gồm các model Fable cho tối đa 50% giới hạn sử dụng hàng tuần mà không phát sinh thêm phí, sau đó tiếp tục dùng usage credit.
  • Gói Pro và Team tiêu chuẩn tính Fable 5.1 bằng usage credit ngay từ message đầu tiên.
  • Gói Enterprise tiêu chuẩn cần bật usage credit để sử dụng vượt giới hạn gói.
  • Hóa đơn Enterprise dựa trên mức sử dụng được tính theo giá API tiêu chuẩn.
  • Request bị biện pháp bảo vệ chuyển sang model khác sẽ không bị tính theo giá Fable.

Xem hướng dẫn các lựa chọn miễn phí và rẻ nhất để hiểu tác động thực tế của từng gói.

Câu hỏi thường gặp

Claude Fable 5.1 có giá bao nhiêu cho mỗi triệu token?

Đầu vào có giá $10 và đầu ra $50, không đổi so với Fable 5.

  • Đọc cache: $0.25 / triệu token
  • Ghi cache 5 phút: $12.50 / triệu token
  • Ghi cache 1 giờ: $20 / triệu token
  • Batch API: $5 đầu vào và $25 đầu ra / triệu token

Claude Fable 5.1 có rẻ hơn Fable 5 không?

Tính theo token đầu vào và đầu ra cơ bản thì không. Tuy nhiên, với workload dùng prompt caching, Fable 5.1 rẻ hơn vì đọc cache giảm từ $1 xuống $0.25 cho mỗi triệu token.

Anthropic ước tính:

  • Rẻ hơn khoảng 25% với workload thông thường
  • Rẻ hơn tới 45% với workload thiên về tác nhân

Workload nặng về output sẽ ít thay đổi.

Claude Fable 5.1 có rẻ hơn Opus 5 không?

Nếu không dùng cache, không: Fable 5.1 có đầu vào $10 và đầu ra $50, gấp đôi Opus 5.

Nếu dùng cache, lợi thế đảo ngược:

  • Fable 5.1 đọc cache: $0.25 / triệu token
  • Opus 5 đọc cache: $0.50 / triệu token

Tuy nhiên, output vẫn có giá $50 trên Fable 5.1 so với $25 trên Opus 5. Vì vậy Opus 5 vẫn phù hợp hơn với các route nặng về output.

Claude Fable 5.1 có Fast mode hoặc Priority Tier không?

Không có cả hai:

  • Fast mode chỉ có trên Opus 5 và Opus 4.8.
  • Priority Tier có trên Fable 5 nhưng không có trên Fable 5.1.

Claude Fable 5.1 có phí cao cấp cho ngữ cảnh dài không?

Không. Toàn bộ cửa sổ ngữ cảnh 1M token được tính theo giá tiêu chuẩn. Chiết khấu cache và batch cũng áp dụng trên toàn bộ cửa sổ.

Claude Fable 5.1 có giá bao nhiêu trên Bedrock hoặc Google Cloud?

Các nền tảng này tự đặt giá và thêm 10% phí cao cấp cho endpoint khu vực. Claude trên AWS và Microsoft Foundry tính theo giá API tiêu chuẩn thông qua Claude Consumption Units.

Xem hướng dẫn triển khai Claude trên các nền tảng cloud để biết cách thiết lập từng nền tảng.

Top comments (0)