Claude Haiku 5.5 có giá 0.10 USD cho mỗi triệu token đầu vào và 0.50 USD cho mỗi triệu token đầu ra với lời nhắc tối đa 100K token. Khi lời nhắc vượt 100.000 token, giá tăng lên 0.50 USD cho đầu vào và 2.50 USD cho đầu ra. Đọc bộ nhớ đệm bắt đầu từ 0.01 USD, API Batch giảm một nửa mọi mức giá, và Anthropic cho biết chi phí trung bình thấp hơn khoảng 75% so với Haiku 4.5.
Bài viết này hướng dẫn cách tính chi phí, kiểm tra ngưỡng 100K token, chọn mức nỗ lực và đo chi phí thực tế từ trường usage trong phản hồi API. Nếu chưa biết mô hình này, xem Claude Haiku 5.5 là gì. Để kiểm tra trên lưu lượng truy cập của riêng bạn, gửi yêu cầu bằng Apidog và lưu lại khối usage của từng phản hồi.
Bảng giá API của Claude Haiku 5.5
Giá dưới đây tính theo mỗi triệu token (MTok), theo tài liệu giá của Anthropic.
| Hạng mục | Lời nhắc tối đa 100K token | Lời nhắc trên 100K token |
|---|---|---|
| Đầu vào | $0.10 | $0.50 |
| Đầu ra | $0.50 | $2.50 |
| Ghi bộ nhớ đệm 5 phút | $0.125 | $0.625 |
| Ghi bộ nhớ đệm 1 giờ | $0.20 | $1.00 |
| Đọc bộ nhớ đệm (lượt truy cập và làm mới) | $0.01 | $0.05 |
| Đầu vào theo lô | $0.05 | $0.25 |
| Đầu ra theo lô | $0.25 | $1.25 |
Các điểm cần kiểm tra trước khi ước tính chi phí
- Ngưỡng 100K áp dụng cho lời nhắc. Anthropic nêu rõ rằng một lời nhắc trên 100.000 token có giá cao hơn. Haiku 5.5 là ngoại lệ so với các mô hình Claude từ 4.6 trở đi, vốn tính một mức giá cho toàn bộ cửa sổ 1M.
-
Chỉ suy luận tại Mỹ. Định tuyến chỉ ở Mỹ qua
inference_geocó hệ số 1.1x trên mỗi danh mục token trong API Claude và Claude trên AWS. Ví dụ, dưới 100K token, giá là 0.11 USD đầu vào và 0.55 USD đầu ra. - Bộ mã hóa mới. Cùng một văn bản có thể tạo nhiều token hơn khoảng 30% so với Haiku 4.5.
- Chi phí công cụ thấp hơn. Lời nhắc hệ thống dùng công cụ là 286 token, giảm từ 496 token ở Haiku 4.5.
- Không có Ưu tiên và không có chế độ nhanh.
“Khoảng 75% ít hơn” được tính như thế nào?
Haiku 5.5 rẻ hơn 90% so với Haiku 4.5 cho yêu cầu đến 100K token và rẻ hơn 50% khi vượt ngưỡng. Anthropic cho biết 90% yêu cầu Haiku 4.5 nằm dưới 100K token; phép tính cũng cần tính đến bộ mã hóa mới.
Có thể ước tính như sau:
- Trọng số theo số lượng yêu cầu:
0.9 × 90% + 0.1 × 50% = 86% thấp hơn
- Tính thêm khoảng 30% token do bộ mã hóa mới:
14% chi phí còn lại × 1.3 = 18.2% chi phí còn lại
Tương đương tiết kiệm khoảng 82%.
Anthropic đưa ra mức trung bình thấp hơn, khoảng 75%. Họ không công bố trọng số chi tiết; các lời nhắc dài có thể chiếm tỷ trọng chi phí lớn hơn tỷ trọng số yêu cầu. Vì vậy, hãy coi 75% là mức tham khảo và dùng dữ liệu usage của chính bạn để tính con số thực tế.
Chi phí mỗi lần thử theo cấp độ nỗ lực
Haiku 5.5 là Haiku đầu tiên có mức độ nỗ lực từ low đến max; medium là mặc định của API. Mức nỗ lực ảnh hưởng trực tiếp đến token đầu ra và tổng hóa đơn.
Các số liệu sau lấy từ biểu đồ theo nỗ lực trong bài đăng ra mắt: Anthropic chạy OSWorld và Terminal-Bench; Artificial Analysis chạy GDPval-AA.
| Nỗ lực | OSWorld 2.1 (điểm, $/lần thử) | GDPval-AA v2.1 (Elo, $/tác vụ) | Terminal-Bench 4.0 (điểm, $/lần thử) |
|---|---|---|---|
| Thấp | 42.0%, $0.0695 | 1125, $0.0117 | 12.7%, $0.424 |
| Trung bình | 53.3%, $0.1257 | 1277, $0.0304 | 20.3%, $0.6798 |
| Cao | 61.3%, $0.1827 | 1420, $0.0894 | 24.8%, $1.0372 |
| Rất cao | 67.6%, $0.2792 | 1513, $0.2673 | 31.5%, $1.7545 |
| Tối đa | 72.4%, $0.6111 | 1620, $0.8659 | 39.2%, $2.6433 |
Cách chọn mức nỗ lực
- Bắt đầu bằng
lowhoặcmediumcho phân loại, trích xuất và tác vụ có đầu ra ngắn. - Chạy cùng một bộ dữ liệu thử nghiệm ở
low,mediumvàhigh. - So sánh đồng thời tỷ lệ thành công,
output_tokensvà chi phí mỗi yêu cầu. - Chỉ dùng
maxkhi mức tăng chất lượng có giá trị lớn hơn chi phí tăng thêm.
Các điểm đáng chú ý:
-
maxtốn gấp 4.9 lầnmediumtrên OSWorld:$0.6111 ÷ $0.1257. -
maxtốn gấp 28.5 lầnmediumtrên GDPval-AA:$0.86593 ÷ $0.03042. -
Điểm trong bảng ra mắt là ở mức
max. Ví dụ, GDPval-AA ởmediumlà 1277, không phải 1620. - Với lập trình tác nhân, nên kiểm tra Sonnet. Trên Terminal-Bench, Sonnet 5.5 ở
lowvới 0.10 USD đọc bộ nhớ đệm đạt 20% với 0.6205 USD; Haiku 5.5 ởmediumđạt 20.3% với 0.6798 USD. Anthropic cho biết Sonnet và Opus vẫn phù hợp hơn cho tác vụ lập trình tác nhân phức tạp. Xem phân tích điểm chuẩn.
So sánh giá với các mô hình khác
| Mô hình | Đầu vào / đầu ra trên MTok | Đọc bộ nhớ đệm | Ghi bộ nhớ đệm 5 phút | Quy tắc lời nhắc dài |
|---|---|---|---|---|
| Claude Haiku 5.5 | $0.10 / $0.50 đến 100K | $0.01 | $0.125 | Trên 100K: $0.50 / $2.50 |
| GPT-6 Luna | $0.10 / $0.50 | $0.01 | $0.125 | Đầu vào trên 272K: 2x đầu vào và bộ nhớ đệm, 1.5x đầu ra ($0.20 / $0.75) |
| Claude Haiku 4.5 | $1 / $5 | $0.10 | $1.25 | Một mức giá, ngữ cảnh 200K |
| Claude Sonnet 5.5 | $2 / $10 | $0.10 | $2.50 | Một mức giá trên 1M |
GPT-6 Luna
GPT-6 Luna có giá tương đương Haiku 5.5 cho lời nhắc đến 100K token, nhưng ngưỡng phụ phí khác nhau. Theo trang mô hình GPT-6 Luna của OpenAI, phụ phí bắt đầu trên 272K token và áp dụng cho toàn bộ yêu cầu.
Ví dụ với 150.000 token đầu vào và 2.000 token đầu ra:
GPT-6 Luna:
(150,000 × $0.10 + 2,000 × $0.50) ÷ 1,000,000 = $0.016
Cùng yêu cầu đó có giá $0.08 trên Haiku 5.5 vì đã vượt ngưỡng 100K.
Bộ mã hóa cũng khác nhau: một người bình luận trên Hacker News ước tính 100K token Claude tương đương khoảng 60–65K token GPT. Trên biểu đồ OSWorld của Anthropic, Haiku 5.5 ở medium đạt 53.3% với $0.1257, cao hơn Luna ở max đạt 48.9% với $0.205. Xem thêm Claude Haiku 5.5 so với GPT-6 Luna.
Claude Sonnet 5.5
Sonnet 5.5 giảm giá đọc bộ nhớ đệm từ 0.20 USD xuống 0.10 USD trong cùng ngày. Anthropic cho biết mức này rẻ hơn khoảng 20% cho hầu hết công việc tác nhân. Hướng dẫn giá Sonnet 5.5 được xuất bản trước khi có đợt giảm giá này.
Claude Haiku 4.5
Haiku 4.5 chưa bị ngừng sử dụng. Trước khi chuyển đổi, xem Haiku 5.5 so với Haiku 4.5 để xác định các thay đổi đột phá cần xử lý.
Tín dụng API và gói người dùng
Tín dụng API Max và Team
- Max 5x nhận 100 USD tín dụng Claude Platform mỗi tháng.
- Max 20x nhận 200 USD mỗi tháng.
- Team nhận 20 USD cho mỗi ghế Standard và 100 USD cho mỗi ghế Premium.
- Tín dụng được gộp chung và giới hạn ở 500 USD.
- Gói Free, Pro và Enterprise không đủ điều kiện.
- Tín dụng dùng cho Claude API, không áp dụng cho Claude Code hoặc các đám mây.
- Tín dụng không chuyển sang tháng sau.
Theo tài liệu tín dụng API, với giá 0.10 USD mỗi MTok đầu vào, 100 USD tương đương 1 tỷ token đầu vào hoặc khoảng 220.000 yêu cầu như Ví dụ 1:
$100 ÷ $0.000455 = khoảng 220.000 yêu cầu
Gói dành cho người dùng
Theo claude.com/pricing, người dùng Free, Pro, Max, Team và Enterprise có thể chọn Haiku 5.5 trên Claude.ai ở web, iOS và Android.
- Pro: 17 USD/tháng khi thanh toán hằng năm hoặc 20 USD/tháng.
- Max: từ 100 USD/tháng.
- Free không có Claude Code.
- Gói trò chuyện không thay thế được script hoặc công việc CI.
Xem cách sử dụng Claude Haiku 5.5 miễn phí để biết thêm chi tiết.
Đám mây
Bedrock, Google Cloud và Foundry tính phí Haiku 5.5 theo bảng giá riêng của từng nền tảng.
Theo dõi chi phí mỗi yêu cầu trong Apidog
Mỗi phản hồi Messages API trả về một đối tượng usage. Bạn có thể dùng dữ liệu này để tính chi phí của từng cuộc gọi trong Apidog.
1. Lưu API key trong biến môi trường
Tạo biến môi trường:
ANTHROPIC_API_KEY
2. Tạo một yêu cầu cho từng mức nỗ lực
Lưu một bản sao yêu cầu cho low, medium và high, nhưng giữ nguyên lời nhắc để so sánh công bằng.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 4000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [
{
"role": "user",
"content": "Classify this support ticket: ..."
}
]
}'
3. Thêm script hậu xử lý để tính giá
Script dưới đây dùng input_tokens để xác định yêu cầu có vượt ngưỡng 100K hay không. Điều này phù hợp khi bạn không dùng bộ nhớ đệm.
const body = pm.response.json();
const u = body.usage;
const long = u.input_tokens > 100000;
const rateIn = long ? 0.50 : 0.10;
const rateOut = long ? 2.50 : 0.50;
const cost =
(u.input_tokens * rateIn + u.output_tokens * rateOut) / 1e6;
pm.environment.set("haiku_call_usd", cost.toFixed(6));
pm.test("not a refusal", () => {
pm.expect(body.stop_reason).to.not.eql("refusal");
});
4. So sánh kết quả
Chạy cả ba biến thể và ghi lại:
| Mức nỗ lực | input_tokens |
output_tokens |
haiku_call_usd |
Tỷ lệ đúng |
|---|---|---|---|---|
low |
||||
medium |
||||
high |
Kiểm tra stop_reason là cần thiết vì các bộ phân loại an toàn của Haiku 5.5 không có dự phòng phía máy chủ. Xem hướng dẫn đầy đủ tại cách sử dụng API Claude Haiku 5.5.
Câu hỏi thường gặp
Claude Haiku 5.5 có giá bao nhiêu cho mỗi triệu token?
0.10 USD đầu vào và 0.50 USD đầu ra cho lời nhắc tối đa 100K token. Khi vượt ngưỡng, giá là 0.50 USD đầu vào và 2.50 USD đầu ra.
Haiku 5.5 có rẻ hơn Haiku 4.5 không?
Có. Haiku 5.5 rẻ hơn 90% mỗi token cho yêu cầu đến 100K, rẻ hơn 50% khi vượt ngưỡng và rẻ hơn khoảng 75% trung bình theo Anthropic.
Haiku 5.5 có giá tương đương GPT-6 Luna không?
Có, với yêu cầu đến 100K token. Sau ngưỡng đó, Haiku 5.5 tăng giá 5 lần, còn Luna giữ giá cơ bản đến 272K token. Xem tổng quan về GPT-6 Luna.
Tín dụng gói Max có hoạt động trong Claude Code không?
Không. Tín dụng áp dụng cho Claude Platform API, không áp dụng cho Claude Code. Xem Claude Haiku 5.5 trong Claude Code để biết cách truy cập theo gói.
Bước tiếp theo: định giá khối lượng công việc của bạn
Chọn ba loại yêu cầu phổ biến nhất trong hệ thống của bạn và thực hiện quy trình sau:
- Đo số yêu cầu vượt 100K token.
- Chạy mỗi yêu cầu ở
lowvàmedium. - Lưu
input_tokens,output_tokensvàstop_reason. - Nhân số token với đơn giá tương ứng.
- So sánh chi phí với tỷ lệ thành công trước khi tăng mức nỗ lực.
Tải Apidog để lưu các yêu cầu, biến môi trường và script tính chi phí trong cùng một dự án.

Top comments (0)