Claude Haiku 5.5 là mô hình nhỏ nhất và nhanh nhất hiện tại của Anthropic, ra mắt ngày 7 tháng 10 năm 2026 với ID API claude-haiku-5-5. Giá là 0,10 đô la cho mỗi triệu token đầu vào và 0,50 đô la cho mỗi triệu token đầu ra với lời nhắc tối đa 100K token; với lời nhắc vượt 100K token, giá là 0,50 đô la/2,50 đô la. Trong bài đăng ra mắt, Anthropic cho biết mô hình có chi phí vận hành trung bình thấp hơn khoảng 75% so với Haiku 4.5 và đây là “mô hình nhanh nhất” của họ. Đây cũng là Haiku đầu tiên hỗ trợ mức độ nỗ lực (effort) và cửa sổ ngữ cảnh 1 triệu token.
Bài viết này tập trung vào thông số, giá theo hai cấp, các thay đổi khi nâng cấp từ Haiku 4.5, benchmark, nền tảng hỗ trợ và quy trình gửi yêu cầu đầu tiên. Để phân tích chi phí chi tiết hơn, xem phân tích chi phí Haiku 5.5. Bạn có thể dùng Apidog để gửi yêu cầu Messages API, lưu API key trong biến môi trường và kiểm tra phản hồi cùng mức sử dụng token.
Thông số kỹ thuật Claude Haiku 5.5
| Thông số | Claude Haiku 5.5 |
|---|---|
| Ngày phát hành | 7 tháng 10 năm 2026 |
| ID mô hình — Claude API, Google Cloud, Microsoft Foundry, Claude Platform trên AWS |
claude-haiku-5-5 — ID cố định, không có hậu tố ngày |
| ID mô hình — Amazon Bedrock | anthropic.claude-haiku-5-5 |
| Cửa sổ ngữ cảnh | 1 triệu token — Haiku 4.5: 200K |
| Đầu ra tối đa | 128K — Haiku 4.5: 64K; 300K qua Batch API với beta header output-300k-2026-03-24
|
| Tư duy | Chỉ thích ứng (adaptive) |
| Mức độ nỗ lực |
low, medium (mặc định), high, xhigh, max
|
| Ngày cắt dữ liệu | Tháng 6 năm 2026 |
| Giá cho prompt tối đa 100K token | 0,10 đô la đầu vào, 0,50 đô la đầu ra / 1 triệu token |
| Giá cho prompt trên 100K token | 0,50 đô la đầu vào, 2,50 đô la đầu ra / 1 triệu token |
| Ngừng hoạt động | Không sớm hơn ngày 7 tháng 10 năm 2027 |
Vị trí của Haiku 5.5 trong dòng Claude
| Mô hình | Đầu vào / đầu ra mỗi triệu token | Mức độ nỗ lực mặc định | Độ trễ |
|---|---|---|---|
| Claude Fable 5.1 | 10 đô la / 50 đô la | high |
Chậm hơn |
| Claude Opus 5.5 | 4 đô la / 20 đô la | medium |
Trung bình |
| Claude Sonnet 5.5 | 2 đô la / 10 đô la | high |
Nhanh |
| Claude Haiku 5.5 | 0,10 đô la / 0,50 đô la cho prompt tối đa 100K token | medium |
Nhanh nhất |
Cả bốn mô hình đều có cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 128K và ngày cắt dữ liệu tháng 6 năm 2026.
Anthropic định vị Haiku 5.5 cho các workload khối lượng lớn và nhạy độ trễ:
- Phân loại.
- Trích xuất dữ liệu.
- Định tuyến yêu cầu.
- Tóm tắt.
- Hỗ trợ trực tiếp.
- Sử dụng trình duyệt.
- Tác vụ subagent dưới Opus 5.5 hoặc Sonnet 5.5.
Lưu ý về tốc độ: Haiku 5.5 là nhanh nhất ở tốc độ tiêu chuẩn của mỗi mô hình, nhưng vẫn chậm hơn Opus trong Fast Mode. Anthropic không công bố số token/giây.
Giá của Claude Haiku 5.5
Giá phụ thuộc vào độ dài prompt. Khi tổng prompt vượt 100.000 token, toàn bộ yêu cầu áp dụng mức giá cao hơn.
Nguồn: Giá API Claude.
Mức “giảm khoảng 75%” là giá trị trung bình:
- Rẻ hơn 90% so với Haiku 4.5 cho prompt tối đa 100K token.
- Rẻ hơn 50% cho prompt trên 100K token.
- Khoảng 90% yêu cầu Haiku 4.5 nằm dưới ngưỡng 100K token.
- Tokenizer mới tạo nhiều hơn khoảng 30% token cho cùng một văn bản.
Suy luận chỉ ở Hoa Kỳ qua inference_geo có chi phí cao hơn 1,1 lần cho mọi loại token. Prompt cache có thể lưu từ tối thiểu 512 token, giảm từ 4.096 token ở Haiku 4.5.
Với prompt dưới 100K token, giá niêm yết khớp GPT-6 Luna:
| Loại token | Haiku 5.5 / GPT-6 Luna |
|---|---|
| Đầu vào | 0,10 đô la / 1 triệu token |
| Đầu ra | 0,50 đô la / 1 triệu token |
| Đọc cache | 0,01 đô la / 1 triệu token |
| Ghi cache | 0,125 đô la / 1 triệu token |
Khác biệt quan trọng là ngưỡng phụ phí: Luna chỉ áp dụng phụ phí từ trên 272K token đầu vào. Xem so sánh Haiku 5.5 với GPT-6 Luna và hướng dẫn định giá để ước tính chi phí thực tế.
Nâng cấp từ Haiku 4.5: các thay đổi cần sửa
Haiku 5.5 tăng cửa sổ ngữ cảnh gấp năm lần, tăng đầu ra tối đa gấp đôi và thêm quyền kiểm soát effort. Tuy nhiên, hướng dẫn di chuyển cảnh báo một số payload của Haiku 4.5 sẽ trả lỗi 400.
1. Thay ngân sách tư duy thủ công bằng adaptive thinking
Không dùng:
{
"thinking": {
"type": "enabled",
"budget_tokens": 4000
}
}
Dùng:
{
"thinking": {
"type": "adaptive"
},
"output_config": {
"effort": "medium"
}
}
2. Xóa tham số lấy mẫu
Xóa temperature, top_p và top_k.
Các trường hợp sau sẽ thất bại:
- Giá trị
temperaturehoặctop_pkhác mặc định. - Bất kỳ giá trị
top_knào. - Gửi đồng thời
temperaturevàtop_p.
3. Không dùng assistant prefill
Assistant prefill bị từ chối, kể cả khi bạn tắt thinking. Hãy bắt đầu luồng phản hồi từ API thay vì ép assistant tiếp tục bằng nội dung có sẵn.
4. Dùng computer toolset mới
Trên Claude API và Google Cloud, thay:
computer_20250124
bằng:
computer_toolset_20260801
5. Giữ lịch sử hội thoại append-only
Không thay đổi system, tools hoặc message trước đó sau khi API đã trả về một thinking block. Hãy chỉ thêm message mới vào cuối lịch sử hội thoại.
Các thay đổi không gây lỗi nhưng ảnh hưởng kết quả
-
Hiển thị thinking: thinking block mặc định chỉ trả chữ ký. Đặt
"display": "summarized"nếu cần đọc bản tóm tắt. -
Số token: cùng một văn bản có thể tiêu thụ nhiều token hơn khoảng 30%;
max_tokenscũng tính cả token tư duy. -
Forced tool use:
tool_choice: "any"hoặc chỉ định tên tool vẫn hoạt động, nhưng phản hồi không có thinking block. -
Refusal: bộ phân loại an toàn có thể trả
stop_reason: "refusal"mà không có fallback phía server. - Priority Tier: không hỗ trợ trên Haiku 5.5.
Bạn có thể tắt thinking khi dùng low, medium hoặc high. Với xhigh và max, tắt thinking sẽ trả lỗi 400.
Haiku 4.5 chưa bị deprecated và vẫn được liệt kê là hoạt động. Xem hướng dẫn Haiku 5.5 so với Haiku 4.5 để xem JSON trước/sau cho từng thay đổi.
Điểm chuẩn Claude Haiku 5.5
Điểm Haiku 5.5 được đo ở mức max, chủ yếu là trung bình của năm lần thử. Artificial Analysis chạy GDPval-AA và AA-Briefcase, Cognition chạy FrontierCode, còn Anthropic chấm Chartography bằng triển khai riêng.
Khi đọc biểu đồ, cần lưu ý:
- FrontierCode so sánh Haiku ở
maxvới Sonnet 5.5 ởxhigh. - Sonnet 5.5 đạt 46,2% ở
max, thấp hơn 46,4% của Haiku. - Anthropic chạy OSWorld của Luna qua OpenAI API.
- Điểm Terminal-Bench của Luna lấy từ bảng xếp hạng công khai sử dụng Codex CLI.
- Ở effort mặc định
medium, Haiku 5.5 đạt 1277 trên GDPval-AA và 1372 trên AA-Briefcase.
Anthropic vẫn khuyến nghị Sonnet 5.5 và Opus 5.5 cho tác vụ coding agent phức tạp. Tính đến ngày 8 tháng 10 năm 2026, chưa có bảng xếp hạng độc lập chứa kết quả Haiku 5.5. Cursor báo cáo 48,4% trên CursorBench riêng ở mức max.
Để xem chi phí và điểm số theo từng mức effort, đọc phân tích benchmark chuyên sâu.
Nơi sử dụng Claude Haiku 5.5
| Nền tảng | Truy cập | Ghi chú |
|---|---|---|
| Claude API | claude-haiku-5-5 |
Thanh toán theo token |
| Amazon Bedrock | anthropic.claude-haiku-5-5 |
Thanh toán qua AWS Marketplace |
| Google Cloud, Microsoft Foundry, Claude Platform trên AWS | claude-haiku-5-5 |
Cùng ID với Claude API |
| Claude.ai — web, iOS, Android | Trình chọn model | Người dùng Free, Pro, Max, Team và Enterprise có thể chọn |
| Claude Code | /model claude-haiku-5-5 |
Phiên bản 2.1.293 trở lên; yêu cầu gói trả phí |
| Vercel AI Gateway | anthropic/claude-haiku-5.5 |
Từ 0,10 đô la / 0,50 đô la |
| Cursor | claude-haiku-5-5 |
Nhóm cùng các model khác |
Tính đến ngày 8 tháng 10 năm 2026, Haiku 5.5 chưa có trên OpenRouter và chưa được công bố cho GitHub Copilot.
Truy cập chat qua gói Free không tương đương với API key. API được tính phí theo mức sử dụng, ngoài khoản credit thử nghiệm nhỏ dành cho người dùng mới. Các gói Max và Team hiện gồm credit API hàng tháng:
- Max 5x: 100 đô la.
- Max 20x: 200 đô la.
- Team: gộp tối đa 500 đô la.
Các credit này không bao gồm Claude Code. Xem hướng dẫn truy cập miễn phí để biết rõ phần nào miễn phí.
Trong Claude Code, alias haiku chỉ trỏ đến Haiku 5.5 khi dùng Anthropic API; trên các nền tảng khác, alias này vẫn có thể trỏ đến Haiku 4.5. Xem Haiku 5.5 trong Claude Code để thiết lập subagent.
Ai nên chuyển sang Haiku 5.5?
- Đang dùng Haiku 4.5: nên nâng cấp sau khi sửa năm thay đổi gây lỗi. Haiku 5.5 có điểm cao hơn ở mọi dòng benchmark mà cả hai model cùng xuất hiện, đồng thời có giá niêm yết thấp hơn.
- Đang dùng Sonnet hoặc Opus cho tác vụ đơn giản, lặp lại: thử Haiku 5.5 cho phân loại, trích xuất, tóm tắt và subagent. Giữ model lớn hơn cho coding agent phức tạp.
- Prompt thường vượt 100K token: tính giá ở cả hai cấp trước khi triển khai. Khi vượt ngưỡng, chi phí đầu vào tăng 5 lần cho mỗi token.
- Làm việc về bảo mật: biện pháp bảo vệ an ninh mạng của Haiku 5.5 vẫn chặn kiểm tra thâm nhập.
Trong bài đăng ra mắt, Asana báo cáo thời gian hoàn thành tác vụ thấp hơn hơn 30%, còn Box ghi nhận điểm số cao hơn 11 điểm so với Haiku 4.5 với độ trễ chỉ bằng khoảng một nửa. Đây là tuyên bố từ khách hàng, không phải thử nghiệm độc lập.
System card cũng ghi nhận Haiku 5.5 từ chối nhiều hơn bất kỳ model nào khác trong kiểm toán tự động của Anthropic. Hãy đo tỷ lệ refusal trên dữ liệu và prompt thực tế của bạn trước khi đưa vào production.
Gửi yêu cầu Haiku 5.5 đầu tiên
Ví dụ dưới đây phân loại một ticket hỗ trợ, bật adaptive thinking và đặt effort ở mức thấp để tối ưu độ trễ và chi phí.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 4000,
"thinking": {
"type": "adaptive",
"display": "summarized"
},
"output_config": {
"effort": "low"
},
"messages": [
{
"role": "user",
"content": "Classify this support ticket as billing, bug, or feature request: The export button returns a 500 error."
}
]
}'
Khi tích hợp:
- Không gửi sampling parameters hoặc assistant prefill.
- Duyệt
contenttheo trườngtype, vì phản hồi có thể bắt đầu bằng thinking block. - Kiểm tra
stop_reason. - Ghi lại trường
usageđể theo dõi token và chi phí.
Trong Apidog, bạn có thể import lệnh cURL thành request mới, lưu key trong biến môi trường ANTHROPIC_API_KEY và thêm assertion:
stop_reason != "refusal"
stop_reason != "max_tokens"
Sau đó, nhân bản request, đổi effort từ low sang medium, rồi so sánh usage và chất lượng đầu ra. Xem hướng dẫn API Haiku 5.5 để triển khai cache, batch và streaming. Nếu cần tạo key, xem hướng dẫn API key Anthropic.
Câu hỏi thường gặp
Claude Haiku 5.5 được phát hành khi nào?
Ngày 7 tháng 10 năm 2026, chín ngày sau Sonnet 5.5.
Claude Haiku 5.5 có miễn phí không?
Trong ứng dụng chat Claude.ai, người dùng Free có thể chọn model này. API tính phí ngoài khoản credit thử nghiệm nhỏ cho người dùng mới. Xem mọi cách truy cập miễn phí.
Cửa sổ ngữ cảnh của Claude Haiku 5.5 là gì?
1 triệu token, với đầu ra tối đa 128K token trên Messages API.
Haiku 4.5 có bị ngừng hoạt động không?
Chưa. Model vẫn hoạt động và thời điểm ngừng hoạt động không sớm hơn ngày 15 tháng 10 năm 2026.
Bước tiếp theo
Chọn một tác vụ khối lượng lớn đang chạy trong hệ thống của bạn, ví dụ phân loại ticket hoặc tóm tắt tài liệu. Chạy cùng dữ liệu với claude-haiku-5-5 ở low và medium, sau đó so sánh:
- Chất lượng đầu ra.
- Tỷ lệ
refusal. - Độ trễ.
-
usage.input_tokensvàusage.output_tokens. - Chi phí so với model hiện tại.
Tải xuống Apidog để lưu request, environment và assertion trong một project. Sau đó, dùng hướng dẫn định giá để chuyển mức sử dụng token thành ước tính hóa đơn hàng tháng.


Top comments (0)