Claude Haiku 5.5 đạt 72.4% trên OSWorld 2.1, 1620 trên GDPval-AA v2.1, 46.4% trên FrontierCode 1.1 và 39.2% trên Terminal-Bench 4.0. Haiku 4.5 đạt lần lượt 15.7%, 735 và 0.0% trên ba trong số các bài kiểm tra này. Đây đều là số liệu ở mức nỗ lực tối đa; với mức medium mặc định, GDPval-AA giảm còn 1277. Tính đến ngày 8 tháng 10 năm 2026, chưa có phòng thí nghiệm độc lập nào công bố kết quả cho Haiku 5.5.
Bài viết này tổng hợp điểm chuẩn của Claude Haiku 5.5, đơn vị thực hiện, tác động của mức nỗ lực đến điểm số và chi phí, cùng quy trình kiểm tra mô hình trên lưu lượng truy cập thực tế bằng Apidog. Để xem thông số kỹ thuật và giá, hãy đọc Claude Haiku 5.5 là gì.
Bảng ra mắt
Mỗi kết quả của Haiku 5.5 dưới đây sử dụng tư duy thích ứng ở mức nỗ lực tối đa, thường lấy trung bình từ năm lần thử. Terminal-Bench dùng mười lần thử cho mỗi tác vụ. n/r nghĩa là chưa công bố kết quả.
| Điểm chuẩn | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, tập con ngoại tuyến | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam, không công cụ | 45.9% | 10.2% | n/r | 56.9% |
| Humanity’s Last Exam, có công cụ | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (Chính) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| Chartography, không công cụ | 46.4% | 6.4% | 29.1% | 61.6% |
Ai thực hiện từng điểm chuẩn?
Anthropic tự thực hiện phần lớn bài kiểm tra. Các bảng đa nhà cung cấp có thể dùng cùng tên benchmark nhưng khác khung thử nghiệm hoặc mức nỗ lực, vì vậy không phải mọi hàng đều so sánh trực tiếp hoàn toàn.
| Điểm chuẩn | Ai thực hiện | Điều kiện |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, độc lập | GDPval-AA: 220 tác vụ, 44 nghề nghiệp; Elo neo với DeepSeek V4.1 Flash (tối đa) ở mức 1600. Briefcase: dự án nhiều tuần |
| FrontierCode 1.1 | Cognition | Claude chạy trong Claude Code, GPT chạy trong Codex; Main gồm 100 tác vụ khó nhất trong 150 tác vụ |
| Chartography | Anthropic, trên benchmark của Surge AI | Bộ chấm điểm Gemini 3.5 Flash; điểm Luna do Surge AI cung cấp |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tác vụ, 10 lần thử mỗi tác vụ, bật biện pháp bảo vệ |
| OSWorld 2.1 | Anthropic | 82/108 tác vụ, 1080p, tối đa 500 bước |
| Humanity’s Last Exam | Anthropic | Ngân sách 980K token mỗi tác vụ, bộ chấm điểm Opus 4.6 |
Hai ô GPT-6 Luna cần được đọc kèm ngữ cảnh:
- Anthropic chạy OSWorld của Luna qua API OpenAI trên cùng 82 tác vụ.
- Điểm Terminal-Bench 16.4% của Luna đến từ bảng xếp hạng công khai, sử dụng Codex CLI ở mức nỗ lực tối đa.
- Trên Terminal-Bench, các biện pháp bảo vệ dừng 1.8% lượt thử của Haiku 5.5, tương đương 12/660 lượt. Mọi lượt bị dừng đều tính là thất bại.
Cạm bẫy khi so sánh FrontierCode
Bảng ra mắt đặt Haiku 5.5 ở mức max (46.4%) cạnh Sonnet 5.5 ở mức xhigh (52.1%), tức mức có điểm tốt nhất của Sonnet. Thẻ hệ thống cung cấp bảng so sánh tương đương hơn:
| FrontierCode 1.1 | Chính | Mở rộng |
|---|---|---|
| Haiku 5.5, tối đa | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, tối đa | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
Ở mức max, Haiku 5.5 nhỉnh hơn Sonnet 5.5 trên tập Main: 46.4% so với 46.2%. Tuy nhiên, khi dùng cấu hình tốt nhất của từng mô hình, Sonnet dẫn 5.7 điểm phần trăm.
Khi trích dẫn FrontierCode, luôn ghi rõ mức nỗ lực.
Thông tin bổ sung từ thẻ hệ thống
Thẻ hệ thống có thêm các benchmark không xuất hiện trong bài ra mắt. Mọi kết quả đều ở mức nỗ lực tối đa, trừ khi có ghi chú khác.
| Điểm chuẩn | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Đa ngôn ngữ | 83.7 | 67.4 | 90.3 |
| SWE-bench Đa phương thức | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, tỷ lệ đậu nghiêm ngặt | 37.1% | n/r | 48.8% |
| Chartography, có công cụ | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional, điều chỉnh theo độ dài | 64.8% | 32.2% | 69.2% |
Hai điểm cần lưu ý khi áp dụng:
- 72.4% trên OSWorld là điểm một phần. Tỷ lệ hoàn thành hoàn toàn chỉ là 37.1%.
- Chartography hưởng lợi lớn từ công cụ. Điểm tăng từ 46.4% lên 86.2%, nên hãy cấp công cụ nếu Haiku 5.5 cần xử lý biểu đồ.
Điểm thấp hơn ở mức nỗ lực mặc định
Mức mặc định của Haiku 5.5 trong Claude API và Claude Code là medium. Nếu không cấu hình output_config.effort, bạn sẽ nhận kết quả gần với cột medium dưới đây.
| Điểm chuẩn | Medium, mặc định | Max | Lưu ý |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Medium dùng khoảng một phần mười số token đầu ra của max |
| AA-Briefcase v1.1 | 1372 | 1578 | Medium dùng dưới một phần tư số token đầu ra của max |
| HealthBench Professional | 59.9% | 64.8% | Low: 57.9%, High: 61.3% |
Tài liệu về mức nỗ lực mô tả cả năm cấp độ: low, medium, high, xhigh và max.
Điểm số và chi phí theo mức nỗ lực
Các số liệu dưới đây lấy từ biểu đồ ra mắt. Chi phí OSWorld và Terminal-Bench tính theo mỗi lần thử; GDPval-AA tính theo mỗi tác vụ.
| Mô hình | Low | Medium | High | Xhigh | Max |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
Các điểm rút ra để chọn cấu hình:
-
maxđắt cho phần cải thiện cuối. Trên GDPval-AA,maxđắt khoảng 28 lầnmediumđể tăng thêm 343 Elo. Trên OSWorld,maxđắt hơn gấp đôixhighđể tăng 4.8 điểm. -
Haiku 5.5 ở
mediumvượt Luna ởmaxtrên OSWorld: 53.3% với $0.13, so với 48.9% với $0.21. -
Haiku 5.5 ở
maxvượt Sonnet 5.5 ởmediumtrên OSWorld: 72.4% với $0.61, so với 66.0% với $0.93. -
Terminal-Bench là ngoại lệ: Sonnet 5.5 ở
highđạt 43.0% với $1.46, tốt hơn Haiku 5.5 ởmaxđạt 39.2% với $2.64. - Luna thường rẻ hơn ở các mức tương ứng; tại
mediumtrên OSWorld, chi phí của Haiku và Luna tương đương. Xem thêm Haiku 5.5 so với GPT-6 Luna.
Chi phí dùng giá niêm yết $0.10/$0.50 trên mỗi triệu token cho prompt đến 100K token; mức dài hơn có giá cao hơn. Xem phân tích giá.
Những điểm Haiku 5.5 vẫn kém hơn
Sonnet 5.5 dẫn đầu trong mọi hàng của bảng ra mắt. Chiến thắng đối đầu duy nhất của Haiku là FrontierCode khi cả hai cùng chạy ở mức max.
Khoảng cách đáng chú ý nhất là:
- Terminal-Bench 4.0: 39.2% của Haiku so với 70.6% của Sonnet.
- SWE-Bench Pro: 64.8 so với 81.3.
- SWE-bench Đa phương thức: 30.7 so với 54.3.
Anthropic cũng nhận định Sonnet 5.5 và Opus 5.5 vẫn phù hợp hơn cho các tác vụ lập trình tác nhân phức tạp. Haiku 5.5 phù hợp hơn với công việc phạm vi hẹp như:
- Nén và tóm tắt nội dung
- Phân loại
- Sử dụng trình duyệt
- Tác nhân phụ trong kiến trúc có mô hình lớn hơn
Một cách triển khai là dùng Haiku làm tác nhân phụ chi phí thấp; xem Haiku 5.5 trong Claude Code.
Kết quả độc lập: chưa có
Tính đến ngày 8 tháng 10 năm 2026, chưa có phòng thí nghiệm độc lập nào công bố benchmark Haiku 5.5.
Trang Haiku 5.5 của Artificial Analysis trả về lỗi 404, còn bảng xếp hạng của họ chỉ liệt kê Claude 4.5 Haiku. Vals, LMArena, SWE-bench và Aider cũng chưa có kết quả.
Chưa có số liệu tốc độ từ bên thứ ba. Anthropic gọi Haiku 5.5 là “mô hình nhanh nhất của họ cho đến nay” ở tốc độ tiêu chuẩn, nhưng chậm hơn Opus ở Chế độ Nhanh.
Số liệu bên ngoài gần nhất đến từ Cursor. Tài liệu mô hình của Cursor cho biết Haiku 5.5 đạt 48.4% trên CursorBench ở mức max, tăng từ 30.9% ở mức low.
Khi tắt tính năng suy nghĩ, Cursor báo cáo mức 22.1% đến 26.2%; khi bật suy nghĩ, điểm đạt 30.9% đến 42.3% tại cùng các mức nỗ lực.
Những gì khách hàng báo cáo
Các số liệu sau đến từ bài đăng ra mắt của Anthropic và chưa được xác minh độc lập:
- HubSpot: Trung bình 92.8% qua ba lần chạy trên bộ cổng CRM mô phỏng; đây là điểm cao nhất họ từng thấy trên bộ này.
- AlphaSense: 0.84 so với 0.76 của Haiku 4.5 trên 400 truy vấn “Hỏi trong Tài liệu”, được họ đánh giá là có ý nghĩa thống kê.
- Box: Cao hơn 11 điểm so với Haiku 4.5 với độ trễ khoảng bằng một nửa trong thử nghiệm ban đầu.
- Asana: Độ trễ hoàn thành tác vụ thấp hơn hơn 30% so với mô hình hiện tại của họ.
- Cognition: Devin Fusion đạt 66.2 trên FrontierCode khi Haiku 5.5 đóng vai trò trợ lý và Opus 5.5 là mô hình chính. Đây là hệ thống hai mô hình, không phải kết quả của riêng Haiku.
Tự chạy đánh giá trên lưu lượng của bạn
Benchmark công khai không thay thế được lưu lượng thực tế. Hướng dẫn tạo prompt của Anthropic khuyến nghị chỉ dùng xhigh hoặc max khi đánh giá nội bộ chứng minh được lợi ích, đồng thời chạy cùng bộ đánh giá đó trên Sonnet 5.5.
Quy trình triển khai trong Apidog
- Lưu
ANTHROPIC_API_KEYtrong biến môi trường. - Tạo 20–50 yêu cầu
messagestừ prompt thực tế của sản phẩm. - Thêm assertion cho:
- Mã trạng thái
200 -
stop_reasonkhông phải"max_tokens"hoặc"refusal" - Các điều kiện nội dung mà câu trả lời đúng phải có
- Mã trạng thái
- Chạy cùng bộ yêu cầu ở
low,mediumvàhigh. - Ghi lại tỷ lệ đậu và token trong trường
usage. - Sao chép collection, đổi mô hình sang
claude-sonnet-5-5, rồi so sánh hai mô hình trong cùng một dự án.
Thay đổi mức nỗ lực sẽ làm mất hiệu lực prompt cache. Bộ mã hóa token mới cũng tạo nhiều hơn khoảng 30% token so với Haiku 4.5 cho cùng một văn bản.
Ví dụ yêu cầu API ở mức medium:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [
{
"role": "user",
"content": "Classify this support ticket as billing, bug or feature request: ..."
}
]
}'
Không gửi các trường sau với Haiku 5.5 vì chúng sẽ trả về lỗi 400:
temperaturetop_ptop_k- Nội dung tiền điền sẵn của trợ lý
Khi xử lý phản hồi, hãy chọn block theo trường type, vì một block thinking có thể xuất hiện trước block nội dung trả lời.
Xem thêm:
Câu hỏi thường gặp
Claude Haiku 5.5 có tốt hơn Sonnet 5.5 không?
Không theo số liệu của Anthropic. Sonnet 5.5 dẫn đầu trong mọi hàng của bảng ra mắt; Haiku chỉ nhỉnh hơn ở FrontierCode khi cả hai chạy max, với 46.4% so với 46.2%. Xem Haiku 5.5 so với Haiku 4.5 để đánh giá mức nâng cấp.
Điểm SWE-bench của Haiku 5.5 là bao nhiêu?
Haiku 5.5 đạt:
- 64.8 trên SWE-Bench Pro
- 83.7 trên SWE-bench Đa ngôn ngữ
- 30.7 trên SWE-bench Đa phương thức
Tất cả đều ở mức nỗ lực tối đa.
Các benchmark chạy ở mức nỗ lực nào?
Phần lớn chạy ở max, thường lấy trung bình năm lần thử. Mức mặc định của API là medium, nơi GDPval-AA đạt 1277 thay vì 1620.
Có benchmark Haiku 5.5 độc lập nào không?
Chưa có benchmark được công bố độc lập cho Haiku 5.5. Artificial Analysis chạy GDPval-AA và AA-Briefcase độc lập, nhưng Anthropic là bên công bố các điểm số đó; Artificial Analysis chưa có trang Haiku 5.5.
GPT-6 Luna có rẻ hơn không?
Thường là có. Luna rẻ hơn ở mọi mức nỗ lực của GDPval-AA và mọi mức OSWorld trừ medium, nơi chi phí tương đương. Haiku 5.5 đạt điểm cao hơn trên cả hai benchmark.
Bước tiếp theo
Bắt đầu với medium, sau đó chỉ tăng mức nỗ lực khi tỷ lệ đậu tăng đủ để bù chi phí. Tải xuống Apidog, xây dựng collection đánh giá từ lưu lượng thực tế và lưu kết quả trong Apidog cạnh benchmark Sonnet 5.5 trước khi chuyển lưu lượng sản xuất.
Top comments (0)