DEV Community

Cover image for Claude Haiku 5.5 Điểm chuẩn
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Claude Haiku 5.5 Điểm chuẩn

Claude Haiku 5.5 đạt 72.4% trên OSWorld 2.1, 1620 trên GDPval-AA v2.1, 46.4% trên FrontierCode 1.1 và 39.2% trên Terminal-Bench 4.0. Haiku 4.5 đạt lần lượt 15.7%, 735 và 0.0% trên ba trong số các bài kiểm tra này. Đây đều là số liệu ở mức nỗ lực tối đa; với mức medium mặc định, GDPval-AA giảm còn 1277. Tính đến ngày 8 tháng 10 năm 2026, chưa có phòng thí nghiệm độc lập nào công bố kết quả cho Haiku 5.5.

Dùng thử Apidog ngay hôm nay

Bài viết này tổng hợp điểm chuẩn của Claude Haiku 5.5, đơn vị thực hiện, tác động của mức nỗ lực đến điểm số và chi phí, cùng quy trình kiểm tra mô hình trên lưu lượng truy cập thực tế bằng Apidog. Để xem thông số kỹ thuật và giá, hãy đọc Claude Haiku 5.5 là gì.

Bảng ra mắt

Mỗi kết quả của Haiku 5.5 dưới đây sử dụng tư duy thích ứng ở mức nỗ lực tối đa, thường lấy trung bình từ năm lần thử. Terminal-Bench dùng mười lần thử cho mỗi tác vụ. n/r nghĩa là chưa công bố kết quả.

Điểm chuẩn Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, tập con ngoại tuyến 72.4% 15.7% 48.9% 83.9%
Humanity’s Last Exam, không công cụ 45.9% 10.2% n/r 56.9%
Humanity’s Last Exam, có công cụ 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (Chính) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, không công cụ 46.4% 6.4% 29.1% 61.6%

Ai thực hiện từng điểm chuẩn?

Anthropic tự thực hiện phần lớn bài kiểm tra. Các bảng đa nhà cung cấp có thể dùng cùng tên benchmark nhưng khác khung thử nghiệm hoặc mức nỗ lực, vì vậy không phải mọi hàng đều so sánh trực tiếp hoàn toàn.

Điểm chuẩn Ai thực hiện Điều kiện
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, độc lập GDPval-AA: 220 tác vụ, 44 nghề nghiệp; Elo neo với DeepSeek V4.1 Flash (tối đa) ở mức 1600. Briefcase: dự án nhiều tuần
FrontierCode 1.1 Cognition Claude chạy trong Claude Code, GPT chạy trong Codex; Main gồm 100 tác vụ khó nhất trong 150 tác vụ
Chartography Anthropic, trên benchmark của Surge AI Bộ chấm điểm Gemini 3.5 Flash; điểm Luna do Surge AI cung cấp
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tác vụ, 10 lần thử mỗi tác vụ, bật biện pháp bảo vệ
OSWorld 2.1 Anthropic 82/108 tác vụ, 1080p, tối đa 500 bước
Humanity’s Last Exam Anthropic Ngân sách 980K token mỗi tác vụ, bộ chấm điểm Opus 4.6

Hai ô GPT-6 Luna cần được đọc kèm ngữ cảnh:

  • Anthropic chạy OSWorld của Luna qua API OpenAI trên cùng 82 tác vụ.
  • Điểm Terminal-Bench 16.4% của Luna đến từ bảng xếp hạng công khai, sử dụng Codex CLI ở mức nỗ lực tối đa.
  • Trên Terminal-Bench, các biện pháp bảo vệ dừng 1.8% lượt thử của Haiku 5.5, tương đương 12/660 lượt. Mọi lượt bị dừng đều tính là thất bại.

Cạm bẫy khi so sánh FrontierCode

Bảng ra mắt đặt Haiku 5.5 ở mức max (46.4%) cạnh Sonnet 5.5 ở mức xhigh (52.1%), tức mức có điểm tốt nhất của Sonnet. Thẻ hệ thống cung cấp bảng so sánh tương đương hơn:

FrontierCode 1.1 Chính Mở rộng
Haiku 5.5, tối đa 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, tối đa 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

Ở mức max, Haiku 5.5 nhỉnh hơn Sonnet 5.5 trên tập Main: 46.4% so với 46.2%. Tuy nhiên, khi dùng cấu hình tốt nhất của từng mô hình, Sonnet dẫn 5.7 điểm phần trăm.

Khi trích dẫn FrontierCode, luôn ghi rõ mức nỗ lực.

Thông tin bổ sung từ thẻ hệ thống

Thẻ hệ thống có thêm các benchmark không xuất hiện trong bài ra mắt. Mọi kết quả đều ở mức nỗ lực tối đa, trừ khi có ghi chú khác.

Điểm chuẩn Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Đa ngôn ngữ 83.7 67.4 90.3
SWE-bench Đa phương thức 30.7 19.8 54.3
OSWorld 2.1, tỷ lệ đậu nghiêm ngặt 37.1% n/r 48.8%
Chartography, có công cụ 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional, điều chỉnh theo độ dài 64.8% 32.2% 69.2%

Hai điểm cần lưu ý khi áp dụng:

  1. 72.4% trên OSWorld là điểm một phần. Tỷ lệ hoàn thành hoàn toàn chỉ là 37.1%.
  2. Chartography hưởng lợi lớn từ công cụ. Điểm tăng từ 46.4% lên 86.2%, nên hãy cấp công cụ nếu Haiku 5.5 cần xử lý biểu đồ.

Điểm thấp hơn ở mức nỗ lực mặc định

Mức mặc định của Haiku 5.5 trong Claude API và Claude Code là medium. Nếu không cấu hình output_config.effort, bạn sẽ nhận kết quả gần với cột medium dưới đây.

Điểm chuẩn Medium, mặc định Max Lưu ý
GDPval-AA v2.1 1277 1620 Medium dùng khoảng một phần mười số token đầu ra của max
AA-Briefcase v1.1 1372 1578 Medium dùng dưới một phần tư số token đầu ra của max
HealthBench Professional 59.9% 64.8% Low: 57.9%, High: 61.3%

Tài liệu về mức nỗ lực mô tả cả năm cấp độ: low, medium, high, xhigh và max.

Điểm số và chi phí theo mức nỗ lực

Các số liệu dưới đây lấy từ biểu đồ ra mắt. Chi phí OSWorld và Terminal-Bench tính theo mỗi lần thử; GDPval-AA tính theo mỗi tác vụ.

Mô hình Low Medium High Xhigh Max
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

Các điểm rút ra để chọn cấu hình:

  • max đắt cho phần cải thiện cuối. Trên GDPval-AA, max đắt khoảng 28 lần medium để tăng thêm 343 Elo. Trên OSWorld, max đắt hơn gấp đôi xhigh để tăng 4.8 điểm.
  • Haiku 5.5 ở medium vượt Luna ở max trên OSWorld: 53.3% với $0.13, so với 48.9% với $0.21.
  • Haiku 5.5 ở max vượt Sonnet 5.5 ở medium trên OSWorld: 72.4% với $0.61, so với 66.0% với $0.93.
  • Terminal-Bench là ngoại lệ: Sonnet 5.5 ở high đạt 43.0% với $1.46, tốt hơn Haiku 5.5 ở max đạt 39.2% với $2.64.
  • Luna thường rẻ hơn ở các mức tương ứng; tại medium trên OSWorld, chi phí của Haiku và Luna tương đương. Xem thêm Haiku 5.5 so với GPT-6 Luna.

Chi phí dùng giá niêm yết $0.10/$0.50 trên mỗi triệu token cho prompt đến 100K token; mức dài hơn có giá cao hơn. Xem phân tích giá.

Những điểm Haiku 5.5 vẫn kém hơn

Sonnet 5.5 dẫn đầu trong mọi hàng của bảng ra mắt. Chiến thắng đối đầu duy nhất của Haiku là FrontierCode khi cả hai cùng chạy ở mức max.

Khoảng cách đáng chú ý nhất là:

  • Terminal-Bench 4.0: 39.2% của Haiku so với 70.6% của Sonnet.
  • SWE-Bench Pro: 64.8 so với 81.3.
  • SWE-bench Đa phương thức: 30.7 so với 54.3.

Anthropic cũng nhận định Sonnet 5.5 và Opus 5.5 vẫn phù hợp hơn cho các tác vụ lập trình tác nhân phức tạp. Haiku 5.5 phù hợp hơn với công việc phạm vi hẹp như:

  • Nén và tóm tắt nội dung
  • Phân loại
  • Sử dụng trình duyệt
  • Tác nhân phụ trong kiến trúc có mô hình lớn hơn

Một cách triển khai là dùng Haiku làm tác nhân phụ chi phí thấp; xem Haiku 5.5 trong Claude Code.

Kết quả độc lập: chưa có

Tính đến ngày 8 tháng 10 năm 2026, chưa có phòng thí nghiệm độc lập nào công bố benchmark Haiku 5.5.

Trang Haiku 5.5 của Artificial Analysis trả về lỗi 404, còn bảng xếp hạng của họ chỉ liệt kê Claude 4.5 Haiku. Vals, LMArena, SWE-bench và Aider cũng chưa có kết quả.

Chưa có số liệu tốc độ từ bên thứ ba. Anthropic gọi Haiku 5.5 là “mô hình nhanh nhất của họ cho đến nay” ở tốc độ tiêu chuẩn, nhưng chậm hơn Opus ở Chế độ Nhanh.

Số liệu bên ngoài gần nhất đến từ Cursor. Tài liệu mô hình của Cursor cho biết Haiku 5.5 đạt 48.4% trên CursorBench ở mức max, tăng từ 30.9% ở mức low.

Khi tắt tính năng suy nghĩ, Cursor báo cáo mức 22.1% đến 26.2%; khi bật suy nghĩ, điểm đạt 30.9% đến 42.3% tại cùng các mức nỗ lực.

Những gì khách hàng báo cáo

Các số liệu sau đến từ bài đăng ra mắt của Anthropic và chưa được xác minh độc lập:

  • HubSpot: Trung bình 92.8% qua ba lần chạy trên bộ cổng CRM mô phỏng; đây là điểm cao nhất họ từng thấy trên bộ này.
  • AlphaSense: 0.84 so với 0.76 của Haiku 4.5 trên 400 truy vấn “Hỏi trong Tài liệu”, được họ đánh giá là có ý nghĩa thống kê.
  • Box: Cao hơn 11 điểm so với Haiku 4.5 với độ trễ khoảng bằng một nửa trong thử nghiệm ban đầu.
  • Asana: Độ trễ hoàn thành tác vụ thấp hơn hơn 30% so với mô hình hiện tại của họ.
  • Cognition: Devin Fusion đạt 66.2 trên FrontierCode khi Haiku 5.5 đóng vai trò trợ lý và Opus 5.5 là mô hình chính. Đây là hệ thống hai mô hình, không phải kết quả của riêng Haiku.

Tự chạy đánh giá trên lưu lượng của bạn

Benchmark công khai không thay thế được lưu lượng thực tế. Hướng dẫn tạo prompt của Anthropic khuyến nghị chỉ dùng xhigh hoặc max khi đánh giá nội bộ chứng minh được lợi ích, đồng thời chạy cùng bộ đánh giá đó trên Sonnet 5.5.

Quy trình triển khai trong Apidog

  1. Lưu ANTHROPIC_API_KEY trong biến môi trường.
  2. Tạo 20–50 yêu cầu messages từ prompt thực tế của sản phẩm.
  3. Thêm assertion cho:
    • Mã trạng thái 200
    • stop_reason không phải "max_tokens" hoặc "refusal"
    • Các điều kiện nội dung mà câu trả lời đúng phải có
  4. Chạy cùng bộ yêu cầu ở low, medium và high.
  5. Ghi lại tỷ lệ đậu và token trong trường usage.
  6. Sao chép collection, đổi mô hình sang claude-sonnet-5-5, rồi so sánh hai mô hình trong cùng một dự án.

Thay đổi mức nỗ lực sẽ làm mất hiệu lực prompt cache. Bộ mã hóa token mới cũng tạo nhiều hơn khoảng 30% token so với Haiku 4.5 cho cùng một văn bản.

Ví dụ yêu cầu API ở mức medium:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Classify this support ticket as billing, bug or feature request: ..."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Không gửi các trường sau với Haiku 5.5 vì chúng sẽ trả về lỗi 400:

  • temperature
  • top_p
  • top_k
  • Nội dung tiền điền sẵn của trợ lý

Khi xử lý phản hồi, hãy chọn block theo trường type, vì một block thinking có thể xuất hiện trước block nội dung trả lời.

Xem thêm:

Câu hỏi thường gặp

Claude Haiku 5.5 có tốt hơn Sonnet 5.5 không?

Không theo số liệu của Anthropic. Sonnet 5.5 dẫn đầu trong mọi hàng của bảng ra mắt; Haiku chỉ nhỉnh hơn ở FrontierCode khi cả hai chạy max, với 46.4% so với 46.2%. Xem Haiku 5.5 so với Haiku 4.5 để đánh giá mức nâng cấp.

Điểm SWE-bench của Haiku 5.5 là bao nhiêu?

Haiku 5.5 đạt:

  • 64.8 trên SWE-Bench Pro
  • 83.7 trên SWE-bench Đa ngôn ngữ
  • 30.7 trên SWE-bench Đa phương thức

Tất cả đều ở mức nỗ lực tối đa.

Các benchmark chạy ở mức nỗ lực nào?

Phần lớn chạy ở max, thường lấy trung bình năm lần thử. Mức mặc định của API là medium, nơi GDPval-AA đạt 1277 thay vì 1620.

Có benchmark Haiku 5.5 độc lập nào không?

Chưa có benchmark được công bố độc lập cho Haiku 5.5. Artificial Analysis chạy GDPval-AA và AA-Briefcase độc lập, nhưng Anthropic là bên công bố các điểm số đó; Artificial Analysis chưa có trang Haiku 5.5.

GPT-6 Luna có rẻ hơn không?

Thường là có. Luna rẻ hơn ở mọi mức nỗ lực của GDPval-AA và mọi mức OSWorld trừ medium, nơi chi phí tương đương. Haiku 5.5 đạt điểm cao hơn trên cả hai benchmark.

Bước tiếp theo

Bắt đầu với medium, sau đó chỉ tăng mức nỗ lực khi tỷ lệ đậu tăng đủ để bù chi phí. Tải xuống Apidog, xây dựng collection đánh giá từ lưu lượng thực tế và lưu kết quả trong Apidog cạnh benchmark Sonnet 5.5 trước khi chuyển lưu lượng sản xuất.

Top comments (0)