Claude Fable 5.1: Phân tích toàn bộ điểm chuẩn và cách tự đánh giá
Anthropic ra mắt Claude Fable 5.1 ngày 1/9/2026 cùng bảng so sánh với Fable 5, Opus 5 và GPT-5.6 Sol trên chín bài kiểm tra. Kết quả nổi bật nhất là Terminal-Bench-Science: Fable 5.1 đạt 52.6%, cao hơn nhiều so với 24.7% của Fable 5. Ít được nhắc đến hơn là CursorBench, nơi Fable 5.1 chỉ hơn Opus 5 3.4 điểm dù có mức giá gấp đôi.
Bài viết này tổng hợp các số liệu đã công bố, giải thích từng điểm chuẩn, phân biệt khoảng cách lớn và nhỏ, đồng thời chỉ ra những giới hạn của bảng đánh giá do nhà cung cấp thực hiện. Nguồn chính là bài đăng ra mắt của Anthropic; thông tin nền tảng có trong Claude Fable 5.1 là gì.
Bảng đầy đủ
| Điểm chuẩn | Nội dung đo lường | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Nghiên cứu khoa học tác nhân trong terminal | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Mã hóa tác nhân trong terminal | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Công việc kiến thức có giá trị kinh tế (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (điểm một phần) | Sử dụng máy tính trên các tác vụ máy tính để bàn thực tế | 77.9% | 72.9% | 75.4% | Không báo cáo |
| OSWorld 2.0 (nghiêm ngặt) | Chỉ tính các tác vụ được hoàn thành đầy đủ | 41.7% | 36.1% | 39.6% | Không báo cáo |
| Humanity’s Last Exam (không công cụ) | Câu hỏi suy luận cấp độ chuyên gia | 60.9% | 57.8% | 56.6% | Không báo cáo |
| Humanity’s Last Exam (có công cụ) | Tương tự, có tìm kiếm và mã hóa | 65.0% | 63.8% | 63.6% | Không báo cáo |
| AutomationBench | Quy trình làm việc kinh doanh đầu cuối | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Các tác vụ mã hóa kiểu IDE | 73.4% | 70.5% | 70.0% | 67.2% |
Anthropic cũng công bố kết quả 60.9% của Mythos 5.1 trên Terminal-Bench 4.0. VentureBeat đưa tin Fable 5.1 đạt 82% trên Browserbase, so với 74% của Opus 5 và 57% của Fable 5 trong nhóm tác vụ tác nhân trình duyệt khó nhất. Đây là số liệu từ báo chí, không phải bài đăng ra mắt, nên cần thận trọng khi diễn giải.
Những khoảng cách lớn
Terminal-Bench-Science 0.1
Fable 5.1: 52.6% — Fable 5: 24.7% — Opus 5: 29.0%.
Fable 5.1 đạt hơn gấp đôi phiên bản tiền nhiệm và gần gấp đôi Opus 5 trên bài kiểm tra yêu cầu mô hình làm nghiên cứu nhiều bước trong terminal, sử dụng các công cụ khoa học. Đây là bằng chứng rõ nhất cho tuyên bố của Anthropic về khả năng “giải quyết vấn đề dài hạn”.
Tuy nhiên, đây mới là phiên bản 0.1. Bộ tác vụ còn non trẻ và điểm số có thể thay đổi khi được hoàn thiện.
AutomationBench
Fable 5.1: 31.4% — Fable 5: 17.1% — Opus 5: 26.9%.
AutomationBench đo quy trình kinh doanh đầu cuối trên nhiều ứng dụng. Điểm tuyệt đối của mọi mô hình vẫn thấp, nhưng Fable 5.1 gần gấp đôi Fable 5 và hơn Opus 5 4.5 điểm.
Nếu sản phẩm của bạn tự động hóa quy trình đa ứng dụng, đây là kết quả đáng chú ý nhất.
Terminal-Bench 4.0
Fable 5.1: 55.8% — Fable 5: 42.0% — Opus 5: 52.3%.
Fable 5.1 tăng 13.8 điểm so với Fable 5 và dẫn trước Opus 5 3.5 điểm trong mã hóa tác nhân. Opus 5 từng vượt Fable 5 trên điểm chuẩn này vào tháng 7, vì vậy lợi thế của dòng Fable đã quay trở lại nhưng vẫn khá hẹp. Phân tích điểm chuẩn Opus 5 có thêm số liệu của tháng 7.
GDPval-AA v2
Fable 5.1: 1853 — Fable 5: 1723 — Opus 5: 1824.
Fable 5.1 tăng 130 Elo so với Fable 5 trong các tác vụ công việc kiến thức. Đây cũng là điểm chuẩn Anthropic dùng để hỗ trợ các tuyên bố về tài liệu, bảng tính và slide.
Khoảng cách với Opus 5 chỉ là 29 Elo, tương đối nhỏ.
Những khoảng cách nhỏ
CursorBench 3.2.0
Fable 5.1: 73.4% — Fable 5: 70.5% — Opus 5: 70.0%.
CursorBench đo các tác vụ mã hóa kiểu IDE. Fable 5.1 chỉ hơn Opus 5 3.4 điểm và hơn Fable 5 2.9 điểm.
Đây là điểm chuẩn gần với công việc hằng ngày của nhiều nhà phát triển nhất, đồng thời là nơi lợi thế của Fable 5.1 mỏng nhất. Nếu nhu cầu chính của bạn là “hãy hỗ trợ tôi trong trình chỉnh sửa”, bảng ra mắt chưa đủ để biện minh cho mức giá gấp đôi.
OSWorld 2.0
Fable 5.1: 77.9% / 41.7% — Opus 5: 75.4% / 39.6%.
Fable 5.1 hơn Opus 5 hai điểm ở cả thang điểm một phần và nghiêm ngặt; đồng thời hơn Fable 5 lần lượt năm và 5.6 điểm.
Đây là cải thiện có thật nhưng chưa lớn. Đáng chú ý, điểm nghiêm ngặt của mọi mô hình đều dưới 50%, nghĩa là sử dụng máy tính vẫn là một trong những năng lực yếu nhất của các mô hình tiên tiến.
Humanity’s Last Exam
Không công cụ: Fable 5.1 đạt 60.9%, Opus 5 đạt 56.6%.
Có công cụ: Fable 5.1 đạt 65.0%, Opus 5 đạt 63.6%.
Không dùng công cụ, Fable 5.1 dẫn trước 4.3 điểm — khoảng cách lớn nhất trong nhóm này. Khi được phép tìm kiếm và thực thi mã, khoảng cách giảm còn 1.4 điểm vì các công cụ thu hẹp khác biệt giữa hai mô hình.
Điểm không công cụ phản ánh tốt hơn khả năng suy luận thuần túy; điểm có công cụ gần với cách mô hình thường được sử dụng trong thực tế hơn.
Fable 5.1 so với GPT-5.6 Sol
Anthropic công bố bốn hàng có cột GPT-5.6 Sol, và Fable 5.1 dẫn đầu cả bốn:
- Terminal-Bench-Science: hơn 30.2 điểm.
- Terminal-Bench 4.0: hơn 18.5 điểm.
- AutomationBench: hơn 11.8 điểm.
- CursorBench: hơn 6.2 điểm.
- GDPval-AA: 1853 so với 1711.
Có hai điểm cần lưu ý:
- Anthropic tự chạy các bài kiểm tra trên mô hình đối thủ.
- GPT-5.6 Sol không có số liệu ở năm hàng còn lại, nhưng Anthropic không giải thích lý do.
So sánh GPT-5.6 Sol với Fable 5 đã đề cập đến thế hệ trước. Với các số liệu hiện tại, Fable 5.1 mở rộng mọi khoảng cách mà Fable 5 từng có.
Những gì tin tức ra mắt đã bỏ qua
Tất cả số liệu đều do nhà cung cấp thực hiện
Anthropic chạy toàn bộ bài kiểm tra, bao gồm cả cột GPT-5.6 Sol. Tại thời điểm ra mắt, chưa có phòng thí nghiệm độc lập nào tái tạo các kết quả này.
Lịch sử điểm chuẩn của Anthropic nhìn chung đáng tin cậy, nhưng các khoảng cách nhỏ trên CursorBench và OSWorld có thể thay đổi nếu dùng công cụ kiểm thử hoặc phương pháp chấm điểm khác.
Mythos 5.1 mới là giới hạn thực sự
System card và bài đăng ra mắt mô tả Fable 5.1 cùng Mythos 5.1 là “cùng một mô hình nhưng có các cấp độ bảo vệ khác nhau”.
Anthropic công bố Mythos 5.1 đạt 60.9% trên Terminal-Bench 4.0, cao hơn 5.1 điểm so với Fable 5.1. Điều này cho thấy các biện pháp bảo vệ có thể làm giảm hiệu năng mã hóa tác nhân. So sánh Mythos 5.1 với Fable 5.1 phân tích khả năng tiếp cận hai mô hình.
Không rõ mức độ nỗ lực được sử dụng
Tài liệu về mức độ nỗ lực của Anthropic cho biết lợi ích của Fable 5.1 lớn nhất ở xhigh và max. Tuy nhiên, bài đăng ra mắt không nêu mức độ nỗ lực tạo ra từng điểm số, cũng không cho biết các mô hình đối chiếu được chạy ở mức nào.
Đây là thiếu sót quan trọng khi cố gắng tái tạo kết quả, vì effort là một trong những biến ảnh hưởng trực tiếp đến chất lượng và chi phí.
Hiệu năng đa ngôn ngữ không thay đổi
Anthropic cho biết hiệu năng đa ngôn ngữ tương đương Fable 5, không được cải thiện. Nếu khối lượng công việc của bạn không dùng tiếng Anh, mức tăng trong bảng điểm có thể không phản ánh đúng lợi ích thực tế.
Điểm số về biện pháp bảo vệ là một loại điểm chuẩn khác
Anthropic báo cáo:
- Giảm 85% trường hợp dương tính giả sinh học trên các yêu cầu lành tính.
- Giảm khoảng 60% số lần can thiệp mạng trên mỗi phiên Claude Code so với Fable 5.
Các số liệu này được đo trên lưu lượng nội bộ của Anthropic nên không thể tái tạo từ bên ngoài. Tuy vậy, với người dùng Fable 5 thường gặp phải từ chối, chúng có thể có giá trị hơn các điểm năng lực trong bảng.
Cách tự kiểm tra trước khi chuyển đổi
Bảng ra mắt cho biết nên kiểm tra ở đâu; đánh giá trên dữ liệu của bạn mới cho biết có nên chuyển đổi hay không. Hãy chạy bốn thử nghiệm sau:
-
Tác vụ tác nhân dài hạn: Chạy một tác vụ thực tế của sản phẩm đến khi hoàn thành trên Fable 5.1 với
high, Opus 5 vớixhighvà Fable 5 vớihigh. Đây là phép thử tương tự Terminal-Bench-Science và AutomationBench, giúp xác định mức giá gấp đôi có đáng hay không. -
Mã hóa trong IDE: Chọn mười lời nhắc khó nhất, chạy trên Fable 5.1 và Opus 5 với cùng mức
effort. Nếu kết quả ngang nhau, lợi thế CursorBench không đủ để biện minh cho việc chuyển đổi. -
Quét mức độ nỗ lực: Chạy cùng một tác vụ thông thường trên Fable 5.1 từ
lowđếnmax. Anthropic tuyên bốmediumcó thể tương đương Fable 5, cònlowcó thể cạnh tranh với Opus 5 về chi phí mỗi tác vụ. - Đo tỷ lệ từ chối: So sánh Fable 5 và Fable 5.1 trên các lời nhắc bảo mật hoặc khoa học đời sống lành tính. Đây là cách kiểm tra hai tuyên bố giảm 60% và 85%.
Bạn có thể xây dựng cả bốn yêu cầu trong Apidog, đặt model và effort làm biến môi trường, rồi thêm các xác nhận cho stop_reason và chuỗi dự kiến trong câu trả lời. Chạy cùng một collection cho từng mô hình để có kết quả so sánh nhất quán.
Lịch sử chạy cung cấp bảng đánh giá có thể tái tạo mà không cần triển khai hạ tầng mới. Tải xuống Apidog để bắt đầu; hướng dẫn API trình bày các dạng yêu cầu cần thiết.
Liên hệ điểm chuẩn với quyết định triển khai
- Tác nhân dài hạn, nghiên cứu và tự động hóa: Khoảng cách lớn và nhất quán. Fable 5.1 là lựa chọn nổi bật; phân tích giá cho thấy chi phí đọc bộ nhớ đệm thấp hơn giúp thu hẹp chênh lệch tổng chi phí.
-
Mã hóa IDE, hỏi đáp kiến thức và suy luận có công cụ: Khoảng cách với Opus 5 chỉ từ 1 đến 4 điểm. Quy tắc thực tế là tiếp tục dùng Opus 5 trừ khi Fable 5.1 vượt qua đánh giá nội bộ ở mức
effortcao hơn. So sánh Fable 5.1 với Opus 5 phân tích chi tiết hơn. - Chuyển đổi từ Fable 5: Mọi hàng trong bảng đều được cải thiện, giá không đổi và tỷ lệ dương tính giả giảm. So sánh Fable 5.1 với Fable 5 tập trung vào chi phí di chuyển.
Câu hỏi thường gặp
Kết quả tốt nhất của Claude Fable 5.1 là gì?
Terminal-Bench-Science 0.1 với 52.6%, cao hơn 24.7% của Fable 5, 29.0% của Opus 5 và 22.4% của GPT-5.6 Sol. Tất cả số liệu đều do Anthropic cung cấp.
Fable 5.1 mã hóa tốt hơn Opus 5 đến mức nào?
Fable 5.1 đạt 55.8% so với 52.3% của Opus 5 trên Terminal-Bench 4.0, và 73.4% so với 70.0% trên CursorBench 3.2.0. Lợi thế có thật nhưng chỉ khoảng ba điểm.
Fable 5.1 có tốt hơn GPT-5.6 Sol không?
Trên bốn điểm chuẩn Anthropic công bố cho cả hai, Fable 5.1 dẫn trước từ 6 đến 30 điểm. Tuy nhiên, Anthropic tự chạy các bài kiểm tra và GPT-5.6 Sol không có số liệu ở năm trong chín hàng.
Các điểm chuẩn đã được xác minh độc lập chưa?
Chưa, tại thời điểm ra mắt. Hãy xem đây là các tuyên bố cần kiểm tra trên khối lượng công việc của riêng bạn.
Mythos 5.1 đạt bao nhiêu điểm?
Anthropic công bố 60.9% trên Terminal-Bench 4.0, cao hơn 5.1 điểm so với Fable 5.1. Hai mô hình được mô tả là cùng một nền tảng với các cấp độ bảo vệ khác nhau.
Các điểm số được chạy ở mức độ nỗ lực nào?
Anthropic không công bố rõ. Tài liệu của họ cho biết lợi ích của Fable 5.1 lớn nhất ở xhigh và max; vì vậy nên giả định các điểm số dùng mức nỗ lực cao và kiểm tra lại các mức thấp hơn trong đánh giá nội bộ.





Top comments (0)