Claude Fable 5.1: วิเคราะห์ตัวเลข Benchmark และสิ่งที่ควรทดสอบเอง
Anthropic เปิดตัว Claude Fable 5.1 เมื่อวันที่ 1 กันยายน 2026 พร้อมผลการเปรียบเทียบกับ Fable 5, Opus 5 และ GPT-5.6 Sol ใน 9 การทดสอบ จุดเด่นคือ Terminal-Bench-Science ที่ Fable 5.1 ทำได้ 52.6% เทียบกับ 24.7% ของ Fable 5 ส่วนตัวเลขที่ถูกพูดถึงน้อยกว่าคือ CursorBench ซึ่งนำ Opus 5 เพียง 3.4 จุด แม้ Opus 5 จะมีราคาสูงกว่าถึงสองเท่า
บทความนี้รวมตัวเลขทั้งหมดพร้อมแหล่งที่มา อธิบายว่าแต่ละ benchmark วัดอะไร แยกความแตกต่างที่มีนัยสำคัญออกจากความแตกต่างเล็กน้อย และชี้ให้เห็นข้อจำกัดของข้อมูล: ผลลัพธ์ทั้งหมดจัดทำโดยผู้ขาย, Mythos 5.1 ทำคะแนนได้ดีกว่า Fable 5.1 ในการทดสอบ agentic coding ที่เผยแพร่ทั้งสองรุ่น และวิธีตัดสินใจที่ถูกต้องคือการทดสอบกับงานจริงของคุณเอง แหล่งข้อมูลหลักคือ โพสต์เปิดตัวของ Anthropic ส่วนบริบทของโมเดลอยู่ในบทความ Claude Fable 5.1 คืออะไร
ตาราง benchmark ฉบับเต็ม
| Benchmark | สิ่งที่วัดผล | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | การวิจัยทางวิทยาศาสตร์แบบ agentic ในเทอร์มินัล | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | การเขียนโค้ดแบบ agentic ในเทอร์มินัล | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | งานความรู้ที่มีมูลค่าทางเศรษฐกิจ (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (partial credit) | การใช้งานคอมพิวเตอร์ในงานเดสก์ท็อปจริง | 77.9% | 72.9% | 75.4% | ไม่ได้รายงาน |
| OSWorld 2.0 (strict) | งานแบบเดียวกัน โดยนับเฉพาะงานที่เสร็จสมบูรณ์ | 41.7% | 36.1% | 39.6% | ไม่ได้รายงาน |
| Humanity’s Last Exam (no tools) | คำถามการให้เหตุผลระดับผู้เชี่ยวชาญ | 60.9% | 57.8% | 56.6% | ไม่ได้รายงาน |
| Humanity’s Last Exam (with tools) | งานเดียวกัน พร้อมการค้นหาและโค้ด | 65.0% | 63.8% | 63.6% | ไม่ได้รายงาน |
| AutomationBench | เวิร์กโฟลว์ธุรกิจแบบครบวงจร | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | งานเขียนโค้ดสไตล์ IDE | 73.4% | 70.5% | 70.0% | 67.2% |
Anthropic ยังเผยแพร่ตัวเลขของ Mythos 5.1 หนึ่งรายการ คือ 60.9% บน Terminal-Bench 4.0 ขณะที่ VentureBeat รายงานผล Browserbase ของ Fable 5.1 ที่ 82% เทียบกับ 74% ของ Opus 5 และ 57% ของ Fable 5 ในงาน browser-agent ที่ยากที่สุด ตัวเลข Browserbase มาจากข่าวประชาสัมพันธ์ ไม่ใช่โพสต์เปิดตัว จึงควรใช้ด้วยความระมัดระวัง
ความแตกต่างที่ชัดเจน
Terminal-Bench-Science 0.1
52.6% เทียบกับ 24.7% ของ Fable 5 และ 29.0% ของ Opus 5
นี่คือผลลัพธ์ที่โดดเด่นที่สุด Fable 5.1 ทำคะแนนได้มากกว่าสองเท่าของรุ่นก่อนหน้า และเกือบสองเท่าของ Opus 5 โดย benchmark นี้ให้โมเดลใช้เทอร์มินัลและเครื่องมือทางวิทยาศาสตร์เพื่อทำวิจัยหลายขั้นตอน
ผลลัพธ์นี้เป็นหลักฐานที่ชัดเจนที่สุดว่าการมุ่งเน้นของ Anthropic ในการ “แก้ปัญหาที่มีความซับซ้อนในระยะยาว” สร้างผลลัพธ์ที่วัดได้จริง อย่างไรก็ตาม นี่คือ benchmark เวอร์ชัน 0.1 ชุดงานยังใหม่ และคะแนนอาจเปลี่ยนแปลงในอนาคต
AutomationBench
31.4% เทียบกับ 17.1% ของ Fable 5 และ 26.9% ของ Opus 5
AutomationBench วัดเวิร์กโฟลว์ธุรกิจแบบครบวงจรที่ทำงานข้ามหลายแอปพลิเคชัน แม้คะแนนรวมของทุกโมเดลยังต่ำ แต่ Fable 5.1 ทำได้เกือบสองเท่าของ Fable 5 และนำ Opus 5 อยู่ 4.5 จุด
หากผลิตภัณฑ์ของคุณต้องทำงานอัตโนมัติข้ามหลายแอปพลิเคชัน แถวนี้ควรได้รับความสนใจเป็นพิเศษ
Terminal-Bench 4.0
55.8% เทียบกับ 42.0% ของ Fable 5
Fable 5.1 นำ Fable 5 อยู่ 13.8 จุดในงาน agentic coding ซึ่งเป็นตัวเลขหลักที่ Anthropic ใช้สื่อสารด้านการเขียนโค้ด เมื่อเทียบกับ Opus 5 ส่วนต่างอยู่ที่ 3.5 จุด
Opus 5 เคยนำ Fable 5 ใน benchmark นี้เมื่อเดือนกรกฎาคม ดังนั้นข้อได้เปรียบของ Fable เหนือ Opus จึงกลับมาอีกครั้ง แต่แคบลงเมื่อเทียบกับเดือนมิถุนายน ดูตัวเลขเพิ่มเติมได้ใน รายละเอียด benchmark ของ Opus 5
GDPval-AA v2
1853 เทียบกับ 1723 ของ Fable 5
Fable 5.1 เพิ่มขึ้น 130 Elo ในงานความรู้ และเป็น benchmark ที่ Anthropic ใช้อ้างอิงสำหรับงานเอกสาร สเปรดชีต และสไลด์ เมื่อเทียบกับ Opus 5 ส่วนต่างอยู่ที่ 29 Elo ซึ่งถือว่าไม่มาก
ความแตกต่างเล็กน้อย
CursorBench 3.2.0
73.4% เทียบกับ 70.5% ของ Fable 5 และ 70.0% ของ Opus 5
CursorBench วัดงานเขียนโค้ดสไตล์ IDE Fable 5.1 นำทั้งสองโมเดลประมาณ 3 จุด แต่เป็น benchmark ที่แสดงส่วนต่างน้อยที่สุด
สำหรับงานประเภท “ช่วยฉันเขียนโค้ดในตัวแก้ไข” ตารางนี้เพียงอย่างเดียวยังไม่สามารถพิสูจน์ความคุ้มค่าของโมเดลที่มีราคาแพงกว่าสองเท่าได้
OSWorld 2.0
77.9% / 41.7% เทียบกับ 75.4% / 39.6% ของ Opus 5
Fable 5.1 นำ Opus 5 อยู่ประมาณ 2 จุดทั้งใน partial credit และ strict scoring และนำ Fable 5 อยู่ประมาณ 5 จุด
อย่างไรก็ตาม strict score แสดงให้เห็นว่างานที่เสร็จสมบูรณ์มีไม่ถึงครึ่งในทุกโมเดล การใช้งานคอมพิวเตอร์จึงยังเป็นจุดอ่อนสำคัญของโมเดลชั้นนำ
Humanity’s Last Exam
60.9% / 65.0% เทียบกับ 56.6% / 63.6% ของ Opus 5
เมื่อไม่ใช้เครื่องมือ Fable 5.1 นำ Opus 5 อยู่ 4.3 จุด ซึ่งเป็นส่วนต่างที่มากที่สุดในกลุ่มความแตกต่างเล็กน้อย เมื่อเปิดใช้เครื่องมือ ส่วนต่างลดลงเหลือ 1.4 จุด เพราะการค้นหาและการรันโค้ดช่วยลดความแตกต่างระหว่างโมเดล
- คะแนนแบบไม่ใช้เครื่องมือเหมาะสำหรับวัดความสามารถด้าน reasoning โดยตรง
- คะแนนแบบใช้เครื่องมือใกล้เคียงกับรูปแบบการใช้งานจริงมากกว่า
Fable 5.1 เทียบกับ GPT-5.6 Sol
Anthropic เผยแพร่ผลเปรียบเทียบที่มี GPT-5.6 Sol อยู่ 4 แถว และ Fable 5.1 เป็นผู้นำทั้งหมด:
- Terminal-Bench-Science: นำ 30.2 จุด
- Terminal-Bench 4.0: นำ 18.5 จุด
- AutomationBench: นำ 11.8 จุด
- CursorBench: นำ 6.2 จุด
GDPval-AA v2 อยู่ที่ 1853 เทียบกับ 1711
ควรพิจารณาข้อมูลนี้โดยคำนึงถึงข้อจำกัดสองประการ:
- Anthropic เป็นผู้ดำเนินการทดสอบโมเดลของคู่แข่งเอง
- GPT-5.6 Sol ไม่มีข้อมูลในอีก 5 จาก 9 benchmark โดย Anthropic ไม่ได้ระบุเหตุผล
การเปรียบเทียบ GPT-5.6 Sol กับ Fable 5 ครอบคลุมการแข่งขันในรุ่นก่อนหน้า จากตัวเลขชุดนี้ Fable 5.1 ขยายช่องว่างที่ Fable 5 เคยมีอยู่ทั้งหมด
สิ่งที่ข่าวเปิดตัวไม่ได้กล่าวถึง
ตัวเลขทั้งหมดดำเนินการโดยผู้ขาย
Anthropic เป็นผู้จัดทำผลลัพธ์ทั้งหมด รวมถึงคอลัมน์ของคู่แข่ง และยังไม่มีห้องปฏิบัติการอิสระทำซ้ำผลลัพธ์เหล่านี้ ณ วันที่เปิดตัว
ประวัติ benchmark ของ Anthropic โดยทั่วไปน่าเชื่อถือ แต่ส่วนต่างของ CursorBench และ OSWorld มีขนาดเล็กพอที่ชุดเครื่องมือหรือวิธีให้คะแนนที่แตกต่างกันอาจทำให้ผลเปลี่ยนแปลงได้
Mythos 5.1 คือขีดจำกัดที่แท้จริง
ทั้ง system card และโพสต์เปิดตัวของ Anthropic ระบุว่า Fable 5.1 และ Mythos 5.1 เป็น “โมเดลเดียวกันแต่มีระดับการป้องกันที่แตกต่างกัน”
Mythos 5.1 ทำได้ 60.9% บน Terminal-Bench 4.0 เทียบกับ 55.8% ของ Fable 5.1 ช่องว่าง 5 จุดนี้สะท้อนต้นทุนของการป้องกันในงาน agentic coding และแสดงให้เห็นว่าโมเดลที่ Anthropic เปิดให้ใช้งานในวงกว้างยังมีรุ่นที่มีความสามารถสูงกว่า
การเปรียบเทียบ Mythos 5.1 กับ Fable 5.1 อธิบายเพิ่มเติมว่าใครเข้าถึง Mythos 5.1 ได้บ้าง
ไม่ระบุระดับความพยายาม
เอกสาร effort ของ Anthropic ระบุว่า Fable 5.1 ได้ประโยชน์มากที่สุดที่ระดับ xhigh และ max
แต่โพสต์เปิดตัวไม่ได้ระบุว่าคะแนนแต่ละรายการเกิดขึ้นที่ระดับใด หรือโมเดลที่นำมาเปรียบเทียบใช้ effort ระดับใด เนื่องจาก effort มีผลโดยตรงต่อคุณภาพ การขาดข้อมูลนี้ทำให้การทำซ้ำผลลัพธ์ทำได้ยาก
ภาษาต่างประเทศไม่ได้ดีขึ้น
Anthropic ระบุว่าประสิทธิภาพด้านภาษาต่างประเทศใกล้เคียงกับ Fable 5 ไม่ได้เพิ่มขึ้น หากภาระงานของคุณไม่ใช่ภาษาอังกฤษ ตารางเปิดตัวอาจทำให้ประเมินการปรับปรุงสูงเกินจริง
ตัวเลขด้านความปลอดภัยเป็น benchmark คนละประเภท
Anthropic รายงานว่า:
- false positive ด้านชีววิทยาลดลง 85% ในคำขอที่ไม่เป็นอันตราย
- การแทรกแซงด้านไซเบอร์ลดลงประมาณ 60% ต่อเซสชัน Claude Code เมื่อเทียบกับ Fable 5
ตัวเลขเหล่านี้มาจากทราฟฟิกของ Anthropic เองและไม่สามารถทำซ้ำจากภายนอกได้ แต่สำหรับผู้ใช้ Fable 5 ที่พบการปฏิเสธบ่อยครั้ง ตัวเลขดังกล่าวอาจสำคัญกว่าคะแนน benchmark ด้านประสิทธิภาพ
สิ่งที่ควรทดสอบด้วยตนเอง
ตาราง benchmark ช่วยบอกว่าควรตรวจสอบจุดใด แต่การประเมินจากงานจริงจะบอกว่าควรย้ายโมเดลหรือไม่ ลองทดสอบ 4 กรณีต่อไปนี้:
งาน agent ระยะยาวจากผลิตภัณฑ์จริง
รันงานจนเสร็จบน Fable 5.1 ที่ระดับhigh, Opus 5 ที่xhighและ Fable 5 ที่highเพื่อจำลอง Terminal-Bench-Science และ AutomationBench จากนั้นคำนวณว่าคุณภาพที่เพิ่มขึ้นคุ้มกับราคาที่สูงกว่าสองเท่าหรือไม่พร้อมท์เขียนโค้ดที่ยากที่สุด 10 รายการ
รันด้วย effort ระดับเดียวกันบน Fable 5.1 และ Opus 5 หากผลลัพธ์ใกล้เคียงกัน คุณอาจได้ผลแบบเดียวกับ CursorBench และ Opus 5 อาจเป็นตัวเลือกที่คุ้มค่ากว่าทดสอบ effort ของ Fable 5.1
รันงานประจำตั้งแต่lowถึงmaxAnthropic อ้างว่าmediumใกล้เคียงกับ Fable 5 และlowอาจแข่งขันกับ Opus 5 ได้ในด้านต้นทุนต่องาน ตรวจสอบข้ออ้างนี้กับข้อมูลของคุณเองวัดจำนวนการปฏิเสธ
ใช้ชุดพร้อมท์ด้านความปลอดภัยและชีววิทยาที่ไม่เป็นอันตราย เปรียบเทียบ Fable 5 กับ Fable 5.1 เพื่อทดสอบข้ออ้างเรื่องการลด false positive 60% และ 85%
สร้างการทดสอบทั้งสี่เป็นคำขอใน Apidog โดยกำหนด model และ effort เป็นตัวแปรสภาพแวดล้อม เพิ่มการตรวจสอบค่า stop_reason และตรวจสอบว่าสตริงที่คาดหวังปรากฏในคำตอบ จากนั้นเรียกใช้คอลเลกชันแยกตามโมเดล
ประวัติการเรียกใช้จะช่วยสร้างตารางประเมินผลที่ทำซ้ำได้โดยไม่ต้องเพิ่มโครงสร้างพื้นฐาน ดาวน์โหลด Apidog เพื่อเริ่มต้น และดู คำแนะนำการใช้งาน Claude API สำหรับรูปแบบคำขอ
Benchmark เหล่านี้เชื่อมโยงกับการตัดสินใจอย่างไร
- Agent ระยะยาว การวิจัย และระบบอัตโนมัติ: ความแตกต่างมีขนาดใหญ่และสอดคล้องกัน Fable 5.1 เป็นตัวเลือกที่แนะนำ และ รายละเอียดราคา แสดงให้เห็นว่าราคา cache read ที่ลดลงช่วยลดต้นทุนของงานประเภทนี้
- การเขียนโค้ดใน IDE, Q&A ด้านความรู้ และ reasoning ที่ใช้เครื่องมือ: ส่วนต่างกับ Opus 5 อยู่ที่ประมาณ 1–4 จุด ให้ใช้ Opus 5 ต่อ เว้นแต่จะล้มเหลวในการประเมินของคุณที่ effort สูงกว่า ดูรายละเอียดใน Fable 5.1 เทียบกับ Opus 5
- ผู้ใช้ที่ย้ายจาก Fable 5: ทุก benchmark ดีขึ้น ราคาไม่เปลี่ยน และอัตรา false positive ลดลง การเปรียบเทียบ Fable 5.1 กับ Fable 5 ครอบคลุมต้นทุนการย้ายเพิ่มเติม
คำถามที่พบบ่อย
ผล benchmark ที่ดีที่สุดของ Claude Fable 5.1 คืออะไร?
Terminal-Bench-Science 0.1 ที่ 52.6% มากกว่าสองเท่าของ Fable 5 ที่ 24.7% และนำหน้า Opus 5 ที่ 29.0% กับ GPT-5.6 Sol ที่ 22.4% ตัวเลขทั้งหมดมาจาก Anthropic
Fable 5.1 เทียบกับ Opus 5 ในการเขียนโค้ดเป็นอย่างไร?
Fable 5.1 ทำได้ 55.8% เทียบกับ 52.3% บน Terminal-Bench 4.0 และ 73.4% เทียบกับ 70.0% บน CursorBench 3.2.0 ตามตัวเลขของ Anthropic Fable 5.1 นำอยู่จริง แต่ส่วนต่างประมาณ 3 จุด
Fable 5.1 ดีกว่า GPT-5.6 Sol หรือไม่?
ใน 4 benchmark ที่ Anthropic เผยแพร่ผลของทั้งสองโมเดล คำตอบคือใช่ โดยนำอยู่ 6–30 จุด อย่างไรก็ตาม Anthropic เป็นผู้ทดสอบ GPT-5.6 Sol เอง และไม่มีข้อมูลของ GPT-5.6 Sol ใน 5 จาก 9 แถว
ผล benchmark ของ Fable 5.1 ได้รับการตรวจสอบโดยอิสระหรือไม่?
ยังไม่ได้รับการตรวจสอบโดยอิสระ ณ วันที่เปิดตัว ตัวเลขทั้งหมดจัดทำโดย Anthropic จึงควรทดสอบกับภาระงานจริงของคุณ
Mythos 5.1 ทำคะแนนได้เท่าไหร่?
Anthropic เผยแพร่ตัวเลขเดียวคือ 60.9% บน Terminal-Bench 4.0 สูงกว่า Fable 5.1 ที่ 55.8% อยู่ 5 จุด ทั้งสองเป็นโมเดลเดียวกันแต่มีระดับการป้องกันแตกต่างกัน
ระดับ effort ใดทำให้เกิดคะแนนเหล่านี้?
Anthropic ไม่ได้ระบุระดับ effort ของแต่ละคะแนน เอกสารระบุว่า Fable 5.1 ได้ประโยชน์มากที่สุดที่ xhigh และ max ดังนั้นควรตั้งสมมติฐานว่าการทดสอบใช้ effort สูง และคาดว่าค่าที่ต่ำกว่าจะได้คะแนนลดลง





Top comments (0)