DEV Community

Cover image for Claude Fable 5.1 Benchmarks: ผลการทดสอบเผยความจริงของตัวเลข
Thanawat Wongchai
Thanawat Wongchai

Posted on Originally published at apidog.com

Claude Fable 5.1 Benchmarks: ผลการทดสอบเผยความจริงของตัวเลข

Claude Fable 5.1: วิเคราะห์ตัวเลข Benchmark และสิ่งที่ควรทดสอบเอง

Anthropic เปิดตัว Claude Fable 5.1 เมื่อวันที่ 1 กันยายน 2026 พร้อมผลการเปรียบเทียบกับ Fable 5, Opus 5 และ GPT-5.6 Sol ใน 9 การทดสอบ จุดเด่นคือ Terminal-Bench-Science ที่ Fable 5.1 ทำได้ 52.6% เทียบกับ 24.7% ของ Fable 5 ส่วนตัวเลขที่ถูกพูดถึงน้อยกว่าคือ CursorBench ซึ่งนำ Opus 5 เพียง 3.4 จุด แม้ Opus 5 จะมีราคาสูงกว่าถึงสองเท่า

ลองใช้ Apidog วันนี้

บทความนี้รวมตัวเลขทั้งหมดพร้อมแหล่งที่มา อธิบายว่าแต่ละ benchmark วัดอะไร แยกความแตกต่างที่มีนัยสำคัญออกจากความแตกต่างเล็กน้อย และชี้ให้เห็นข้อจำกัดของข้อมูล: ผลลัพธ์ทั้งหมดจัดทำโดยผู้ขาย, Mythos 5.1 ทำคะแนนได้ดีกว่า Fable 5.1 ในการทดสอบ agentic coding ที่เผยแพร่ทั้งสองรุ่น และวิธีตัดสินใจที่ถูกต้องคือการทดสอบกับงานจริงของคุณเอง แหล่งข้อมูลหลักคือ โพสต์เปิดตัวของ Anthropic ส่วนบริบทของโมเดลอยู่ในบทความ Claude Fable 5.1 คืออะไร

ตาราง benchmark ฉบับเต็ม

Benchmark สิ่งที่วัดผล Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 การวิจัยทางวิทยาศาสตร์แบบ agentic ในเทอร์มินัล 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 การเขียนโค้ดแบบ agentic ในเทอร์มินัล 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 งานความรู้ที่มีมูลค่าทางเศรษฐกิจ (Elo) 1853 1723 1824 1711
OSWorld 2.0 (partial credit) การใช้งานคอมพิวเตอร์ในงานเดสก์ท็อปจริง 77.9% 72.9% 75.4% ไม่ได้รายงาน
OSWorld 2.0 (strict) งานแบบเดียวกัน โดยนับเฉพาะงานที่เสร็จสมบูรณ์ 41.7% 36.1% 39.6% ไม่ได้รายงาน
Humanity’s Last Exam (no tools) คำถามการให้เหตุผลระดับผู้เชี่ยวชาญ 60.9% 57.8% 56.6% ไม่ได้รายงาน
Humanity’s Last Exam (with tools) งานเดียวกัน พร้อมการค้นหาและโค้ด 65.0% 63.8% 63.6% ไม่ได้รายงาน
AutomationBench เวิร์กโฟลว์ธุรกิจแบบครบวงจร 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 งานเขียนโค้ดสไตล์ IDE 73.4% 70.5% 70.0% 67.2%

Anthropic ยังเผยแพร่ตัวเลขของ Mythos 5.1 หนึ่งรายการ คือ 60.9% บน Terminal-Bench 4.0 ขณะที่ VentureBeat รายงานผล Browserbase ของ Fable 5.1 ที่ 82% เทียบกับ 74% ของ Opus 5 และ 57% ของ Fable 5 ในงาน browser-agent ที่ยากที่สุด ตัวเลข Browserbase มาจากข่าวประชาสัมพันธ์ ไม่ใช่โพสต์เปิดตัว จึงควรใช้ด้วยความระมัดระวัง

ความแตกต่างที่ชัดเจน

Terminal-Bench-Science 0.1

52.6% เทียบกับ 24.7% ของ Fable 5 และ 29.0% ของ Opus 5

นี่คือผลลัพธ์ที่โดดเด่นที่สุด Fable 5.1 ทำคะแนนได้มากกว่าสองเท่าของรุ่นก่อนหน้า และเกือบสองเท่าของ Opus 5 โดย benchmark นี้ให้โมเดลใช้เทอร์มินัลและเครื่องมือทางวิทยาศาสตร์เพื่อทำวิจัยหลายขั้นตอน

ผลลัพธ์นี้เป็นหลักฐานที่ชัดเจนที่สุดว่าการมุ่งเน้นของ Anthropic ในการ “แก้ปัญหาที่มีความซับซ้อนในระยะยาว” สร้างผลลัพธ์ที่วัดได้จริง อย่างไรก็ตาม นี่คือ benchmark เวอร์ชัน 0.1 ชุดงานยังใหม่ และคะแนนอาจเปลี่ยนแปลงในอนาคต

ผล Terminal-Bench-Science

AutomationBench

31.4% เทียบกับ 17.1% ของ Fable 5 และ 26.9% ของ Opus 5

AutomationBench วัดเวิร์กโฟลว์ธุรกิจแบบครบวงจรที่ทำงานข้ามหลายแอปพลิเคชัน แม้คะแนนรวมของทุกโมเดลยังต่ำ แต่ Fable 5.1 ทำได้เกือบสองเท่าของ Fable 5 และนำ Opus 5 อยู่ 4.5 จุด

หากผลิตภัณฑ์ของคุณต้องทำงานอัตโนมัติข้ามหลายแอปพลิเคชัน แถวนี้ควรได้รับความสนใจเป็นพิเศษ

Terminal-Bench 4.0

55.8% เทียบกับ 42.0% ของ Fable 5

Fable 5.1 นำ Fable 5 อยู่ 13.8 จุดในงาน agentic coding ซึ่งเป็นตัวเลขหลักที่ Anthropic ใช้สื่อสารด้านการเขียนโค้ด เมื่อเทียบกับ Opus 5 ส่วนต่างอยู่ที่ 3.5 จุด

Opus 5 เคยนำ Fable 5 ใน benchmark นี้เมื่อเดือนกรกฎาคม ดังนั้นข้อได้เปรียบของ Fable เหนือ Opus จึงกลับมาอีกครั้ง แต่แคบลงเมื่อเทียบกับเดือนมิถุนายน ดูตัวเลขเพิ่มเติมได้ใน รายละเอียด benchmark ของ Opus 5

ผล Terminal-Bench

GDPval-AA v2

1853 เทียบกับ 1723 ของ Fable 5

Fable 5.1 เพิ่มขึ้น 130 Elo ในงานความรู้ และเป็น benchmark ที่ Anthropic ใช้อ้างอิงสำหรับงานเอกสาร สเปรดชีต และสไลด์ เมื่อเทียบกับ Opus 5 ส่วนต่างอยู่ที่ 29 Elo ซึ่งถือว่าไม่มาก

ความแตกต่างเล็กน้อย

CursorBench 3.2.0

73.4% เทียบกับ 70.5% ของ Fable 5 และ 70.0% ของ Opus 5

CursorBench วัดงานเขียนโค้ดสไตล์ IDE Fable 5.1 นำทั้งสองโมเดลประมาณ 3 จุด แต่เป็น benchmark ที่แสดงส่วนต่างน้อยที่สุด

สำหรับงานประเภท “ช่วยฉันเขียนโค้ดในตัวแก้ไข” ตารางนี้เพียงอย่างเดียวยังไม่สามารถพิสูจน์ความคุ้มค่าของโมเดลที่มีราคาแพงกว่าสองเท่าได้

ผล CursorBench

OSWorld 2.0

77.9% / 41.7% เทียบกับ 75.4% / 39.6% ของ Opus 5

Fable 5.1 นำ Opus 5 อยู่ประมาณ 2 จุดทั้งใน partial credit และ strict scoring และนำ Fable 5 อยู่ประมาณ 5 จุด

อย่างไรก็ตาม strict score แสดงให้เห็นว่างานที่เสร็จสมบูรณ์มีไม่ถึงครึ่งในทุกโมเดล การใช้งานคอมพิวเตอร์จึงยังเป็นจุดอ่อนสำคัญของโมเดลชั้นนำ

Humanity’s Last Exam

60.9% / 65.0% เทียบกับ 56.6% / 63.6% ของ Opus 5

เมื่อไม่ใช้เครื่องมือ Fable 5.1 นำ Opus 5 อยู่ 4.3 จุด ซึ่งเป็นส่วนต่างที่มากที่สุดในกลุ่มความแตกต่างเล็กน้อย เมื่อเปิดใช้เครื่องมือ ส่วนต่างลดลงเหลือ 1.4 จุด เพราะการค้นหาและการรันโค้ดช่วยลดความแตกต่างระหว่างโมเดล

  • คะแนนแบบไม่ใช้เครื่องมือเหมาะสำหรับวัดความสามารถด้าน reasoning โดยตรง
  • คะแนนแบบใช้เครื่องมือใกล้เคียงกับรูปแบบการใช้งานจริงมากกว่า

ผล Humanity’s Last Exam

Fable 5.1 เทียบกับ GPT-5.6 Sol

Anthropic เผยแพร่ผลเปรียบเทียบที่มี GPT-5.6 Sol อยู่ 4 แถว และ Fable 5.1 เป็นผู้นำทั้งหมด:

  • Terminal-Bench-Science: นำ 30.2 จุด
  • Terminal-Bench 4.0: นำ 18.5 จุด
  • AutomationBench: นำ 11.8 จุด
  • CursorBench: นำ 6.2 จุด

GDPval-AA v2 อยู่ที่ 1853 เทียบกับ 1711

ควรพิจารณาข้อมูลนี้โดยคำนึงถึงข้อจำกัดสองประการ:

  1. Anthropic เป็นผู้ดำเนินการทดสอบโมเดลของคู่แข่งเอง
  2. GPT-5.6 Sol ไม่มีข้อมูลในอีก 5 จาก 9 benchmark โดย Anthropic ไม่ได้ระบุเหตุผล

การเปรียบเทียบ GPT-5.6 Sol กับ Fable 5 ครอบคลุมการแข่งขันในรุ่นก่อนหน้า จากตัวเลขชุดนี้ Fable 5.1 ขยายช่องว่างที่ Fable 5 เคยมีอยู่ทั้งหมด

สิ่งที่ข่าวเปิดตัวไม่ได้กล่าวถึง

ตัวเลขทั้งหมดดำเนินการโดยผู้ขาย

Anthropic เป็นผู้จัดทำผลลัพธ์ทั้งหมด รวมถึงคอลัมน์ของคู่แข่ง และยังไม่มีห้องปฏิบัติการอิสระทำซ้ำผลลัพธ์เหล่านี้ ณ วันที่เปิดตัว

ประวัติ benchmark ของ Anthropic โดยทั่วไปน่าเชื่อถือ แต่ส่วนต่างของ CursorBench และ OSWorld มีขนาดเล็กพอที่ชุดเครื่องมือหรือวิธีให้คะแนนที่แตกต่างกันอาจทำให้ผลเปลี่ยนแปลงได้

Mythos 5.1 คือขีดจำกัดที่แท้จริง

ทั้ง system card และโพสต์เปิดตัวของ Anthropic ระบุว่า Fable 5.1 และ Mythos 5.1 เป็น “โมเดลเดียวกันแต่มีระดับการป้องกันที่แตกต่างกัน”

Mythos 5.1 ทำได้ 60.9% บน Terminal-Bench 4.0 เทียบกับ 55.8% ของ Fable 5.1 ช่องว่าง 5 จุดนี้สะท้อนต้นทุนของการป้องกันในงาน agentic coding และแสดงให้เห็นว่าโมเดลที่ Anthropic เปิดให้ใช้งานในวงกว้างยังมีรุ่นที่มีความสามารถสูงกว่า

การเปรียบเทียบ Mythos 5.1 กับ Fable 5.1 อธิบายเพิ่มเติมว่าใครเข้าถึง Mythos 5.1 ได้บ้าง

ไม่ระบุระดับความพยายาม

เอกสาร effort ของ Anthropic ระบุว่า Fable 5.1 ได้ประโยชน์มากที่สุดที่ระดับ xhigh และ max

แต่โพสต์เปิดตัวไม่ได้ระบุว่าคะแนนแต่ละรายการเกิดขึ้นที่ระดับใด หรือโมเดลที่นำมาเปรียบเทียบใช้ effort ระดับใด เนื่องจาก effort มีผลโดยตรงต่อคุณภาพ การขาดข้อมูลนี้ทำให้การทำซ้ำผลลัพธ์ทำได้ยาก

ภาษาต่างประเทศไม่ได้ดีขึ้น

Anthropic ระบุว่าประสิทธิภาพด้านภาษาต่างประเทศใกล้เคียงกับ Fable 5 ไม่ได้เพิ่มขึ้น หากภาระงานของคุณไม่ใช่ภาษาอังกฤษ ตารางเปิดตัวอาจทำให้ประเมินการปรับปรุงสูงเกินจริง

ตัวเลขด้านความปลอดภัยเป็น benchmark คนละประเภท

Anthropic รายงานว่า:

  • false positive ด้านชีววิทยาลดลง 85% ในคำขอที่ไม่เป็นอันตราย
  • การแทรกแซงด้านไซเบอร์ลดลงประมาณ 60% ต่อเซสชัน Claude Code เมื่อเทียบกับ Fable 5

ตัวเลขเหล่านี้มาจากทราฟฟิกของ Anthropic เองและไม่สามารถทำซ้ำจากภายนอกได้ แต่สำหรับผู้ใช้ Fable 5 ที่พบการปฏิเสธบ่อยครั้ง ตัวเลขดังกล่าวอาจสำคัญกว่าคะแนน benchmark ด้านประสิทธิภาพ

สิ่งที่ควรทดสอบด้วยตนเอง

ตาราง benchmark ช่วยบอกว่าควรตรวจสอบจุดใด แต่การประเมินจากงานจริงจะบอกว่าควรย้ายโมเดลหรือไม่ ลองทดสอบ 4 กรณีต่อไปนี้:

  1. งาน agent ระยะยาวจากผลิตภัณฑ์จริง

    รันงานจนเสร็จบน Fable 5.1 ที่ระดับ high, Opus 5 ที่ xhigh และ Fable 5 ที่ high เพื่อจำลอง Terminal-Bench-Science และ AutomationBench จากนั้นคำนวณว่าคุณภาพที่เพิ่มขึ้นคุ้มกับราคาที่สูงกว่าสองเท่าหรือไม่

  2. พร้อมท์เขียนโค้ดที่ยากที่สุด 10 รายการ

    รันด้วย effort ระดับเดียวกันบน Fable 5.1 และ Opus 5 หากผลลัพธ์ใกล้เคียงกัน คุณอาจได้ผลแบบเดียวกับ CursorBench และ Opus 5 อาจเป็นตัวเลือกที่คุ้มค่ากว่า

  3. ทดสอบ effort ของ Fable 5.1

    รันงานประจำตั้งแต่ low ถึง max Anthropic อ้างว่า medium ใกล้เคียงกับ Fable 5 และ low อาจแข่งขันกับ Opus 5 ได้ในด้านต้นทุนต่องาน ตรวจสอบข้ออ้างนี้กับข้อมูลของคุณเอง

  4. วัดจำนวนการปฏิเสธ

    ใช้ชุดพร้อมท์ด้านความปลอดภัยและชีววิทยาที่ไม่เป็นอันตราย เปรียบเทียบ Fable 5 กับ Fable 5.1 เพื่อทดสอบข้ออ้างเรื่องการลด false positive 60% และ 85%

สร้างการทดสอบทั้งสี่เป็นคำขอใน Apidog โดยกำหนด model และ effort เป็นตัวแปรสภาพแวดล้อม เพิ่มการตรวจสอบค่า stop_reason และตรวจสอบว่าสตริงที่คาดหวังปรากฏในคำตอบ จากนั้นเรียกใช้คอลเลกชันแยกตามโมเดล

ประวัติการเรียกใช้จะช่วยสร้างตารางประเมินผลที่ทำซ้ำได้โดยไม่ต้องเพิ่มโครงสร้างพื้นฐาน ดาวน์โหลด Apidog เพื่อเริ่มต้น และดู คำแนะนำการใช้งาน Claude API สำหรับรูปแบบคำขอ

การทดสอบโมเดลใน Apidog

Benchmark เหล่านี้เชื่อมโยงกับการตัดสินใจอย่างไร

  • Agent ระยะยาว การวิจัย และระบบอัตโนมัติ: ความแตกต่างมีขนาดใหญ่และสอดคล้องกัน Fable 5.1 เป็นตัวเลือกที่แนะนำ และ รายละเอียดราคา แสดงให้เห็นว่าราคา cache read ที่ลดลงช่วยลดต้นทุนของงานประเภทนี้
  • การเขียนโค้ดใน IDE, Q&A ด้านความรู้ และ reasoning ที่ใช้เครื่องมือ: ส่วนต่างกับ Opus 5 อยู่ที่ประมาณ 1–4 จุด ให้ใช้ Opus 5 ต่อ เว้นแต่จะล้มเหลวในการประเมินของคุณที่ effort สูงกว่า ดูรายละเอียดใน Fable 5.1 เทียบกับ Opus 5
  • ผู้ใช้ที่ย้ายจาก Fable 5: ทุก benchmark ดีขึ้น ราคาไม่เปลี่ยน และอัตรา false positive ลดลง การเปรียบเทียบ Fable 5.1 กับ Fable 5 ครอบคลุมต้นทุนการย้ายเพิ่มเติม

คำถามที่พบบ่อย

ผล benchmark ที่ดีที่สุดของ Claude Fable 5.1 คืออะไร?

Terminal-Bench-Science 0.1 ที่ 52.6% มากกว่าสองเท่าของ Fable 5 ที่ 24.7% และนำหน้า Opus 5 ที่ 29.0% กับ GPT-5.6 Sol ที่ 22.4% ตัวเลขทั้งหมดมาจาก Anthropic

Fable 5.1 เทียบกับ Opus 5 ในการเขียนโค้ดเป็นอย่างไร?

Fable 5.1 ทำได้ 55.8% เทียบกับ 52.3% บน Terminal-Bench 4.0 และ 73.4% เทียบกับ 70.0% บน CursorBench 3.2.0 ตามตัวเลขของ Anthropic Fable 5.1 นำอยู่จริง แต่ส่วนต่างประมาณ 3 จุด

Fable 5.1 ดีกว่า GPT-5.6 Sol หรือไม่?

ใน 4 benchmark ที่ Anthropic เผยแพร่ผลของทั้งสองโมเดล คำตอบคือใช่ โดยนำอยู่ 6–30 จุด อย่างไรก็ตาม Anthropic เป็นผู้ทดสอบ GPT-5.6 Sol เอง และไม่มีข้อมูลของ GPT-5.6 Sol ใน 5 จาก 9 แถว

ผล benchmark ของ Fable 5.1 ได้รับการตรวจสอบโดยอิสระหรือไม่?

ยังไม่ได้รับการตรวจสอบโดยอิสระ ณ วันที่เปิดตัว ตัวเลขทั้งหมดจัดทำโดย Anthropic จึงควรทดสอบกับภาระงานจริงของคุณ

Mythos 5.1 ทำคะแนนได้เท่าไหร่?

Anthropic เผยแพร่ตัวเลขเดียวคือ 60.9% บน Terminal-Bench 4.0 สูงกว่า Fable 5.1 ที่ 55.8% อยู่ 5 จุด ทั้งสองเป็นโมเดลเดียวกันแต่มีระดับการป้องกันแตกต่างกัน

ระดับ effort ใดทำให้เกิดคะแนนเหล่านี้?

Anthropic ไม่ได้ระบุระดับ effort ของแต่ละคะแนน เอกสารระบุว่า Fable 5.1 ได้ประโยชน์มากที่สุดที่ xhigh และ max ดังนั้นควรตั้งสมมติฐานว่าการทดสอบใช้ effort สูง และคาดว่าค่าที่ต่ำกว่าจะได้คะแนนลดลง

Top comments (0)