DEV Community

Cover image for Claude Fable 5.1 Benchmarks: Mengungkap Fakta di Balik Angka
Walse
Walse

Posted on Originally published at apidog.com

Claude Fable 5.1 Benchmarks: Mengungkap Fakta di Balik Angka

Claude Fable 5.1: Analisis Benchmark, Selisih Skor, dan Cara Mengujinya

Anthropic meluncurkan Claude Fable 5.1 pada 1 September 2026. Dalam tabel perbandingan dengan Fable 5, Opus 5, dan GPT-5.6 Sol pada sembilan pengujian, hasil paling menonjol adalah Terminal-Bench-Science: Fable 5.1 mencetak 52,6%, dibandingkan 24,7% untuk Fable 5. Namun, pada CursorBench, selisihnya terhadap Opus 5 hanya 3,4 poin—sementara biaya modelnya dua kali lipat.

Coba Apidog hari ini

Panduan ini merangkum seluruh angka yang diterbitkan, menjelaskan apa yang diukur setiap benchmark, dan memisahkan peningkatan besar dari peningkatan marginal. Ada dua hal penting yang sering terlewat: semua angka berasal dari pengujian vendor, dan Mythos 5.1 mengungguli Fable 5.1 pada satu benchmark pengodean agentic yang diterbitkan untuk keduanya. Respons terbaik terhadap tabel peluncuran adalah menjalankan evaluasi Anda sendiri.

Sumber utama adalah postingan peluncuran Anthropic. Untuk konteks model, baca apa itu Claude Fable 5.1.

Tabel lengkap

Benchmark Apa yang diukur Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 Penelitian ilmiah agentic di terminal 52,6% 24,7% 29,0% 22,4%
Terminal-Bench 4.0 Pengodean agentic di terminal 55,8% 42,0% 52,3% 37,3%
GDPval-AA v2 Pekerjaan pengetahuan bernilai ekonomi (Elo) 1853 1723 1824 1711
OSWorld 2.0 (partial credit) Penggunaan komputer untuk tugas desktop nyata 77,9% 72,9% 75,4% Tidak dilaporkan
OSWorld 2.0 (strict) Penyelesaian penuh tugas desktop 41,7% 36,1% 39,6% Tidak dilaporkan
Humanity’s Last Exam (no tools) Pertanyaan penalaran tingkat ahli 60,9% 57,8% 56,6% Tidak dilaporkan
Humanity’s Last Exam (with tools) Penalaran dengan pencarian dan kode 65,0% 63,8% 63,6% Tidak dilaporkan
AutomationBench Alur kerja bisnis end-to-end 31,4% 17,1% 26,9% 19,6%
CursorBench 3.2.0 Tugas pengodean gaya IDE 73,4% 70,5% 70,0% 67,2%

Anthropic juga menerbitkan satu angka untuk Mythos 5.1: 60,9% pada Terminal-Bench 4.0. VentureBeat melaporkan hasil Browserbase sebesar 82% untuk Fable 5.1, 74% untuk Opus 5, dan 57% untuk Fable 5 pada tugas agen peramban paling sulit. Karena angka Browserbase berasal dari liputan pers, bukan postingan peluncuran, perlakukan hasil tersebut dengan tingkat kehati-hatian yang sesuai.

Selisih besar

Terminal-Bench-Science 0.1

52,6% vs 24,7% untuk Fable 5 dan 29,0% untuk Opus 5.

Fable 5.1 lebih dari dua kali lipat skor pendahulunya dan hampir dua kali lipat skor Opus 5. Benchmark versi 0.1 ini menempatkan model di terminal dengan alat ilmiah, lalu memintanya melakukan penelitian multi-langkah.

Hasil ini menjadi bukti paling jelas bahwa fokus Anthropic pada “pemecahan masalah jangka panjang” menghasilkan peningkatan terukur. Namun, karena kumpulan tugasnya masih baru, skornya dapat berubah seiring waktu.

Perbandingan Terminal-Bench-Science

AutomationBench

31,4% vs 17,1% untuk Fable 5 dan 26,9% untuk Opus 5.

AutomationBench mengukur alur kerja bisnis end-to-end lintas aplikasi. Skor absolutnya masih rendah untuk semua model, tetapi Fable 5.1 hampir menggandakan skor Fable 5 dan unggul 4,5 poin dari Opus 5.

Jika produk Anda mengotomatisasi tugas bisnis multi-aplikasi, ini adalah salah satu baris yang paling relevan.

Terminal-Bench 4.0

55,8% vs 42,0% untuk Fable 5 dan 52,3% untuk Opus 5.

Fable 5.1 meningkat 13,8 poin dibandingkan Fable 5 pada pengodean agentic, angka yang ditekankan Anthropic dalam bagian pengodeannya. Keunggulannya atas Opus 5 adalah 3,5 poin.

Opus 5 sempat mengungguli Fable 5 pada benchmark ini di bulan Juli. Artinya, keunggulan Fable atas tingkatan Opus kembali, tetapi lebih kecil daripada di bulan Juni. Lihat rincian benchmark Opus 5 untuk angka bulan Juli.

Perbandingan Terminal-Bench

GDPval-AA v2

1853 vs 1723 untuk Fable 5 dan 1824 untuk Opus 5.

Fable 5.1 memperoleh peningkatan 130 Elo dibandingkan Fable 5 pada tugas pekerjaan pengetahuan. Anthropic menggunakan benchmark ini untuk mendukung klaim tentang pembuatan dokumen, spreadsheet, dan slide.

Terhadap Opus 5, selisihnya hanya 29 Elo—peningkatan yang relatif kecil.

Selisih kecil

CursorBench 3.2.0

73,4% vs 70,5% untuk Fable 5 dan 70,0% untuk Opus 5.

CursorBench mengukur tugas pengodean bergaya IDE. Fable 5.1 hanya unggul sekitar tiga poin dari model lain.

Benchmark ini penting bagi sebagian besar pengembang. Jika beban kerja Anda adalah “bantu saya di editor”, tabel peluncuran saja belum cukup untuk membenarkan harga dua kali lipat.

Perbandingan CursorBench

OSWorld 2.0

77,9% / 41,7% untuk Fable 5.1 vs 75,4% / 39,6% untuk Opus 5.

OSWorld mengukur penggunaan komputer. Fable 5.1 unggul dua poin dari Opus 5 pada penilaian partial-credit maupun strict, serta unggul lima poin dari Fable 5.

Peningkatannya nyata, tetapi tidak dramatis. Perhatikan skor strict: kurang dari setengah tugas diselesaikan sepenuhnya oleh model mana pun. Penggunaan komputer masih menjadi area terlemah di jajaran model frontier.

Humanity’s Last Exam

60,9% / 65,0% untuk Fable 5.1 vs 56,6% / 63,6% untuk Opus 5.

Tanpa alat, Fable 5.1 unggul 4,3 poin dari Opus 5—selisih terbesar dalam kategori peningkatan kecil. Dengan alat, selisihnya menyusut menjadi 1,4 poin karena pencarian dan eksekusi kode memperkecil perbedaan.

  • Tanpa alat: lebih dekat dengan ukuran penalaran mentah.
  • Dengan alat: lebih mencerminkan cara model digunakan dalam praktik.

Perbandingan Humanity’s Last Exam

Fable 5.1 vs GPT-5.6 Sol

Anthropic menerbitkan empat benchmark dengan kolom GPT-5.6 Sol, dan Fable 5.1 memimpin semuanya:

  • Terminal-Bench-Science: 30,2 poin
  • Terminal-Bench 4.0: 18,5 poin
  • AutomationBench: 11,8 poin
  • CursorBench: 6,2 poin
  • GDPval-AA: 1853 vs 1711

Ada dua peringatan penting:

  1. Anthropic menjalankan pengujian terhadap model pesaingnya sendiri.
  2. Lima dari sembilan baris tidak memiliki skor GPT-5.6 Sol, tanpa penjelasan dari Anthropic.

Perbandingan GPT-5.6 Sol vs Fable 5 membahas perbandingan sebelumnya. Berdasarkan angka terbaru, Fable 5.1 memperlebar semua keunggulan yang dimiliki Fable 5.

Hal yang terlewat dari liputan peluncuran

Semua angka dijalankan oleh vendor

Anthropic menjalankan seluruh pengujian, termasuk kolom model pesaing. Tidak ada laboratorium independen yang mereproduksi hasil tersebut saat peluncuran.

Riwayat benchmark Anthropic biasanya cukup konsisten, tetapi selisih kecil pada CursorBench dan OSWorld dapat berubah akibat perbedaan harness atau metode penilaian.

Mythos 5.1 adalah batas sebenarnya

Kartu sistem Anthropic dan postingan peluncuran menyatakan bahwa Fable 5.1 dan Mythos 5.1 adalah “model yang sama tetapi dengan tingkat perlindungan yang berbeda”.

Anthropic menerbitkan skor Mythos 5.1 sebesar 60,9% pada Terminal-Bench 4.0, dibandingkan 55,8% untuk Fable 5.1. Selisih lima poin tersebut menunjukkan biaya perlindungan pada pengodean agentic. Model yang paling mampu dan dirilis secara luas oleh Anthropic memiliki saudara yang performanya lebih tinggi.

Perbandingan Mythos 5.1 vs Fable 5.1 membahas siapa yang dapat mengaksesnya.

Tingkat effort tidak disebutkan

Menurut dokumentasi effort Anthropic, keunggulan Fable 5.1 paling besar pada tingkat xhigh dan max.

Namun, postingan peluncuran tidak menyebutkan:

  • Tingkat effort yang digunakan untuk setiap skor.
  • Tingkat effort model pembanding.
  • Apakah semua model diuji dengan konfigurasi yang setara.

Karena effort merupakan pengungkit kualitas utama, informasi ini penting jika Anda ingin mereproduksi hasil.

Performa multibahasa tidak meningkat

Anthropic menyatakan performa multibahasa Fable 5.1 setara dengan Fable 5. Jika beban kerja Anda tidak menggunakan bahasa Inggris, tabel peluncuran mungkin melebih-lebihkan keuntungan praktisnya.

Angka perlindungan memakai benchmark berbeda

Dibandingkan Fable 5, Anthropic melaporkan:

  • 85% lebih sedikit false positive biologi pada permintaan jinak.
  • Sekitar 60% lebih sedikit intervensi siber per sesi Claude Code.

Angka ini diukur dari lalu lintas internal Anthropic sehingga tidak dapat direproduksi secara eksternal. Namun, bagi pengguna Fable 5 yang sering mengalami penolakan, metrik ini mungkin lebih penting daripada benchmark kemampuan.

Apa yang perlu Anda uji sendiri

Tabel peluncuran menunjukkan area yang perlu diperiksa. Evaluasi internal menentukan apakah Anda perlu bermigrasi.

1. Uji agen jangka panjang

Jalankan tugas dari produk Anda sendiri sampai selesai dengan konfigurasi berikut:

  • Fable 5.1 pada high
  • Opus 5 pada xhigh
  • Fable 5 pada high

Ini merupakan analog Terminal-Bench-Science dan AutomationBench. Di sinilah Anda dapat mengukur apakah biaya dua kali lipat menghasilkan nilai bisnis.

2. Uji pengodean

Gunakan sepuluh prompt pengodean tersulit Anda dengan tingkat effort yang sama pada Fable 5.1 dan Opus 5.

Jika hasilnya seri, Anda telah mereproduksi cerita CursorBench—dan Opus 5 mungkin menjadi pilihan yang lebih ekonomis.

3. Lakukan sweep effort

Uji Fable 5.1 pada tingkat low hingga max untuk tugas rutin.

Klaim Anthropic adalah:

  • medium setara dengan Fable 5.
  • low dapat bersaing dengan Opus 5 berdasarkan biaya per tugas.

Validasi klaim tersebut pada beban kerja Anda sendiri.

4. Ukur tingkat penolakan

Hitung penolakan pada prompt keamanan atau ilmu hayat yang jinak, lalu bandingkan Fable 5 dengan Fable 5.1.

Dengan cara ini, klaim penurunan false positive sebesar 85% dan penurunan intervensi sekitar 60% dapat diverifikasi dalam satu hari.

Buat keempat pengujian sebagai request di Apidog, dengan model dan effort sebagai variabel lingkungan. Tambahkan assertion untuk stop_reason dan keberadaan string yang diharapkan dalam jawaban, lalu jalankan collection untuk setiap model.

Riwayat eksekusi akan menghasilkan tabel evaluasi yang dapat direproduksi tanpa infrastruktur baru. Unduh Apidog untuk memulai, lalu gunakan panduan API Claude Fable 5.1 sebagai referensi format request.

Evaluasi model di Apidog

Cara memetakan benchmark ke keputusan

  • Agen jangka panjang, penelitian, dan otomasi: selisihnya besar dan konsisten. Fable 5.1 adalah kandidat utama. Rincian harga menunjukkan bahwa cache read yang lebih murah dapat mempersempit selisih biaya.
  • Pengodean IDE, tanya jawab pengetahuan, dan penalaran berbasis alat: selisih dengan Opus 5 hanya satu hingga empat poin. Gunakan aturan Anthropic: tetap gunakan Opus 5 kecuali Fable 5.1 terbukti lebih baik pada evaluasi Anda dengan effort lebih tinggi. Baca perbandingan Fable 5.1 vs Opus 5.
  • Migrasi dari Fable 5: semua baris benchmark meningkat, harga tidak meningkat, dan false positive menurun. Perbandingan Fable 5.1 vs Fable 5 membahas biaya migrasi.

FAQ

Apa hasil benchmark terbaik Claude Fable 5.1?

Terminal-Bench-Science 0.1 dengan skor 52,6%—lebih dari dua kali lipat Fable 5 pada 24,7%, serta lebih tinggi dari Opus 5 pada 29,0% dan GPT-5.6 Sol pada 22,4%. Semua angka tersebut berasal dari Anthropic.

Bagaimana Fable 5.1 dibandingkan dengan Opus 5 dalam pengodean?

Pada Terminal-Bench 4.0, Fable 5.1 mencetak 55,8% vs 52,3%. Pada CursorBench 3.2.0, skornya 73,4% vs 70,0%. Keunggulannya nyata, tetapi sempit—sekitar tiga poin.

Apakah Fable 5.1 lebih baik daripada GPT-5.6 Sol?

Pada empat benchmark yang diterbitkan untuk keduanya, ya, dengan keunggulan antara 6 hingga 30 poin. Namun, Anthropic menjalankan sendiri pengujian GPT-5.6 Sol, dan lima dari sembilan baris tidak memiliki skor GPT-5.6 Sol.

Apakah benchmark Fable 5.1 diverifikasi secara independen?

Belum saat peluncuran. Semua angka dijalankan oleh Anthropic, jadi perlakukan hasilnya sebagai klaim yang perlu diuji pada beban kerja Anda sendiri.

Berapa skor Mythos 5.1?

Anthropic menerbitkan satu angka: 60,9% pada Terminal-Bench 4.0, lima poin di atas Fable 5.1 yang mencetak 55,8%. Keduanya menggunakan model yang sama dengan tingkat perlindungan berbeda.

Tingkat effort apa yang menghasilkan skor tersebut?

Anthropic tidak menyebutkannya. Pedoman mereka menyatakan bahwa keuntungan Fable 5.1 paling besar pada xhigh dan max. Gunakan effort tinggi sebagai asumsi awal, lalu perkirakan skor lebih rendah pada konfigurasi effort yang lebih rendah.

Top comments (0)