DEV Community

Cover image for Claude Fable 5.1 ベンチマーク: 数字が語る真実
Akira
Akira

Posted on Originally published at apidog.com

Claude Fable 5.1 ベンチマーク: 数字が語る真実

Claude Fable 5.1のベンチマークを読み解く:本当に移行すべきか

Anthropicは2026年9月1日、Claude Fable 5.1を発表しました。9つのテストでFable 5、Opus 5、GPT-5.6 Solと比較したベンチマーク表も公開されています。最も注目されたTerminal-Bench-Scienceでは、Fable 5.1が52.6%を記録し、Fable 5の24.7%を大きく上回りました。一方、CursorBenchでは、価格が2倍のOpus 5に対する差はわずか3.4ポイントでした。

今すぐApidogを試す

この記事では、公開された数値を出典とともに整理し、各ベンチマークが測定する内容、大きな差と小さな差、発表時の報道で見過ごされたポイントを解説します。

重要なのは、次の3点です。

  • 公開された数値はすべてベンダーによる実行結果である
  • 両方の数値が公開された唯一のエージェント型コーディングテストでは、Mythos 5.1がFable 5.1を上回っている
  • 発表表を鵜呑みにせず、自社ワークロードで評価する必要がある

主な情報源はAnthropicの発表記事です。モデルの概要はClaude Fable 5.1とは何かで確認できます。

全ベンチマーク表

ベンチマーク 測定内容 Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 ターミナルでのエージェントによる科学研究 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 ターミナルでのエージェントによるコーディング 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 経済的価値のある知識労働(Elo) 1853 1723 1824 1711
OSWorld 2.0(部分点) 実際のデスクトップタスクでのコンピューター使用 77.9% 72.9% 75.4% 未報告
OSWorld 2.0(厳密) タスクを完全に完了した場合のみ加点 41.7% 36.1% 39.6% 未報告
人類最後の試験(ツールなし) 専門家レベルの推論問題 60.9% 57.8% 56.6% 未報告
人類最後の試験(ツールあり) 検索とコード実行を使った推論 65.0% 63.8% 63.6% 未報告
AutomationBench エンドツーエンドのビジネスワークフロー 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 IDEスタイルのコーディングタスク 73.4% 70.5% 70.0% 67.2%

AnthropicはMythos 5.1についても、Terminal-Bench 4.0で60.9%という数値を公開しています。

VentureBeatによると、最も難しいブラウザエージェントタスクでは、Fable 5.1が82%、Opus 5が74%、Fable 5が57%でした。ただし、この数値はAnthropicの発表記事ではなく報道に基づくため、他の数値より慎重に扱うべきです。

大きなギャップ

Terminal-Bench-Science 0.1:52.6%対24.7%、29.0%

Terminal-Bench-Scienceの比較

Terminal-Bench-Scienceは、科学ツールを備えたターミナル上でモデルを動かし、多段階の研究タスクを完了させるベンチマークです。

Fable 5.1はFable 5の2倍以上、Opus 5のほぼ2倍のスコアを記録しました。Anthropicが重視する「長期的な問題解決」が、測定可能な成果として表れた最も明確な例です。

ただし、バージョン0.1の新しいベンチマークなので、タスクセットや評価方法が成熟するにつれてスコアが変動する可能性があります。

AutomationBench:31.4%対17.1%、26.9%

AutomationBenchは、複数のアプリケーションをまたぐエンドツーエンドのビジネスワークフローを測定します。

絶対スコアはどのモデルも低いものの、Fable 5.1はFable 5のほぼ2倍で、Opus 5も4.5ポイント上回りました。複数のSaaSや社内システムを横断して業務を自動化する場合、この差は重要です。

Terminal-Bench 4.0:55.8%対42.0%

Terminal-Benchの比較

エージェント型コーディングでは、Fable 5.1がFable 5を13.8ポイント上回り、Opus 5にも3.5ポイント差をつけています。

Opus 5は7月時点ですでにFable 5を上回っていたため、Fableティアがエージェント型コーディングでOpusティアに対する優位性を取り戻した形です。ただし、6月と比べると差は縮小しています。7月の数値はOpus 5のベンチマーク詳細で確認できます。

GDPval-AA v2:1853対1723

知識労働タスクでは、Fable 5.1がFable 5を130 Eloポイント上回りました。ドキュメント、スプレッドシート、スライド作成に関するAnthropicの主張を支える数値です。

ただし、Opus 5との差は29 Eloポイントにとどまります。これは小さな差です。

小さなギャップ

CursorBench 3.2.0:73.4%対70.5%、70.0%

CursorBenchはIDEスタイルのコーディングタスクを測定します。

Fable 5.1の差はFable 5に対して2.9ポイント、Opus 5に対して3.4ポイントです。多くの開発者にとって最も実用的なベンチマークであり、Fable 5.1のリードが最も薄い項目でもあります。

ワークロードが「エディター内のコーディング支援」中心なら、この表だけでは2倍の価格を正当化できません。

OSWorld 2.0:77.9% / 41.7%対75.4% / 39.6%

OSWorldの比較

OSWorldは、実際のデスクトップ環境でコンピューターを操作する能力を測定します。

Fable 5.1は、部分点と厳密なスコアの両方でOpus 5を約2ポイント、Fable 5を約5ポイント上回りました。実用的な差ではありますが、劇的な差ではありません。

特に厳密なスコアに注目してください。タスクを完全に完了できた割合は、どのモデルでも半分未満です。コンピューター使用は、依然としてフロンティアモデルの弱点です。

人類最後の試験:60.9% / 65.0%対56.6% / 63.6%

人類最後の試験の比較

ツールなしでは、Fable 5.1がOpus 5を4.3ポイント上回りました。小さなギャップの中では最大の差です。

一方、検索とコード実行を許可すると差は1.4ポイントに縮まります。

  • ツールなし:純粋な推論能力に近い
  • ツールあり:実際の利用環境に近い

どちらを重視するかは、モデルをどのように使うかで決まります。

Fable 5.1対GPT-5.6 Sol

AnthropicがGPT-5.6 Solとの比較を公開したのは、次の5項目です。

  • Terminal-Bench-Science:30.2ポイント差
  • Terminal-Bench 4.0:18.5ポイント差
  • AutomationBench:11.8ポイント差
  • CursorBench:6.2ポイント差
  • GDPval-AA:1853対1711

Fable 5.1は、公開されたすべての項目でリードしています。

ただし注意点があります。比較モデルの評価もAnthropicが実行しており、全9項目のうち5項目ではGPT-5.6 Solの数値が公開されていません。したがって、単一ベンダーによる不完全な比較として読む必要があります。

以前の比較はGPT-5.6 Sol対Fable 5で解説されています。今回の数値では、Fable 5.1がFable 5のリードをさらに広げています。

発表時の報道が見過ごした点

すべての数値はベンダーによる実行結果

競合モデルのスコアを含め、公開された数値はすべてAnthropicが実行したものです。発表時点で、独立した研究室による再現結果はありません。

Anthropicのベンチマーク履歴は概ね信頼できます。しかし、CursorBenchやOSWorldの差は小さいため、評価ハーネスやスコアリング方法が変われば結果が逆転する可能性があります。

Mythos 5.1が実質的な上限

Anthropicのシステムカードと発表記事によれば、Fable 5.1とMythos 5.1は「セーフガードのレベルが異なるだけで同じモデル」です。

Terminal-Bench 4.0では、次の差が報告されています。

  • Fable 5.1:55.8%
  • Mythos 5.1:60.9%

5ポイントの差は、エージェント型コーディングにおけるセーフガードのコストを示しています。広くリリースされたFable 5.1の上には、さらに高性能な兄弟モデルが存在します。Mythos 5.1対Fable 5.1の比較では、アクセス条件を解説しています。

Effortレベルが明記されていない

Anthropicのeffortに関するドキュメントでは、Fable 5.1の性能向上はxhighmaxで最大になると説明されています。

しかし、発表記事では各スコアがどのeffortレベルで得られたのか、比較モデルにどの設定を使ったのかが明記されていません。effortは品質とコストを大きく左右するため、再現評価ではこの情報の欠落が重要です。

多言語性能は横ばい

Anthropicは、多言語性能はFable 5と同等で、改善していないと説明しています。非英語のワークロードでは、公開表だけを見ると性能向上を過大評価する可能性があります。

セーフガードの数値は別カテゴリ

Anthropicは、次の改善も報告しています。

  • 良性の生物学関連リクエストに対する誤検出が85%減少
  • Claude Codeセッションあたりのサイバー関連介入がFable 5比で約60%減少

これらはAnthropic自身のトラフィックで測定された値で、外部環境では再現できません。ただし、Fable 5で頻繁に拒否に遭遇するユーザーにとっては、能力向上より重要な改善になり得ます。

自分でテストする方法

公開表は「どこを調べるべきか」を示します。移行すべきかどうかは、自社の評価で判断してください。

1. 長期タスクを最後まで実行する

自社製品で長期的に動作するエージェントタスクを、次の設定で比較します。

  • Fable 5.1:high
  • Opus 5:xhigh
  • Fable 5:high

これはTerminal-Bench-ScienceとAutomationBenchの実務向けアナログです。タスク完了率と実行コストを比較し、2倍の価格が妥当か判断します。

2. 難しいコーディングタスクを比較する

最も難しいコーディングプロンプトを10個用意し、Fable 5.1とOpus 5を同じeffortレベルで実行します。

結果が同点なら、CursorBenchと同じ状況です。その場合は、価格とレイテンシを基準にOpus 5を選べる可能性があります。

3. Effortをスイープする

ルーティンタスクをFable 5.1だけで実行し、effortをlowからmaxまで変化させます。

Anthropicの主張は次のとおりです。

  • medium:Fable 5と同等の性能
  • low:タスク単価でOpus 5と競合
  • xhigh / max:性能向上が最大

実際のワークロードでこの関係を検証してください。

4. 拒否率を測定する

良性のセキュリティ関連またはライフサイエンス関連プロンプトを用意し、Fable 5とFable 5.1で拒否回数を比較します。

これは、Anthropicが報告した約60%と85%の改善を、短時間で検証する方法です。

上記4つの評価は、Apidogでリクエストとして構築できます。modeleffortを環境変数に設定し、次のアサーションを追加してください。

  • stop_reasonが期待値である
  • 回答に期待する文字列が含まれる
  • モデルごとにコレクションを実行する

実行履歴を使えば、新しいインフラを用意せずに再現可能な評価表を作成できます。環境を準備するにはApidogをダウンロードしてください。APIウォークスルーには、リクエストの具体的な形状が掲載されています。

Apidogでの評価

ベンチマークを意思決定につなげる

  • 長期エージェント、研究、自動化

    差は大きく、一貫しています。Fable 5.1が有力です。料金の内訳を見ると、キャッシュリードが安価なため、対象ワークロードでは実質的なコスト差が縮まる可能性があります。

  • IDEコーディング、知識Q&A、ツール支援推論

    Opus 5との差は1〜4ポイントです。高いeffort設定を含めて評価しない限り、Opus 5を使い続ける判断も合理的です。Fable 5.1対Opus 5の比較も参照してください。

  • Fable 5からの移行

    すべての公開項目で改善し、価格は変わらず、誤検出も減少しています。Fable 5.1対Fable 5の比較で移行コストを確認できます。

よくある質問

Claude Fable 5.1の最高のベンチマーク結果は何ですか?

Terminal-Bench-Science 0.1の52.6%です。Fable 5の24.7%の2倍以上で、Opus 5の29.0%とGPT-5.6 Solの22.4%も上回っています。ただし、すべてAnthropicによる実行結果です。

Fable 5.1とOpus 5のコーディング性能はどの程度違いますか?

Anthropicの数値では、Terminal-Bench 4.0で55.8%対52.3%、CursorBench 3.2.0で73.4%対70.0%です。差は約3ポイントで、実用的ではあるものの小さなリードです。

Fable 5.1はGPT-5.6 Solより優れていますか?

Anthropicが両方の数値を公開した項目では、6〜30ポイント差でFable 5.1が上回っています。ただし、GPT-5.6 Solの評価はAnthropic自身が実行したもので、全9項目のうち5項目にはデータがありません。

Fable 5.1のベンチマークは独立検証されていますか?

発表時点では、独立した検証はありません。公開値はすべてAnthropicが実行したものなので、自社ワークロードで検証すべき主張として扱ってください。

Mythos 5.1のスコアはどうですか?

Anthropicが公開した数値は、Terminal-Bench 4.0の60.9%です。Fable 5.1の55.8%より5ポイント高く、両者はセーフガードが異なるだけで同じモデルと説明されています。

これらのスコアはどのeffortレベルで得られましたか?

Anthropicは明記していません。Fable 5.1の性能向上はxhighmaxで最大になるとされているため、評価を再現する際は高いeffort設定が使われた可能性を考慮し、低い設定ではスコアが下がる前提で検証してください。

Top comments (0)