DEV Community

Cover image for クロード・ハイク 5.5 ベンチマーク
Akira
Akira

Posted on Originally published at apidog.com

クロード・ハイク 5.5 ベンチマーク

Claude Haiku 5.5は、OSWorld 2.1で72.4%、GDPval-AA v2.1で1620、FrontierCode 1.1で46.4%、Terminal-Bench 4.0で39.2%のスコアを記録しました。Haiku 4.5は、これら3つのうち、15.7%、735、0.0%のスコアでした。これらはすべて最大努力の数値であり、デフォルトのmedium努力では、GDPval-AAは1277に低下します。現時点では、独立した研究機関からHaiku 5.5の結果はまだ発表されていません。

今すぐApidogを試す

以下では、Claude Haiku 5.5のベンチマーク、実行者、努力レベルがスコアとコストに与える影響、さらにApidogで実際のトラフィックを使ってモデルを評価する手順を説明します。仕様と価格については、Claude Haiku 5.5とはを確認してください。

公開時のテーブル

Haiku 5.5の各セルは、最大努力で適応的思考を使用しており、通常は5回の試行の平均値です。Terminal-Benchではタスクごとに10回試行されています。n/rは結果が公開されていないことを意味します。

ベンチマーク Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1、オフラインサブセット 72.4% 15.7% 48.9% 83.9%
Humanity’s Last Exam、ツールなし 45.9% 10.2% n/r 56.9%
Humanity’s Last Exam、ツールあり 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1(メイン) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography、ツールなし 46.4% 6.4% 29.1% 61.6%

各ベンチマークの実行者

Anthropicはほとんどのテストを自社で実行しました。ベンダー間の行はベンチマーク名を共有していますが、ハーネスや努力設定まで同じとは限りません。

ベンチマーク 実行者 条件
GDPval-AA v2.1、AA-Briefcase v1.1 Artificial Analysis、独立して GDPval-AA: 220タスク、44職種。EloはDeepSeek V4.1 Flash(最大)の1600に固定。Briefcase: 数週間のプロジェクト
FrontierCode 1.1 Cognition ClaudeはClaude Code、GPTはCodexで実行。メイン = 150タスク中、最も難しい100タスク
Chartography Anthropic、Surge AIのベンチマークで Gemini 3.5 Flashグレーダー。LunaのスコアはSurge AIから
Terminal-Bench 4.0 Anthropic Claude Code --bare、66タスク、各10回試行、セーフガード有効
OSWorld 2.1 Anthropic 108タスク中82タスク、1080p、最大500ステップ
Humanity’s Last Exam Anthropic 98万トークンのタスク予算、Opus 4.6グレーダー

GPT-6 Lunaの2つのセルには文脈が必要です。AnthropicはOpenAIのAPIを介して、LunaのOSWorldスコアを同じ82タスクで実行しました。LunaのTerminal-Bench 16.4%は、公開リーダーボードのCodex CLI・最大努力によるものです。

Terminal-Benchでは、Haiku 5.5の試行の1.8%(660回中12回)がセーフガードによって停止され、それぞれ失敗としてカウントされました。

FrontierCodeの罠

公開時のテーブルでは、Haiku 5.5の最大値である46.4%と、Sonnet 5.5の最高スコアであるxhigh値の52.1%が並んでいます。システムカードには、同条件での数値が示されています。

FrontierCode 1.1 メイン 拡張
Haiku 5.5、最大 46.4% 58.4%
Haiku 5.5、xhigh 45.8% n/r
Sonnet 5.5、最大 46.2% 59.1%
Sonnet 5.5、xhigh 52.1% 64.4%

最大努力では、Haiku 5.5がメインでSonnet 5.5を46.4%対46.2%でわずかに上回ります。一方、各モデルの最高設定を比較すると、Sonnetが5.7ポイントリードします。

FrontierCodeの結果を引用する場合は、必ず努力レベルも併記してください。

システムカードの追加情報

システムカードには、公開投稿で省略された行が追加されています。特に明記されていない限り、すべて最大努力での結果です。

ベンチマーク Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Multilingual 83.7 67.4 90.3
SWE-bench Multimodal 30.7 19.8 54.3
OSWorld 2.1、厳格な合格率 37.1% n/r 48.8%
Chartography、ツールあり 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional(長さを調整済み) 64.8% 32.2% 69.2%

OSWorldの72.4%は部分点であり、完全に合格したタスクは37.1%です。

Chartographyはツールを使用すると46.4%から86.2%まで上昇します。チャートを扱うワークフローでは、Haiku 5.5に必要なツールを提供してください。

デフォルトの努力レベルではスコアが低い

Claude APIおよびClaude Codeでは、Haiku 5.5のデフォルトはmediumです。システムカードには、デフォルト努力レベルでの結果も報告されています。

ベンチマーク Medium(デフォルト) 最大 注記
GDPval-AA v2.1 1277 1620 Mediumでは、最大努力の約10分の1の出力トークンを使用
AA-Briefcase v1.1 1372 1578 Mediumでは、最大努力の4分の1未満の出力トークンを使用
HealthBench Professional 59.9% 64.8% Low 57.9%、high 61.3%

output_config.effortを指定せずにAPIを呼び出すと、左列の結果に近い挙動を期待することになります。努力レベルのドキュメントには、5段階すべての設定が記載されています。

努力レベル別のスコアとコスト

公開チャートの数値を、スコアとコストとして整理します。OSWorldとTerminal-Benchのコストは試行ごと、GDPval-AAのコストはタスクごとです。

モデル Low Medium High Xhigh Max
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

実装時に見るべきポイントは次のとおりです。

  • 最大努力は最後の段階で高価になります。 GDPval-AAでは、最大努力はmediumの約28倍のコストで、Eloは343ポイント高くなります。OSWorldでは、最大努力はxhighの2倍以上のコストで、スコア差は4.8ポイントです。
  • OSWorldではHaiku 5.5のmediumがLunaの最大努力を上回ります。 Haiku 5.5は53.3%($0.13)、Lunaは48.9%($0.21)です。ただし、他の同レベル設定ではLunaの方が安価です。詳細はHaiku 5.5 vs GPT-6 Lunaを参照してください。
  • OSWorldではHaiku 5.5の最大努力がSonnet 5.5のmediumを上回ります。 Haiku 5.5は72.4%($0.61)、Sonnet 5.5は66.0%($0.93)です。
  • Terminal-Benchは例外です。 Sonnet 5.5のhighは43.0%($1.46)で、Haiku 5.5の最大努力である39.2%($2.64)を、より低いコストで上回ります。Sonnetのコストには新しい$0.10のキャッシュ読み取り価格が適用されています。

コストは定価に基づいています。10万トークンまでのプロンプトでは100万トークンあたり$0.10/$0.50で、それを超えると高くなります。詳細は価格の内訳を確認してください。

Haiku 5.5がまだ劣る点

Sonnet 5.5は公開テーブルのすべての行でリードしています。Haikuが直接対決で勝利したのは、同じ最大努力でのFrontierCodeだけです。

差が大きいベンチマークは次のとおりです。

  • Terminal-Bench 4.0: 39.2% 対 70.6%
  • SWE-Bench Pro: 64.8 対 81.3
  • SWE-bench Multimodal: 30.7 対 54.3

Anthropicも、Sonnet 5.5とOpus 5.5は「複雑なエージェント型コーディングタスクには依然として優れた選択肢」であると述べています。

Haiku 5.5は、要約、分類、ブラウザ操作、または大きなモデル配下のサブエージェントなど、範囲を限定した作業に適しています。安価なサブエージェントとしてHaiku 5.5を実行する方法は、Claude CodeにおけるHaiku 5.5を参照してください。

独立した結果:まだなし

2026年10月8日現在、独立した研究機関からHaiku 5.5の結果は発表されていません。

Artificial AnalysisのHaiku 5.5ページは404エラーを返し、そのリーダーボードにはClaude 4.5 Haikuのみが掲載されています。Vals、LMArena、SWE-bench、Aiderでも結果は示されていません。

第三者機関による速度の数値はありません。AnthropicはHaiku 5.5を標準速度では「現時点で最速のモデル」と呼んでいますが、Fast ModeのOpusよりは遅いとしています。

最も近い外部数値はCursorから来ています。モデルドキュメントによると、Haiku 5.5はCursorBenchで最大努力時に48.4%のスコアを記録しており、lowの30.9%から上昇しています。

思考オフの場合、Cursorは22.1%から26.2%を報告しています。同じ努力レベルで思考オンの場合は30.9%から42.3%です。

顧客の報告

以下はAnthropicの公開投稿によるものであり、独立して検証されたものではありません。

  • HubSpot: シミュレーションされたCRMポータルスイートでの3回の実行の平均で92.8%を記録。これは同スイートでこれまでに見られた最高スコアです。
  • AlphaSense: 400のドキュメント内質問クエリで、Haiku 4.5の0.76に対して0.84を記録。統計的に有意であるとしています。
  • Box: 初期テストで、Haiku 4.5よりも約半分のレイテンシで11ポイント高いスコアを記録。
  • Asana: タスク完了レイテンシが、現在のモデルと比較して30%以上低下。
  • Cognition: Devin FusionはHaiku 5.5をサイドキック、Opus 5.5をリードとして使用し、FrontierCodeで66.2のスコアを保持。これはHaiku単独ではなく、2モデルのシステムです。

独自の評価を実行する

ベンチマークのスコアを、そのまま本番ワークロードの意思決定に使うべきではありません。

Anthropicのプロンプトガイドでは、自社の評価で改善が確認できる場合にのみxhighまたはmaxを使用し、比較対象としてSonnet 5.5でも同じ評価を実行することを推奨しています。

Apidogで評価コレクションを作成する手順は次のとおりです。

  1. ANTHROPIC_API_KEYを環境変数として保存します。
  2. 実際の入力から20〜50個を選び、Messages APIリクエストとして保存します。
  3. 各リクエストにアサーションを追加します。
    • ステータスコードが200
    • stop_reasonが"max_tokens"または"refusal"ではない
    • 正答に必要な文字列、構造、またはフィールドが含まれる
  4. low、medium、highでコレクションを実行します。努力レベルを変えると、プロンプトキャッシュは無効になります。
  5. 合格率とusage内のトークン数を記録します。新しいトークナイザーは、同じテキストに対してHaiku 4.5よりも約30%多くのトークンを生成します。
  6. コレクションを複製してモデルをclaude-sonnet-5-5に変更し、同じプロジェクト内で比較します。
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{
      "role": "user",
      "content": "Classify this support ticket as billing, bug or feature request: ..."
    }]
  }'
Enter fullscreen mode Exit fullscreen mode

Haiku 5.5では、temperature、top_p、top_k、またはアシスタントの事前入力を送信しないでください。これらは400エラーを返します。

また、thinkingブロックが最初に返る場合があるため、レスポンスコンテンツは配列の位置ではなくtypeで選択してください。

実装例とテスト方法は、APIガイドおよびLLMアプリケーションのテストを参照してください。

よくある質問

Claude Haiku 5.5はSonnet 5.5よりも優れていますか?

Anthropicの数値では、全体としてはそうではありません。Sonnet 5.5は公開テーブルのすべての行でリードしています。

Haikuがわずかに上回るのは、両方が最大努力で実行された場合のFrontierCodeのみです。Haiku 5.5は46.4%、Sonnet 5.5は46.2%です。

アップグレードの視点については、Haiku 5.5 vs Haiku 4.5を参照してください。

Haiku 5.5のSWE-benchスコアはどのくらいですか?

すべて最大努力で、以下の結果です。

  • SWE-Bench Pro: 64.8
  • SWE-bench Multilingual: 83.7
  • SWE-bench Multimodal: 30.7

ベンチマークはどの努力レベルで実行されましたか?

最大努力で、通常は5回の試行の平均です。

APIのデフォルトはmediumであり、GDPval-AAでは1620ではなく1277を記録します。

独立したHaiku 5.5のベンチマークはありますか?

まだありません。

Artificial AnalysisはGDPval-AAとAA-Briefcaseを独立して実行しましたが、これらのスコアはAnthropicが公開したものです。AAにはHaiku 5.5のページはありません。

GPT-6 Lunaの方が安価ですか?

通常はそうです。

LunaはGDPval-AAのすべての努力レベルと、mediumを除くOSWorldのすべてのレベルで低コストです。OSWorldのmediumでは両者のコストはほぼ同じです。Haiku 5.5は両方のベンチマークでより高いスコアを記録しています。

次のステップ

まずはmediumで始めてください。評価コレクションで合格率の改善を確認し、その改善が追加コストに見合う場合にのみhigh、xhigh、maxへ進みます。

Apidogをダウンロードし、実際のプロンプトで評価コレクションを作成してください。本番トラフィックを切り替える前に、Sonnet 5.5のベースラインとともに結果をApidogに保存して比較します。

Top comments (0)