DEV Community

Cover image for ジェミニ 4 アルゴン vs GPT-6 アストラ vs クロード オプス 5.5 比較
Akira
Akira

Posted on Originally published at apidog.com

ジェミニ 4 アルゴン vs GPT-6 アストラ vs クロード オプス 5.5 比較

Gemini 4 Argonは、GoogleのベンチマークテーブルでGPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1を相手に19項目中13項目で首位とされています。ただし、導入判断でより重要なのは入手性です。AstraとOpus 5.5は今日購入できますが、Argonは購入できません。Googleの新しいフロンティアモデルは現在Fairwindプログラム参加者のみが利用でき、導入期間中は入力/出力100万トークンあたり$2/$10、その後は$4/$20です。これはOpus 5.5の標準価格と同額です。

今すぐApidogを試す

この記事では、4モデルの価格・制限・ベンチマークを比較し、数値をそのまま比較できない理由を整理します。最後に、実際のワークロードへルーティングするための判断基準と、Apidogで同一プロンプトを使ってモデルを評価する手順を紹介します。Argonの概要はGemini 4 Argonとは何か、提供時期はArgonリリース日ガイドを参照してください。

価格と制限の比較

Googleの比較にはClaude Fable 5.1も含まれるため、ここでも4モデルを並べます。価格は100万トークンあたりです。出典はGoogleのローンチ投稿、OpenAIのGPT-6 Astraモデルページ、Anthropicの価格ページです。

項目 Gemini 4 Argon GPT-6 Astra Claude Opus 5.5 Claude Fable 5.1
今日利用可能か? Fairwindのみ はい はい はい
APIモデルID 未公開 gpt-6-astra claude-opus-5-5 claude-fable-5-1
入力 導入時$2、その後$4 $10 $4 $10
キャッシュ済み入力 導入時$0.10、その後$0.20 $1 $0.20 $0.25
出力 導入時$10、その後$20 $50 $20 $50
最大出力 1M(Google公称) 128K 128K(Batchでは300K、ベータ) 128K
コンテキストウィンドウ 未公開 1,050,000(最大入力922K) 1M 1M
長文プロンプトの追加料金 記載なし 入力272K超:入力・キャッシュ2倍、出力1.5倍 なし なし

実装時に押さえるべきポイントは3つです。

  1. Argonの標準価格はOpus 5.5と同じ

    Argonの価格優位性は導入期間中だけです。ただしGoogleは導入期間の終了日を公開していません。

  2. AstraとFable 5.1は高単価

    Argonの標準価格と比べると、入力・出力ともに2.5倍です。Argon導入価格との比較では5倍になります。

  3. 最大出力は実測で確認する

    GoogleはArgonを1M出力と公称しています。一方でVals AIは、テストしたArgon構成の最大出力を262Kと記載しています。アプリケーション側では、公称値ではなく実際のAPIレスポンスとトークン使用量で制限を検証してください。

リクエスト単位の費用計算は、Gemini 4 Argonの価格設定も参照してください。

Googleのテーブルで各モデルがリードするベンチマーク

数値を見る前に、比較条件を確認してください。これはGoogleのテーブルです。ArgonのスコアはGoogleが報告したもので、一部は自己計算、一部は公開リーダーボード由来です。競合モデルのスコアは主に各ベンダーの自己申告値、または最大推論設定時の公開リーダーボード結果です。

つまり、小さな差をモデルの絶対的な優劣として扱わないことが重要です。

優位モデル ベンチマーク Argon Astra Fable 5.1 Opus 5.5
Argon:知識労働 Vals Index 68.9% 63.1% 65.8% 67.0%
Argon:知識労働 AutomationBench 51.3% 41.4% 31.4% 42.5%
Argon:知識労働 Harvey’s Legal Agent Benchmark 19.6% 5.4% 6.7% 3.8%
Argon:コーディング DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
Argon:長いコンテキスト GraphWalks 256K to 1M(F1) 84.2% 71.8% 65.0% 66.8%
Argon:マルチモーダル LVBench 91.7% 87.5% 79.7% 83.7%
Argon:マルチモーダル Chartography 71.6% 71.0% 46.2% 66.3%
Astra FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
Astra Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3%
Astra OSWorld-2.0(オフライン、部分) 69.2% 72.6% 未報告 未報告
Opus 5.5 Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4%
Opus 5.5 PostTrainBench 45.3% 44.3% 40.2% 49.3%
引き分け CWE-bench v1 68.0% 68.0% 58.0% 67.0%

Argonは、上記以外にもVals Finance Agent v2、Vibe Code Bench、LABBench 2、RiemannBench、GraphWalks up to 128K、Agent’s Last Examで完全勝利とされています。Fable 5.1はこのテーブルのどの行でも首位ではありません。

CWE-bench v1では、DeepMindのサイバーリーダーボードによると、Argon、Astra、Grok 4.7が68%で同率首位、Opus 5.5が67%です。

Gemini 4 ArgonとFable 5.1の比較では、両方が数値を公開している17項目のうち15項目でArgonが上回っています。Fable 5.1が優位なのは次の2項目です。

  • FrontierSWE v2:56.3%対55.0%
  • Terminal-bench 4.0:57.9%対57.4%

Anthropicが公開した数値はClaude Fable 5.1ベンチマーク、19項目の全テーブルはGemini 4 Argonベンチマークで確認できます。

ベンチマーク差を鵜呑みにする前の3つの注意点

1. 競合モデルの数値はGoogleの再実行結果ではない

Googleの評価方法論では、Gemini以外の結果は「特に明記されていない限り、プロバイダーが自己申告した数値から引用」とされています。一部はVals AI、Proximal、Surgeが運営する公開リーダーボードの値です。

実務上の対応: ベンダー横断の比較表を設計判断の唯一の根拠にせず、自分のプロンプト・ツール・リトライ設定で評価を実行してください。

2. 評価ハーネスが異なる

DeepSWE v1.1では、Googleはmini swe-agentハーネスでArgonの77.9%を自己計算しています。一方、Astraのスコアは公開リーダーボード、Anthropicモデルのスコアはシステムカード由来です。

LVBenchでも入力条件は揃っていません。

  • Gemini:毎秒1フレームで動画をサンプリング
  • Astra:800フレーム
  • Opus 5.5:600フレーム
  • Fable 5.1:300フレーム(API制限による)

実務上の対応: 動画・画像・長文コンテキストを扱う場合、モデル名だけでなく、フレーム数、画像解像度、チャンク戦略、ツール呼び出し回数を評価ログに保存してください。

3. 同じモデルでも設定によってスコアは変わる

Opus 5.5のTerminal-bench 4.0の数値は、ハーネスと努力設定によりチャートごとに異なります。Anthropicはxhigh努力設定で66.4%を報告しています。

実務上の対応: 比較表には最低限、次の情報を残してください。

- モデルID
- 推論・努力設定
- max_tokens
- 温度
- ツール定義
- システムプロンプト
- リトライ回数
- 入力トークン数
- 出力トークン数
- 実行日時
Enter fullscreen mode Exit fullscreen mode

異なる条件の結果を、同一条件の性能比較として混在させないことが重要です。

第三者評価者の見解

独立系リーダーボードでは、差はより小さく見えます。

Artificial Analysisでは、Argonは223モデル中8位です。ただし、このランキングでは推論設定ごとに別モデルとしてカウントされます。モデル単位では、Argonは53でGPT-6 AstraおよびClaude Fable 5.1と同点です。Claude Opus 5.5は最大58、Claude Sonnet 5.5は56です。

Artificial AnalysisはAA-OmniscienceにおけるArgonの幻覚発生率を15%と記載しており、Astraの最大設定は51%でした。

Arenaでは、ArgonはText部門で1525点、4,942票の予備評価により1位です。Opus 5.5は4位です。Vals AIでは、ArgonはVals Indexの41モデル中1位で、Geminiモデルとして初の首位とされています。

一方、Google社内でも評価は一様ではありません。Bloombergの報道によると、アクセス権を持つ一部の従業員は、ベンチマークに比べて一部のコーディングやフロントエンド設計作業でArgonが期待外れだと述べています。Googleはこの特徴付けは不正確だとしています。

ワークロード別のルーティング方法

2026年時点で、すべてのタスクに対する唯一の最適モデルはありません。モデルを固定するのではなく、タスク特性ごとにルーティングしてください。また、Argonが一般提供されたときに同じ評価を実行できるよう、GeminiモデルIDは変数として管理するのが安全です。

タスク 今日のルーティング先 Argon出荷時の検証方針
法律、金融、オフィス自動化エージェント Opus 5.5(Vals Index 67.0%) Argonを評価する。知識労働4項目すべてでArgonが首位
ターミナルを多用するコーディングエージェント Opus 5.5(Terminal-bench 4.0:66.4%) Opus 5.5を基準に継続比較
エージェント型ソフトウェアエンジニアリング Astra(FrontierSWE v2:65.5%)またはOpus 5.5 ArgonはDeepSWEで首位、FrontierSWEでは劣るため両方で評価
コンピュータ利用とGUIエージェント Astra(OSWorld-2.0:72.6%) Astraを基準に、ArgonはAgent’s Last Examも含めて比較
256K超の長文推論 Opus 5.5(追加料金なし)またはAstra(272K超で追加料金) Argonを評価する。GraphWalks 256K to 1Mは84.2%
動画・チャート理解 Astra(LVBench:87.5%) Argonを評価する。91.7%だがフレーム数を揃える
科学・MLエンジニアリング Astra(Terminal-Bench Science)、Opus 5.5(PostTrainBench) ArgonはLABBench 2、RiemannBenchも含めて比較
128K超の単一応答 Batch上のOpus 5.5(300K、ベータ) Google公称1MのArgonを実測で確認
大量処理・コスト重視 Opus 5.5($4/$20) Argon導入期間中は$2/$10で評価

価格を優先してモデルを選ぶ場合は、GPT-6 Sol vs Claude Opus 5.5も参考になります。

独自のプロンプトで3モデルを比較する

ベンダーのベンチマークだけでは、あなたのプロンプト、ツール、データ形式、レイテンシ要件における性能は判断できません。Apidogで、同じ入力を3モデルへ送る小規模な評価環境を作成してください。

1. モデルごとにリクエストを作成する

1プロジェクトに、次の3リクエストを作成します。

  • GPT-6 Astra
  • Claude Opus 5.5
  • Gemini

GeminiのモデルIDは環境変数で管理します。ArgonのIDが未公開の間は、既存のGeminiモデルを指定します。

GEMINI_MODEL=gemini-3.8-flash
Enter fullscreen mode Exit fullscreen mode

ArgonのIDが公開されたら、この値だけを更新します。

GEMINI_MODEL=<公開されたArgonのモデルID>
Enter fullscreen mode Exit fullscreen mode

各ベンダーのリクエスト形式は、GPT-6 Astra APIガイドとClaude Opus 5.5とは何かを参照してください。

2. APIキーとプロンプトを環境変数へ分離する

APIキーをリクエスト本文へ直接書かず、環境変数に保存します。

OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GOOGLE_API_KEY=...

EVAL_PROMPT=次のコードのバグを特定し、最小変更のパッチを提示してください。
Enter fullscreen mode Exit fullscreen mode

3リクエストで同じ EVAL_PROMPT を参照すれば、入力差分を防げます。

{
  "model": "{{GEMINI_MODEL}}",
  "input": "{{EVAL_PROMPT}}"
}
Enter fullscreen mode Exit fullscreen mode

モデルによってリクエスト形式は異なりますが、評価対象のタスク本文、システムプロンプト、ツール定義、max_tokens は可能な限り揃えてください。

3. 最低限のアサーションを追加する

各リクエストに、少なくとも次のチェックを追加します。

  • HTTPステータスが200
  • 回答本文が空ではない
  • 出力トークンが上限以下
  • 推定コストが予算内
  • 必要なJSONフィールドが存在する
  • ツール呼び出しが期待した形式で返る

例えば、コードレビューAPIなら次のような基準を作れます。

- status === 200
- response.answer が空文字ではない
- usage.output_tokens <= 8000
- response に patch または diff が含まれる
- 推定コスト <= $0.50
Enter fullscreen mode Exit fullscreen mode

4. 3リクエストを1つのテストシナリオで実行する

テストシナリオでは、次の順序で実行すると比較しやすくなります。

1. Astraへ送信
2. Opus 5.5へ送信
3. Geminiへ送信
4. 各レスポンスのトークン数・レイテンシ・アサーション結果を記録
5. テストレポートで横並びに比較
Enter fullscreen mode Exit fullscreen mode

評価は1回で終わらせず、少なくとも次のケースを含めてください。

  • 短い指示への応答
  • 長いコンテキストの要約・検索
  • コード修正
  • ツール呼び出し
  • JSONなどの構造化出力
  • 失敗時のリカバリー
  • 実データに近い曖昧な入力

コストアサーションの計算例

20,000入力トークン、4,000出力トークンのリクエストを想定します。

GPT-6 Astra

入力: 20,000 × $10 / 1,000,000 = $0.20
出力:  4,000 × $50 / 1,000,000 = $0.20
合計: $0.40
Enter fullscreen mode Exit fullscreen mode

Claude Opus 5.5

入力: 20,000 × $4 / 1,000,000 = $0.08
出力:  4,000 × $20 / 1,000,000 = $0.08
合計: $0.16
Enter fullscreen mode Exit fullscreen mode

Gemini 4 Argon

導入価格:
入力: 20,000 × $2 / 1,000,000 = $0.04
出力:  4,000 × $10 / 1,000,000 = $0.04
合計: $0.08

標準価格:
入力: 20,000 × $4 / 1,000,000 = $0.08
出力:  4,000 × $20 / 1,000,000 = $0.08
合計: $0.16
Enter fullscreen mode Exit fullscreen mode

ただし、トークン単価だけでタスク単価は決まりません。Artificial Analysisは、Argonのタスクあたりの出力を約62Kトークン、Astraの最大努力設定を約27Kトークンと測定しています。

そのため、評価では次の2つを必ず記録してください。

タスク単価 = 入力トークン費用 + 出力トークン費用
成功単価   = タスク単価 ÷ 成功したタスク数
Enter fullscreen mode Exit fullscreen mode

出力が長いモデルは、単価が低くても最終コストが高くなる可能性があります。

Argonが出荷されたら、GEMINI_MODEL の値を変更して同じシナリオを再実行してください。これにより、現在購入できるAstraとOpus 5.5に対して、完全に同一のプロンプト・同一のアサーションで比較できます。

FAQ

Gemini 4 ArgonはGPT-6 Astraより優れていますか?

Artificial Analysisでは両方とも53点です。GoogleのテーブルではArgonが多くの項目で高スコアですが、AstraはFrontierSWE v2、Terminal-Bench Science 0.1、OSWorld-2.0で勝利しています。また、Astraは今日利用できるモデルです。

Gemini 4 ArgonとClaude Opus 5.5ではどちらが優れていますか?

GoogleのテーブルではArgonが多くの項目で優位です。一方でOpus 5.5はTerminal-bench 4.0とPostTrainBenchで勝利しています。Artificial AnalysisではOpus 5.5が58、Argonが53です。標準料金は同額です。

Gemini 4 ArgonはClaude Opus 5.5より安いですか?

導入期間中はArgonが半額です。Argonは$2/$10、Opus 5.5は$4/$20です。導入終了後のArgonは$4/$20で、Opus 5.5と同額になります。Googleは導入期間の終了時期を公開していません。

最大出力制限が最も大きいモデルはどれですか?

ArgonはGoogle公称で1Mトークンです。ただしVals AIは、テストした構成では262Kと記載しています。他モデルの同期出力上限は128Kです。詳細は1M出力トークンガイドを参照してください。

Gemini 4 Argonは今日利用できますか?

現在はGoogleのFairwindプログラムを通じた、審査済みサイバー防御パートナー向けの提供のみです。有料API顧客とGoogle AI Ultra加入者への提供はその後とされていますが、日程は未定です。

ワークロードで選び、継続的にテストする

Argonは知識労働、長文コンテキスト、マルチモーダルで強い結果を示しています。AstraはFrontierSWE、Terminal-Bench Science、OSWorldで優位です。Opus 5.5はターミナル作業とMLエンジニアリングで強く、Argonの導入終了後と同じ価格帯です。

今すぐ実装するなら、購入可能なAstraとOpus 5.5で開発を進めつつ、GeminiのモデルIDを変数化してください。Argonが一般公開された日に同じ評価シナリオを再実行すれば、ベンダーのベンチマークではなく、自分のワークロードに基づいてルーティングを決められます。

1つのプロジェクトで3モデルのリクエスト比較を設定するには、Apidogをダウンロードしてください。

Top comments (0)