DEV Community

Cover image for ジェミニ 4 アルゴン 対 ジェミニ 3.8 フラッシュ: アルゴンを待つべきか、今すぐフラッシュで始めるべきか?
Akira
Akira

Posted on Originally published at apidog.com

ジェミニ 4 アルゴン 対 ジェミニ 3.8 フラッシュ: アルゴンを待つべきか、今すぐフラッシュで始めるべきか?

Gemini 3.8 Flashは本日より提供開始されます。フリーティア付きの安定版モデルで、2026年12月31日までの料金は入力1Mトークンあたり$0.75、出力1Mトークンあたり$3.75です。以降はそれぞれ$1.50、$7.50になります。出力上限は64Kトークンです。一方、Gemini 4 Argonは一般提供されていません。Googleの発表記事によると、発表期間中(終了時期は未定)の料金は入力$2、出力$10で、その後は$4、$20です。GoogleはArgonの出力上限を1Mトークンとしており、現時点ではFairwindプログラムの防御者にのみ提供しています。今四半期中にリリースする必要があるならFlashを採用し、Argonへ設定変更だけで切り替えられるように実装しておきましょう。

Apidogを今すぐ試す

この記事では、両モデルの仕様、共通ベンチマーク、サイバー評価、同一リクエストのコストを比較します。最後に、モデル名を環境変数で切り替える実装例を紹介します。背景はGemini 4 Argonとは何か、Gemini 3.8 Flashとは何かを参照してください。

サイドバイサイド:今日利用できるもの

項目 Gemini 3.8 Flash Gemini 4 Argon
提供状況 Gemini API、AI Studio、Antigravity、Gemini Enterpriseで安定版 Fairwindプログラムパートナーの一部に、Gemini Enterpriseのマネージドモデルとして提供
モデルID gemini-3.8-flash 未公開
1Mトークンあたりの料金(入力 / 出力) 2026年12月31日まで$0.75 / $3.75、その後$1.50 / $7.50 発表期間中$2 / $10、終了後$4 / $20
1Mトークンあたりのキャッシュ入力 $0.075、その後$0.15 発表期間中$0.10、その後$0.20(入力料金から95%オフ)
出力上限 65,536トークン 1Mトークン(Googleの公称上限)
入力ウィンドウ 1,048,576トークン 未公開
思考レベル low、medium(デフォルト)、high。minimalはHTTP 400 未文書化
無料APIティア あり(レート制限あり) 発表なし
消費者アクセス AI Pro・UltraのGeminiアプリ、検索のAIモード 未提供。AI Ultra加入者は初期対象とされるが日程未定

いくつか補足があります。GoogleはArgonの入力ウィンドウを公開していません。ただし、Google自身の長文コンテキスト評価では最大1Mトークンのプロンプトが使用されています。

Argonの出力上限はGoogleによると1Mトークンですが、サードパーティ評価者のVals AIは、テストした構成で最大262K出力と記載しています。また、Argonの評価は「最高の思考設定」で実施されていますが、Googleはレベル名やデフォルト値を公開していません。

Flashの思考レベルはGoogleの思考ドキュメントと、3.8 Flash思考レベルガイドを確認してください。

Flashのフリーティアにはレート制限があり、Googleはフリーティアのデータが「製品の改善に使用される」と説明しています。Argonを無料で利用する方法は、現時点でGoogleから発表されていません。利用可能な無料Geminiモデルは、Argon無料アクセス説明を参照してください。

両方の発表記事で共通するベンチマーク項目(テキスト)

Googleが両モデルの発表テーブルでテキストとして共通掲載している項目は、次の2つです。数値はGoogleの報告値であり、Argonの評価方法は両方ともVals AIによるものとしています。

ベンチマーク Gemini 3.8 Flash(9月2日のテーブル) Gemini 4 Argon(9月30日のテーブル)
Vals Finance Agent v2 61.4% 65.4%
Harvey Legal Agent Benchmark 10.0% 19.6%

これらのテーブルは1か月間隔で公開され、競合モデルのセットも異なります。そのため、厳密な統制比較ではなく、方向性を示す数値として扱ってください。

ただし、法律分野の差は目立ちます。Argonは19.6%で、Flashの10.0%のほぼ2倍です。金融分野では4ポイント差です。

Argonのテーブルにある他の項目には、3.8 Flash側でテキストとして対応する項目がありません。Googleの3.8 FlashテーブルではHLE-Verifiedが報告されていましたが、Argonのテーブルにはありません。FlashのDeepSWEスコアはモデルカード画像でのみ表示されていました。

サードパーティランキングであるArenaのText leaderboardでは、Argon(High)が予備投票で1位、Gemini 3.8 Flash(High)は11位です。評価者を含むArgonの全19項目については、Argonベンチマークの内訳を参照してください。

サイバー:Argon vs 3.8 Flash Cyber

DeepMindのサイバーページでは、ArgonとGemini 3.8 Flash Cyberを比較しています。Gemini 3.8 Flash Cyberは、FlashのFairwind限定サイバー兄弟モデルです。

サイバー評価 Gemini 4 Argon Gemini 3.8 Flash Cyber
実世界の脆弱性発見 85.8% 71.0%
Wiz Penetration Test Benchmark 70.9% 58.2%

ただし、両モデルともアクセスが制限されています。

  • Gemini 3.8 Flash Cyber: Gemini Enterprise Agent Platform上で許可リストの背後にあるGAモデル
  • Gemini 4 Argon: Fairwind限定

Fairwindパートナーでなければ、これらの数値は今日開発できるモデルの選択には直接影響しません。一般的なAPIワークロードでは、通常のGemini 3.8 Flashが利用対象です。

両モデルで同じ呼び出しを行った場合のコスト

入力100,000トークン、出力8,000トークンのリクエストを例にします。

現在のGeminiモデルでは、思考トークンも出力として課金されます。そのため、以下の8,000トークンには思考トークンも含まれます。GoogleはArgonにおける思考トークンの課金方法を明示していないため、ここでは現在のGeminiモデルと同じ方式だと仮定します。

モデルと期間 入力コスト 出力コスト 呼び出しごとの合計
3.8 Flash、発表期間中 0.1M × $0.75 = $0.075 0.008M × $3.75 = $0.030 $0.105
3.8 Flash、2027年1月1日以降 0.1M × $1.50 = $0.150 0.008M × $7.50 = $0.060 $0.210
Argon、発表期間中 0.1M × $2 = $0.200 0.008M × $10 = $0.080 $0.280
Argon、標準料金 0.1M × $4 = $0.400 0.008M × $20 = $0.160 $0.560

Argonのトークン単価は、発表期間中・標準料金のどちらでもFlashの8 / 3、約2.67倍です。

このリクエストを1日1,000回実行する場合は次のとおりです。

  • 3.8 Flash(発表期間中): 1日$105
  • Argon(発表期間中): 1日$280

実際のコストでは、次の要因を考慮してください。

  • トークン数は一致しない

    同じプロンプトでも、出力トークン数と思考トークン数はモデルごとに異なります。Argonの公開評価は最高の思考設定で実施されています。Flashでは、高い思考レベルがより多くのトークンを使う可能性があるとGoogleが説明しています。

  • 長い出力では計算が変わる

    200,000トークンの回答はFlashの65,536トークン上限に収まらないため、複数回の呼び出しに分割する必要があります。Argonの公称上限内であれば、1レスポンスで返せる可能性があります。200,000出力トークンなら、Argonは発表期間中で0.2M × $10 = $2.00、標準料金では$4.00です。1Mトークンを完全に出力する場合は、発表期間中で$10、標準料金で$20です。

  • 発表期間の終了日はArgonでは未定

    Flashの発表料金は2026年12月31日に終了します。Argonの発表料金がいつ終了するかはGoogleから示されていません。

FlashはGemini API料金ページによると、Batchで50%オフです。2026年12月31日までは入力$0.375、出力$1.875になります。ArgonのBatch料金は公開されていません。詳細はArgon料金ガイドと3.8 Flash料金ガイドを確認してください。

Argonを待つべきか、Flashでリリースすべきか?

以下の場合は、今すぐ3.8 Flashでリリースする

  • コストを重視する場合

    FlashはArgonのトークン単価の3/8で、Batchを使えばさらに半額になります。

  • 大量に実行する場合

    分類、抽出、ルーティング、大規模チャットでは、Argonの出力1Mトークンあたり$10がすぐに累積します。

  • 今日中に必要な場合

    Flashには安定したモデルID、プロトタイピング用フリーティア、公開済みの料金体系があります。

  • 応答が65,536トークンに収まる場合

    一般的なAPIワークロードの多くはこの範囲です。

以下の場合は、Argonを計画する

  • 長期的な作業を実行する場合

    GoogleはArgonについて、「複雑で長期的なワークフロー全体で深い推論を維持するように構築されている」と説明しています。

  • 64Kを超える出力が必要な場合

    完全なモジュールの書き換え、長いレポート、大規模な移行では、1M出力上限が必要になる可能性があります。

  • 法律または金融エージェントを実行する場合

    Googleが両モデルを公開比較した2項目では、Argonがどちらも上回っています。

  • Fairwindの資格がある防御者の場合

    Argonは現在、このプログラムを通じて提供されているモデルです。

選択は固定ではありません。大半のトラフィックはFlashへルーティングし、Argonが利用可能になったら難しいタスクだけを切り替える構成にできます。

1つの保存済みリクエスト、2つのモデル

実装パターンはシンプルです。

  1. モデル名を環境変数に保存する
  2. 現在はgemini-3.8-flashで実行する
  3. Argonの正式なモデルIDが公開されたら、変数だけを変更する
  4. 同じリクエストを再実行して、出力・トークン使用量・コストを比較する

GoogleはArgonのモデルIDを公開していないため、推測したIDをハードコードしないでください。

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"

curl -s -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "Summarize this contract clause in 3 bullets."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "medium"
      },
      "maxOutputTokens": 8192
    }
  }'
Enter fullscreen mode Exit fullscreen mode

generateContentレスポンスにはusageMetadataが含まれます。Apidogでは、GEMINI_API_KEYとGEMINI_MODELを環境変数として保存し、このリクエストをコレクションに保存してください。

追加するチェック項目は次のとおりです。

  • HTTPステータスが200
  • アプリケーションが使用するレスポンスフィールドが存在すること
  • usageMetadata.thoughtsTokenCountが予算上限を超えないこと
  • maxOutputTokensが意図した上限に設定されていること

たとえば、テストスクリプトでは次のような検証を追加できます。

pm.test("HTTP 200 を返す", () => {
  pm.response.to.have.status(200);
});

const body = pm.response.json();

pm.test("候補レスポンスを返す", () => {
  pm.expect(body.candidates).to.be.an("array").that.is.not.empty;
});

pm.test("思考トークン数が上限以内", () => {
  const thoughts = body.usageMetadata?.thoughtsTokenCount ?? 0;
  pm.expect(thoughts).to.be.below(20000);
});
Enter fullscreen mode Exit fullscreen mode

このリクエストをテストシナリオへ追加し、まずFlashで実行してレポートをベースラインとして保存します。

Argonのリリース時には、次の2点にも注意してください。

  1. Googleは「すべての新しいモデル」がInteractions APIでリリースされると述べています。ArgonがgenerateContentをサポートするかは明示されていません。POST https://generativelanguage.googleapis.com/v1beta/interactionsとgeneration_config.thinking_levelを使うInteractions API版も別途保存してください。
  2. Argonの思考レベル名は未文書化です。Flashで使うmediumがそのまま利用できるとは限りません。

正式リリース後は、モデル変数を1つ変更して同じテストを再実行し、出力とusageMetadataをFlashのベースラインと比較してください。

FAQ

Gemini 4 ArgonはGemini 3.8 Flashより優れていますか?

両方の発表テーブルで共通するテキスト評価2項目では、Argonが上回っています。Vals Finance Agent v2では65.4%対61.4%、Harvey Legal Agent Benchmarkでは19.6%対10.0%です。ただし、Argonのトークン単価は約2.67倍で、現時点では一般に呼び出せません。

Gemini 4 Argonを待つべきですか?

今リリースが必要なら待つべきではありません。Googleはリリース日を「できるだけ早く」としており、有料API顧客とAI Ultra加入者から開始するとしています。

新しいプロジェクトにはGemini 3.8 FlashとArgonのどちらが適していますか?

まずはモデル名を変数化したうえで、3.8 Flashから始めてください。長い出力や法律・金融分野での深い推論が必要なリクエストは、独自のプロンプトで比較テストした後にArgonへ移行します。

Argonを無料で利用する方法はありますか?

ありません。GoogleはArgonのフリーティアを発表していません。現在利用できる無料Geminiモデルは、Argon無料アクセス説明を確認してください。

ArgonはGemini 3.8 Flashを置き換えますか?

Googleは置き換えについて言及していません。GoogleはArgonを新しいフロンティアモデルと呼んでおり、ロイター通信は従来のProラインより大きいと報じています。そのため、Flashとは異なるティアのモデルと考えるのが妥当です。

次のステップ

今日のうちにリクエストを設定し、Gemini 3.8 Flashで実行してテストレポートを保存してください。Argonがリリースされたら、同じリクエストを再実行するだけで、自分のトラフィックに対して価格差を正当化できるか判断できます。

比較用のリクエストと環境変数を管理するには、Apidogをダウンロードしてください。

Top comments (0)