Gemini 3.8 Flashは本日より提供開始されます。フリーティア付きの安定版モデルで、2026年12月31日までの料金は入力1Mトークンあたり$0.75、出力1Mトークンあたり$3.75です。以降はそれぞれ$1.50、$7.50になります。出力上限は64Kトークンです。一方、Gemini 4 Argonは一般提供されていません。Googleの発表記事によると、発表期間中(終了時期は未定)の料金は入力$2、出力$10で、その後は$4、$20です。GoogleはArgonの出力上限を1Mトークンとしており、現時点ではFairwindプログラムの防御者にのみ提供しています。今四半期中にリリースする必要があるならFlashを採用し、Argonへ設定変更だけで切り替えられるように実装しておきましょう。
この記事では、両モデルの仕様、共通ベンチマーク、サイバー評価、同一リクエストのコストを比較します。最後に、モデル名を環境変数で切り替える実装例を紹介します。背景はGemini 4 Argonとは何か、Gemini 3.8 Flashとは何かを参照してください。
サイドバイサイド:今日利用できるもの
| 項目 | Gemini 3.8 Flash | Gemini 4 Argon |
|---|---|---|
| 提供状況 | Gemini API、AI Studio、Antigravity、Gemini Enterpriseで安定版 | Fairwindプログラムパートナーの一部に、Gemini Enterpriseのマネージドモデルとして提供 |
| モデルID | gemini-3.8-flash |
未公開 |
| 1Mトークンあたりの料金(入力 / 出力) | 2026年12月31日まで$0.75 / $3.75、その後$1.50 / $7.50 | 発表期間中$2 / $10、終了後$4 / $20 |
| 1Mトークンあたりのキャッシュ入力 | $0.075、その後$0.15 | 発表期間中$0.10、その後$0.20(入力料金から95%オフ) |
| 出力上限 | 65,536トークン | 1Mトークン(Googleの公称上限) |
| 入力ウィンドウ | 1,048,576トークン | 未公開 |
| 思考レベル |
low、medium(デフォルト)、high。minimalはHTTP 400 |
未文書化 |
| 無料APIティア | あり(レート制限あり) | 発表なし |
| 消費者アクセス | AI Pro・UltraのGeminiアプリ、検索のAIモード | 未提供。AI Ultra加入者は初期対象とされるが日程未定 |
いくつか補足があります。GoogleはArgonの入力ウィンドウを公開していません。ただし、Google自身の長文コンテキスト評価では最大1Mトークンのプロンプトが使用されています。
Argonの出力上限はGoogleによると1Mトークンですが、サードパーティ評価者のVals AIは、テストした構成で最大262K出力と記載しています。また、Argonの評価は「最高の思考設定」で実施されていますが、Googleはレベル名やデフォルト値を公開していません。
Flashの思考レベルはGoogleの思考ドキュメントと、3.8 Flash思考レベルガイドを確認してください。
Flashのフリーティアにはレート制限があり、Googleはフリーティアのデータが「製品の改善に使用される」と説明しています。Argonを無料で利用する方法は、現時点でGoogleから発表されていません。利用可能な無料Geminiモデルは、Argon無料アクセス説明を参照してください。
両方の発表記事で共通するベンチマーク項目(テキスト)
Googleが両モデルの発表テーブルでテキストとして共通掲載している項目は、次の2つです。数値はGoogleの報告値であり、Argonの評価方法は両方ともVals AIによるものとしています。
| ベンチマーク | Gemini 3.8 Flash(9月2日のテーブル) | Gemini 4 Argon(9月30日のテーブル) |
|---|---|---|
| Vals Finance Agent v2 | 61.4% | 65.4% |
| Harvey Legal Agent Benchmark | 10.0% | 19.6% |
これらのテーブルは1か月間隔で公開され、競合モデルのセットも異なります。そのため、厳密な統制比較ではなく、方向性を示す数値として扱ってください。
ただし、法律分野の差は目立ちます。Argonは19.6%で、Flashの10.0%のほぼ2倍です。金融分野では4ポイント差です。
Argonのテーブルにある他の項目には、3.8 Flash側でテキストとして対応する項目がありません。Googleの3.8 FlashテーブルではHLE-Verifiedが報告されていましたが、Argonのテーブルにはありません。FlashのDeepSWEスコアはモデルカード画像でのみ表示されていました。
サードパーティランキングであるArenaのText leaderboardでは、Argon(High)が予備投票で1位、Gemini 3.8 Flash(High)は11位です。評価者を含むArgonの全19項目については、Argonベンチマークの内訳を参照してください。
サイバー:Argon vs 3.8 Flash Cyber
DeepMindのサイバーページでは、ArgonとGemini 3.8 Flash Cyberを比較しています。Gemini 3.8 Flash Cyberは、FlashのFairwind限定サイバー兄弟モデルです。
| サイバー評価 | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| 実世界の脆弱性発見 | 85.8% | 71.0% |
| Wiz Penetration Test Benchmark | 70.9% | 58.2% |
ただし、両モデルともアクセスが制限されています。
- Gemini 3.8 Flash Cyber: Gemini Enterprise Agent Platform上で許可リストの背後にあるGAモデル
- Gemini 4 Argon: Fairwind限定
Fairwindパートナーでなければ、これらの数値は今日開発できるモデルの選択には直接影響しません。一般的なAPIワークロードでは、通常のGemini 3.8 Flashが利用対象です。
両モデルで同じ呼び出しを行った場合のコスト
入力100,000トークン、出力8,000トークンのリクエストを例にします。
現在のGeminiモデルでは、思考トークンも出力として課金されます。そのため、以下の8,000トークンには思考トークンも含まれます。GoogleはArgonにおける思考トークンの課金方法を明示していないため、ここでは現在のGeminiモデルと同じ方式だと仮定します。
| モデルと期間 | 入力コスト | 出力コスト | 呼び出しごとの合計 |
|---|---|---|---|
| 3.8 Flash、発表期間中 | 0.1M × $0.75 = $0.075 | 0.008M × $3.75 = $0.030 | $0.105 |
| 3.8 Flash、2027年1月1日以降 | 0.1M × $1.50 = $0.150 | 0.008M × $7.50 = $0.060 | $0.210 |
| Argon、発表期間中 | 0.1M × $2 = $0.200 | 0.008M × $10 = $0.080 | $0.280 |
| Argon、標準料金 | 0.1M × $4 = $0.400 | 0.008M × $20 = $0.160 | $0.560 |
Argonのトークン単価は、発表期間中・標準料金のどちらでもFlashの8 / 3、約2.67倍です。
このリクエストを1日1,000回実行する場合は次のとおりです。
- 3.8 Flash(発表期間中): 1日$105
- Argon(発表期間中): 1日$280
実際のコストでは、次の要因を考慮してください。
トークン数は一致しない
同じプロンプトでも、出力トークン数と思考トークン数はモデルごとに異なります。Argonの公開評価は最高の思考設定で実施されています。Flashでは、高い思考レベルがより多くのトークンを使う可能性があるとGoogleが説明しています。長い出力では計算が変わる
200,000トークンの回答はFlashの65,536トークン上限に収まらないため、複数回の呼び出しに分割する必要があります。Argonの公称上限内であれば、1レスポンスで返せる可能性があります。200,000出力トークンなら、Argonは発表期間中で0.2M × $10 = $2.00、標準料金では$4.00です。1Mトークンを完全に出力する場合は、発表期間中で$10、標準料金で$20です。発表期間の終了日はArgonでは未定
Flashの発表料金は2026年12月31日に終了します。Argonの発表料金がいつ終了するかはGoogleから示されていません。
FlashはGemini API料金ページによると、Batchで50%オフです。2026年12月31日までは入力$0.375、出力$1.875になります。ArgonのBatch料金は公開されていません。詳細はArgon料金ガイドと3.8 Flash料金ガイドを確認してください。
Argonを待つべきか、Flashでリリースすべきか?
以下の場合は、今すぐ3.8 Flashでリリースする
コストを重視する場合
FlashはArgonのトークン単価の3/8で、Batchを使えばさらに半額になります。大量に実行する場合
分類、抽出、ルーティング、大規模チャットでは、Argonの出力1Mトークンあたり$10がすぐに累積します。今日中に必要な場合
Flashには安定したモデルID、プロトタイピング用フリーティア、公開済みの料金体系があります。応答が65,536トークンに収まる場合
一般的なAPIワークロードの多くはこの範囲です。
以下の場合は、Argonを計画する
長期的な作業を実行する場合
GoogleはArgonについて、「複雑で長期的なワークフロー全体で深い推論を維持するように構築されている」と説明しています。64Kを超える出力が必要な場合
完全なモジュールの書き換え、長いレポート、大規模な移行では、1M出力上限が必要になる可能性があります。法律または金融エージェントを実行する場合
Googleが両モデルを公開比較した2項目では、Argonがどちらも上回っています。Fairwindの資格がある防御者の場合
Argonは現在、このプログラムを通じて提供されているモデルです。
選択は固定ではありません。大半のトラフィックはFlashへルーティングし、Argonが利用可能になったら難しいタスクだけを切り替える構成にできます。
1つの保存済みリクエスト、2つのモデル
実装パターンはシンプルです。
- モデル名を環境変数に保存する
- 現在は
gemini-3.8-flashで実行する - Argonの正式なモデルIDが公開されたら、変数だけを変更する
- 同じリクエストを再実行して、出力・トークン使用量・コストを比較する
GoogleはArgonのモデルIDを公開していないため、推測したIDをハードコードしないでください。
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "Summarize this contract clause in 3 bullets."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "medium"
},
"maxOutputTokens": 8192
}
}'
generateContentレスポンスにはusageMetadataが含まれます。Apidogでは、GEMINI_API_KEYとGEMINI_MODELを環境変数として保存し、このリクエストをコレクションに保存してください。
追加するチェック項目は次のとおりです。
- HTTPステータスが
200 - アプリケーションが使用するレスポンスフィールドが存在すること
-
usageMetadata.thoughtsTokenCountが予算上限を超えないこと -
maxOutputTokensが意図した上限に設定されていること
たとえば、テストスクリプトでは次のような検証を追加できます。
pm.test("HTTP 200 を返す", () => {
pm.response.to.have.status(200);
});
const body = pm.response.json();
pm.test("候補レスポンスを返す", () => {
pm.expect(body.candidates).to.be.an("array").that.is.not.empty;
});
pm.test("思考トークン数が上限以内", () => {
const thoughts = body.usageMetadata?.thoughtsTokenCount ?? 0;
pm.expect(thoughts).to.be.below(20000);
});
このリクエストをテストシナリオへ追加し、まずFlashで実行してレポートをベースラインとして保存します。
Argonのリリース時には、次の2点にも注意してください。
- Googleは「すべての新しいモデル」がInteractions APIでリリースされると述べています。Argonが
generateContentをサポートするかは明示されていません。POST https://generativelanguage.googleapis.com/v1beta/interactionsとgeneration_config.thinking_levelを使うInteractions API版も別途保存してください。 - Argonの思考レベル名は未文書化です。Flashで使う
mediumがそのまま利用できるとは限りません。
正式リリース後は、モデル変数を1つ変更して同じテストを再実行し、出力とusageMetadataをFlashのベースラインと比較してください。
FAQ
Gemini 4 ArgonはGemini 3.8 Flashより優れていますか?
両方の発表テーブルで共通するテキスト評価2項目では、Argonが上回っています。Vals Finance Agent v2では65.4%対61.4%、Harvey Legal Agent Benchmarkでは19.6%対10.0%です。ただし、Argonのトークン単価は約2.67倍で、現時点では一般に呼び出せません。
Gemini 4 Argonを待つべきですか?
今リリースが必要なら待つべきではありません。Googleはリリース日を「できるだけ早く」としており、有料API顧客とAI Ultra加入者から開始するとしています。
新しいプロジェクトにはGemini 3.8 FlashとArgonのどちらが適していますか?
まずはモデル名を変数化したうえで、3.8 Flashから始めてください。長い出力や法律・金融分野での深い推論が必要なリクエストは、独自のプロンプトで比較テストした後にArgonへ移行します。
Argonを無料で利用する方法はありますか?
ありません。GoogleはArgonのフリーティアを発表していません。現在利用できる無料Geminiモデルは、Argon無料アクセス説明を確認してください。
ArgonはGemini 3.8 Flashを置き換えますか?
Googleは置き換えについて言及していません。GoogleはArgonを新しいフロンティアモデルと呼んでおり、ロイター通信は従来のProラインより大きいと報じています。そのため、Flashとは異なるティアのモデルと考えるのが妥当です。
次のステップ
今日のうちにリクエストを設定し、Gemini 3.8 Flashで実行してテストレポートを保存してください。Argonがリリースされたら、同じリクエストを再実行するだけで、自分のトラフィックに対して価格差を正当化できるか判断できます。
比較用のリクエストと環境変数を管理するには、Apidogをダウンロードしてください。
Top comments (0)