Gemini 3.8 Flash:より深く考えるFlashモデルの仕様・料金・API活用ガイド
Gemini 3.8 Flashは、2026年9月2日にリリースされたGoogleの最新Flash層モデルです。ゲートアクセス型セキュリティツインのGemini 3.8 Flash Cyberと同時発表されました。7月21日のGemini 3.6 Flash、8月13日の3.7 Flashに続く、6週間で3番目のFlashリリースです。導入価格は3.7 Flashと同じで、2026年12月31日まで入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドルです。Googleは、長期的なソフトウェアエンジニアリング、自律型エージェント、複雑なエンタープライズワークフロー向けの「最もインテリジェントなFlashモデル」と位置付けています。
最大の変更点は価格やコンテキストウィンドウではなく、モデルの挙動です。Gemini 3.8 Flashは難しいタスクで「より懸命に作業する」よう設計され、細かい推論、途中での自己検証、反復的なツール呼び出しを行います。その結果、エージェントベンチマークは向上しますが、タスクあたりのトークン消費量は増加します。Artificial Analysisは、3.7 Flash比で出力トークンが約30%増えたと測定しました。
- トークン単位の予算:価格は据え置き
- タスク単位の予算:実質的な費用は増加
この記事では、仕様、「より懸命に作業する」設計、ベンチマーク、料金、利用可能性、Cyberツインモデル、制限事項、API呼び出しまでを実装視点で整理します。リクエストはJSONを含むプレーンなHTTPなので、アプリケーションに組み込む前にApidogで構築・検査できます。主な情報源はGoogleの発表記事とモデルページです。
Gemini 3.8 Flashの概要
| 項目 | 値 |
|---|---|
| APIモデルID |
gemini-3.8-flash(安定版、プレビュー接尾辞なし) |
| リリース日 | 2026年9月2日 |
| ベース | Gemini 3.7 Flash(DeepMindモデルカードによる) |
| コンテキストウィンドウ | 入力1,048,576トークン |
| 最大出力 | 65,536トークン |
| 入力モダリティ | テキスト、画像、動画、音声、PDF |
| 出力モダリティ | テキストのみ |
| 思考レベル |
low、medium(デフォルト)、high。minimalはエラー |
| 導入価格(2026年12月31日まで) | 入力100万トークンあたり0.75ドル / 出力100万トークンあたり3.75ドル。思考トークンは出力として課金 |
| 標準価格(2027年1月1日より) | 入力100万トークンあたり1.50ドル / 出力100万トークンあたり7.50ドル |
| コンテキストキャッシング | キャッシュ済み100万トークンあたり0.075ドル(導入価格)、標準価格0.15ドル |
| バッチAPI | 50%オフ。導入価格は入力0.375ドル / 出力1.875ドル |
| 知識カットオフ | 2026年3月 |
| 開発者向け提供先 | Gemini API、Google AI Studio、Android Studio、Google Antigravity、Stitch、Gemini Enterprise |
| ユーザー向け提供先 | Geminiアプリ(AI ProおよびUltraサブスクライバー)、検索のAIモード、GoogleスプレッドシートのGemini |
| 3.7 Flash | 完全サポート継続。廃止予定なし |
実装時に注意すべき点は3つあります。
- デフォルトの思考レベルはGemini 3 Proの
highではなくmediumです。Pro向けに調整したプロンプトをそのまま使う場合、レベルを指定しなければ推論量が減る可能性があります。 -
minimalはlowへ自動変換されず、検証エラーになります。詳細は思考レベルガイドを参照してください。 - 知識カットオフは2026年3月ですが、モデルカードには一部ドメインの知識が2025年1月までに限定される場合があると記載されています。
Gemini 3.8 Flashとは
FlashはGoogleの主力層です。Proが最も難しい問題を処理する一方、Flashは大半のプロダクショントラフィックを担うことを想定しています。
Googleは3.8 Flashを「これまでで最もインテリジェントな主力モデル」と説明しています。一方、DeepMindモデルカードによると、新しいベースモデルではなく3.7 Flashをベースにした改良版です。つまり、3週間前にリリースされたモデルを、長期的なソフトウェアエンジニアリングとエージェント作業向けにチューニングした後継モデルと考えるのが適切です。
リリースの間隔と価格は次のとおりです。
- Gemini 3.6 Flash:2026年7月21日、入力1.50ドル / 出力7.50ドル
- Gemini 3.7 Flash:2026年8月13日、導入価格は入力0.75ドル / 出力3.75ドル
- Gemini 3.8 Flash:2026年9月2日、3.7 Flashと同じ導入価格
Googleは「6週間で3番目のFlashリリース」と表現していますが、Artificial Analysisは3.5 Flash-Liteも含め、4か月足らずで4番目のFlashモデルと数えています。3.7 Flashの新機能に関する記事が公開されてからまだ3週間ですが、すでに前世代モデルの説明になっています。
今回、Gemini 3.8 Pro、Gemini 4、新しいFlash-Liteは発表されていません。GoogleはProの次回アップデート時期も明言していません。
「より懸命に作業する」設計とコスト
Googleによると、複雑なタスクでGemini 3.8 Flashは次の処理を行います。
- 追加の推論ステップを実行する
- より小さな推論ステップに分解する
- 途中で自分の作業を検証する
- ツールを繰り返し呼び出す
そのため、Googleは「特に高い労力レベルでは、複雑なタスクが長く実行され、設計上より多くのトークンを使用する可能性がある」と説明しています。
Artificial Analysisの独立した報告では、Intelligence Indexの実行時に次の差が測定されました。
| 設定 | タスクあたりの費用 | タスクあたりの時間 |
|---|---|---|
Gemini 3.7 Flash high
|
0.40ドル | 2.2分 |
Gemini 3.8 Flash high
|
0.58ドル | 2.5分 |
Gemini 3.8 Flash medium
|
0.41ドル | — |
Gemini 3.8 Flash low
|
0.24ドル | 0.8分 |
3.8 Flash highは平均48,000出力トークンを使用し、3.7 Flashから30%増加しました。トークン単価は同じでも、タスク単位ではコストが上がります。
したがって、思考レベルはグローバル設定ではなくルーティングの判断として扱うべきです。
- 低レイテンシーのエンドポイント:
low - 一般的なエージェントループ:
medium - 完了率を優先する複雑なジョブ:
high
価格の内訳では、各レベルで1日1,000件のエージェントタスクを処理した場合の費用を確認できます。
速度自体は大きく変わっていません。GoogleのLogan Kilpatrickは「3.7と同じ価格で、ほぼ同じ速度」と説明しています。Artificial Analysisはhigh推論で毎秒302.1出力トークン、最初のトークンまで13.30秒を測定しました。この待ち時間はネットワーク遅延ではなく、モデルが回答前に推論している時間です。
ベンチマーク
GoogleはDeepMind Flashページで、次のベンチマーク結果を公開しています。
| ベンチマーク | 3.8 Flash | 3.7 Flash | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|---|---|---|---|
| Vals Finance Agent v2 | 61.4% | 59.0% | 58.6% | 53.8% | 54.4% | 53.9% |
| Harvey Legal Agent Benchmark | 10.0% | 8.8% | 6.7% | 2.5% | 0.8% | 5.0% |
| HLE-Verified | 54.9% | 53.6% | 54.4% | 54.5% | 51.1% | 31.0% |
3.7 Flashからの向上幅は、それぞれ2.4、1.2、1.3ポイントです。改善幅は控えめですが、金融・法務では、Flash価格帯の3.8 Flashが、トークン単価で数倍高いOpus 5やGPT-5.6 Solを上回っています。
前日にリリースされたClaude Fable 5.1は、このGoogleの表には含まれていません。3者比較では、公開されている近いモデルとしてAnthropicのOpus 5とSonnet 5を比較対象にしています。
Googleは、数値をテキストで示さず、さらに次の主張をしています。
- DeepSWE v1.1:3.8 Flashは「ごくわずかなコスト」で「ほとんどの大規模フロンティアモデルを上回る」。割合はモデルカードの画像テーブルにのみ掲載されており、3.7 Flashは65.3%。
- ドキュメント中心の長期ワークフロー:社内評価で、Gemini 3.7 Flashの3倍以上のタスクを完了。
- Gray Swanプロンプトインジェクション:数値なしで「大幅な飛躍」を主張。
- SWE-Bench Pro、Terminal-bench、OSWorld:3.8 Flashのテキスト形式の結果は未公開。
独立評価では、Artificial AnalysisのIntelligence Indexは次のとおりです。
- Gemini 3.8 Flash
high:59 - Gemini 3.7 Flash:56
- Gemini 3.6 Flash:52
- GPT-5.6 Sol
xhigh、Grok 4.6medium:59相当 - GPT-5.6 Terra
max、Claude Fable 5.1medium、Muse Spark 1.2xhigh:57
3.8 Flashは、GPT-5.6 Terra、Claude Fable 5.1、Muse Spark 1.2を上回っています。τ³-Bankingのツール利用評価では45%を記録し、3.7 Flashを12ポイント上回りました。3.8と3.7 Flashの比較では、ワークロード別のトークンコストとともに確認できます。
料金:トークン単価は同じ、タスク単位では高くなる
Googleの料金ページでは、3.8 Flashは3.6および3.7 Flashと同じ価格行に掲載されています。2027年1月1日には、3モデルとも価格が2倍になります。
| 項目 | 2026年12月31日まで | 2027年1月1日より |
|---|---|---|
| 入力 | 100万トークンあたり0.75ドル | 100万トークンあたり1.50ドル |
| 出力(思考を含む) | 100万トークンあたり3.75ドル | 100万トークンあたり7.50ドル |
| キャッシュ済み入力 | 100万トークンあたり0.075ドル | 100万トークンあたり0.15ドル |
| キャッシュストレージ | 100万トークン/時間あたり0.50ドル | 100万トークン/時間あたり1.00ドル |
| バッチ入力 / 出力 | 0.375ドル / 1.875ドル | 0.75ドル / 3.75ドル |
実装上の注意点は次の2つです。
- 思考トークンは出力トークンとして課金され、
usageMetadata.thoughtsTokenCountで別途報告されます。そのため、highで短い回答を返す場合でも、lowで長い回答を返す場合より高くなることがあります。 - Google検索グラウンディングは別料金です。Gemini 3.xモデル共通で月5,000回の無料枠があり、その後は1,000リクエストあたり14ドルです。
AI StudioとAPIには、レート制限付きの無料枠もあります。Googleは無料枠のデータを「製品改善のために使用する」と明記しています。モデルごとのレート制限はドキュメントではなくAI Studioに表示されます。
- Tier 1:請求アカウントをリンク
- Tier 2:100ドル使用後、3日で解除
- Tier 3:1,000ドル使用後、30日で解除
無料アクセスガイドでは無料枠の制限を、バッチAPIガイドでは待機可能なジョブの50%割引を解説しています。
APIの呼び出し方
Googleは現在、Gemini 3.xの主要なAPIとしてInteractions APIを扱っています。generateContentは「レガシー」とされていますが、完全サポートが継続され、廃止予定はありません。
最小限のInteractionsリクエストは次のとおりです。
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-[REDACTED CREDENTIAL] \
-H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'
複数ターンの会話ではprevious_interaction_idを渡し、サーバー側に状態を保持させます。
関数呼び出しではJSONスキーマでツールを宣言し、function_callステップを受け取った後、call_idとnameの両方を含むfunction_resultを返します。3.8 Flashではこの形式が必須です。従来のgenerateContentではフィールド名がidでした。
-
APIウォークスルー:RESTとPythonでInteractions APIと
generateContentを解説 - 関数呼び出しガイド:反復的なツールループとループ制限を解説
3.7 Flashからの移行チェックリスト
3.7 Flashからの変更は小さいものの、既存設定によってはエラーになります。
-
minimal思考は拒否される -
thinking_budgetはthinking_levelに変更 -
candidate_countは非対応 -
temperatureはデフォルトの1.0を推奨 -
temperatureを下げるとループや性能低下を招く可能性がある
詳細は3.7から3.8 Flashへの移行ガイドで、変更前後のJSONとともに確認できます。
Gemini 3.8 Flashでできないこと
モデルページで明示されている非対応機能は次のとおりです。
- 音声生成
- Live API
- 画像生成
- 画像セグメンテーション(Gemini 3モデル)
入力はテキスト、画像、動画、音声、PDFに対応していますが、出力はテキストのみです。リアルタイム音声や画像出力が必要な製品では、3.8 Flashは推論・ツール呼び出し層として利用し、別の生成コンポーネントを組み合わせる必要があります。
重い推論を必要としない安価で高スループットのテキスト処理には、Gemini 3.5 Flash-Liteも選択肢です。料金は入力0.30ドル / 出力2.50ドルです。
次の機能はサポートされています。
- 関数呼び出し
- 構造化出力
- コンテキストキャッシング
- コード実行
- Google検索およびGoogleマップのグラウンディング
- バッチAPI
- プレビュー版のコンピュータ利用
Gemini 3.8 Flash Cyber:ゲートアクセス型ツインモデル
Gemini 3.8 Flash Cyberも同日にリリースされましたが、一般ユーザーはサインアップできません。Fairwindプログラムを通じて、次の対象者にのみ提供されます。
- 信頼できる政府機関
- 重要インフラ事業者
- ソフトウェア保守者
身元調査やフィッシング耐性のあるMFAなどの要件があります。公開API、公開価格設定、セルフホスティングはありません。3.5 Flash Cyberの限定パイロット版を置き換えるモデルです。
Googleが報告した主な数値は次のとおりです。
- 20のプログラミング言語で、実際の脆弱性発見成功率が70%以上
- Chromeセキュリティチームの報告で、Chromeの脆弱性に対するより正確なパッチが、はるかに大規模な最高商用モデルより2.6倍多い
詳細はGemini 3.8 Flash Cyberの解説で、資格、義務、アクセスできないチームへの影響を確認できます。
ApidogでGemini 3.8 Flashをテストする
3.8 Flashはタスクあたりのトークン消費量が変わるため、テストではHTTP 200だけでなく、使用量も検証します。
Apidogでは、通常のAPIテストとして次のように設定できます。
-
GEMINI_API_KEYを環境変数として保存する - Interactions APIと
generateContentをエンドポイントとして登録する - HTTPステータス200をアサートする
- アプリケーションが使用するJSONフィールドを検証する
-
usageMetadata.thoughtsTokenCountに上限を設定する - 同じプロンプトを
low、medium、highで実行する
こうすると、Artificial Analysisの平均値ではなく、自分のプロンプトに対する思考レベル別のトークン分布を取得できます。
ストリーミング応答はSSEとしてレンダリングされます。includeThoughts: trueで思考の要約をデバッグする場合は、SSEテストガイドが役立ちます。
シナリオを毎日スケジュールし、請求書にトークン回帰が現れる前にアサーションを失敗させましょう。Apidogをダウンロードして、無料プランで設定できます。
よくある質問
Gemini 3.8 Flashは新モデルですか、それとも3.7 Flashのアップデートですか?
DeepMindのモデルカードによると、3.7 Flashをベースにしたチューニング済みの後継モデルです。価格、速度、コンテキストウィンドウは同じですが、難しいタスクではより多くの推論ステップとツール呼び出しを実行します。3.7 Flashも完全サポートが継続され、廃止予定はありません。
なぜ3.7 Flashより多くのトークンを使うのですか?
設計上、複雑なタスクで追加の推論と検証を行うためです。Googleは複雑なタスクでより多くのトークンを使う可能性を説明しており、Artificial Analysisは約30%多い出力トークンを測定しました。不要な推論を減らす場合は、thinking_levelをmediumまたはlowに設定してください。思考レベルガイドにレベル別の料金表があります。
コンテキストウィンドウはどれくらいですか?
入力1,048,576トークン、出力65,536トークンです。2026年12月31日までは、キャッシュ済み100万トークンあたり0.075ドルでコンテキストキャッシングを利用できます。
無料のGeminiアプリで利用できますか?
リリース情報では、Geminiアプリでの提供対象はGoogle AI ProおよびUltraサブスクライバーです。無料アプリ層は対象外です。開発者はAI StudioとAPIのレート制限付き無料枠を利用できます。
Claude Fable 5.1と比べてどうですか?
Artificial Analysisの評価は、Gemini 3.8 Flashが59、Claude Fable 5.1が57です。Claude Fable 5.1の料金は入力10ドル / 出力50ドル(100万トークンあたり)で、3.8 Flashの導入価格の約13倍です。ただし、タスクあたりのトークン消費量で比較すると差は縮まります。
次のステップ
Gemini 3.8 Flashは、より長く考える主力モデルです。エージェントベンチマークでは数ポイント、ツール利用評価では12ポイント向上しましたが、高推論時の出力トークンは約30%増えます。
用途別には次のように選択してください。
- 3.7 Flashでエージェントが限界に達している:3.8 Flashへ移行
- レイテンシーが重要なチャット:
thinking_level: "low"、または3.7 Flashを継続 - 完了率重視の自律型エージェント:
mediumまたはhigh - 待機可能な大量処理:バッチAPIを利用
まずはAPIウォークスルーを参照し、Apidogから最初のリクエストを送信してください。thoughtsTokenCountのアサーションを追加し、リリース記事ではなく実測値で各ルートの思考レベルを決定しましょう。

Top comments (0)