Gemini 3.8 Flashの料金:トークン単価は同じでも請求額が増える理由
Gemini 3.8 Flashの料金は、入力トークン100万個あたり0.75ドル、出力トークン100万個あたり3.75ドルです。これはGoogleが3.7 Flashに設定した導入時の料金と同じですが、2026年12月31日までの期間限定です。2027年1月1日には入力1.50ドル、出力7.50ドルへ倍増します。3.6 Flashと3.7 Flashにも同じ値上げが適用され、トークン単価そのものは今回のリリースで変更されていません。
変わったのは、モデルが消費するトークン数です。Googleによると、3.8 Flashはより多くの推論ステップを実行し、ツールを繰り返し呼び出すため、複雑で実行時間の長いタスクでは設計上より多くのトークンを使用します。
Artificial Analysisの測定では、ハイ思考レベルのインテリジェンスインデックス実行時、3.8 Flashはタスクあたり0.58ドル、3.7 Flashは0.40ドルでした。3.8 Flashではタスクあたりの出力トークンも約30%増加しています。定価が同じでも、実際の請求額は高くなります。
このガイドでは、Gemini APIの公式料金ページをもとに、思考レベル別のコスト、1日1,000タスクの試算、Flash-Lite、Claude Sonnet 5、GPT-5.6 Lunaとの比較、そしてApidogでのコスト回帰検出方法を解説します。
モデルの概要は、Gemini 3.8 Flashとは何かから確認できます。
Gemini 3.8 Flashの料金概要
以下は有料ティアにおける100万トークンあたりの料金です。
| 料金 | 導入料金 (2026年12月31日まで) |
通常料金 (2027年1月1日から) |
|---|---|---|
| 入力 (テキスト、画像、ビデオ、オーディオ、PDF) |
$0.75 | $1.50 |
| 出力 (思考トークンを含む) |
$3.75 | $7.50 |
| コンテキストキャッシュ読み取り | $0.075 | $0.15 |
| キャッシュストレージ (100万トークンあたり/時間) |
$0.50 | $1.00 |
| バッチAPI入力 (50%オフ) |
$0.375 | $0.75 |
| バッチAPI出力 (50%オフ) |
$1.875 | $3.75 |
| Google検索グラウンディング | Gemini 3.x全体で月間5,000リクエストまで無料、以降1,000リクエストあたり14ドル | 同じ |
| 無料ティア | 0ドル、レート制限あり。データはGoogle製品改善に使用 | 同じ |
特に重要なのは次の3点です。
- 出力料金には思考トークンも含まれるため、内部推論も1,000,000トークンあたり3.75ドルで課金されます。
- 導入料金には2026年12月31日という明確な終了日があります。
- 3.7 Flashと3.6 Flashも2027年1月1日に倍増するため、旧モデルへ移行しても値上げは回避できません。
3.7 Flashの料金内訳では、タスクあたりのトークン消費が少ないモデルにも同じ料金体系が適用されることを説明しています。
思考トークンは出力トークンとして課金される
Gemini 3.8 Flashは回答前に推論し、その推論トークンを出力として計上します。generateContentのレスポンスでは、次のように使用量が報告されます。
-
promptTokenCount: 入力トークン -
candidatesTokenCount: 可視の回答トークン -
thoughtsTokenCount: 思考トークン
candidatesTokenCountとthoughtsTokenCountは、どちらも出力トークンとして同じ3.75ドルで課金されます。
思考量はthinking_levelで制御します。
lowmediumhigh
3.8 Flashのデフォルトはmediumです。Gemini 3 Proのデフォルトであるhighとは異なります。minimalは廃止されており、指定すると検証エラーになるため、旧モデルから設定を移行する場合はlowへマッピングしてください。
Googleの思考に関するドキュメントでは、思考レベルをトークン予算ではなく相対的な努力量として説明しています。以前の整数型thinking_budgetのように、思考トークン数を直接上限設定することはできません。
レベルごとのレイテンシとコストは、3.8 Flashの思考レベルガイドも参照してください。
1リクエストの計算例
次の使用量を想定します。
- 入力: 10,000トークン
- 可視出力: 2,000トークン
- 思考: 6,000トークン
導入料金では、次のようになります。
- 入力:
10,000 × $0.75 / 1,000,000 = $0.0075 - 出力:
(2,000 + 6,000) × $3.75 / 1,000,000 = $0.03 - 合計: 1リクエストあたり$0.0375
思考トークンだけで出力料金の75%、リクエスト全体の60%を占めます。2027年1月1日以降は、同じリクエストが$0.015 + $0.06 = $0.075になります。
「3.7と同じ価格」という説明は、トークン単価については正しいものの、消費トークン数までは表していません。
タスクあたりのコストが上昇した理由
Googleの発表記事によると、3.8 Flashは複雑なタスクで追加の推論ステップを実行し、ツールを繰り返し呼び出して作業を検証します。
ステップ数が増えるほど、次のコストが増えます。
- 思考トークン
- エージェントループ内のツール呼び出しターン
- タスク全体の実行時間
Googleが示す対策は、thinking_levelを下げるか、3.7 Flashを使い続けることです。
Artificial Analysisは、9つの評価からなるインテリジェンスインデックスでこの差を測定しました。ハイ設定では、3.8 Flashが59点、3.7 Flashが56点でした。一方、3.8 Flashはタスクあたり平均約48,000個の出力トークンを使用し、3.7 Flashより約30%多くなっています。
| 構成 | タスクあたりのコスト (AA、導入料金) |
タスクあたりの時間 | 1,000タスク/日のコスト |
|---|---|---|---|
| Gemini 3.8 Flash、ハイ | $0.58 | 2.5分 | $580 |
| Gemini 3.8 Flash、ミディアム | $0.41 | 未公開 | $410 |
| Gemini 3.8 Flash、ロー | $0.24 | 0.8分 | $240 |
| Gemini 3.7 Flash、ハイ | $0.40 | 2.2分 | $400 |
3.8 Flashのハイ設定は、3.7 Flashよりインデックスが3点高い一方、タスクあたりのコストは45%高くなります($0.58 / $0.40 = 1.45)。
3.8 Flash内で比較すると、ハイから下げた場合の削減幅は次のとおりです。
- ミディアム: 29%削減(
$0.41 / $0.58 = 0.71) - ロー: 59%削減(
$0.24 / $0.58 = 0.41)
ミディアムは、3.7 Flashのハイ設定とほぼ同じコストです。アップグレード判断の基準として使えます。詳しいワークロード別の比較は、3.8 Flashと3.7 Flashの比較をご覧ください。
Artificial Analysisは、入力と出力の比率が3:1の場合、100万トークンあたり0.58ドルのブレンド価格も示しています。これはトークン単価の話であり、タスクあたりのコストはモデルが実際に消費するトークン数で決まります。
12月31日までにできるコスト対策
導入料金を「確保する」といっても、2027年の利用分を2026年の価格で前払いできるわけではありません。Googleはトークンが消費された時点の料金で請求します。
実行できる対策は、裁量的な処理を導入料金期間中に前倒しすることです。
1. バッチ処理を前倒しする
バックフィルや一度限りのドキュメント処理は、今すぐバッチAPIで実行します。
1億トークンを、入力7,500万、出力2,500万に分ける場合の費用は次のとおりです。
- 2026年中のバッチ料金:
75 × $0.375 + 25 × $1.875 = $74.99 - 2027年1月以降: $149.98
2. 評価セットとトークンベースラインを作る
値上げ前に評価セットとベースラインを構築しておくと、1月以降に請求額が変動した原因をトークン使用量と料金変更に分離できます。
3. ルートごとに思考レベルを決める
mediumのまま放置されたルートは、コスト最適化されていないルートです。lowで品質評価に合格するルートは、1月までにlowへ変更しましょう。
プロバイダー間の価格比較には、最も安価なLLM APIプロバイダーのまとめを利用できます。Fable 5.1とGPT-5.6 Solの比較では、プレミアムティアを比較しています。
Flash-Lite、Sonnet 5、GPT-5.6 Lunaとの比較
100万トークンあたりの料金を比較します。
| モデル | 入力 | 出力 | 備考 |
|---|---|---|---|
| Gemini 3.8 Flash (導入料金) |
$0.75 | $3.75 | 思考は出力として課金。キャッシュ読み取り$0.075 |
| Gemini 3.8 Flash (1月1日以降) |
$1.50 | $7.50 | キャッシュ読み取り$0.15 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 約350トークン/秒 |
| Claude Sonnet 5 | $2 | $10 | 恒久的。9月1日の値上げは中止 |
| GPT-5.6 Luna | $1 | $6 |
導入料金では、3.8 FlashはFlash-Liteと比べて入力が2.5倍、出力が1.5倍です。
Sonnet 5と比較すると、3.8 Flashは次のとおり安価です。
- 入力:
$0.75対$2 - 出力:
$3.75対$10 - いずれも約2.7倍安価
Lunaと比較しても、3.1.50、出力$7.50になります。Lunaよりも入力・出力の両方で高くなり、Sonnet 5との差も約1.3倍まで縮まります($2 / $1.50、$10 / $7.50)。
Flash-Liteは常に安価です。導入料金が選択理由なら、1月に再評価する予定を今すぐ設定してください。
トークン単価だけでは判断できません。回答あたりのトークン消費が少ないモデルは、単価が高くてもタスクあたりのコストが低くなる可能性があります。候補モデルへ同じタスクセットを実行し、使用量カウントを比較するのが確実です。
3.8 Flash APIガイドでは、Interactions APIと従来のgenerateContentの両方でusageMetadataを読み取る方法を解説しています。
Apidogのトークンアサーションでコスト回帰を検出する
3.8 Flashで注意すべき失敗は、回答内容の誤りだけではありません。プロンプトや思考レベルを変更した結果、トークン使用量が静かに40%増え、請求書が届くまで気づけないケースもあります。
Apidogでは、トークン数をステータスコードと同じようにアサーション対象のフィールドとして扱えます。
1. APIキーを環境変数に保存する
Apidog環境にGEMINI_API_KEYを作成し、x-goog-api-keyヘッダーで{{GEMINI_API_KEY}}として参照します。キーをリクエスト本体に直接保存せずに済みます。
2. ゴールデンプロンプトを送信する
本番ルートごとに、代表的なプロンプトと明示的なthinkingConfig.thinkingLevelを設定したPOSTリクエストを保存します。
エンドポイント:
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
3. 使用量フィールドをアサートする
usageMetadataを読み取り、ベースラインから設定した上限を超えた場合にテストを失敗させるポストプロセッサースクリプトを追加します。
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
4. スケジュール実行する
リクエストをテストシナリオに追加してスケジュール実行します。トークン使用量の急増を、同日のテスト失敗として検出できます。
設定方法は、ApidogでのAPIテストのスケジュール設定ガイドを参照してください。
2027年1月1日に2つの料金定数を更新すれば、コストアサーションで請求額を継続的に追跡できます。
同じシナリオをプロバイダー比較テストにも利用できます。リクエストをFlash-Lite、Sonnet 5、Lunaへコピーし、使用量フィールドを並べて比較しましょう。
Apidogをダウンロードして、最初のシナリオを構築できます。無料プランでこのワークフローをカバーできます。
FAQ
Gemini 3.8 Flashは3.7 Flashより高価ですか?
トークン単価は同じです。両モデルとも12月31日までは入力$0.75、出力$3.75、その後は入力$1.50、出力$7.50です。
タスクあたりでは高くなる可能性があります。Artificial Analysisによると、3.8 Flashは3.7 Flashより約30%多くの出力トークンを生成し、ハイ設定のインデックスタスクでは3.8 Flashが$0.58、3.7 Flashが$0.40でした。
思考トークンは個別に請求されますか?
いいえ。思考トークンは導入料金で100万トークンあたり$3.75の出力トークンとして請求され、usageMetadata.thoughtsTokenCountに表示されます。thinking_levelで間接的に制御します。
3.8 Flashには厳密なトークン予算がなく、minimalはエラーになります。
Gemini 3.8 Flashに無料ティアはありますか?
はい。AI Studioの無料ティアでは入出力ともに料金はかかりません。ただしレート制限があり、Googleは無料ティアのデータを製品改善に使用します。
一般消費者向けGeminiアプリでは、AI ProおよびUltra加入者のみに3.8 Flashが提供されます。詳細は無料利用ガイドをご覧ください。
2027年1月1日以降、コストはどうなりますか?
入力、出力、キャッシュ読み取り、キャッシュストレージ、バッチ料金がすべて2倍になります。タスクあたりのトークン使用量が変わらなければ、請求額も2倍です。3.6 Flashと3.7 Flashも同日に値上げされます。
どの思考レベルが最もコストを抑えられますか?
Artificial Analysisの評価結果では、インデックスタスクあたりのコストは次のとおりです。
- ロー: $0.24
- ミディアム: $0.41
- ハイ: $0.58
各レベルで独自の評価を実行し、品質要件を満たす最も低いレベルを採用してください。さらにトークン数をアサートすると、設定変更によるコスト増を検出できます。
今週やるべきこと
Gemini 3.8 Flashは3.7 Flashと同じトークン単価ですが、より大きなモデルのようにトークンを消費します。
今週は次の順で対応しましょう。
- 本番ルートごとに
thinking_levelを決める。 - 各ルートのトークン使用量をベースライン化する。
- Apidogで思考・出力トークンとリクエストコストをアサートする。
- バッチ処理に適した作業を12月31日までに前倒しする。
- 2027年1月の料金で再評価する予定を設定する。
思考レベルをモデル設定ではなくコスト設定として扱うことが、料金倍増とトークン消費増に備える最短ルートです。

Top comments (0)