Googleは、3.6 Flashの3週間後となる2026年8月13日にGemini 3.7 Flashを出荷し、これを「最もインテリジェントな主力モデル」と呼んでいます。APIコストを管理するなら、注目すべきはベンチマークではなく料金表です。導入価格は100万入力トークンあたり0.75ドル、100万出力トークンあたり3.75ドルですが、この価格は2026年12月31日で終了します。2027年1月1日から、入力・出力ともに料金は2倍になります。
つまり、このモデルで構築するすべての継続ワークロードは、コード・トラフィック・プロンプトを変更しなくてもコストが2倍になります。現在月額790ドルのチャットボットは、2027年1月には月額1,575ドルになります。3.7 Flashプロジェクトの予算では、表示中の導入価格だけでなく、標準価格も含めて見積もってください。
この記事では、2つの料金体系、3種類の実運用ワークロードのトークン計算、価格比較、そして料金が2倍になる前に実施できるコスト削減策を解説します。まだ最初のリクエストを送信していない場合は、Gemini 3.7 Flash APIクイックスタートを参照してください。リクエスト送信後は、Apidogで各レスポンスのusageMetadataトークン数を確認できるため、以下の見積もりを実トラフィックと比較できます。
要点
- 導入料金は、100万入力トークンあたり0.75ドル、100万出力トークンあたり3.75ドルです。2026年12月31日まで有効です。
- 2027年1月1日以降の標準料金は、入力1.50ドル、出力7.50ドルです。どちらもちょうど2倍になります。
- 導入価格は、Gemini 3.6 Flashのリリース時価格の半額です。
- Gemini 3.7 Flashは、1Mトークンのコンテキストウィンドウ、64kトークンの出力上限を持ち、テキスト・画像・動画・音声・PDF入力を受け付けます。
- 1日10,000リクエストのチャットボットは、導入料金で約26ドル/日、標準料金で52.50ドル/日です。
- 主な削減策は、コンテキストキャッシュ、出力上限、バッチ処理、小規模モデルへのルーティングです。
2つの料金体系
Gemini 3.7 Flashは恒久価格ではなく、期間限定の割引価格でリリースされました。
| 料金体系 | 期間 | 入力(100万トークンあたり) | 出力(100万トークンあたり) |
|---|---|---|---|
| 導入 | 2026年8月13日〜2026年12月31日 | $0.75 | $3.75 |
| 標準 | 2027年1月1日以降 | $1.50 | $7.50 |
実装・予算の観点では、次の2点が重要です。
導入料金はGemini 3.6 Flashリリース時の半額です。
3.6 Flashからアップグレードする場合は、3.6から3.7 Flashへの移行ガイドで差分を確認してください。導入価格の削減分で、回帰テスト費用をカバーできる可能性があります。出力トークンは入力トークンの5倍の単価です。
冗長なシステムプロンプトを減らすことも有効ですが、コスト削減効果が大きいのは出力の制限です。特に、デフォルトの出力上限を放置しないことが重要です。
上記はAI Studioキー経由で請求されるGemini APIの料金です。Vertex AIはGoogle CloudのSKU経由で請求され、コンテキストキャッシュやバッチ処理にも別項目があります。予算確定前に公式料金ページで最新価格を確認してください。
実際のワークロードにかかる費用
100万トークンあたりの単価だけでは、月額コストは判断できません。以下の式で、自分のトラフィックに置き換えて計算してください。
入力コスト = 入力トークン数 / 1,000,000 × 入力単価
出力コスト = 出力トークン数 / 1,000,000 × 出力単価
総コスト = 入力コスト + 出力コスト
ワークロード1:カスタマーサポートチャットボット
前提:
- 1日あたり10,000リクエスト
- 1リクエストあたり入力2,000トークン
- 1リクエストあたり出力300トークン
| 項目 | 1日のトークン数 | 導入時の1日あたり費用 | 標準時の1日あたり費用 |
|---|---|---|---|
| 入力 | 20M | $15.00 | $30.00 |
| 出力 | 3M | $11.25 | $22.50 |
| 合計 | 23M | $26.25 | $52.50 |
30日間では、導入料金で約788ドル/月、標準料金で1,575ドル/月です。
実装時は、会話履歴を無制限に渡さないでください。履歴ウィンドウを固定し、maxOutputTokensもサポート回答に必要な値へ制限します。
{
"generationConfig": {
"maxOutputTokens": 500
}
}
ワークロード2:PDFドキュメントパイプライン
Gemini 3.7 FlashはPDFをネイティブに読み取れます。GDP.pdfのベンチマークは3.6 Flashの22.0%から34.0%へ向上しており、ドキュメント抽出は想定ユースケースの1つです。
前提:
- 1日あたり500ドキュメント
- 1ドキュメントあたり入力40,000トークン
- 1ドキュメントあたり出力1,000トークン
| 項目 | 1日のトークン数 | 導入時の1日あたり費用 | 標準時の1日あたり費用 |
|---|---|---|---|
| 入力 | 20M | $15.00 | $30.00 |
| 出力 | 0.5M | $1.88 | $3.75 |
| 合計 | 20.5M | $16.88 | $33.75 |
月額では、導入料金で約506ドル、標準料金で約1,013ドルです。
このワークロードは入力がコストの大半を占めます。対策の優先順位は次のとおりです。
- 繰り返し使用する指示・分類ルールをキャッシュする
- 緊急性のない処理はバッチ化する
- 必要な抽出項目だけを指定して、出力を短く保つ
ワークロード3:エージェントループ
エージェントは、モデル呼び出し回数とコンテキスト長が同時に増えやすいため、コストを過小評価しがちです。
前提:
- 1日あたり200タスク
- 1タスクあたり12回のモデル呼び出し
- 1呼び出しあたり入力8,000トークン
- 1呼び出しあたり出力400トークン
| 項目 | 1日のトークン数 | 導入時の1日あたり費用 | 標準時の1日あたり費用 |
|---|---|---|---|
| 入力 | 19.2M | $14.40 | $28.80 |
| 出力 | 0.96M | $3.60 | $7.20 |
| 合計 | 20.16M | $18.00 | $36.00 |
月額では、導入料金で540ドル、標準料金で1,080ドルです。
エージェントでは、呼び出し回数だけでなく、各ステップで再送信するコンテキストを測定してください。12回の呼び出しが20回へ増えると、追加コストは約67%になります。
また、64kトークンの最大出力は、1回あたりの最悪ケースを導入料金で約0.24ドル、標準料金で約0.48ドルに制限します。ただし、最大出力でリトライするループはすぐに高額化するため、リトライ回数と出力上限を必ず設定してください。
3.7 Flashの価格比較
プロバイダー間のトークン単価は短期間で変わるため、固定の価格表ではなくポジショニングとして判断してください。
Gemini 3.7 Flashは主力層のモデルです。Gemini Pro、Claudeの大規模モデル、OpenAIのフラッグシップ層のようなフロンティアモデルより低価格でありながら、DeepSWE v1.1で65.3%、WebDev Arena Eloで1588と、近年のフラッグシップモデルに近いベンチマーク性能を示しています。
導入割引期間は、実際のワークロードで3.7 Flashが十分かを検証する期間として使うのが実用的です。
また、API価格は下がるとは限りません。DeepSeekの値上げについては、DeepSeekの価格値上げとコスト最適化ガイドで解説しています。Geminiの場合は、値上げの日付と金額がすでに公開されています。
プロトタイプで数ドル使うだけなら、導入期間後にコストが2倍になっても影響は限定的です。一方、月額10,000ドルの継続パイプラインは20,000ドルになる可能性があります。継続トラフィックは、標準料金で採算が合うかを先に確認してください。
トークン消費を削減する5つの方法
1. エンドポイントごとに出力トークンを制限する
generationConfig.maxOutputTokensを、エンドポイントごとに必要な最小値へ設定します。
{
"generationConfig": {
"maxOutputTokens": 500
}
}
サポート返信が500トークン以内で足りるなら、64kの上限を許可する理由はありません。出力トークンは入力の5倍の単価なので、最も効果の大きい最適化です。
2. 静的コンテキストをキャッシュする
毎回同じシステムプロンプト、ポリシー文書、製品仕様を送っている場合、同じ入力トークンに繰り返し課金されます。
たとえば、3,000トークンの静的プレフィックスを毎リクエストに含めるチャットボットでは、キャッシュの効果が大きくなります。Gemini APIドキュメントで、現在のキャッシュ設定と料金を確認してください。
3. 非対話処理をバッチ化する
ドキュメント要約や夜間集計のように即時応答が不要な処理は、バッチ処理へ移します。
- リアルタイム性が必要な処理: 通常リクエスト
- 数分〜数時間待てる処理: バッチ処理
この切り分けにより、遅延と引き換えにコストを削減できます。
4. ルートごとにモデルを使い分ける
すべてのリクエストで3.7 Flashを使う必要はありません。
| 処理 | 推奨方針 |
|---|---|
| 分類・ルーティング | Flash-Lite層などの軽量モデルを検討 |
| 短いフィールド抽出 | 軽量モデルを検討 |
| 複雑な計画・デバッグ | Gemini 3.7 Flash |
| ツール呼び出しを伴う複数ステップ処理 | Gemini 3.7 Flash |
ルーティング判定を先に入れるだけでも、主力モデルへのトラフィックを減らせます。
5. フリーティアでプロンプトを固める
AI Studioの無料クォータを使い、プロンプト・出力スキーマ・失敗時の挙動を先に検証します。無料のGemini APIアクセスガイドでは、無料利用の範囲と制限を説明しています。
本番で有料トークンを消費する前に、少なくとも以下を確認してください。
- 必要な出力形式が安定しているか
-
maxOutputTokensが適切か - プロンプトが不要な長文を含んでいないか
- リトライ時に同一コンテキストを再送していないか
Apidogでエンドポイントごとの費用を追跡する
見積もりは予算作成に役立ちますが、予算超過を防ぐにはリクエスト単位の計測が必要です。Geminiレスポンスには、入力・出力トークン数を含むusageMetadataが含まれます。
代表的なレスポンスでは、次の値を確認します。
{
"usageMetadata": {
"promptTokenCount": 2000,
"candidatesTokenCount": 300
}
}
Apidogでは、次の手順でトークン回帰をテストできます。
本番エンドポイントごとにリクエストをコレクションへ保存します。
例: チャット、ドキュメント要約、エージェントステップ。APIキーを
GEMINI_API_KEY環境変数へ設定します。実際に近いペイロードでリクエストを実行し、
usageMetadata.promptTokenCountとusageMetadata.candidatesTokenCountを取得します。トークン数に対するアサーションを追加します。
たとえば、チャットエンドポイントの入力が2,500トークンを超えたら失敗させます。プロンプト、レスポンススキーマ、ツール定義を変更するたびにテストを再実行します。
たとえば、次のような基準を運用ルールとして設定できます。
chat.promptTokenCount <= 2500
chat.candidatesTokenCount <= 500
summary.candidatesTokenCount <= 1200
agent_step.promptTokenCount <= 10000
トークン数もレイテンシと同様に回帰します。違いは、トークン回帰が請求書として現れる点です。アサーションベースのAPIテストの構築方法は、QAエンジニア向けAPIテストガイドも参照してください。
FAQ
Gemini 3.7 Flashの価格はいつ2倍になりますか?
2027年1月1日です。100万入力トークンあたり0.75ドル、100万出力トークンあたり3.75ドルの導入料金は2026年12月31日まで適用され、その後は標準料金である入力1.50ドル、出力7.50ドルへ移行します。
Gemini 3.7 FlashはGemini 3.6 Flashよりも安いですか?
リリース時点では安価です。3.7 Flashの導入価格は、3.6 Flashのリリース価格の半額です。ベンチマークも向上しており、DeepSWE v1.1は49.0%から65.3%へ上昇しています。
仕様とベンチマークは、Gemini 3.7 Flashクイックリファレンスで確認できます。
Vertex AIにも導入価格は適用されますか?
この記事の料金は、AI Studioキー経由で請求されるGemini APIの料金です。Vertex AIはGoogle CloudのSKUおよびエンタープライズ条項を通じて請求されます。Vertex AIで本番トラフィックを運用している場合は、GCP課金コンソールと公式料金ページの最新値を確認してください。
入力トークンの請求対象となるものは何ですか?
送信するすべての入力が対象です。
- テキスト
- 画像
- 動画
- 音声
- PDFページ
長いドキュメントやメディアを含むリクエストでは、入力コストが大きくなります。実際のカウントは、各レスポンスのusageMetadataで確認してください。
リクエストを送信する前にトークンを推定するにはどうすればよいですか?
APIのcountTokensエンドポイントを使うと、生成を実行せずにペイロードのトークン数を測定できます。
また、代表的なリクエストを実行し、レスポンスのusageMetadataを確認する方法も有効です。トークナイズの挙動はモデルファミリーごとに異なるため、他プロバイダーのトークナイザーによる推測ではなく、実ペイロードで測定してください。
3.7 Flashをスタックに組み込む方法
Gemini 3.7 Flashの導入価格は、高性能な主力モデルとしては低価格です。ただし、その価格が終了する日付も明示されています。
実装上の推奨手順は次のとおりです。
- 導入期間中に主力トラフィックで3.7 Flashを評価する
- エンドポイント単位で入力・出力トークンを測定する
- 出力上限、キャッシュ、バッチ処理を適用する
- 軽量モデルへ移せるルートを切り分ける
- 標準料金を使って2027年1月以降の月額を再計算する
Apidogをダウンロードして、Geminiリクエスト、環境変数、トークンアサーション、コストチェックを1つのワークスペースで管理しましょう。2027年1月の請求額を予期しない結果ではなく、事前に測定・予測した数値にできます。
Top comments (0)