Gemini 3.8 Flashには、low、medium、highの3つの思考レベルがあります。これは回答生成前の内部推論の深さを制御し、レイテンシー、出力トークン数、請求額に影響します。3.8 Flashは複雑なタスクで「より懸命に働く」よう設計されているため、3.7 Flashよりレベル選択が重要です。初めて使う場合は、Gemini 3.8 Flashの概要でローンチの背景を確認できます。この記事では設定方法に集中します。
最初に注意すべき点は2つです。3.8 Flashのデフォルトはhighではなくmediumです。Gemini 3 Proのデフォルトがhighであるため、混同しやすい点です。また、Gemini 3.7 Flash向けのminimalは3.8 Flashでは受け付けられません。トークンが生成される前にリクエスト検証が失敗します。詳細はGoogleのWhat’s new in Gemini 3.8 Flashを参照してください。
この記事では、各レベルの特徴、コスト、2種類のAPIでの設定方法、ルート別の戦略、デプロイ前に差分を測定する再現可能なテスト方法を説明します。
思考レベルの概要
| レベル | Googleの推奨事項 | タスクあたりのコスト (AA) | タスクあたりの時間 (AA) | 利用すべき状況 |
|---|---|---|---|---|
low |
レイテンシーとコストを最小化。シンプルな指示、チャット、高スループットのルート | $0.24 | 0.8 min | ユーザー待ちの処理、文字起こし検索、分類 |
medium(デフォルト) |
複雑なコードやエージェント的な作業の標準設定 | $0.41 | テキストでは未公開 | ほとんどのルート、一般的な動画Q&A |
high |
最も困難な多段階問題に対する最大の推論深度 | $0.58 | 2.5 min | 高密度な視覚的Q&A、60分以上の動画、後続処理を左右する計画ステップ |
minimal |
3.8 Flashでは未サポート | n/a | n/a | 使用せず、lowへマッピング |
コストと時間は、Googleの導入価格で各レベルのIntelligence Indexを実行したArtificial Analysisの平均値です。Google公式の数値ではなく、ユーザーのプロンプトでもありません。比率の目安として使い、最終的には自分のルートで測定してください。
各レベルの特徴
3.8 Flashの応答には、可視化されない思考トークンが含まれる場合があります。思考トークンは出力トークンとして課金され、APIではusageMetadata.thoughtsTokenCountとして報告されます。導入価格は2026年12月31日まで出力100万トークンあたり3.75ドル、2027年1月1日からは7.50ドルです。
-
low: 思考を短く抑え、最初のトークンを速く返します。チャット、単純な指示、高スループットのエンドポイント向けです。 -
medium: レイテンシー、コスト、品質のバランスが取れたデフォルトです。複雑なコードやエージェントタスクに適しています。 -
high: 最も深い推論を行います。困難な多段階問題に限定して使うのが基本です。
3.8 Flashは、複雑なタスクで追加の推論ステップやツール呼び出しを実行し、途中で処理を検証するよう設計されています。Googleは、長時間かかる複雑なタスクではより多くのトークンを使えること、特に高い努力レベルではパフォーマンス最大化のためにトークン使用量が増える可能性を説明しています。
つまり、思考レベルはこの挙動のスロットルです。トークン使用量が多い場合、Googleの最初の提案はレベルを下げること、次の提案は引き続き完全サポートされている3.7 Flashを使うことです。
thinking_levelは予算ではない
thinking_levelは列挙型であり、トークン予算ではありません。以前の整数値フィールドthinking_budgetはGemini 3で廃止されているため、「最大2,000思考トークン」のようには指定できません。レベルを選び、実際のプロンプトでコストと品質を測定する必要があります。
デフォルトはhighではなくmedium
thinking_levelを省略すると、3.8 Flashはmediumで動作します。
Gemini 3 Proでプロトタイプを作成したチームは、デフォルトがhighだと想定して、意図せず中程度の推論深度を使う可能性があります。また、3.7 Flashへの移行時にthinking_budgetを削除しただけで、代わりのレベルを設定しなかった場合、チャットルートを含むすべての処理がmediumになります。
解決策は、すべてのリクエストでルートごとにthinking_levelを明示することです。コードに埋め込むのではなく設定ファイルで管理すると、Googleがデフォルトを変更してもコストプロファイルを維持できます。
minimal廃止によるエラーを修正する
minimalはGemini 3.7 Flashでは動作しましたが、3.8 Flashでサポートされる値はlow、medium、highだけです。モデルページにもこの3つだけが記載されています。
REST APIでは、モデル実行前に次のような400 INVALID_ARGUMENTが返ります。
Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.
SDKはこのエラーを独自の例外でラップするため、メッセージ文字列ではなく、HTTP 400またはINVALID_ARGUMENTコードで判定してください。
Before:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
After:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
Googleの移行ガイダンスでは、minimalをlowへ直接マッピングします。
次の設定は避けてください。
- より小さい下限を得るために
thinking_budgetを使う - モデルを「落ち着かせる」ために
temperatureを下げる
Gemini 3ではthinking_budgetはサポートされていません。また、GoogleはすべてのGemini 3モデルでtemperatureをデフォルトの1.0に保つよう推奨しています。値を下げるとループや出力品質の劣化につながる可能性があります。
思考シグネチャや関数応答のcall_id要件を含むチェックリストは、3.7から3.8 Flashへの移行ガイドにまとめられています。
このエラーは検証時に発生するため、各レベルのテストにminimalのガードケースを追加すれば、設定が誤って戻ったことを無料で検出できます。
タスクあたりのコスト
思考レベルによってトークン単価は変わりません。Googleの料金ページによると、導入価格は入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドルです。2027年1月1日には、それぞれ1.50ドルと7.50ドルへ倍増します。
レベル間の差は主に生成トークン数です。
| モデルとレベル | タスクあたりのコスト | タスクあたりの時間 |
|---|---|---|
Gemini 3.8 Flash low
|
$0.24 | 0.8 min |
Gemini 3.8 Flash medium
|
$0.41 | テキストでは未公開 |
Gemini 3.8 Flash high
|
$0.58 | 2.5 min |
Gemini 3.7 Flash high
|
$0.40 | 2.2 min |
出典: Artificial Analysis。Intelligence Indexを導入価格で実行した結果です。
この表から、次の3点が分かります。
-
lowはhighの約41%のコストで、実測時間は約3分の1です。このモデルで使える最大の単一レバーと言えます。 -
3.8 Flashの
mediumは、3.7 Flashのhighとほぼ同じコストです(0.41ドル対0.40ドル)。3.7 Flashのhighで問題なかった場合、3.8 Flashではmediumが近い予算ラインになります。 -
3.8 Flashの
highは、3.7 Flashのhighよりタスクあたり45%高コストです。トークン単価は同じでも、3.8 Flashが平均約48kトークン、約30%多く出力するためです。
これが「より懸命に働く」という設計が請求額に現れる部分です。追加トークンに価値があるかはワークロード次第です。3.8 Flashと3.7 Flashの比較では、品質向上が現れるタスクを詳しく説明しています。
品質については注意が必要です。Artificial AnalysisのIntelligence Indexスコア59はhighで実行された値です。mediumとlowのインデックススコアは公開されていないため、品質がコストに比例すると仮定しないでください。ルートのレベルを下げる前に、各レベルで独自の評価を実行しましょう。
1日1,000タスクのコスト例と12月31日の料金変更については、Gemini 3.8 Flashの料金設定を参照してください。
Interactions APIでthinking_levelを設定する
Interactions APIは、Gemini 3.x向けのGoogleの主要インターフェースです。generation_config内にスネークケースで指定します。
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Pythonでは次のように設定します。
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Explain HTTP caching in 3 sentences.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
これはリクエスト単位のフィールドです。previous_interaction_idを使うフォローアップを含め、すべての呼び出しで設定してください。
応答は思考やツール呼び出しなどの実行ステップのリストとして返され、最後にmodel_outputが含まれます。SDKでは最終テキストをoutput_textから取得できます。マルチターン状態やストリーミングを含む完全な例は、Gemini 3.8 Flash APIの使用方法を参照してください。
レガシーなgenerateContentで設定する
既存のGeminiコードの多くは、まだgenerateContentを使っています。GoogleはこれをレガシーAPIとしていますが、廃止予定日はなく、完全にサポートされています。急いで移行する必要はありません。
このAPIでは、フィールドが1階層深く、キャメルケースになります。
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' -X POST \
-d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Python:
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Explain HTTP caching in 3 sentences.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: trueを指定すると、thought: trueとしてマークされた部分が応答に追加されます。レベル調整中は便利ですが、運用時にはノイズになる可能性があります。
監視すべき数値はusageMetadata.thoughtsTokenCountです。これは出力として課金される思考トークンの正確なカウントです。
ルートごとの戦略
思考レベルはグローバル設定ではなく、ルーティングの一部として管理しましょう。
-
チャット、オートコンプリート、人が待つ処理:
low最初のトークンレイテンシーを優先します。 -
分類、抽出、文字起こし検索:
low独自評価で精度が維持されることを確認してください。Googleの動画例でも文字起こし検索にはlowを使っています。 -
コーディングエージェント、ツールループ:
medium後続処理を左右する計画ステップだけhighへ上げ、その後はmediumに戻します。ループ全体でhighを使うとコストが急増します。 -
ドキュメント中心の長期ワークフロー:
highインタラクティブでなければ、Batch APIで50%オフにして処理できます。 -
動画:
高密度な視覚的Q&Aや60分以上の動画は
high、一般的な動画Q&Aはmedium、文字起こし検索はlowです。
3.8 Flashのlowでも過剰な場合は、Flash-Liteラインを検討してください。Gemini 3.1 Flash-Liteガイドではトレードオフを説明しています。Gemini 3.5 Flash-Liteは現在、入力100万トークンあたり0.30ドル、出力100万トークンあたり2.50ドルです。
レベルはルートごとの設定として保持し、gemini-3.7-flashはフィーチャーフラグの背後に置いてください。アップグレード後にトークン数が増えても、デプロイなしでレベルやモデルを切り替えられます。
Apidogで3つのレベルを並行テストする
Artificial Analysisの表から比率は分かりますが、実際のコストとレイテンシーは自分のプロンプトで測定する必要があります。以下では、1つのゴールデンプロンプトをすべてのレベルで実行し、結果を検証します。
Apidogを使えば、Interactions APIとレガシーAPIのどちらでもテストできます。ここではusageMetadataがトップレベルにあるレガシーエンドポイントを例にします。
APIキーを環境変数に保存する
Apidog環境にGEMINI_API_KEYを作成し、x-goog-api-keyヘッダーから{{GEMINI_API_KEY}}として参照します。さらにTHINKING_LEVELを追加します。リクエストを1つ保存する
/v1beta/models/gemini-3.8-flash:generateContentへPOSTし、ゴールデンプロンプトと次の設定を指定します。
"thinkingConfig": {
"thinkingLevel": "{{THINKING_LEVEL}}"
}
3ステップのテストシナリオを作る
同じリクエストを3回インポートし、各ステップでTHINKING_LEVELをlow、medium、highに上書きします。変動するフィールドを検証する
各ステップで、ステータスが200であること、usageMetadata.thoughtsTokenCountが存在することを確認します。
lowでは、思考トークン数と応答時間が許容上限を下回ることを検証します。最初の実行をベースラインにしてください。ポストプロセッサースクリプトで各ステップのカウントを変数に保存し、highがlow以上の推論を行ったことも検証できます。順序が逆転した場合は、モデルまたはデフォルト設定の変更を疑います。minimalのガードステップを追加する
thinkingLevel: "minimal"を送信し、ステータスが200以外になることを検証します。モデルIDを変更した際、新しいモデルでもminimalが拒否されるか確認できます。毎日スケジュールする
設定の退行やサイレントな挙動変更を、予期しない請求ではなく、失敗したテストとして検出します。設定方法はApidogでAPIテストをスケジュールする方法を参照してください。
ストリーミング応答でも、SSEレンダリングを使って同じシナリオを実行できます。SSE経由でストリーミングするLLM APIをテストする方法で設定を確認できます。Apidogをダウンロードして、シナリオ全体を無料で試すこともできます。
よくある質問(FAQ)
思考レベルによってトークン単価は変わりますか?
いいえ。3.8 Flashでは、レベルに関係なく、導入価格で入力は100万トークンあたり0.75ドル、出力は3.75ドルです。レベルは思考として生成される出力トークン数を変えるだけで、思考トークンは出力価格で課金されます。料金の内訳では、キャッシュ、バッチ、1月1日の値上げについて説明しています。
正確な思考トークン予算を設定できますか?
Gemini 3ではできません。thinking_budgetはthinking_level列挙型に置き換えられ、3.8 Flashはlow、medium、highのみを受け入れます。上限が必要な場合は、リクエスト内ではなく、テストとアラートで強制してください。
Artificial Analysisのスコア59はどのレベルで測定されていますか?
highです。AAはIntelligence Indexをhighで実行し、lowとmediumのコストと時間も公開しています。ただし、これらのレベルのインデックススコアは公開していません。独自評価を行うまでは、低いレベルはこのベンチマークで未検証として扱ってください。
思考を減らすためにtemperatureを下げるべきですか?
いいえ。GoogleはすべてのGemini 3モデルでtemperatureをデフォルトの1.0に保つよう推奨しています。値を下げるとループや出力品質の劣化が起きる可能性があります。推論の深さはthinking_levelで制御してください。
lowでも遅すぎる、または高すぎる場合はどうすればよいですか?
廃止予定日なしで完全サポートされているGemini 3.7 Flashにとどまるか、そのルートをFlash-Liteモデルへ移行してください。3.8と3.7 Flashの比較では、追加トークンが測定可能な品質向上につながるケースを説明しています。
ルートごとに選択し、測定する
Gemini 3.8 Flashには3つの思考レベルがあり、デフォルトでは以前のモデルより多く推論する可能性があります。
実運用では次のルールを徹底してください。
- すべてのルートで
thinking_levelを明示する - 残っている
minimalをlowへマッピングする -
usageMetadata.thoughtsTokenCountを監視する - 各レベルで品質、レイテンシー、コストを評価する
- Apidogの3ステップシナリオを定期実行する
AAのタスクあたりの数値(0.24ドル、0.41ドル、0.58ドル)は傾向を示す参考値です。12月31日の料金変更で影響が大きくなる前に、自分のワークロードで実測値を取得しておきましょう。
Top comments (0)