DEV Community

Cover image for ジェミニ 3.8 フラッシュ 思考レベル比較:低・中・高、ミニマル廃止の理由
Akira
Akira

Posted on Originally published at apidog.com

ジェミニ 3.8 フラッシュ 思考レベル比較:低・中・高、ミニマル廃止の理由

Gemini 3.8 Flashには、low、medium、highの3つの思考レベルがあります。これは回答生成前の内部推論の深さを制御し、レイテンシー、出力トークン数、請求額に影響します。3.8 Flashは複雑なタスクで「より懸命に働く」よう設計されているため、3.7 Flashよりレベル選択が重要です。初めて使う場合は、Gemini 3.8 Flashの概要でローンチの背景を確認できます。この記事では設定方法に集中します。

Apidogを今すぐ試す

最初に注意すべき点は2つです。3.8 Flashのデフォルトはhighではなくmediumです。Gemini 3 Proのデフォルトがhighであるため、混同しやすい点です。また、Gemini 3.7 Flash向けのminimalは3.8 Flashでは受け付けられません。トークンが生成される前にリクエスト検証が失敗します。詳細はGoogleのWhat’s new in Gemini 3.8 Flashを参照してください。

この記事では、各レベルの特徴、コスト、2種類のAPIでの設定方法、ルート別の戦略、デプロイ前に差分を測定する再現可能なテスト方法を説明します。

思考レベルの概要

レベル Googleの推奨事項 タスクあたりのコスト (AA) タスクあたりの時間 (AA) 利用すべき状況
low レイテンシーとコストを最小化。シンプルな指示、チャット、高スループットのルート $0.24 0.8 min ユーザー待ちの処理、文字起こし検索、分類
medium(デフォルト) 複雑なコードやエージェント的な作業の標準設定 $0.41 テキストでは未公開 ほとんどのルート、一般的な動画Q&A
high 最も困難な多段階問題に対する最大の推論深度 $0.58 2.5 min 高密度な視覚的Q&A、60分以上の動画、後続処理を左右する計画ステップ
minimal 3.8 Flashでは未サポート n/a n/a 使用せず、lowへマッピング

コストと時間は、Googleの導入価格で各レベルのIntelligence Indexを実行したArtificial Analysisの平均値です。Google公式の数値ではなく、ユーザーのプロンプトでもありません。比率の目安として使い、最終的には自分のルートで測定してください。

各レベルの特徴

3.8 Flashの応答には、可視化されない思考トークンが含まれる場合があります。思考トークンは出力トークンとして課金され、APIではusageMetadata.thoughtsTokenCountとして報告されます。導入価格は2026年12月31日まで出力100万トークンあたり3.75ドル、2027年1月1日からは7.50ドルです。

  • low: 思考を短く抑え、最初のトークンを速く返します。チャット、単純な指示、高スループットのエンドポイント向けです。
  • medium: レイテンシー、コスト、品質のバランスが取れたデフォルトです。複雑なコードやエージェントタスクに適しています。
  • high: 最も深い推論を行います。困難な多段階問題に限定して使うのが基本です。

3.8 Flashは、複雑なタスクで追加の推論ステップやツール呼び出しを実行し、途中で処理を検証するよう設計されています。Googleは、長時間かかる複雑なタスクではより多くのトークンを使えること、特に高い努力レベルではパフォーマンス最大化のためにトークン使用量が増える可能性を説明しています。

つまり、思考レベルはこの挙動のスロットルです。トークン使用量が多い場合、Googleの最初の提案はレベルを下げること、次の提案は引き続き完全サポートされている3.7 Flashを使うことです。

thinking_levelは予算ではない

thinking_levelは列挙型であり、トークン予算ではありません。以前の整数値フィールドthinking_budgetはGemini 3で廃止されているため、「最大2,000思考トークン」のようには指定できません。レベルを選び、実際のプロンプトでコストと品質を測定する必要があります。

デフォルトはhighではなくmedium

thinking_levelを省略すると、3.8 Flashはmediumで動作します。

Gemini 3 Proでプロトタイプを作成したチームは、デフォルトがhighだと想定して、意図せず中程度の推論深度を使う可能性があります。また、3.7 Flashへの移行時にthinking_budgetを削除しただけで、代わりのレベルを設定しなかった場合、チャットルートを含むすべての処理がmediumになります。

解決策は、すべてのリクエストでルートごとにthinking_levelを明示することです。コードに埋め込むのではなく設定ファイルで管理すると、Googleがデフォルトを変更してもコストプロファイルを維持できます。

minimal廃止によるエラーを修正する

minimalはGemini 3.7 Flashでは動作しましたが、3.8 Flashでサポートされる値はlow、medium、highだけです。モデルページにもこの3つだけが記載されています。

REST APIでは、モデル実行前に次のような400 INVALID_ARGUMENTが返ります。

Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.

SDKはこのエラーを独自の例外でラップするため、メッセージ文字列ではなく、HTTP 400またはINVALID_ARGUMENTコードで判定してください。

Before:

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "minimal" }
}
Enter fullscreen mode Exit fullscreen mode

After:

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "low" }
}
Enter fullscreen mode Exit fullscreen mode

Googleの移行ガイダンスでは、minimalをlowへ直接マッピングします。

次の設定は避けてください。

  • より小さい下限を得るためにthinking_budgetを使う
  • モデルを「落ち着かせる」ためにtemperatureを下げる

Gemini 3ではthinking_budgetはサポートされていません。また、GoogleはすべてのGemini 3モデルでtemperatureをデフォルトの1.0に保つよう推奨しています。値を下げるとループや出力品質の劣化につながる可能性があります。

思考シグネチャや関数応答のcall_id要件を含むチェックリストは、3.7から3.8 Flashへの移行ガイドにまとめられています。

このエラーは検証時に発生するため、各レベルのテストにminimalのガードケースを追加すれば、設定が誤って戻ったことを無料で検出できます。

タスクあたりのコスト

思考レベルによってトークン単価は変わりません。Googleの料金ページによると、導入価格は入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドルです。2027年1月1日には、それぞれ1.50ドルと7.50ドルへ倍増します。

レベル間の差は主に生成トークン数です。

モデルとレベル タスクあたりのコスト タスクあたりの時間
Gemini 3.8 Flash low $0.24 0.8 min
Gemini 3.8 Flash medium $0.41 テキストでは未公開
Gemini 3.8 Flash high $0.58 2.5 min
Gemini 3.7 Flash high $0.40 2.2 min

出典: Artificial Analysis。Intelligence Indexを導入価格で実行した結果です。

この表から、次の3点が分かります。

  1. lowはhighの約41%のコストで、実測時間は約3分の1です。このモデルで使える最大の単一レバーと言えます。
  2. 3.8 Flashのmediumは、3.7 Flashのhighとほぼ同じコストです(0.41ドル対0.40ドル)。3.7 Flashのhighで問題なかった場合、3.8 Flashではmediumが近い予算ラインになります。
  3. 3.8 Flashのhighは、3.7 Flashのhighよりタスクあたり45%高コストです。トークン単価は同じでも、3.8 Flashが平均約48kトークン、約30%多く出力するためです。

これが「より懸命に働く」という設計が請求額に現れる部分です。追加トークンに価値があるかはワークロード次第です。3.8 Flashと3.7 Flashの比較では、品質向上が現れるタスクを詳しく説明しています。

品質については注意が必要です。Artificial AnalysisのIntelligence Indexスコア59はhighで実行された値です。mediumとlowのインデックススコアは公開されていないため、品質がコストに比例すると仮定しないでください。ルートのレベルを下げる前に、各レベルで独自の評価を実行しましょう。

1日1,000タスクのコスト例と12月31日の料金変更については、Gemini 3.8 Flashの料金設定を参照してください。

Interactions APIでthinking_levelを設定する

Interactions APIは、Gemini 3.x向けのGoogleの主要インターフェースです。generation_config内にスネークケースで指定します。

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Enter fullscreen mode Exit fullscreen mode

Pythonでは次のように設定します。

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Explain HTTP caching in 3 sentences.",
    generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

これはリクエスト単位のフィールドです。previous_interaction_idを使うフォローアップを含め、すべての呼び出しで設定してください。

応答は思考やツール呼び出しなどの実行ステップのリストとして返され、最後にmodel_outputが含まれます。SDKでは最終テキストをoutput_textから取得できます。マルチターン状態やストリーミングを含む完全な例は、Gemini 3.8 Flash APIの使用方法を参照してください。

レガシーなgenerateContentで設定する

既存のGeminiコードの多くは、まだgenerateContentを使っています。GoogleはこれをレガシーAPIとしていますが、廃止予定日はなく、完全にサポートされています。急いで移行する必要はありません。

このAPIでは、フィールドが1階層深く、キャメルケースになります。

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' -X POST \
  -d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Enter fullscreen mode Exit fullscreen mode

Python:

from google.genai import types

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Explain HTTP caching in 3 sentences.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)
print(response.usage_metadata.thoughts_token_count)
Enter fullscreen mode Exit fullscreen mode

includeThoughts: trueを指定すると、thought: trueとしてマークされた部分が応答に追加されます。レベル調整中は便利ですが、運用時にはノイズになる可能性があります。

監視すべき数値はusageMetadata.thoughtsTokenCountです。これは出力として課金される思考トークンの正確なカウントです。

ルートごとの戦略

思考レベルはグローバル設定ではなく、ルーティングの一部として管理しましょう。

  • チャット、オートコンプリート、人が待つ処理: low 最初のトークンレイテンシーを優先します。
  • 分類、抽出、文字起こし検索: low 独自評価で精度が維持されることを確認してください。Googleの動画例でも文字起こし検索にはlowを使っています。
  • コーディングエージェント、ツールループ: medium 後続処理を左右する計画ステップだけhighへ上げ、その後はmediumに戻します。ループ全体でhighを使うとコストが急増します。
  • ドキュメント中心の長期ワークフロー: high インタラクティブでなければ、Batch APIで50%オフにして処理できます。
  • 動画: 高密度な視覚的Q&Aや60分以上の動画はhigh、一般的な動画Q&Aはmedium、文字起こし検索はlowです。

3.8 Flashのlowでも過剰な場合は、Flash-Liteラインを検討してください。Gemini 3.1 Flash-Liteガイドではトレードオフを説明しています。Gemini 3.5 Flash-Liteは現在、入力100万トークンあたり0.30ドル、出力100万トークンあたり2.50ドルです。

レベルはルートごとの設定として保持し、gemini-3.7-flashはフィーチャーフラグの背後に置いてください。アップグレード後にトークン数が増えても、デプロイなしでレベルやモデルを切り替えられます。

Apidogで3つのレベルを並行テストする

Artificial Analysisの表から比率は分かりますが、実際のコストとレイテンシーは自分のプロンプトで測定する必要があります。以下では、1つのゴールデンプロンプトをすべてのレベルで実行し、結果を検証します。

Apidogを使えば、Interactions APIとレガシーAPIのどちらでもテストできます。ここではusageMetadataがトップレベルにあるレガシーエンドポイントを例にします。

  1. APIキーを環境変数に保存する

    Apidog環境にGEMINI_API_KEYを作成し、x-goog-api-keyヘッダーから{{GEMINI_API_KEY}}として参照します。さらにTHINKING_LEVELを追加します。

  2. リクエストを1つ保存する

    /v1beta/models/gemini-3.8-flash:generateContentへPOSTし、ゴールデンプロンプトと次の設定を指定します。

   "thinkingConfig": {
     "thinkingLevel": "{{THINKING_LEVEL}}"
   }
Enter fullscreen mode Exit fullscreen mode
  1. 3ステップのテストシナリオを作る

    同じリクエストを3回インポートし、各ステップでTHINKING_LEVELをlow、medium、highに上書きします。

  2. 変動するフィールドを検証する

    各ステップで、ステータスが200であること、usageMetadata.thoughtsTokenCountが存在することを確認します。

    lowでは、思考トークン数と応答時間が許容上限を下回ることを検証します。最初の実行をベースラインにしてください。ポストプロセッサースクリプトで各ステップのカウントを変数に保存し、highがlow以上の推論を行ったことも検証できます。順序が逆転した場合は、モデルまたはデフォルト設定の変更を疑います。

  3. minimalのガードステップを追加する

    thinkingLevel: "minimal"を送信し、ステータスが200以外になることを検証します。モデルIDを変更した際、新しいモデルでもminimalが拒否されるか確認できます。

  4. 毎日スケジュールする

    設定の退行やサイレントな挙動変更を、予期しない請求ではなく、失敗したテストとして検出します。設定方法はApidogでAPIテストをスケジュールする方法を参照してください。

ストリーミング応答でも、SSEレンダリングを使って同じシナリオを実行できます。SSE経由でストリーミングするLLM APIをテストする方法で設定を確認できます。Apidogをダウンロードして、シナリオ全体を無料で試すこともできます。

よくある質問(FAQ)

思考レベルによってトークン単価は変わりますか?

いいえ。3.8 Flashでは、レベルに関係なく、導入価格で入力は100万トークンあたり0.75ドル、出力は3.75ドルです。レベルは思考として生成される出力トークン数を変えるだけで、思考トークンは出力価格で課金されます。料金の内訳では、キャッシュ、バッチ、1月1日の値上げについて説明しています。

正確な思考トークン予算を設定できますか?

Gemini 3ではできません。thinking_budgetはthinking_level列挙型に置き換えられ、3.8 Flashはlow、medium、highのみを受け入れます。上限が必要な場合は、リクエスト内ではなく、テストとアラートで強制してください。

Artificial Analysisのスコア59はどのレベルで測定されていますか?

highです。AAはIntelligence Indexをhighで実行し、lowとmediumのコストと時間も公開しています。ただし、これらのレベルのインデックススコアは公開していません。独自評価を行うまでは、低いレベルはこのベンチマークで未検証として扱ってください。

思考を減らすためにtemperatureを下げるべきですか?

いいえ。GoogleはすべてのGemini 3モデルでtemperatureをデフォルトの1.0に保つよう推奨しています。値を下げるとループや出力品質の劣化が起きる可能性があります。推論の深さはthinking_levelで制御してください。

lowでも遅すぎる、または高すぎる場合はどうすればよいですか?

廃止予定日なしで完全サポートされているGemini 3.7 Flashにとどまるか、そのルートをFlash-Liteモデルへ移行してください。3.8と3.7 Flashの比較では、追加トークンが測定可能な品質向上につながるケースを説明しています。

ルートごとに選択し、測定する

Gemini 3.8 Flashには3つの思考レベルがあり、デフォルトでは以前のモデルより多く推論する可能性があります。

実運用では次のルールを徹底してください。

  • すべてのルートでthinking_levelを明示する
  • 残っているminimalをlowへマッピングする
  • usageMetadata.thoughtsTokenCountを監視する
  • 各レベルで品質、レイテンシー、コストを評価する
  • Apidogの3ステップシナリオを定期実行する

AAのタスクあたりの数値(0.24ドル、0.41ドル、0.58ドル)は傾向を示す参考値です。12月31日の料金変更で影響が大きくなる前に、自分のワークロードで実測値を取得しておきましょう。

Top comments (0)