DEV Community

Cover image for Gemini 3.5 Flash-Liteと3.6 Flash 比較:使うべきはどっち?
Akira
Akira

Posted on • Originally published at apidog.com

Gemini 3.5 Flash-Liteと3.6 Flash 比較:使うべきはどっち?

まず結論からお伝えします。コストと速度を最優先し、大量のシンプルなタスクを実行する場合は、Gemini 3.5 Flash-Liteを選びましょう。分類、抽出、短いチャット返信、RAG応答、オートコンプリートなどが該当します。一方、請求額よりも品質を重視する場合は、Gemini 3.6 Flashを選んでください。多段階エージェント、ツール利用、コーディング、コンピューター利用、誤った結果が高くつく応答などが該当します。

今すぐApidogを試す

両モデルは、2026年7月21日にGoogleのFlash-tier刷新とともにリリースされました。どちらも最大100万入力トークンを受け入れます。同じトレードオフ曲線上にある別々の選択肢なので、「どちらが優れているか」ではなく、実装するタスクにどちらが適しているかで選ぶべきです。

なお、命名には少し分かりにくい点があります。主力モデルは3.6へ更新されましたが、Liteティアは3.5のままです。そのため、本記事では3.5モデルと3.6モデルを比較します。これは誤記ではなく、Googleの意図したバージョン体系です。

簡単な答え

数百万回実行するシンプルなタスクには、デフォルトでFlash-Liteを使います。

推論、ツール利用、コード編集が必要なタスクでは、すぐにGemini 3.6 Flashへ切り替えてください。

迷う場合は、次のルールで始めると実装しやすくなります。

  1. まずFlash-Liteで実装する
  2. 実際のプロンプトと評価データで品質を確認する
  3. 失敗率や再試行率が高い呼び出しだけを3.6 Flashへ昇格する
  4. タスク単位でルーティングを分ける

アプリケーション全体で単一モデルに統一する必要はほとんどありません。

価格と速度の比較

属性 Gemini 3.5 Flash-Lite Gemini 3.6 Flash
モデルID gemini-3.5-flash-lite gemini-3.6-flash
入力価格 100万トークンあたり$0.30 100万トークンあたり$1.50
出力価格 100万トークンあたり$2.50 100万トークンあたり$7.50
スループット 約350出力トークン/秒 個別には公開されていません
コンテキストウィンドウ 100万トークン 100万トークン
無料枠 あり(レート制限あり) あり(レート制限あり)

Flash-Liteは、入力・出力ともに低コストです。入力は5分の1、出力は3分の1のコストで済みます。

GoogleはFlash-Liteのスループットを約350出力トークン/秒と公表しています。チャットボックスやオートコンプリートのように、低レイテンシがUXに直結する用途に適しています。

Googleは3.6 Flashの個別の秒間トークン数を公開していません。ただし、3.6 Flashは置き換え対象の3.5 Flashより約17%少ない出力トークンで生成するため、多段階の作業では表示価格だけでは測れない効率が期待できます。

最新の料金は、Gemini API料金ページおよびGemini 3.6 Flash料金詳細で確認してください。

品質とベンチマーク

価格差は、難しいタスクにおける品質差にも表れます。

エージェント型のターミナル作業を測定するTerminal-Bench 2.1では、Flash-Liteは54点、3.6 Flashは78.0点を獲得しました。この24点差は、多段階かつツール駆動のタスクでは3.6 Flashが明確に強いことを示しています。

Geminiモデルのベンチマーク比較

3.6 Flashは、実際のブラウザやデスクトップを操作するコンピューター利用ベンチマーク、OSWorld-Verifiedで83.0点を記録しました。Flash-Liteはこのスキルを対象としていません。

ワークロードに以下が含まれる場合は、3.6 Flashを選ぶべきです。

  • ブラウザ上のクリックやフォーム入力
  • デスクトップアプリケーションの操作
  • 複数ツールをまたぐワークフロー
  • 状態を確認しながら分岐する操作

コーディングでは、3.6 FlashはSWE-Bench Proで58.7%、DeepSWE v1.1で49%を記録しています。スタックトレースの解析、複数ファイルの編集、プルリクエスト作成のようなエージェント型コーディングは、3.6 Flash向けの領域です。

一方、Flash-Liteも弱いモデルではありません。Terminal-Bench 2.1では、以前のLite世代の31点から54点へ向上しています。分岐が少ないタスクに対し、高速かつ低コストで十分な推論能力を提供するよう調整されています。

GoogleのFlashモデルページ発表でも、両モデルは「量向け」と「深さ向け」の選択肢として位置付けられています。

どのタスクにどのモデルを使うか

まずは次の対応表を初期ルールとして使い、自分の評価データに基づいて調整してください。

タスク 最適なモデル
大量の分類または抽出 Flash-Lite
チャットアシスタントと短い返信 Flash-Lite
取得済みコンテキストからのRAG回答 Flash-Lite
オートコンプリート形式の低遅延UX Flash-Lite
検索規模のリクエストパイプライン Flash-Lite
多段階エージェント 3.6 Flash
ツール利用と関数呼び出しチェーン 3.6 Flash
コーディングとコードレビュー 3.6 Flash
コンピューター利用(ブラウザまたはデスクトップ) 3.6 Flash
エラーのコストが高い重要な回答 3.6 Flash

実装時の判断基準は単純です。

  • タスクが限定的で、呼び出し量が大きい: Flash-Lite
  • タスクが分岐し、失敗コストが高い: 3.6 Flash

たとえば、1日に1,000万件のサポートチケットへカテゴリタグを付与する処理はFlash-Lite向きです。

一方で、スタックトレースを読み込み、3つのファイルを修正し、プルリクエストを作成するエージェントは3.6 Flash向きです。

Flash-Liteではなく旧3.5 Flashとの比較が必要な場合は、Gemini 3.6 Flashと3.5 Flashの比較も参照してください。

同じワークロードにおけるコスト比較

たとえば、1日のジョブで以下を処理するとします。

  • 入力: 1,000万トークン
  • 出力: 200万トークン

これは、バッチ要約や抽出パイプラインでよくある構成です。

モデル 入力(1,000万) 出力(200万) 1日あたりの合計
Flash-Lite $3.00 $5.00 $8.00
3.6 Flash $15.00 $15.00 $30.00

この条件では、3.6 FlashはFlash-Liteの3.75倍のコストです。

  • Flash-Lite: 1日あたり$8.00、月あたり約$240
  • 3.6 Flash: 1日あたり$30.00、月あたり約$900

ただし、コスト差は固定ではありません。

Flash-Liteは入力で5倍、出力で3倍安価なので、実際の差はトラフィック形態に応じて3倍から5倍の間になります。

  • 入力負荷が高い処理: 5倍差に近づく 例: 長いRAGコンテキスト、大規模ドキュメント、分類バッチ
  • 出力負荷が高い処理: 3倍差に近づく 例: 長文生成、詳細な説明文の生成

判断すべき問いは、「3.6 Flashで実行できるか」だけではありません。

自分のトラフィック量で、呼び出しごとに3倍から4倍多く支払う価値が品質向上に見合うか?

検索規模のパイプラインでは、多くの場合はFlash-Liteで十分です。コードを編集したりチケットを起票したりするエージェントでは、3.6 Flashの品質差にコストを払う価値があります。

Apidogで両モデルをA/Bテストする方法

どのティアで十分かを推測する必要はありません。Gemini APIはRESTエンドポイントとして利用できるため、同一プロンプトを両モデルへ送信し、応答を直接比較できます。

Apidogを使うと、リクエスト、環境変数、アサーションをまとめて管理できます。

ApidogでのAPIリクエスト比較

以下の手順で、比較可能なテストを作成してください。

  1. Gemini APIエンドポイント向けのPOSTリクエストを作成します。
  2. APIキーはApidogの環境変数に保存します。リクエスト本文やバージョン管理システムにキーを残さないようにします。
  3. モデルIDをgemini-3.5-flash-liteに設定して送信します。
  4. 応答本文、レイテンシ、出力トークン数を記録します。
  5. リクエストを複製し、モデルIDだけをgemini-3.6-flashへ変更します。
  6. プロンプト、温度、出力形式、その他のパラメーターは同一に保ちます。
  7. 品質、レイテンシ、期待するJSON形式への適合を比較します。

モデル以外の条件を揃えることが重要です。これにより、モデル差だけを評価できます。

さらに、以下のようなアサーションを追加すると、「十分な品質」を自動チェックできます。

  • ステータスコードが200である
  • 必須JSONフィールドが存在する
  • 回答に必要なキーワードが含まれる
  • 出力が指定したスキーマに一致する
  • レイテンシが許容値以内である

リクエストを保存すれば、比較を繰り返し可能な回帰テストにできます。ApidogでAPIテストをスケジュールし、同じプロンプトを定期的に再実行してください。

これにより、Googleによるモデル更新後に品質やレイテンシが変化した場合も検出できます。

Apidogはリクエスト送信とアサーション確認を支援しますが、モデル自体を実行するわけではなく、どちらの回答がより適切かを自動判定するものでもありません。最終的な品質基準は、実際のユースケースに基づいて定義してください。

始めるには、Apidogをダウンロードし、同じGeminiエンドポイントに対する2つのリクエストを作成します。

よくある質問

Flash-Liteは3.6 Flashの単なる劣化版ですか?

いいえ。コスト、品質、速度のトレードオフ曲線上で異なる位置にあります。

Flash-Liteは難しい推論における上限は低い一方、低コストかつ高速です。3.6 Flashはより高コストですが、より強い推論能力を持ちます。

シンプルで大量のタスクでは、Flash-Liteの安さと速さが最適な選択になることが多いです。

なぜ一方が3.5で、もう一方が3.6なのですか?

バージョン管理が混在しているためです。

今回の刷新でGoogleは主要なFlashモデルを3.6へ移行しましたが、Liteティアは3.5のままでした。同じリリースには3.5 Flash Cyberセキュリティモデルも含まれていました。

同じファミリーですが、バージョン番号は異なります。Flash-Liteの3.5を「古い」「見捨てられた」と解釈しないでください。

同じコンテキストウィンドウを共有していますか?

はい。両方とも最大100万入力トークンを受け入れます。

長いコンテキストを使うこと自体は、どちらか一方を選ぶ決定打にはなりません。推論品質、価格、速度で選択してください。

1つのアプリで両方を使用できますか?

はい。それが推奨されるパターンです。

安価でシンプルかつ大量の呼び出しはFlash-Liteにルーティングし、難しい呼び出しだけを3.6 Flashへエスカレーションします。API形式は同一なので、基本的にはモデルIDを変更するだけで切り替えられます。

無料で試せますか?

両モデルともGoogle AI Studioの無料枠を利用できます。ただし、レート制限があります。

Googleは無料枠のデータを製品改善に使用する可能性があります。検証には便利ですが、機密情報を送信する前に利用規約を確認してください。

結論

大規模で、安価かつ高速なシンプルな処理にはFlash-Liteをデフォルトとして使いましょう。

難しい、多段階、分岐の多い、またはコード量の多い呼び出しは3.6 Flashへ昇格させます。Terminal-Bench 2.1での24点差は、エージェント型タスクでは3倍から4倍の価格差を正当化できる品質差です。

抽象的な比較だけで決めず、実際のプロンプトを両モデルに送信してください。品質、レイテンシ、コストを測定し、評価結果に基づいてルーティングを決めるのが最も確実です。

Apidogを使えば、この比較は2つのリクエストから始められます。

Top comments (0)