Gemini 3.6 Flashは、Googleの新しい主力ミドルティアモデルです。2026年7月21日に一般提供が開始され、Gemini 3.5 Flashよりも低コストで、出力トークン効率も向上しています。大量のAPIトラフィックを処理しながら、最上位モデルの料金を避けつつ安定した品質を求める用途に適しています。
このガイドでは、Gemini 3.6 Flashの仕様、3.5 Flashからの変更点、料金、ベンチマーク、APIでの呼び出し方を整理します。さらに、保存したAPIテストでレスポンス・レイテンシー・スキーマを継続検証する手順も紹介します。
Gemini 3.6 Flashとは?
Gemini 3.6 Flashは、Geminiファミリーのミドルティア高性能モデルです。要約、情報抽出、分類、チャット、多段階のツール呼び出しといった、プロダクションで頻出する処理向けに調整されています。
1回のリクエストで次の入力を扱えます。
- テキスト
- 画像
- 動画
- 音声
出力はテキストのみです。
Googleは2026年7月21日に、以下の3モデルを公開しました。
- Gemini 3.6 Flash: 日常的なプロダクション処理向けの主力ミドルティアモデル
- Gemini 3.5 Flash-Lite: 大量処理向けの低コスト・高速モデル
- Gemini 3.5 Flash Cyber: 政府機関および信頼できるパートナー向けのゲート型セキュリティモデル
Flash-Liteの詳細はGemini 3.5 Flash-Liteとは何か、Flash CyberについてはGemini 3.5 Flash Cyberとは何かを参照してください。
モデル選択時は、バージョン番号を混同しないことが重要です。
gemini-3.6-flash
gemini-3.5-flash-lite
これらは別ティアのモデルです。gemini-3.5-flash-liteはgemini-3.6-flashの誤記ではありません。
Googleの発表はGoogleブログ、モデルカードはDeepMind Flashのページで確認できます。
Gemini 3.5 Flashからの変更点
Gemini 3.6 Flashへ移行する際に確認すべき変更点は、主に次の3つです。
1. 出力トークン効率の改善
Googleによると、Gemini 3.6 Flashは同じ処理を完了するために、3.5 Flashより約17%少ない出力トークンを使用します。
出力トークンは料金とストリーミング時間に強く影響します。したがって、同じ品質で出力が短くなるなら、次の両方を改善できます。
- APIコスト
- 応答レイテンシー
2. 出力料金の引き下げ
出力100万トークンあたりの料金は、3.5 Flashの9.00ドルから3.6 Flashでは7.50ドルに下がりました。
| モデル | 出力100万トークンあたりの料金 |
|---|---|
| Gemini 3.5 Flash | 9.00ドル |
| Gemini 3.6 Flash | 7.50ドル |
トークン効率の改善と単価の低下を合わせると、タスク単位の実コストは表示価格以上に下がる可能性があります。
3. エージェント処理の効率化
Gemini 3.6 Flashは、コーディング、コンピューター操作、多段階ワークフローにも対応します。少ない推論ステップとツール呼び出しで完了できれば、エージェント実行時のコストと待機時間を抑えられます。
既存トラフィックの移行判断には、Gemini 3.6 Flashと3.5 Flashの比較も参照してください。
Gemini 3.6 Flashの仕様
| 属性 | Gemini 3.6 Flash |
|---|---|
| モデルID | gemini-3.6-flash |
| 入力コンテキストウィンドウ | 100万トークン |
| 最大出力 | 64kトークン |
| 入力モダリティ | テキスト、画像、動画、音声、PDF |
| 出力 | テキストのみ |
| 入力価格 | 100万トークンあたり1.50ドル |
| 出力価格 | 100万トークンあたり7.50ドル(思考トークンを含む) |
| 無料枠 | Google AI Studio経由で利用可能(レート制限あり) |
| リリース日 | 2026年7月21日 |
実装時は、特に次の上限を考慮してください。
- 入力100万トークン: 大規模な文書群、長い会議文字起こし、コードベースを1リクエストで渡せます。
- 最大出力64kトークン: 長大な生成結果が必要な場合は、ジョブを複数リクエストへ分割します。
たとえば、長文レポートを生成する場合は、章単位で生成・検証・結合する設計にすると、出力上限への到達を避けやすくなります。
パフォーマンス
ベンチマークは実運用の保証ではありません。導入前には、自分のプロンプト、データ、コンテキスト長で評価してください。
Googleが報告した公開ベンチマークの主なスコアは以下のとおりです。
| 領域 | ベンチマーク | スコア |
|---|---|---|
| コーディング | SWE-Bench Pro | 58.7% |
| ソフトウェア工学 | DeepSWE v1.1 | 49% |
| ターミナル操作 | Terminal-bench 2.1 | 78.0% |
| コンピューター操作 | OSWorld-Verified | 83.0% |
| 総合的な専門タスク | GDPVal-AA v2 Elo | 1421 |
OSWorld-Verifiedでは、Gemini 3.5 Flashの78.4%からGemini 3.6 Flashでは83.0%へ向上しています。GUIを介してアプリケーションを操作するエージェントを構築する場合は、実環境に近いワークフローで再現テストを実施してください。
長いコンテキストでは注意も必要です。
- 128kトークンの検索: 平均91.8%
- 100万トークンに近いポイントワイズ検索: 54.0%
大量の入力を渡せることと、コンテキスト全域で完全に検索・想起できることは別です。長文検索を実装する場合は、次のような評価セットを用意します。
- 正解情報を文書の先頭・中央・末尾に配置する
- コンテキスト長を段階的に増やす
- 正解率、応答時間、出力トークン数を記録する
- 必要に応じてチャンク分割や検索前処理を導入する
価格概要
Gemini 3.6 Flashの標準料金は以下のとおりです。
| 項目 | 料金 |
|---|---|
| 入力 | 100万トークンあたり1.50ドル |
| 出力 | 100万トークンあたり7.50ドル |
| コンテキストキャッシュ | 100万トークンあたり0.15ドル |
| キャッシュストレージ | 100万トークン・1時間あたり1.00ドル |
出力料金には思考トークンが含まれます。最終レスポンスに表示されない推論処理も課金対象になるため、コスト監視ではレスポンス本文の文字数だけで判断しないでください。
Google AI Studioには無料枠があります。ただし、レート制限があり、Googleが製品改善のために無料枠のデータを使用する可能性があるため、主にプロトタイプ向けです。
- 無料利用の手順: Gemini 3.6 Flashを無料で利用する方法
- 料金計算の例: Gemini 3.6 Flashの料金設定
- 公式料金: Gemini API料金ページ
Gemini 3.6 Flashへのアクセス方法
Gemini 3.6 Flashには複数のアクセス経路があります。
Gemini API / Google AI Studio
Google AI StudioでAPIキーを取得し、RESTクライアントまたはSDKからgemini-3.6-flashを呼び出します。Google Antigravity
Googleのエージェント開発プラットフォームで利用できます。Gemini Enterprise Agent Platform
管理された業務エージェントを構築するチーム向けです。Geminiアプリ
モデルと直接チャットする用途に利用できます。
多くの開発者にとっては、Gemini APIを直接呼び出す方法が基本になります。
REST APIリクエストの例
APIキーはソースコードへ直接書き込まず、環境変数で管理してください。
export GEMINI_API_KEY="YOUR_API_KEY"
以下は、gemini-3.6-flashにテキストを送るリクエスト例です。
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent?key=${GEMINI_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "次の文章を3つの箇条書きで要約してください。"
}
]
}
]
}'
導入手順はGemini 3.6 Flash APIの使用方法、認証やリクエスト形式の基本はGoogle Gemini 3 APIガイドで確認できます。公式リファレンスはai.google.devにあります。
Googleのラインナップにおける位置付け
モデル選択は、品質・レイテンシー・コストのバランスで決めます。
| 用途 | 推奨モデル |
|---|---|
| 大量の低レイテンシー処理、コスト最優先 | Gemini 3.5 Flash-Lite |
| 要約、抽出、チャット、ツール呼び出し、エージェント処理 | Gemini 3.6 Flash |
| 高度なセキュリティ用途 | Gemini 3.5 Flash Cyber |
Gemini 3.5 Flash-Liteは、入力100万トークンあたり0.30ドル、出力100万トークンあたり2.50ドルで、毎秒約350出力トークンとされています。最高品質が不要な大量ジョブではFlash-Liteを検討できます。
一方、より難しいタスクや、出力の安定性を重視する処理ではGemini 3.6 Flashが適しています。
なお、Gemini 3.5 Proはまだ一般公開されていません。Googleはパートナーとテスト中であると述べており、Gemini 4の事前トレーニング実行も示唆されていますが、どちらも現時点で利用可能な一般提供モデルではありません。
以前の世代の位置付けは、Gemini 3.5とは何かで確認できます。
ApidogでGemini 3.6 Flashをテストする
公開ベンチマークではなく、自分のプロンプト・入力サイズ・期待するJSON形式で評価することが重要です。
Apidogを使うと、Gemini APIリクエストの作成、環境変数の管理、レスポンス検証、回帰テストの実行をまとめて行えます。
実装手順
- Gemini APIエンドポイントへ
POSTリクエストを作成します。 - モデルIDに
gemini-3.6-flashを設定します。 - APIキーをURLやリクエスト本文に固定せず、Apidogの環境変数として保存します。
- テスト環境と本番環境で異なるキーを使う場合は、環境を切り替えます。
- リクエストを送信し、ステータスコード、レスポンスJSON、レイテンシーを確認します。
- 必要なフィールドにアサーションを追加します。
- テストを保存し、定期実行してモデル更新後の差分を検知します。
たとえば、以下のような観点をテスト条件にします。
- HTTPステータスが200である
- 応答本文に候補テキストが含まれる
- 期待するJSONフィールドが存在する
- レスポンス時間が許容上限を超えない
- 出力がアプリケーション側のスキーマに適合する
定期実行については、ApidogでAPIテストをスケジュールする方法を参照してください。
Apidogはモデルを実行するAIフレームワークではありません。APIリクエストを構築・送信し、レスポンスを検証するためのクライアント兼テストプラットフォームです。Geminiモデルが更新されたとき、保存済みテストを再実行すれば、応答形式、内容、レイテンシーの変化を短時間で確認できます。
Apidogをダウンロードして、まずは1つのGemini APIリクエストを保存するところから始めてください。
よくある質問
Gemini 3.6 Flashは無料ですか?
Google AI Studio経由の無料枠があります。ただし、レート制限があり、主にプロトタイピング向けです。本番トラフィックでは、入力100万トークンあたり1.50ドル、出力100万トークンあたり7.50ドルが課金されます。
Gemini 3.6 Flashは3.5 Flashより優れていますか?
多くの用途では優れています。Googleによると、出力トークンを約17%削減し、出力単価は100万トークンあたり9.00ドルから7.50ドルへ下がりました。コーディングやコンピューター操作も強化され、OSWorld-Verifiedでは78.4%から83.0%へ向上しています。
Gemini 3.5 Proはリリースされましたか?
いいえ。Googleはパートナーとテスト中であると述べており、このリリースには一般公開されたProモデルは含まれていません。
モデルIDは何ですか?
モデルIDは以下です。
gemini-3.6-flash
低価格ティアのgemini-3.5-flash-liteとは別モデルです。
Gemini 3.6 Flashでできないことは何ですか?
Gemini 3.6 Flashはテキストのみを出力します。画像、音声、動画、PDFを入力として扱えますが、それらを生成するモデルではありません。
また、100万トークンのコンテキストウィンドウに近づくほど想起精度が低下するため、超長文のポイントワイズ検索を実装する場合は、実際のデータで評価してください。
Gemini 3.6 Flashは、コスト、速度、品質のバランスを重視するGemini APIワークロードに適したモデルです。移行前には、代表的なプロンプトを保存したAPIテストで実行し、レスポンス品質、レイテンシー、トークン使用量、JSONスキーマを比較してください。


Top comments (0)