まだ公開されているGemini 4 Argon APIはなく、GoogleはモデルIDを公開していません。Googleは2026年9月30日にArgonを発表し、現在はFairwindプログラムの擁護者(Fairwindパートナーの一部がGemini Enterprise上のマネージドモデルとして利用)のみが利用可能です。Artificial Analysisは、Google AI StudioをArgonの唯一のAPIプロバイダーとしていますが、速度やレイテンシのデータはありません。これは登録可能なエンドポイントというより、許可リストによるプレリリースアクセスに該当します。より広範な展開が始まるとき、Googleは「有料API顧客とGoogle AI Ultraの購読者から」開始すると述べているため、有料のGemini APIキーがあれば優先的に利用できる可能性があります。
発表からアクセスまでのこの空白期間は、統合を準備する時間です。このガイドでは、GoogleがArgon APIについて確認した情報と未公開の情報を分けたうえで、Gemini 3.8 Flashで今すぐ実行できる実装を説明します。リクエストの構築、Go-Liveアラートの設定、Apidogでのレスポンスモック、Argonの価格を前提にしたコスト上限の追加を行います。モデル自体については、Gemini 4 Argonとは何か、展開段階についてはGemini 4 Argonのリリース日を参照してください。
Gemini 4 Argon APIについて確認されていることと、そうでないこと
Googleの発表投稿では、価格と出力制限が示されています。一方、統合に必要な情報の多くはまだ公開されていません。
| 項目 | ステータス | 詳細 |
|---|---|---|
| 入力価格 | 確認済み | 100万トークンあたり2ドル(導入期間)、導入期間後は4ドル |
| 出力価格 | 確認済み | 100万トークンあたり10ドル(導入期間)、導入期間後は20ドル |
| キャッシュ済み入力 | 確認済み | 入力95%オフ:導入期間0.10ドル、標準0.20ドル |
| 出力制限 | 確認済み | 64Kから1Mトークンに増加 |
| APIサーフェス | 示唆あり | Googleのドキュメントによると、すべての新しいモデルはInteractions APIで起動される |
| モデルID | 未公開 | モデルページ、価格ページ、変更履歴に記載なし |
| 入力コンテキストウィンドウ | 未公開 | Googleの長文コンテキスト評価では最大1Mトークンのプロンプトが使用されたが、これは仕様ではない |
| 思考レベル | 未公開 | 評価は「最高の思考設定」で実行された。名前とデフォルトは不明 |
| レート制限 | 未公開 | 階層は発表されていない |
| バッチサポート | 未公開 | バッチまたはFlexの価格設定なし |
| 長文プロンプトティア | 未公開 | 3.1 Proは200Kを超えると追加料金が発生するが、Argonのルールは未発表 |
| 導入期間の長さ | 未公開 | 2ドル/10ドルの終了日は未定 |
特に「APIサーフェス」と「出力制限」は実装時に注意が必要です。
-
APIサーフェス: Interactions APIドキュメントでは、新しいモデルはInteractions APIで起動されると説明されています。Argonは新しいモデルのため、まずInteractions APIで利用可能になると考えるのが安全です。
generateContentをサポートするかはGoogleから明言されていません。 - 出力制限:Googleは最大1Mトークンの出力制限を示しています。ただし、Vals AIはテストした構成で最大262K出力しか記載していません。すべてのエンドポイントが初日から完全な1M出力をサポートするとは限りません。1M出力トークンガイドで、ストリーミング、タイムアウト、ストレージへの影響を確認してください。
価格をリクエスト単位で見積もる場合、20,000トークンの入力と5,000トークンの出力では次のようになります。
導入価格:
20,000 × $2 / 1M + 5,000 × $10 / 1M
= $0.04 + $0.05
= $0.09
標準価格:
= $0.18
Argonの導入時出力価格($10)はGemini 3.1 Pro Previewの$12を下回ります。標準価格はClaude Opus 5.5と一致します。キャッシュ済み入力や最大100万トークンのレスポンスを含む計算は、Gemini 4 Argonの価格内訳を参照してください。
オンラインで見つけたモデルIDをハードコードしないでください
ArgonのモデルIDを検索すると、ベンチマークサイト、アグリゲーター、オープンソースのプルリクエストで文字列が見つかる場合があります。しかし、それらはプレースホルダーです。Vals AIは独自のslugを使用しており、GitHubプルリクエストに暫定的なIDが追加されている例もあります。OpenRouter形式のパスがnot-foundページに接続されるケースもあります。
GoogleはこれらのIDを確認していません。推測したIDを使うと、デプロイ日に本番環境で404エラーが起きたり、広すぎる例外処理によってサイレントフォールバックが発生したりします。
モデル名は必ず環境変数で管理してください。以下の例では、現在利用できる安定モデルとして gemini-3.8-flash をデフォルトに設定した GEMINI_MODEL を使います。GoogleがArgonの正式IDを公開したら、変更するのは1つの変数だけです。
export GEMINI_MODEL=gemini-3.8-flash
Gemini 3.8 Flashでコードを準備する
Gemini 3.8 Flash(gemini-3.8-flash)は、Argonが利用すると予想されるエンドポイント、ヘッダー、レスポンス形式と同じものを使用します。2026年12月31日まで、100万トークンあたり入力$0.75、出力$3.75で動作します。
APIキーは GEMINI_API_KEY に保存し、コードへ直接貼り付けないでください。環境変数の設定を含む手順は、Gemini 3.8 Flash APIガイドにあります。
ステップ1:Interactions APIリクエストを送信する
Interactions APIはGoogleの主要APIであり、2026年6月から一般提供されています。Argonの思考レベル名は未公開のため、モデル名だけでなく思考レベルも変数として扱います。
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"
curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d "{
\"model\": \"${MODEL}\",
\"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
\"generation_config\": {\"thinking_level\": \"${THINKING}\"}
}"
Pythonでは google-genai 2.3.0以降が必要です。
# pip install "google-genai>=2.3.0"
import os
from google import genai
MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")
client = genai.Client() # GEMINI_API_KEY を環境変数から読み込む
interaction = client.interactions.create(
model=MODEL,
input="List the retry rules a REST client should follow for HTTP 429.",
generation_config={"thinking_level": THINKING},
)
print(interaction.output_text)
3.8 Flashで有効な思考レベルは次の3つです。
low
medium
high
medium がデフォルトです。minimal はHTTP 400を返します。レベルごとのトレードオフは、思考レベルガイドを参照してください。
複数ターンの会話では、前のレスポンスIDを previous_interaction_id に渡します。サーバーサイドストレージを無効化する場合は store: false を指定してください。
ステップ2:generateContentパスを機能させ続ける
既存のコードの多くはレガシーな generateContent エンドポイントを使用しています。Googleによると、このエンドポイントも完全にサポートされ続けます。
curl -s "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d "{
\"contents\": [
{
\"parts\": [
{
\"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
}
]
}
],
\"generationConfig\": {
\"thinkingConfig\": {
\"thinkingLevel\": \"${THINKING}\"
}
}
}"
思考レベルの指定場所はAPIごとに異なります。
| API | 思考レベルのフィールド |
|---|---|
| Interactions API | generation_config.thinking_level |
| generateContent | generationConfig.thinkingConfig.thinkingLevel |
両方をラップするクライアントを実装する場合、新しいモデルはデフォルトでInteractions APIへルーティングし、generateContent はフォールバックとして残してください。ツール定義も同様に確認が必要です。Gemini 3.8 Flash関数呼び出しも参照してください。
ステップ3:models.listでGo-Liveチェックをスケジュールする
変更履歴を手動で監視するのではなく、APIに問い合わせてください。models エンドポイントは利用可能なモデル、トークン制限、対応メソッドを返します。
import os
import sys
import requests
resp = requests.get(
"https://generativelanguage.googleapis.com/v1beta/models",
params={"pageSize": 1000},
headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
timeout=30,
)
resp.raise_for_status()
hits = [
m for m in resp.json().get("models", [])
if "argon" in m["name"].lower()
]
for m in hits:
print(
m["name"],
"in:", m.get("inputTokenLimit"),
"out:", m.get("outputTokenLimit"),
m.get("supportedGenerationMethods"),
)
sys.exit(1 if hits else 0) # 失敗した実行をアラートとして扱う
このスクリプトを、本番アプリと同じAPIキーでcronまたはCIスケジュールから1時間ごとに実行してください。
2026年10月1日に有料プロジェクトキーでこの呼び出しを実行した際は、61件のモデルが返され、nextPageToken はなく、argon を含むモデル名もありませんでした。一致したモデルが現れたとき、次の情報を同時に取得できます。
- 実際のモデルID
-
outputTokenLimitが完全な1Mかどうか - 利用可能な生成メソッド
ステップ4:レスポンスをモックして、アクセス前にクライアントを構築する
Argonを利用できなくても、Argonを消費するクライアントは構築できます。
- ステップ2の
generateContentリクエストをApidogに保存する。 -
GEMINI_API_KEYとGEMINI_MODELを環境変数として登録する。 - Gemini 3.8 Flashへ一度リクエストを送信する。
- 実際のレスポンスをエンドポイントのレスポンス例として保存する。
- プロジェクト設定の「機能設定」→「モック設定」で、デフォルトのモックメソッドを Response example first に設定する。
ApidogのデフォルトSmart Mockはスキーマからデータを生成します。Response example first を使うと、モックURLは保存済みのレスポンスを返します。そのため、フロントエンド、キューワーカー、パーサーを、実トークンを消費せずにテストできます。
ただし、このモックはArgon固有のスキーマではありません。GoogleはArgon専用のレスポンススキーマをまだ公開していないため、これは現在のGeminiレスポンススキーマです。それでも、Argonも同じAPIで利用可能になると予想されるため、事前実装の基盤として有効です。
大規模レスポンスを検証する場合は、レスポンス例の usageMetadata を大きな値に変更し、請求処理やアラートが正しく反応するか確認してください。
ステップ5:usageMetadataとコスト上限についてアサートする
すべての generateContent レスポンスには usageMetadata が含まれます。ApidogのポストプロセッサースクリプトでArgonの標準価格を使ったコスト計算を実行し、上限を超えたテストを失敗させます。
// Apidogのポストプロセッサー:
// このレスポンスをGemini 4 Argonの標準料金で計算する
const u = pm.response.json().usageMetadata;
const IN = 4 / 1e6; // 導入期間後の入力トークンあたりのUSD
const OUT = 20 / 1e6; // 出力トークンあたりのUSD
// 現在のGeminiモデルでは思考トークンも出力として請求される
const out =
(u.candidatesTokenCount || 0) +
(u.thoughtsTokenCount || 0);
const cost = u.promptTokenCount * IN + out * OUT;
pm.test("usageMetadataは存在する", () => {
pm.expect(u).to.be.an("object");
});
pm.test("Argon料金でのコストが0.10ドル未満である", () => {
pm.expect(cost).to.be.below(0.10);
});
リクエストごとに上限を設定してください。この例のような短いプロンプトには $0.10 が適しています。
Googleは、Argonにおける思考トークンの課金方法を明示していません。そのため、上記スクリプトは現在のGeminiの課金ルールを前提にしています。同じ保存済みリクエストを今は3.8 Flashで、Argon公開後はArgonで実行してください。トークン数とコストの差分をリグレッション比較に利用できます。
よくある質問
Gemini 4 Argon APIは利用できますか?
公開されていません。ArgonはFairwindプログラムのパートナーの一部にのみ展開され、Gemini Enterpriseを通じて利用されています。有料API顧客とGoogle AI Ultraの購読者が次に続く予定ですが、具体的な日程は未定です。
Gemini 4 ArgonのモデルIDは何ですか?
Googleは公開していません。サードパーティサイトの文字列はプレースホルダーとして扱い、モデル名を環境変数に保持しつつ、models.list を監視してください。
Gemini 4 Argon APIの費用はいくらですか?
期間未定の導入期間中は、100万トークンあたり入力2ドル、出力10ドルです。その後は入力4ドル、出力20ドルになります。キャッシュ済み入力は95%オフです。詳細はGemini 4 Argonの価格を参照してください。
ArgonはgenerateContentで動作しますか?
Googleは明言していません。ドキュメントでは、すべての新しいモデルはInteractions APIで起動されると説明されています。Interactions APIを中心に実装し、generateContent はフォールバックとして扱うべきです。
Google AI UltraでAPIアクセスが得られますか?
いいえ。AI Ultraは消費者向けサブスクリプションであり、APIキーではありません。Googleは、APIアクセスは有料API顧客から始まると述べています。
次のステップ
次の項目を実装してください。
- すべての環境で
GEMINI_MODELを設定する。 -
models.listチェックをスケジュールする。 - Interactions APIと
generateContentのリクエストを保存する。 - 各リクエストにコスト上限アサーションを追加する。
- モックレスポンスでフロントエンドとワーカーを事前テストする。
Apidogをダウンロードして、リクエスト、モック、テストを1つのワークスペースにまとめてください。Googleが正式なArgonモデルIDを公開したら、変更するのは GEMINI_MODEL の値だけです。

Top comments (0)