GLM-5.3-Flashは現在半額です。この割引は2026年9月9日に終了し、その後は現在の料金を基準にしたすべての費用予測が2倍になります。
この記事では、現在の料金、割引終了後の費用、代替案との比較、そしてその差がワークロードにとって重要かを判断する方法を説明します。数値はすべて2026年8月27日に検証済みです。料金ページは変更される可能性があるため、予算を確定する前にプロバイダーへ確認してください。
料金表
| ローンチ価格 (2026年9月9日まで) | 通常価格 (それ以降) | |
|---|---|---|
| 入力 | $0.075 / 100万トークン | $0.15 / 100万トークン |
| 出力 | $0.25 / 100万トークン | $0.50 / 100万トークン |
| キャッシュ済み入力 | $0.015 / 100万トークン | $0.03 / 100万トークン |
Artificial Analysisは、キャッシュヒット、入力、出力の比率を7:2:1としたブレンド価格として、100万トークンあたり$0.10を公開しています。比較には便利な単一指標ですが、実際の請求額はワークロードの比率で決まります。
実際の費用
抽象的な単価だけでは分かりにくいため、9月9日以降に適用される通常価格で3つの例を見てみましょう。
サポート分類器。 月間10万件のチケットを処理し、1件あたり約800入力トークンと100出力トークンを使用するケースです。月間の使用量は入力8,000万トークン、出力1,000万トークン。入力$12.00、出力$5.00で、合計は月額$17です。reasoning_effortをlowにすれば、出力コストをさらに削減できます。
コーディングアシスタント。 1日500セッション、1セッションあたり約15,000入力トークン(多くは繰り返し使うファイルコンテキスト)と2,000出力トークンを使用するケースです。月間では入力2億2,500万トークン、出力3,000万トークンになります。
- キャッシュなし:$33.75 + $15.00 = $48.75
- 入力の70%がキャッシュヒット:約$14.85 + $15.00 = 約$30
画像を含むドキュメントパイプライン。 月間1万件のドキュメントを処理し、画像を含めて1件あたり約4万入力トークン、1,500出力トークンを使用するケースです。月間の使用量は入力4億トークン、出力1,500万トークン。入力$60.00、出力$7.50で、ビジョン処理を含む場合は月額$67.50です。
いずれも大きな金額ではありません。それがこのモデルの強みです。
キャッシュ済み入力が最大のレバー
新規入力は100万トークンあたり$0.15ですが、キャッシュ済み入力は$0.03です。つまり、キャッシュ済みトークンは新規トークンの5分の1のコストです。
安定したプレフィックス、システムプロンプト、繰り返し参照するドキュメント、コンテキスト内のコードベースがある場合は、呼び出し間でプレフィックスが同一になるように設計しましょう。
キャッシュヒット率を下げる典型的な原因は、プロンプトの先頭近くに可変値を置くことです。システムプロンプト内のタイムスタンプ、リクエストID、ユーザー名などが変わると、その後のコンテンツ全体が無効になる可能性があります。安定したコンテンツを先頭に、可変コンテンツを末尾に配置してください。
Z.aiは、期間限定でキャッシュ済み入力ストレージも無料と記載しています。ただし、これはプロモーションとして扱い、依存するアーキテクチャを構築する前に現在の規約を確認してください。
第二のレバー:推論努力 (reasoning_effort)
このモデルのreasoning_effortはデフォルトでmaxです。これは最も高価な設定で、変更しない場合に適用されます。
利用できるモードはlow、high、maxの3つです。推論トークンは出力として課金されるため、深い検討を必要としないタスクでは、誰も読まない思考に対して出力料金を支払うことになります。
分類、抽出、ルーティング、フォーマットなどのタスクでは、lowに設定すると出力側のコストを大幅に削減できます。
設定方法は当社のAPIガイドで説明しています。請求額が上記の計算より高い場合、まず試すべき変更はこの1行です。
比較
同じシリーズのモデルを通常価格で比較します。
| モデル | 100万トークンあたりのブレンド費用 |
|---|---|
| GLM-5.3-Flash | $0.10 |
| GLM-5.3 | $0.90 |
Artificial Analysis Intelligence Indexでは57対60、わずか3ポイントの差に対して、費用は約9倍異なります。当社の詳細な比較では、このトレードオフが適さないケースを説明しています。
要約すると、GLM-5.3はほぼ2倍の速度で生成します。そのため、待機中のユーザーへ長い回答をストリーミングする場合は、上位モデルの価値が高まります。
GLM-5.2と比べると、Z.aiはタスクあたりの費用が$0.045で、約10分の1の価格だと主張しています。GLM-5.2の料金内訳には、移行を予算化するための旧料金表を掲載しています。
他社の安価なマルチモーダルティアと比べても、GLM-5.3-Flashは価格競争力があります。さらにMITライセンスであるため、セルフホスティングの選択肢も残されています。当社のGemini 3.7 Flash料金解説記事では、Google側の最も近い比較対象を説明しています。
リセラー価格は大きく異なる場合がある
このモデルは、Z.aiから直接利用できるほか、OpenRouter、Cloudflare Workers AI、Vercel AI Gateway、DeepInfra、Novita、GMICloud、Baseten、io.net経由でも利用できます。
ただし、すべてが同じ料金ではありません。例えばAIHubMixは、入力約$0.113、出力約$0.394を提示しています。これはZ.aiのプロモーション価格と通常価格の中間です。
プロバイダーによってはローンチ割引を適用しますが、適用しない場合もあります。アグリゲーター経由で利用する際は、Z.aiと同じ料金だと仮定せず、必ず現在の料金を確認してください。
統合ゲートウェイの利便性にはマージンが含まれる場合があります。この価格帯では、割合で見ると小さな上乗せでも、実額としては見過ごされやすく、受け入れやすい点に注意が必要です。
セルフホスティングが有利になる時
ウェイトはMITライセンスで提供されているため、自分で実行することは現実的な選択肢です。ただし、API価格がここまで下がると、セルフホスティングの損益分岐点は厳しくなります。
おおよその目安は次のとおりです。
- フル精度での提供には8x H200クラスのノードが必要
- レンタルクラウド容量は1日あたり約$24〜$48
- ノードの稼働・アイドル状態にかかわらず、固定費は月額約$1,000
通常API価格では、$1,000で約67億入力トークンを購入できます。ノードの固定費がAPI利用料を上回るには、非常に大量かつ継続的な利用が必要です。
多くのチームにとって、GLM-5.3-Flashのセルフホスティングは、コストよりも制御、データ所在地、ライセンスが主な理由になります。
例外は量子化ティアです。GGUF量子化が存在し、すでに所有しているハードウェアで量子化モデルを実行できるなら、限界費用は電気代になるため計算は大きく変わります。当社のローカル実行ガイドでは、各ハードウェアティアで可能なことを説明しています。
コーディングプランという代替案
API呼び出しを行うアプリケーションではなく、Claude CodeまたはClineで作業する開発者であれば、トークン単価は適切な比較軸ではないかもしれません。
GLMコーディングプランは月額約$18から始まり、GLM-5.3-Flashを含み、GLM-5.3の3倍の利用可能クォータが付与されると報告されています。Z.aiのドキュメントによると、オフピーク時の呼び出しは標準ポイントの半分を消費します。
毎日コーディングする一人の開発者にとって、定額プランは従量課金のAPIアクセスより安く、支出も予測しやすいことが一般的です。当社のハーネス設定ガイドでは接続方法を、コーディングプランの比較ではGLMプランと代替案を比較しています。
出力側に注目する
入力料金は、トークン量が多いことから注目されがちです。しかし、予算を圧迫するのは出力側であることが少なくありません。理由は2つあります。
- 出力は100万トークンあたり$0.50で、入力の$0.15の3倍以上です。
- 推論トークンも出力として課金されます。
maxの推論努力に設定したモデルは、最終回答に表示されるより数倍多くのトークンを生成する可能性があり、そのすべてが出力料金の対象になります。
そのため、控えめなプロンプトと多弁なモデルを組み合わせたアプリケーションは、書面上は入力中心に見えても、最終的には出力コストが支配的になることがあります。
100万トークンあたり$0.10というブレンド価格は、実際のワークロードには合わないことがある7:2:1の比率を前提にしています。
推測ではなく測定しましょう。すべての完了応答には、その呼び出しのトークン数を含むusageオブジェクトがあります。これをログに記録・集計し、予算作成時の仮定と実際の比率を比較してください。
出力が合計トークンの約15%を超える場合、最初に確認するのはreasoning_effort、次にプロンプトの長さです。
9月9日までにすべきこと
割引期間中に、次の3つを実施してください。
- 実際のトークンミックスを測定する。 ブレンド価格は7:2:1を前提としています。出力が多ければ、実効コストは$0.10ではなく、$0.50の出力レートに近づきます。
- キャッシュヒット率を確認する。 キャッシュ済み入力と新規入力には5倍の価格差があります。ここが最大の節約ポイントです。
- 通常価格でコストモデルを再計算する。 9月10日にはすべてが2倍になります。プロモーション価格でしか採算が合わないワークロードは、2週間後ではなく今すぐ見直すべきです。
実際のトークン使用量を追跡するには、完了応答に含まれるusageオブジェクトを保存します。ここには入力、出力、キャッシュ済みトークンの必要な数値が含まれます。
代表的な呼び出しをApidogの保存済みコレクションとして実行し、モデルIDを環境変数にしておけば、リクエストごとの数値を取得できます。同じスイートをGLM-5.3に対して再実行すれば、マーケティング上の単価ではなく、実際の請求額を比較できます。
よくある質問(FAQ)
GLM-5.3-Flashは無料ですか?
いいえ。ローンチ前に「ox-alpha」として匿名で稼働していた約1週間は無料でしたが、発表時に終了しました。現在の50%割引は無料とは異なります。
割引はいつ正確に終了しますか?
2026年9月9日です。それ以降は通常価格が適用されます。
なぜサイトによって価格が異なるのですか?
一部のサイトはプロモーション価格を、別のサイトは通常価格を提示しています。また、リセラーは独自のマージンを設定します。実際に利用するプロバイダーの料金を必ず確認してください。
画像入力には追加費用がかかりますか?
画像はコンテキストトークンを消費し、入力として課金されます。画像専用の追加料金はありませんが、高解像度の画像は大量のトークンを消費する可能性があります。
セルフホストの方が安価ですか?
非常に大規模で継続的なボリュームがある場合、または既存ハードウェアで量子化ビルドを使用する場合に限られます。入力100万トークンあたり$0.15という価格では、8x H200ノードのレンタルをコストだけで正当化するのは困難です。
Top comments (0)