DEV Community

Cover image for Qwen 3.8 価格解説:100万コンテキストの入出力料金(入力$2/出力$6)
Akira
Akira

Posted on • Originally published at apidog.com

Qwen 3.8 価格解説:100万コンテキストの入出力料金(入力$2/出力$6)

Alibabaは2026年8月上旬にQwen 3.8-Maxをリリースし、価格が正式に確定しました。7月のプレビュー期間に言及されていた「プレビュー価格10%割引」は終了しており、一般提供開始時点でのModel Studio公式料金ページでは、qwen3.8-max入力100万トークンあたり2ドル、出力100万トークンあたり6ドルです。料金は100万トークンのコンテキストウィンドウ全体でフラットです。

今すぐApidogを試す

多くのフロンティアモデルでは、プロンプトが特定のコンテキスト長を超えるとトークン単価が上がります。一方、Qwen 3.8-Maxでは、5,000トークンでも900,000トークンでも、入力は100万トークンあたり2ドル、出力は100万トークンあたり6ドルです。

この記事では、料金表の読み方、キャッシング、推論トークン、無料枠、実運用に近いコスト計算、計測手順を解説します。モデル自体の概要は、先にQwen 3.8とは何か、そしてそれが重要な理由を確認してください。

注意点として、表示価格だけで実コストは判断できません。Qwen 3.8-Maxのデフォルトはxhighの推論努力であり、思考トークンも出力トークンとして課金されます。正確なコストを出すには、代表的なリクエストを実行し、レスポンスのusageを計測してください。Apidogでは、テスト中のレスポンスからトークン使用量を確認できます。

一般提供の料金:入力2ドル、出力6ドル、単一ティア

以下は、2026年8月3日時点でModel Studio料金ページに記載されたqwen3.8-maxの料金です。

項目 価格(100万トークンあたり)
入力 $2.00
出力(思考トークンを含む) $6.00
キャッシュされた入力(キャッシュヒット) 入力料金の10%
明示的なキャッシュ作成 入力料金の125%
コンテキスト層 単一層、0〜100万トークン
思考トークンと非思考トークン 同じ料金で課金

実装時に押さえるべき点は3つです。

  1. 100万トークンまで入力単価は変わりません。 長いプロンプト向けの追加ティアはありません。
  2. 思考トークンも出力として課金されます。 reasoning_effortの設定はコストに直接影響します。
  3. 1リクエストの最大出力は65,536トークンです。 出力のみの最大課金額は約$0.39です。

公式のQwen 3.8発表では、総パラメータ数2.4兆、アクティブパラメータ数950億、100万トークンのコンテキストウィンドウ、マルチモーダル入力対応が説明されています。

100万トークン全体でフラットな価格設定が重要な理由

階層型の料金では、コンテキスト長がしきい値を超えると、入力トークン単価が上がります。長文RAG、コードベース解析、ツール定義を含むエージェントなどでは、この上昇が請求額に大きく影響します。

Alibaba自身も、同じModel Studio料金ページqwen3-maxqwen3-coder-plusにコンテキスト長別の料金を設定しています。対してQwen 3.8-Maxの料金表は、0 < トークン ≤ 1Mの単一行です。

コスト見積もりは次の式で処理できます。

リクエストコスト =
  (入力トークン数 × $2 / 1,000,000) +
  (出力トークン数 × $6 / 1,000,000)
Enter fullscreen mode Exit fullscreen mode

ただし、出力トークン数には思考トークンも含める必要があります。

Qwen 3.7-Maxの定価よりも安い

Qwen 3.8-Maxは、前世代の定価より低い価格で提供されています。

  • Qwen 3.7-Maxの定価: 入力$2.50 / 出力$7.50
  • Qwen 3.8-Max: 入力$2.00 / 出力$6.00

入力・出力ともに20%低い価格です。

ただし、Qwen 3.7-Maxには現在50%割引プロモーションがあり、プロモーション価格は入力$1.25 / 出力$3.75です。100万トークンのコンテキスト、マルチモーダル入力、エージェント機能の向上が不要なワークロードでは、プロモーション期間中の3.7-Maxを比較対象に含める価値があります。

さらに低コストを優先する場合、Qwen 3.7-Plusは20%プロモーションにより、入力$0.40 / 出力$1.60です。プロモーション価格は終了する前提で、定価ベースの予算も別途作成してください。

思考トークンは出力として課金される

Qwen 3.8-Maxは、reasoning_effortとして次の3段階をサポートします。

  • xhigh
  • medium
  • low

デフォルトはxhighです。推論モードでは、最終回答の前に内部的な推論トークンが生成されます。このトークンは、ユーザーに見える回答と同様に出力トークンとして100万トークンあたり6ドルで課金されます。

たとえば、画面上では800トークンの回答でも、難しい推論タスクでは数千トークンの思考トークンが消費される可能性があります。

実装では、タスクごとに推論努力を分けてください。

タスク 推奨する考え方
分類、抽出、変換、フォーマット mediumまたはlowを検討
複雑な推論、計画、エージェント実行 必要に応じてxhighを使用
コスト見積もり 実レスポンスのusageを使う

重要なのは、入力より出力の単価が3倍高い点です。推論量が増えるタスクほど、出力トークンを重点的に監視してください。

コンテキストキャッシング:ヒット時10%、作成時125%

長いシステムプロンプト、固定ドキュメント、ツール定義など、同じプレフィックスを繰り返し送るアプリケーションではコンテキストキャッシングが有効です。

  • キャッシュヒット: 通常の入力料金の10%。100万トークンあたり$0.20。
  • 明示的なキャッシュ作成: 通常の入力料金の125%。100万トークンあたり$2.50。

キャッシュ作成には通常入力より25%高いコストが1回発生します。しかし、以後のヒットでは90%節約できます。プレフィックスを2回以上再利用するなら、キャッシングはすでに有利になります。

キャッシュ候補には、変更頻度が低い要素を選びます。

  • 長いシステムプロンプト
  • 製品ドキュメント
  • 固定のツールスキーマ
  • 安定したポリシーやルール
  • 頻繁に変わらないナレッジ

一方で、ユーザーごと・リクエストごとに大きく変わるデータは、キャッシュ効果が小さくなります。

無料枠:100万トークン、シンガポール、90日間

Model Studioにはqwen3.8-max向けの無料枠があります。

  • サイズ: 100万トークン
  • リージョン: シンガポールのみ
  • 期間: 有効化から90日間

シンガポールリージョンでは、クライアントのベースURLを次のように設定します。

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

この無料枠は北京リージョンおよび米国バージニアリージョンには適用されません。また、思考トークンも通常の出力トークンと同様に無料枠を消費します。xhighで難しい推論タスクを続けると、想定より早く枠を使い切る可能性があります。

Qwen Chatを含む無料利用方法は、Qwen 3.8を無料で使う方法にまとめられています。

Qwen 3.8の料金比較

以下は、100万トークンあたりの定価ベースの比較です。プロモーションは終了する可能性があるため、通常料金と分けて扱ってください。

モデル 入力 出力 備考
Qwen 3.8-Max $2.00 $6.00 100万トークンまでフラット、キャッシュヒット10%
Qwen 3.7-Max $2.50 $7.50 現在50%オフ:$1.25 / $3.75(プロモーション)
Qwen 3.7-Plus $0.40 $1.60 現在20%オフ(プロモーション)
Kimi K3 $3.00 $15.00 キャッシュヒット$0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

料金表から読み取れるポイントは次のとおりです。

  • Kimi K3と比較すると、Qwen 3.8-Maxは入力が3分の1安く、出力が60%安く、キャッシュヒットも$0.20でK3の$0.30を下回ります。Kimi K3 APIガイドも参考にしてください。
  • Claude Opus 5と比較すると、Qwenは入力が60%安く、出力が76%安い料金です。
  • GPT-5.6 Terraとは入力単価が同じ$2.00で、Qwenの出力料金は半額です。

価格だけで品質は判断できません。実際には、同じプロンプトと評価基準を使って、自分のワークロードで比較してください。

計算例:実際のタスクのコスト

例1:5万トークンのエージェントセッション

1回のエージェント実行で、38,000入力トークンと12,000出力トークンを使うとします。

入力: 38,000 × $2 / 1,000,000 = $0.076
出力: 12,000 × $6 / 1,000,000 = $0.072
合計: $0.148
Enter fullscreen mode Exit fullscreen mode

1セッションあたり約$0.15です。

ここに8,000の思考トークンが加わる場合、出力は20,000トークンになります。

入力: 38,000 × $2 / 1,000,000 = $0.076
出力: 20,000 × $6 / 1,000,000 = $0.120
合計: $0.196
Enter fullscreen mode Exit fullscreen mode

1セッションあたり約$0.20です。思考トークンによって、コストは約33%増えます。

例2:80万トークンの長文ドキュメント分析

800,000トークンのドキュメントを読み込み、5,000トークンの構造化要約を生成するケースです。

入力: 800,000 × $2 / 1,000,000 = $1.60
出力: 5,000 × $6 / 1,000,000 = $0.03
合計: $1.63
Enter fullscreen mode Exit fullscreen mode

1回あたり約$1.63です。

このケースでは、80万トークンの入力すべてが、最初の数千トークンと同じ入力単価で計算されます。長文コンテキストを扱うワークロードでは、この予測可能性が重要です。

例3:10万トークンのシステムプロンプトを毎日50回再利用する

システムプロンプト、製品ドキュメント、ツール定義の合計が100,000トークンで、毎日50回使われるとします。

キャッシュなしの場合:

100,000 × $2 / 1,000,000 = $0.20 / 呼び出し
$0.20 × 50 = $10.00 / 日
Enter fullscreen mode Exit fullscreen mode

キャッシュありの場合:

キャッシュ作成:
100,000 × $2.50 / 1,000,000 = $0.25

49回のキャッシュヒット:
100,000 × $0.20 / 1,000,000 × 49 = $0.98

合計:
$0.25 + $0.98 = $1.23 / 日
Enter fullscreen mode Exit fullscreen mode

1日あたり約$1.23で、キャッシュなしの$10.00と比べて約88%削減できます。

推測ではなく、測定された使用量からコストを見積もる

料金表からの見積もりは出発点です。実際のコストモデルは、アプリケーションの代表リクエストを送信し、usageを集計して作成してください。

実施手順は次のとおりです。

  1. APIキーを取得する。
  2. 利用するリージョンのエンドポイントを設定する。
  3. タスクタイプごとに代表的なリクエストを10件程度用意する。
  4. reasoning_effortごとに同じリクエストを実行する。
  5. 各レスポンスの入力・出力・推論トークン数を記録する。
  6. タスクタイプごとに平均値を算出する。
  7. 入力には$2 / 1,000,000、出力には$6 / 1,000,000を掛ける。
  8. 日次・月次の呼び出し回数を掛けて予算化する。

エンドポイント、OpenAI互換プロトコル、Anthropic互換プロトコルについては、Qwen 3.8 APIガイドを参照してください。

Apidogでは、リージョン別ベースURLを環境として保存し、reasoning_effortを変えながら同じリクエストを比較できます。qwen3.7-maxやKimi K3にも同じプロンプトを送れば、品質・レイテンシ・トークン使用量を同じ条件で比較できます。Apidogを無料でダウンロードして、まずは実タスクのコストを測定してください。

結論

Qwen 3.8-Maxの入力$2 / 出力$6は、フロンティアクラスのフラッグシップモデルとして積極的な料金です。前モデルの定価より低く、GPT-5.6 Terraと入力単価は同じで出力は半額、100万トークンのコンテキスト全体で料金がフラットです。

特に、長いコンテキストを扱い、固定プレフィックスを繰り返し送るワークロードでは、10%のキャッシュヒット料金が大きく効きます。

ただし、次の2点は必ず確認してください。

  • デフォルトのxhighでは、思考トークンにより出力課金が増える。
  • Qwen 3.7-Maxの50%割引やシンガポールの無料枠など、プロモーション条件は永続ではない。

実際のusageを計測し、タスクに応じてreasoning_effortを設定すれば、コストを予測可能な形で管理できます。

よくある質問

Qwen 3.8は長いプロンプトの場合、料金が高くなりますか?

いいえ。公式料金では、0〜100万トークンを単一ティアでカバーしています。したがって、900,000トークンのプロンプトも、短いプロンプトと同じ入力100万トークンあたり2ドルで課金されます。

これは、コンテキスト長に応じて料金が上がるモデルとは異なります。Model Studioモデルリストにある一部のモデルには、コンテキスト長別の料金があります。

Qwen 3.8では思考トークンに追加料金がかかりますか?

思考専用の別料金はありません。思考モードと非思考モードは同じ入力$2 / 出力$6で課金されます。

ただし、思考トークンは出力トークンとして扱われます。reasoning_effortのデフォルトはxhighなので、推論が多いタスクは、画面に表示される回答量から想定するより高コストになる可能性があります。簡単なタスクでは努力レベルを下げ、各レスポンスのusageを確認してください。

Qwen 3.8を無料で試す方法はありますか?

はい。Model Studioには、シンガポールリージョンのエンドポイントで有効な、90日間・100万トークンの無料枠があります。Qwen Chatもブラウザから無料で利用できます。

詳細はQwen 3.8を無料で使う方法を参照してください。

以前の「10%プレビュー料金」はまだ利用可能ですか?

いいえ。これは2026年7月のプレビュー期間中に報じられたプロモーションです。一般提供開始後は、標準の入力$2 / 出力$6の料金表に置き換えられています。最新の条件はModel Studio料金ページで確認してください。

Top comments (0)