Alibabaは2026年8月初旬にQwen 3.8-Maxをリリースしました。「永久に無料で使える」という説明も見かけますが、実際には利用条件があります。2026年8月3日時点でAlibabaの公式ページから確認できる、開発者向けの現実的な無料利用ルートは4つです。
まず、モデルの仕様(総パラメータ2.4兆、アクティブ950億、100万トークンコンテキスト)を確認したい場合は、Qwen 3.8の概要を参照してください。
無料利用ルートの一覧
| ルート | 無料? | 今日から利用可能? | 注意点 |
|---|---|---|---|
| Qwen Chat | はい | はい | 消費者向けアプリ。APIなし |
| Model Studio APIクォータ | 100万トークン | はい | シンガポールリージョン限定、90日間 |
| オープンウェイト(自己ホスト) | ウェイトは無料予定 | まだ | 「来週」提供予定。ハードウェアは無料ではない |
| 旧Qwenモデル | はい | はい | Qwen 3.8-Maxではない |
ルート1:Qwen Chatで試す
最も早く試せるのはQwen Chatです。サインイン後にモデルを選択すれば、クレジットカードやクラウドコンソールなしでQwen 3.8-Maxを利用できます。公式リリース投稿でも、モデルを試す標準的な方法として案内されています。
Qwen Chatで確認できること:
- フラッグシップモデルとの会話
- 画像理解
- ドキュメント理解
- プロンプトの基本的な挙動
ただし、APIキーは発行されません。アプリへの組み込み、自動テスト、バッチ処理、エージェント実装には使えません。
また、Qwen Chatには独自のシステムプロンプトやアプリ側設定が適用される可能性があります。製品導入前の評価では、Qwen Chatの結果をそのままAPIのベンチマーク結果として扱わないでください。
使いどころ: モデルの能力を短時間で確認したい場合。
向いていない用途: API統合や本番ワークロードの評価。
ルート2:Model Studioの無料APIクォータを使う
コードからQwen 3.8-Maxを呼び出すなら、Alibaba Cloud Model Studioの無料クォータが実用的です。新規アクティベーションでは、qwen3.8-max に対して 100万トークン の無料クォータが提供されます。
ただし、利用前に次の3点を確認してください。
1. 無料クォータはシンガポールリージョン限定
料金ページによると、無料クォータが適用されるのはシンガポール(国際)リージョンです。
OpenAI互換エンドポイントを使う場合のベースURLは次のとおりです。
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
北京やUS-Virginiaのエンドポイントにリクエストを送ると、最初のトークンから課金されます。無料枠で検証するなら、アプリ設定やCI環境変数でリージョンを明示的に固定してください。
2. 無料クォータの有効期限は90日
クォータはサービスのアクティベーションから90日間です。未使用分は繰り越されず、期限後に失効します。
評価スケジュールを立てる際は、次のように進めると無駄を減らせます。
- Model Studioをアクティベートする
- APIキーを発行する
- 最小プロンプトで接続確認する
- 少量の評価データで品質を測定する
- 本格的な負荷試験は消費量を見ながら実行する
3. クォータ終了後は従量課金
無料クォータ終了後の料金は、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルです。
100万トークンのコンテキスト全体に対する定額料金であり、階層料金ではありません。無料枠を使い切った後に想定外の請求が発生しないよう、利用開始前に請求アラートを設定してください。
ワークロード別の料金イメージは、Qwen 3.8料金ガイドも参照してください。
APIキーを設定する
Model Studioでアカウントを作成し、サービスを有効化してAPIキーを生成します。環境変数には DASHSCOPE_API_KEY を使用します。
export DASHSCOPE_API_KEY="your-api-key"
モデルカタログでは、推奨モデルの一つとして qwen3.8-max が掲載されています。Model StudioはOpenAI互換プロトコルとAnthropic互換エンドポイントを提供しています。
OpenAI互換APIでの実装手順は、Qwen 3.8 API ウォークスルーで、ストリーミングと推論出力を含めて確認できます。
最小リクエストで接続を確認する
最初は短いプロンプトで、モデル名・リージョン・認証の設定が正しいことを確認してください。
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "JavaScriptで配列を重複なくまとめる方法を短く説明してください。"
}
],
"reasoning_effort": "low"
}'
本格的なプロンプトや長いコンテキストを送る前に、このような最小リクエストで疎通確認を済ませると、無料クォータの消費を抑えられます。
クォータを消費する罠:推論がデフォルトでオン
Qwen 3.8-Maxでは、reasoning_effort が xhigh に設定されています。推論トークンも出力トークンとしてカウントされるため、難しいプロンプトでは回答本文の前に大量のトークンを消費することがあります。
通常の要約、分類、構造化出力、簡単なコード補完では、reasoning_effort を下げてください。
{
"reasoning_effort": "low"
}
推論が必要な評価だけで medium や xhigh を使う運用にすると、無料クォータを比較対象のタスクに集中できます。
100万トークンを長持ちさせる実装手順
無料クォータを短期間で使い切らないために、開発フローを分けます。
ライブAPI呼び出しは最小限にする
リクエスト形式、認証、パラメータを最初に確認し、無限リトライやデバッグループを避けます。レスポンスを保存してモックに切り替える
レスポンス形式が分かったらサンプルを保存します。フロントエンドやエージェントの開発中はモックレスポンスを返し、最後の統合確認だけライブAPIで実行します。トークン使用量を記録する
APIレスポンスに含まれる使用量をログに出し、リクエスト単位で入力・出力・推論トークンを確認します。
Node.jsでは、レスポンスの使用量をログに残すだけでも消費ペースを把握しやすくなります。
const response = await client.chat.completions.create({
model: "qwen3.8-max",
messages,
reasoning_effort: "low",
});
console.log({
usage: response.usage,
requestId: response.id,
});
リクエスト作成、環境ごとのベースURL切り替え、レスポンス保存、モック化にはApidogを利用できます。シンガポール、北京、USのURLを環境変数として分けておくと、誤って課金対象リージョンに送信する事故を防ぎやすくなります。
評価: 現時点で最も実用的な開発者向けルートです。ただし、シンガポール限定・90日間限定という条件があります。
ルート3:オープンウェイトを待つ
Qwen 3.8-Maxは、Qwen-Maxクラスで初のオープンウェイトモデルになる予定です。Alibabaは、Hugging FaceとModelScopeでウェイトを「来週」公開すると述べており、時期は8月10日前後と見込まれています。
ただし、2026年8月3日時点ではダウンロードできません。現時点で取得、量子化、ローカル実行する手順は存在しません。
ウェイト公開前に「今日からQwen 3.8-Maxをローカル実行する」と説明するチュートリアルを見かけた場合は、実際に対象モデルのウェイトが公開されているか確認してください。
セルフホストの現実
ウェイトが無料で公開されても、推論環境まで無料になるわけではありません。
Qwen 3.8-Maxは合計2.4兆パラメーターのモデルです。近い例として、2.8兆パラメーターのKimi K3は、アグレッシブなMXFP4量子化でも594GBのウェイトとして提供されました。
Qwen 3.8-Maxでも、数百GB規模のウェイト、複数GPU、実用的にはマルチノード構成が必要になる可能性があります。一般的なコンシューマーGPUや単一ワークステーションでの運用は現実的ではありません。
Kimi K3をローカルで実行する場合のハードウェア要件も、規模感を把握する参考になります。
オープンウェイト公開の実際のメリットは、個人PCでの実行よりも、サードパーティホストが提供するAPIの選択肢が増えることです。競争によって、ファーストパーティより低価格なホスティングが登場する可能性があります。
評価: まだ利用できません。8月中旬以降に公開状況を再確認し、自己ホスト前提ではなくホスティング予算も含めて検討してください。
ルート4:旧Qwenモデルを使う
Qwen 3.8-Maxに限定せず、費用ゼロでQwenモデルを使いたい場合は、旧世代のモデルが現実的な選択肢です。
小規模なオープンウェイトQwenモデルは、すでに一般的な開発環境で扱えるものがあります。90日で失効する無料枠ではなく、既存の無料アクセスパスや自己ホストを選べる場合もあります。
具体的な選択肢は、Qwen 3.7を無料で利用する方法を参照してください。
トレードオフは明確です。Qwen 3.8-Maxが注目を集めたベンチマーク性能は得られません。一方で、サイドプロジェクト、分類、要約、API形式の学習、プロトタイプ作成には、旧モデルで十分なケースもあります。
現時点で存在しないもの
2026年8月3日時点で、次のような利用方法は確認できません。
無制限の無料APIティア
無料なのは100万トークンのクォータで、有効期限は90日です。シンガポール以外の無料APIティア
北京およびUS-Virginiaのエンドポイントは最初のトークンから課金されます。ダウンロード可能なQwen 3.8-Maxウェイト
「来週公開予定」は約束であり、現時点ではダウンロードリンクではありません。サードパーティアグリゲーターの公式無料Qwen 3.8-Max
ウェイト公開後にホスト型サービスが登場する可能性はありますが、それ以前の「無料Qwen 3.8-Max」には、実際にどのモデルを提供しているか確認が必要です。
よくある質問
Qwen 3.8 APIは本当に無料ですか?
部分的に無料です。Alibaba Cloud Model Studioでは、シンガポールリージョン限定で90日間有効な100万トークンの無料クォータがあります。
クォータ終了後は、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルです。評価は90日間の期間内に完了するよう計画してください。
Qwen 3.8-Maxを今すぐダウンロードしてローカル実行できますか?
できません。ウェイトは2026年8月10日頃にHugging FaceとModelScopeで公開予定ですが、本稿執筆時点では未公開です。
公開後も、数百GB規模のストレージとマルチGPUによる推論環境を想定してください。2.4兆パラメーターのモデルであり、ノートPC向けではありません。
Kimi K3の無料ルートと何が違いますか?
Kimi K3はすでにウェイトが公開され、ダウンロード可能です。そのためセルフホストの準備はできますが、Qwen 3.8-Maxのウェイト公開はまだ保留中です。
ただし、どちらもコンシューマー向けハードウェアで気軽に実行できる規模ではありません。Kimi K3を無料で利用する方法では、Kimi K3の利用ルートを確認できます。
無料クォータは推論トークンも対象ですか?
対象ですが、クォータを消費します。推論出力は通常の出力と同様にカウントされ、デフォルトの reasoning_effort は xhigh です。
通常のリクエストでは low または medium に下げ、推論能力を測定したい評価タスクだけで高い設定を使うのが安全です。
結論
Qwen 3.8-Maxを無料で使う方法はありますが、条件付きです。
- 手軽に試すならQwen Chat
- API統合を評価するなら、シンガポールリージョンの100万トークン・90日間のModel Studio無料クォータ
- オープンウェイトは公開待ち
- 継続的に無料で使いたいなら旧Qwenモデルも検討
API評価では、デバッグのためにトークンを消費しないことが重要です。Apidogでリクエストをプロトタイプし、レスポンスをモック化し、ライブAPIは最終的な品質評価に集中して使いましょう。

Top comments (0)