DEV Community

Cover image for Qwen 3.8-Max とは?
Akira
Akira

Posted on • Originally published at apidog.com

Qwen 3.8-Max とは?

Alibabaは2026年8月上旬にQwen 3.8-Maxを正式リリースしました。これは、総パラメータ数2.4兆・トークンごとのアクティブパラメータ数95BのMixture-of-Experts(MoE)モデルです。1Mコンテキスト全体で入力100万トークンあたり$2、出力100万トークンあたり$6の一律料金を採用し、Hugging FaceとModelScopeでのウェイト公開も予告されています。MaxクラスのQwenがオープンウェイトとして公開されるのは初めてです。

今すぐApidogを試す

公式発表によると、Qwen 3.8-Maxは従来のQwenで最も高性能なモデルです。ベンダー公開のベンチマークには強力な結果だけでなく、競合に劣る項目も含まれています。

この記事では、Qwen 3.8-Maxの仕様、ベンチマークの読み方、Kimi K3・Fable 5・GPT-5.6 Solとの比較、そしてAPIから実行する実践手順をまとめます。API開発ではOpenAI互換・Anthropic互換の両エンドポイントを利用できるため、Apidogのようなプロトコル対応クライアントを使うと、同じAPIキーで両形式を検証できます。

Qwen 3.8-Maxの概要

仕様 Qwen 3.8-Max
開発元 Alibaba(Qwenチーム)
リリース 2026年8月上旬(Model StudioでGA、8月3日)
アーキテクチャ MoE、Qwen 3.5基盤上に構築
総パラメータ数 2.4T
アクティブパラメータ数 95B(約4%)
コンテキストウィンドウ 1,000,000トークン
最大出力 65,536トークン
モダリティ テキスト・画像入力、テキスト出力
推論制御 reasoning_effort: xhigh(デフォルト)、mediumlow
APIモデルID qwen3.8-max
価格 入力$2 / 出力$6(100万トークンあたり、全コンテキストで一律)
オープンウェイト 約8月10日に公開予定。2026年8月上旬時点では未公開
APIプロトコル OpenAI互換、Anthropic互換

表の仕様はAlibabaのリリース資料とModel Studioの料金ページに基づいています。

Qwen 3.8-Maxとは

Qwen 3.8-Maxは、AlibabaのQwenファミリーにおける新しいフラッグシップモデルです。Qwen 3.5のアーキテクチャを基盤とし、従来のQwen3.7-Maxを置き換えます。

ベンダーの表では、前世代から次のような向上が示されています。

  • Terminal Bench 2.1: 74.5 → 86.6
  • PaperBench: 64.8 → 93.0

Qwen3.7-Maxから移行する場合は、Qwen 3.8 vs Qwen 3.7 Max比較も確認してください。

Qwen 3.8-Maxの概要

重要なのはパラメータ構成です。総パラメータ数は2.4Tですが、MoE設計により、1回のフォワードパスで有効になるのは95Bのみです。この約4%のアクティベーション率が、大規模モデルを入力$2・出力$6という価格で提供できる理由です。

参考として、Kimi K3は総パラメータ数2.8T、アクティブパラメータ数104Bです。Qwen 3.8-Maxは、総数・アクティブ数ともにKimi K3より小さい構成です。

入力はテキストと画像を受け付け、出力はテキストです。Alibabaのブログでは、メモリグラフを使った200ページ超のPDF理解や100時間の動画理解も紹介されています。ただし、公開APIの入力モダリティとして明示されているのはテキストと画像です。

推論レベルを制御する

推論はreasoning_effortで制御できます。

{
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

指定可能な値は以下です。

  • xhigh: デフォルト。より多くの推論を行う
  • medium: 推論量とレイテンシーのバランスを取る
  • low: 推論量を抑える

enable_thinkingpreserve_thinkingも利用でき、思考内容はデフォルトで保持されます。

実装時の注意点は、思考モードと非思考モードの単価自体は同じでも、思考トークンは出力トークンとして課金されることです。デフォルトのxhighを使う場合、単純な入出力本文だけで見積もった額より実コストが増える可能性があります。

初のオープンウェイトMaxクラスQwen

Alibabaはこれまで複数のQwenモデルをオープンソース化してきましたが、Maxティアは公開していませんでした。Qwen 3.8-Maxでは、Hugging FaceとModelScopeへのウェイト公開を「来週」、つまり8月10日頃に予定しています。

導入計画では、次の2点を前提にしてください。

  1. 2026年8月上旬時点ではウェイトをダウンロードできません。

    公開は約束段階です。Kimi K3では、ローンチから11日後にウェイトが公開された前例があります。

  2. 2.4Tモデルのセルフホストにはマルチノード環境が必要です。

    強い量子化を行った場合でも、一般的なワークステーションでの実行を想定する規模ではありません。多くのチームにとって、オープンウェイト化の価値はローカル実行よりも、サードパーティプロバイダーを通じたホスト型アクセスの選択肢が増える点にあります。

API料金をすぐに支払わず試すなら、Qwen ChatまたはModel Studioの無料クォータが現実的です。詳しくはQwen 3.8を無料で利用する方法を参照してください。

ベンチマークが示すもの(敗北を含む)

AlibabaはQwen 3.8-MaxをClaude Opus 4.8、Fable 5、GPT-5.6 Sol、Qwen3.7-Maxと比較したベンチマーク表を公開しています。

結果を読む前に、次の条件を確認してください。

  • 数値はベンダー自身が実行した結果です。
  • コーディング系の多くは、すべてのモデルでClaude Codeハーネスを使用しています。
  • QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBenchはAlibaba独自の社内ベンチマークです。
  • 執筆時点では、Artificial Analysisなどによる独立した数値はありません。

優れている項目

  • PaperBench: 93.0

    GPT-5.6 Solの90.5、Fable 5の88.8、Opus 4.8の80.3を上回ります。

  • IFBench: 82.8

    この項目で最高スコアです。Solの72.7を上回ります。

  • Terminal Bench 2.1: 86.6

    Opus 4.8とFable 5の84.6を上回り、Solの88.8に次ぐ結果です。

  • マルチモーダル・ドキュメント理解

    MathVision 95.2、LogicVista 91.9、OSWorld-Verified 86.1、OCR関連の大半で先行しています。

劣っている項目

  • SWE-bench Pro: 67.7

    Fable 5の80.0を大きく下回り、Opus 4.8の69.2にも届きません。ただしSolの64.6は上回っています。

  • HLE: 43.6

    比較対象のフラッグシップの中で最も低いスコアです。Fable 5は53.3、Solは47.2、Opus 4.8は45.7です。

実務的にまとめると、Alibabaの公開値では、Qwen 3.8-Maxは一部のエージェント関連タスクでOpus 4.8を上回り、主要なコーディング系ではFable 5に届かず、マルチモーダル・ドキュメントインテリジェンスで強みを持ちます。

GPQA Diamondでは92.6でFable 5と同点、Solの94.1にはわずかに届きません。科学推論でも競争力はあります。詳細な表とハーネス条件は、Qwen 3.8ベンチマークの内訳を確認してください。

Alibabaは次のショーケース実行も公開しています。

  • 公開リポジトリでの16日間の自律コーディング
    • 265コミット
    • 127プルリクエスト
  • 元論文のAIME24結果を上回る論文再現実行
  • 24時間で526の人力チーム中458チームを上回った天池コンテストのエントリー

これらは制御された独立評価ではなく、ベンダーによるデモンストレーションとして扱うべきです。Claude Codeハーネスを含む実装面は、コーディングのためのQwen 3.8で確認できます。

Kimi K3、Fable 5、GPT-5.6 Solに対する位置付け

Kimi K3との比較

両者は、中国の研究組織から数週間差で登場した巨大MoEモデルです。

項目 Qwen 3.8-Max Kimi K3
総パラメータ数 2.4T 2.8T
アクティブパラメータ数 95B 104B
モダリティ テキスト・画像 テキストのみ
入力料金 $2 / 1M tokens $3 / 1M tokens
出力料金 $6 / 1M tokens $15 / 1M tokens
キャッシュヒット 入力料金の10% $0.30
ウェイト 公開予定 公開済み

直接的な第三者比較評価はまだありません。各ベンダーが個別のベンチマーク表を公開している状態です。比較の詳細はQwen 3.8 vs Kimi K3を参照してください。Kimi K3を初めて使う場合は、Kimi K3とは何かから始めるとよいでしょう。

Fable 5との比較

Fable 5はコーディング性能の比較対象として依然強力です。Alibaba自身の表でも、Qwen 3.8-MaxはSWE-bench ProとHLEで明確に差をつけられています。

  • SWE-bench Pro: 67.7 vs 80.0
  • HLE: 43.6 vs 53.3

一方、Qwen 3.8-Maxは以下を提供します。

  • より低い料金
  • 1Mトークンのコンテキスト
  • 公開予定のオープンウェイト
  • 強力なマルチモーダル・ドキュメント理解性能

GPT-5.6 Solとの比較

GPT-5.6 Solは次の項目で優位です。

  • Terminal Bench: 88.8 vs 86.6
  • GPQA: 94.1 vs 92.6
  • HLE: 47.2 vs 43.6

Qwen 3.8-Maxは次の項目で優位です。

  • PaperBench: 93.0 vs 90.5
  • IFBench: 82.8 vs 72.7

価格面では、Qwen 3.8-Maxの$2/$6はGPT-5.6 Terraの出力$2/$12を下回ります。Solティアへのアクセスはさらに高価です。

Claude Opus 5は$5/$25でリストされています。ベンチマークの解釈にかかわらず、Alibabaはフラッグシップモデルを大量ワークロードで比較しやすい料金帯に置いています。

料金: 1Mトークン全体で一律$2/$6

料金はシンプルです。

  • 入力: 100万トークンあたり$2
  • 出力: 100万トークンあたり$6
  • 対象範囲: トークン数0から1Mコンテキストまで一律
  • 思考モード: 単価は同じ。ただし思考トークンは出力として課金

長文コンテキストでは、プロンプトが長くなるほど単価が上がるモデルが多い一方、Qwen 3.8-Maxは一律料金です。

Qwen3.7-Maxの定価は$2.5/$7.5ですが、現在は50%割引プロモーションにより$1.25/$3.75で提供されており、コスト重視の選択肢として残っています。

キャッシュと無料クォータ

繰り返し利用する長いシステムプロンプトや共通コンテキストでは、キャッシュを検討してください。

  • キャッシュヒット: 入力料金の10%
  • 明示的なキャッシュ作成: 通常入力料金の125%
  • 無料クォータ: 1Mトークン
  • 対象リージョン: シンガポールのみ
  • 有効期限: 90日間

タスク単位のコスト例や思考トークンを含む見積もりは、Qwen 3.8料金ガイドを参照してください。

Qwen 3.8-Maxへのアクセス方法

アクセスルートは5つあります。

  1. Qwen Chat

    APIキー不要のコンシューマーアプリです。まず対話品質を確認したい場合に向いています。

  2. Alibaba Cloud Model Studio(DashScope)API

    home.qwencloud.comでAPIキーを取得し、DASHSCOPE_API_KEYを設定します。OpenAI互換のChat CompletionsまたはResponsesエンドポイントからqwen3.8-maxを呼び出せます。

  3. Anthropic互換エンドポイント

    https://dashscope-intl.aliyuncs.com/apps/anthropicはAnthropic Messagesプロトコルに対応します。Claude向けに作成したツールは、環境変数を切り替えることでQwenに接続できます。

  4. コーディングハーネス

    AlibabaはClaude Code、Codex、Qoder、Qwen Code、OpenClaw向けの公式設定を公開しています。

  5. オープンウェイト

    Hugging FaceとModelScopeで公開予定です。ただし、2026年8月上旬時点ではダウンロードできません。

OpenAI互換APIを呼び出す

利用するリージョンに合わせてベースURLを選択します。

リージョン ベースURL
北京 https://dashscope.aliyuncs.com/compatible-mode/v1
シンガポール https://dashscope-intl.aliyuncs.com/compatible-mode/v1
米国・バージニア https://dashscope-us.aliyuncs.com/compatible-mode/v1

Model Studioのモデルページでも、Qwen 3.8-Maxは推奨スタックの最上位に掲載されています。

環境変数を設定します。

export DASHSCOPE_API_KEY="your_api_key"
export DASHSCOPE_BASE_URL="https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
Enter fullscreen mode Exit fullscreen mode

次に、OpenAI互換のChat Completionsリクエストを送信します。

curl "$DASHSCOPE_BASE_URL/chat/completions" \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "このPull Requestをレビューし、重大な問題を3件まで挙げてください。"
      }
    ],
    "reasoning_effort": "medium"
  }'
Enter fullscreen mode Exit fullscreen mode

Pythonから呼び出す場合は、OpenAI互換クライアントにベースURLを設定します。

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "このPull Requestをレビューし、重大な問題を3件まで挙げてください。",
        }
    ],
    extra_body={
        "reasoning_effort": "medium",
    },
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

ルート2〜4の詳細な設定は、Qwen 3.8 APIガイドで確認できます。

Claude CodeからAnthropic互換エンドポイントを使う

Claude Codeで利用する場合、Anthropic互換のDashScopeエンドポイントを指定します。

export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

AlibabaはClaude Code以外にも、Codex、Qoder、Qwen Code、OpenClaw向けの公式設定を公開しています。ベンダーのコーディング系ベンチマークの多くはClaude Codeハーネスで実行されているため、同じ条件に近い評価を行いたい場合にも有用です。

デュアルプロトコルAPIのテスト

同じモデルをOpenAI互換・Anthropic互換の両方から呼び出せる場合、実装では次を確認する必要があります。

  • 同じプロンプトで出力品質は変わるか
  • ストリーミングのイベント形式は期待どおりか
  • reasoning_contentがどのタイミングで返るか
  • xhighmediumlowで出力トークン量とコストがどう変わるか
  • リージョンごとのレイテンシーに差があるか

Apidogを使う場合は、北京・シンガポール・米国バージニアのベースURLを環境変数として登録し、リクエストを編集せずにリージョンを切り替えられます。

実践的には、以下のようにテストケースを固定します。

  1. OpenAI互換エンドポイントのリクエストを作成する。
  2. Anthropic互換エンドポイント用に同一タスクのリクエストを作成する。
  3. 同じプロンプト、同じ添付データ、同じ推論レベルで送信する。
  4. SSEストリームを確認し、最終回答前のreasoning_contentの差分を記録する。
  5. レスポンス時間、入力・出力トークン、実コストを比較する。

xhighが生成する思考トークン量を確認しておくことは重要です。思考トークンは出力として請求されるためです。

エンドポイント接続を試す場合は、Apidogを無料でダウンロードしてください。同じワークスペースで、qwen3.8-maxqwen3.7-maxkimi-k3を同じプロンプトでA/Bテストできます。

Qwen 3.8-Maxのラインナップにおける位置付け

Qwen 3.8-Maxは、Qwen3.7-MaxおよびPlusティアより上位に位置します。

選定の目安は次のとおりです。

  • Qwen 3.8-Max: マルチモーダル、ドキュメント理解、エージェント系で最高性能を優先する場合
  • Qwen3.7-Max: プロモーション期間の価格を重視する場合
  • Plusモデル: 日常的なタスクを低コストで処理する場合

ワークロード別の選び方は、最適なQwenモデルのガイドを参照してください。

FAQ

Qwen 3.8はオープンソースですか?

まだではありませんが、公開予定です。Alibabaはローンチ時に、Hugging FaceとModelScopeへ「来週」ウェイトを公開すると説明しています。公開されれば、初のオープンウェイトMaxクラスQwenになります。

2026年8月上旬時点ではダウンロードできません。それまではAPIまたはQwen Chatを利用してください。無料で試す手順はQwen 3.8を無料で利用する方法を参照してください。

Qwen 3.8-Maxの費用はいくらですか?

入力100万トークンあたり$2、出力100万トークンあたり$6です。1Mコンテキスト全体で一律料金です。

キャッシュヒットは入力料金の10%で課金されます。思考トークンは出力として課金され、デフォルトの推論レベルはxhighです。推論を多く使うタスクは、表示単価以上の出力コストを見込んでください。

Qwen 3.8-MaxはKimi K3より優れていますか?

直接比較の独立評価はまだありません。両ベンダーが個別のベンチマーク表を公開しています。

仕様上は、Qwen 3.8-MaxはKimi K3より小さく、マルチモーダル入力に対応し、出力料金も低価格です。

  • Qwen 3.8-Max: 2.4T / アクティブ95B / 出力$6
  • Kimi K3: 2.8T / アクティブ104B / 出力$15

Kimi K3の現時点での利点は、ウェイトがすでに公開されていることです。

Claude CodeでQwen 3.8-Maxを使えますか?

使えます。ANTHROPIC_BASE_URLをAnthropic互換DashScopeエンドポイントに設定し、ANTHROPIC_MODEL=qwen3.8-maxを指定します。

AlibabaはClaude Codeに加えて、Codex、Qoder、Qwen Code、OpenClaw向けの公式設定も公開しています。

次に行うこと

Qwen 3.8-Maxは、プレス向けの先行公開ではなく、3つのAPIリージョンでGAされているフラッグシップモデルです。料金、ベンダー実行のベンチマーク、オープンウェイト公開予定が提示されています。

実務上は、ベンダーの表だけで採用を決めず、自分のワークロードで検証してください。

おすすめの進め方は以下です。

  1. Model Studioの無料クォータを取得する。
  2. OpenAI互換・Anthropic互換の両エンドポイントを接続する。
  3. 本番で使う実際のプロンプトとデータで評価セットを作る。
  4. xhighmediumlowごとに品質・レイテンシー・出力トークン量を測定する。
  5. qwen3.8-maxqwen3.7-maxkimi-k3を同一条件で比較する。
  6. 8月10日頃に予定どおりウェイトが公開されたか確認する。

まずはAPIセットアップガイドから始めてください。

Top comments (0)