DEV Community

Cover image for Qwen 3.8 vs Qwen 3.7 Max:何が変わった?変更点を徹底解説
Akira
Akira

Posted on • Originally published at apidog.com

Qwen 3.8 vs Qwen 3.7 Max:何が変わった?変更点を徹底解説

Alibabaは2026年8月上旬にQwen 3.8-Maxをリリースしました。すでに本番環境でqwen3.7-maxを運用している場合、移行判断が必要です。3.8-Maxはエージェント性能と研究ベンチマークを向上させ、画像入力を追加し、定価を引き下げました。さらに、Alibabaは従来のMaxモデルでは示してこなかったオープンウェイト公開も約束しています。

今すぐApidogを試す

ただし、「新モデルなので即移行」とは限りません。Qwen 3.7-Maxには現在50%の期間限定割引があり、実効価格では3.8-Maxより安価です。ベンチマークの改善幅もタスクによって大きく異なります。本記事では、性能、価格、API移行、画像入力、オープンウェイトを比較し、どのモデルを選ぶべきか判断できるようにします。

Qwen 3.8-Maxの概要は、Qwen 3.8-Max解説記事を参照してください。前世代の背景は、Qwen 3.7がもたらしたもので確認できます。

以下のベンチマーク値は、Alibabaが公式Qwen 3.8リリース投稿で公開した比較表に基づいています。両モデルが同一ベンダーのテスト条件で評価されているため、第三者検証前でも世代間の差分を確認する材料にはなります。コーディング系の多くはClaude Codeハーネスで実行され、一部はQwen社内ベンチマークです。

簡潔にまとめると

変更点 Qwen 3.7-Max Qwen 3.8-Max
ターミナルベンチ 2.1 74.5 86.6
SWE-bench Pro 60.6 67.7
PaperBench 64.8 93.0
IFBench 79.1 82.8
GPQAダイヤモンド 92.4 92.6
HLE 41.4 43.6
定価(100万トークンあたり) $2.5イン / $7.5アウト $2イン / $6アウト
現在の価格(プロモーション) $1.25イン / $3.75アウト $2イン / $6アウト
画像入力 なし あり
公開されたアーキテクチャ 非公開 合計2.4兆、アクティブMoE 950億
オープンウェイト 未リリース 「来週」(約8月10日)に公開予定
コンテキストウィンドウ 100万トークン 100万トークン

結論を先に整理すると、エージェント、研究再現、画像理解が重要なら3.8-Maxを評価する価値があります。一方で、一般的なQ&A、要約、チャットが中心で、3.7-Maxの品質で十分なら、プロモーション価格の3.7-Maxは依然として有力です。

ベンチマークの差分:どこが伸びたのか

主な改善は、計画・実行・自己修正を伴う長時間のエージェントタスクと、研究系ワークロードに集中しています。

ターミナルベンチ 2.1:74.5 → 86.6

ターミナル操作を伴うエージェントタスクで12ポイント向上しています。Alibabaの比較表では、Claude Opus 4.8とFable 5がそれぞれ84.6であり、3.8-Maxはこれらを上回ります。GPT-5.6 Solは88.8でリードしています。

CLI操作、リポジトリ探索、テスト実行、ファイル修正を行うエージェントを実装している場合、この改善は優先的に検証すべき項目です。

SWE-bench Pro:60.6 → 67.7

実世界のソフトウェアエンジニアリングタスクで7ポイント向上しています。ただし、Alibabaの同じ比較表ではFable 5が80.0です。3.8-Maxは改善していますが、この項目だけで最先端に到達したわけではありません。

SWE-benchに近いバグ修正ワークロードを持つ場合は、ベンダー比較表だけで判断せず、自社のissue・テスト・CI環境で評価してください。

PaperBench:64.8 → 93.0

AI研究論文の再現タスクでは28ポイント上昇しており、最も大きな改善です。Alibabaの比較では、3.8-Maxはこの項目で他モデルを上回っています。

論文実装、長い技術仕様の読解、多段階の科学的推論を含むワークロードでは、3.8-Maxを優先候補にできます。

IFBench:79.1 → 82.8

指示追従は約4ポイント改善しています。3.7-Maxはすでにこの領域で強く、今回の更新は弱点の補強というより既存性能の上積みです。

構造化出力、複数制約を持つプロンプト、ツール呼び出しの手順制御などでは、実際の失敗率を比較してください。

GPQAダイヤモンド:92.4 → 92.6

ほぼ横ばいです。大学院レベルの科学QAでは、3.7-Maxはすでに高い水準にあり、3.8-Maxへの更新で大きな品質差は見られません。

このタイプの知識QAが中心なら、価格面で3.7-Maxを維持する選択肢があります。

HLE:41.4 → 43.6

HLEでは2ポイント改善していますが、Alibabaの比較表ではFable 5が53.3、GPT-5.6 Solが47.2です。最難関の推論評価では、3.8-Maxにも依然として差があります。

ベンチマークの詳細、ハーネス、社内評価の区別は、Qwen 3.8ベンチマーク詳細解説で確認できます。

アーキテクチャ:公開された数値を容量計画に使う

Qwen 3.8-Maxは、Qwen 3.5のアーキテクチャ基盤上に構築された混合エキスパート(MoE)モデルです。

  • 総パラメータ数:2.4兆
  • 順方向パスあたりのアクティブパラメータ:950億
  • アクティベーション比率:約4%
  • コンテキストウィンドウ:100万トークン

この構成では、総パラメータ数2.4兆ではなく、主にアクティブな950億パラメータ相当の計算量がサービスコストに影響します。

Qwen 3.7-Maxでは、パラメータ数、アクティベーション比率、エキスパート構成などの比較可能な数値は公開されていませんでした。3.8-Maxでは、Model Studioのモデルドキュメントとリリース投稿にアーキテクチャ情報が記載されているため、コスト予測やキャパシティ計画を立てやすくなります。

オープンウェイト競合との比較では、Kimi K3は総パラメータ2.8兆、アクティブ1040億です。Qwen 3.8-Maxは両方の軸でより小規模です。

マルチモーダル:3.7-Maxにはない画像入力

Qwen 3.7-Maxはテキストモデルです。Qwen 3.8-Maxはネイティブの画像入力をサポートします。

Alibabaが公開したマルチモーダル比較表では、以下のスコアが示されています。

  • MathVision:95.2
  • LogicVista:91.9
  • OSWorld-Verified:86.1

3.7-Maxの比較列が存在しないのは、古いモデルが画像を受け付けないためです。

実装上は、これまで別のビジョンモデルにルーティングしていた処理を、3.8-Maxへ統合できる可能性があります。

  • スクリーンショットの理解
  • 文書画像の抽出
  • UI自動化
  • グラフやダッシュボードの読み取り
  • 画面操作エージェント

ただし、リリース投稿で紹介されている長文文書や動画の理解は、個別のAPI入力タイプとして明記されたものではなく、ブログ上のデモです。対象ユースケースを実装する前に、対応するAPI入力形式を確認してください。

価格:定価では3.8-Max、現時点では3.7-Maxが安い

Qwen 3.8-Maxの定価は、100万トークンあたり以下です。

  • 入力:$2
  • 出力:$6

Qwen 3.7-Maxの定価は以下です。

  • 入力:$2.5
  • 出力:$7.5

定価ベースでは、3.8-Maxはより高性能でありながら、入力・出力ともに約20%安価です。

ただし、3.7-Maxには期間限定の50%プロモーションがあります。

  • 入力:$1.25
  • 出力:$3.75

現時点の実効価格では、3.7-Maxは3.8-Maxより約38%安価です。料金は公式Model Studio価格ページで確認できます。

コスト比較で確認すべき2点

  1. プロモーション終了後の価格を前提にする

    Alibabaはこの割引を期間限定としていますが、終了日は公開していません。長期的な予算計画では、3.7-Maxの割引価格ではなく、3.8-Maxの定価で比較する必要があります。

  2. 思考トークンを含めて見積もる

    Qwen 3.8-Maxはデフォルトでreasoning_effort: xhighです。思考トークンは出力として課金されるため、実リクエストのコストが表示単価だけでは予測できない場合があります。

reasoning_effortは明示的に設定して、品質とコストのバランスを制御してください。

{
  "model": "qwen3.8-max",
  "messages": [
    {
      "role": "user",
      "content": "次の障害ログを分析し、原因と修正案をJSONで返してください。"
    }
  ],
  "reasoning_effort": "medium"
}
Enter fullscreen mode Exit fullscreen mode

キャッシュ経済性やタスク単価の算出は、Qwen 3.8価格ガイドで確認できます。

両方のMaxモデルが予算に合わない場合、qwen3.7-plusは入力$0.4、出力$1.6で提供されています。定型的な分類・抽出・テンプレート生成では、Plus対Maxの比較も参考にしてください。

オープンウェイト:Maxクラスでは初の試み

Qwen-Maxクラスでオープンウェイトが提供された前例はありません。Qwen 3.7-Maxも非公開でした。

Qwen 3.8-Maxでは、リリース投稿においてHugging FaceとModelScopeで「来週」、おおよそ2026年8月10日頃にウェイトを公開すると記載されています。

本稿執筆時点の2026年8月3日では、まだダウンロードできません。したがって、調達要件やコンプライアンス要件でオープンウェイトが必須の場合は、実際に公開され、ライセンスや配布条件を確認できるまで本番採用を確定しない方が安全です。

なお、量子化済みであっても2.4兆パラメータのセルフホスティングは、ほとんどのチームにとってマルチノード運用のプロジェクトになります。現実的な影響は、自社ラックへの導入よりも、サードパーティホスティングの選択肢や価格競争に現れる可能性があります。

変わらなかった点

アップグレード判断では、変更されていない部分も重要です。

  • コンテキストウィンドウ:両方とも100万トークン

    長文コンテキストの上限は拡張されていません。3.8-Maxも100万トークンを維持し、コンテキスト全体でフラットな価格が適用されます。

  • アクセスパス:同じModel Studio API

    どちらもOpenAI互換エンドポイントを持つAlibaba Cloud Model Studioから利用できます。基本的な切り替えはモデルIDの変更です。

  • 推論設定:3.8-Maxでは明示的に制御可能

    3.8-Maxでは、reasoning_effortenable_thinkingpreserve_thinkingが文書化されています。reasoning_effortにはデフォルトのxhighmediumlowがあります。

基本的な移行は次のようになります。

- "model": "qwen3.7-max"
+ "model": "qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

3.8-MaxはAnthropic互換APIサーフェスも追加しています。対応ツールを使っている場合は、Apidogのようなクライアントで、OpenAI互換・Anthropic互換の両方をテストできます。

アップグレードすべきか?3つの判断基準

1. 今すぐ3.8-Maxを評価すべきケース

次のワークロードでは、3.8-Maxを優先してA/Bテストしてください。

  • ターミナル操作を行うエージェント
  • コード修正・テスト・反復実行を行うエージェント
  • 研究論文の再現
  • 長い技術文書の分析
  • スクリーンショットや文書画像の理解
  • UI自動化・コンピューター操作

TerminalBench 2.1の74.5→86.6、PaperBenchの64.8→93.0は、本番ワークロードでも差が出る可能性がある改善です。

2. 3.7-Maxのプロモーションを活用すべきケース

次のようなタスクでは、3.7-Maxを維持する合理性があります。

  • 一般的なQ&A
  • 要約
  • チャット
  • 知識ベース検索の回答生成
  • 画像入力を必要としない定型ワークロード

GPQAダイヤモンドは92.4→92.6でほぼ変化していません。既存の品質要件を3.7-Maxが満たしているなら、$1.25 / $3.75のプロモーション価格は有利です。

ただし、割引終了を見逃さないよう、価格確認のリマインダーを設定してください。割引終了後の比較対象は3.7-Maxの定価ではなく、3.8-Maxの$2 / $6です。

3. qwen3.7-plusへ移行すべきケース

コストが最優先で、タスクが定型的ならqwen3.7-plusを検討できます。

  • 分類
  • 情報抽出
  • フォーマット変換
  • テンプレートベースの文章生成
  • 単純なJSON生成

$0.4 / $1.6では、3.8-Maxの入力価格と比べて5倍安価です。Maxクラスの推論性能が不要なパイプラインでは、より低いティアの方が費用対効果に優れます。

コミット前に切り替えをテストする

ベンダーベンチマークだけで移行を決めないでください。実際に重要なのは、自社のプロンプト、ツール定義、出力スキーマ、レイテンシ要件、トークン消費量です。

最小限の比較手順は次のとおりです。

  1. 本番を代表する20〜50件のプロンプトを用意する
  2. 成功条件を定義する
    • JSON妥当性
    • テスト通過率
    • タスク完了率
    • 人手レビューの評価
    • レスポンス時間
    • 出力トークン数
  3. モデルIDだけを変えた2つの環境を作る
  4. 同じリクエストを両モデルへ送る
  5. 品質だけでなく、実効コストを比較する
  6. 画像入力が必要なケースは3.8-Max専用の評価セットとして分離する

たとえば、環境変数でモデルを切り替える構成にすると、アプリケーションコードを変更せずに比較できます。

# .env.qwen37
MODEL_ID=qwen3.7-max
REASONING_EFFORT=medium

# .env.qwen38
MODEL_ID=qwen3.8-max
REASONING_EFFORT=medium
Enter fullscreen mode Exit fullscreen mode

Pythonでの最小例です。

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url=os.environ["MODEL_STUDIO_BASE_URL"],
)

response = client.chat.completions.create(
    model=os.environ["MODEL_ID"],
    messages=[
        {
            "role": "user",
            "content": "次のPR差分をレビューし、重大度順に問題点を列挙してください。"
        }
    ],
    extra_body={
        "reasoning_effort": os.getenv("REASONING_EFFORT", "medium")
    }
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Apidogでは、1つのコレクションに対してモデルIDだけが異なる2つの環境を作成できます。

  • 環境A:qwen3.7-max
  • 環境B:qwen3.8-max

同一のModel Studio OpenAI互換エンドポイントに対してリクエストを実行し、環境を切り替えながら出力、レイテンシ、トークン使用量を比較できます。代表的な本番プロンプトをテストシナリオとして保存しておけば、Alibabaの更新や価格改定時にも再利用できます。

Apidogを無料でダウンロードし、本番設定を変更する前に自社トラフィックで比較してください。

よくある質問

Qwen 3.8-MaxはQwen 3.7-Maxより安いですか?

定価では安価です。Qwen 3.8-Maxは100万トークンあたり入力$2、出力$6であり、Qwen 3.7-Maxの$2.5 / $7.5を下回ります。

ただし現時点では、3.7-Maxの期間限定50%プロモーションにより$1.25 / $3.75となっており、3.8-Maxより約38%安価です。詳細はQwen 3.8価格ガイドを参照してください。

qwen3.7-maxからqwen3.8-maxへの切り替えでコード変更は必要ですか?

基本的なテキスト利用では、通常はモデルIDの変更だけです。両モデルは同じOpenAI互換のModel Studioエンドポイントで利用できます。

ただし、3.8-Maxでは以下を確認してください。

  • reasoning_effortを明示的に設定する
  • 思考トークンを含めてコストを計測する
  • 画像を送る場合は対応する画像入力メッセージ形式を使う

Qwen 3.7-Maxにはオープンウェイトがありますか?

ありません。Alibabaのこれまでの方針から、今後も公開される可能性は低いと考えられます。

Qwen 3.8-Maxは、オープンウェイト公開が約束された初のMaxクラスモデルです。2026年8月10日頃にHugging FaceとModelScopeで公開予定ですが、2026年8月3日時点ではまだダウンロードできません。

Qwen 3.8-MaxはClaudeやGPTより優れていますか?

評価項目によって異なります。また、ここで紹介した数値はAlibaba自身の比較表です。

Alibabaの表では、Qwen 3.8-Maxは以下で高い結果を示しています。

  • TerminalBench 2.1:Opus 4.8とFable 5を上回る
  • PaperBench:比較対象モデルを上回る
  • IFBench:比較対象モデルを上回る

一方で、以下では差があります。

  • SWE-bench Pro:Fable 5が80.0、Qwen 3.8-Maxが67.7
  • HLE:Fable 5が53.3、GPT-5.6 Solが47.2、Qwen 3.8-Maxが43.6

第三者による独立評価が出るまでは、ベンチマークを参考値として扱い、自社タスクで検証するのが安全です。

Top comments (0)