DEV Community

Cover image for Qwen 3.8ベンチマーク分析:アリババの性能評価から読み解く真価と限界
Akira
Akira

Posted on • Originally published at apidog.com

Qwen 3.8ベンチマーク分析:アリババの性能評価から読み解く真価と限界

2週間にわたり、Qwen 3.8に関する記事には重要な欠落がありました。7月のプレスプレビューではフロンティア級モデルが約束されたものの、スコアが公開されず、初期の報道は使用感に依存していました。2026年8月3日、AlibabaはQwen 3.8-Maxの公式リリース投稿で、Claude Opus 4.8、Fable 5、GPT-5.6 Sol、Qwen3.7-Maxとのベンチマークを公開しました。Gemini 3.1 ProおよびGPT-5.6 Solとのマルチモーダル比較も含まれています。

今すぐApidogを試す

この記事では、公開テーブルから読み取れる勝敗、解釈時の注意点、そして自分のAPIワークロードで再現可能な評価を行う手順を整理します。モデルのパラメータ、価格、アクセス方法を先に確認したい場合は、Qwen 3.8-Max解説を参照してください。

前提: 以下のスコアはすべてAlibabaが公開したテーブルに基づいています。脚注によると、リーダーボードのデータは2026年8月3日時点のものです。執筆時点で独立評価は公開されていませんでした。

ベンチマークテーブルの概要

Alibabaが公開した主要なテキストモデルの比較です。いずれも数値が高いほど良い評価です。

ベンチマーク Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (Humanity’s Last Exam) 43.6 45.7 53.3 47.2 41.4

出典はAlibabaがベンダーとして実施した評価です。この点は、スコアそのものと同じくらい重要です。

Qwen 3.8-Maxが優位に立つ点

PaperBench: 93.0で首位

研究論文の結果をモデルが再現できるかを測るPaperBenchでは、Qwen 3.8-Maxは93.0でした。

  • GPT-5.6 Sol: 90.5
  • Fable 5: 88.8
  • Claude Opus 4.8: 80.3
  • Qwen3.7-Max: 64.8

Qwen3.7-Maxから28ポイント以上伸びています。世代間の変化として非常に大きいため、実運用で研究支援や論文再現を想定する場合は、独自のタスクで再確認すべき項目です。

IFBench: 指示追従で大差

IFBenchではQwen 3.8-Maxが82.8でした。Qwen以外で最も近いGPT-5.6 Solは72.7です。

モデル IFBench
Qwen 3.8-Max 82.8
Qwen3.7-Max 79.1
GPT-5.6 Sol 72.7
Fable 5 63.5
Claude Opus 4.8 62.2

Qwen3.7-Maxも79.1を記録しているため、指示追従はQwen系列で継続して強い領域に見えます。構造化出力、必須フィールド、複数条件を含むプロンプトを多用するアプリケーションでは、優先的に検証する価値があります。

Terminal Bench 2.1: Claudeを上回るが首位ではない

Terminal Bench 2.1では、Qwen 3.8-Maxは86.6でした。

  • GPT-5.6 Sol: 88.8
  • Qwen 3.8-Max: 86.6
  • Claude Opus 4.8: 84.6
  • Fable 5: 84.6

Claude Opus 4.8とFable 5を上回る一方、GPT-5.6 Solには届いていません。したがって、この結果は「エージェント的なターミナルタスクで競争力がある」ことを示しますが、全項目で優位という意味ではありません。

マルチモーダル評価

Alibabaの別のマルチモーダルテーブルでは、Qwen 3.8-Maxは以下の結果を報告しています。

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1
  • 多くのOCR項目で首位

この比較にはOpus 4.8やFable 5が直接含まれていないため、テキストモデルの比較とは分けて読む必要があります。一方で、視覚的推論、OCR、文書インテリジェンスを必要とするワークロードでは、明確な差別化ポイントです。

Kimi K3はテキストのみのモデルであるため、比較する場合はモダリティの差も考慮してください。Qwen 3.8とKimi K3の比較では、この違いを詳しく扱っています。

Qwen 3.8-Maxが劣る点

Alibabaのテーブルには、Qwen 3.8-Maxが明確に後れを取る項目も残されています。

HLE: 43.6で4モデル中最下位

Humanity’s Last Exam(HLE)は、幅広い知識を問うフロンティアベンチマークです。

モデル HLE
Fable 5 53.3
GPT-5.6 Sol 47.2
Claude Opus 4.8 45.7
Qwen 3.8-Max 43.6
Qwen3.7-Max 41.4

Qwen3.7-Maxの41.4より改善しているものの、Fable 5とは約10ポイント差です。広範な知識問題や難度の高い推論問題が主なユースケースであれば、この点は無視できません。

SWE-bench Pro: Fable 5との差が大きい

SWE-bench Proでは、Qwen 3.8-Maxは67.7です。

  • Fable 5: 80.0
  • Claude Opus 4.8: 69.2
  • Qwen 3.8-Max: 67.7
  • GPT-5.6 Sol: 64.6
  • Qwen3.7-Max: 60.6

Qwen3.7-Maxからは改善しています。しかし、深いソフトウェア工学タスクではFable 5に12ポイント以上離されています。

DeepSWEと難しいエージェントタスク

DeepSWEでも、Alibabaのテーブル上ではQwen 3.8-Maxはフロンティアモデルに後れを取ります。公開結果からは、次のように整理できます。

  • ターミナル駆動のエージェントタスクでは競争力がある
  • 深いソフトウェア工学評価では後れを取る
  • マルチモーダルや文書インテリジェンスでは強い

Alibabaの公式料金ページによると、価格は100万トークンあたり入力2ドル、出力6ドルです。この価格帯で見ると強力な結果ですが、全面的なフロンティア首位と結論づけるには不十分です。

ベンチマークを読むときの4つの注意点

ベンダーのベンチマークは、採用判断の材料にはなります。ただし、実測値ではなく、まずはベンダーによる主張として扱うべきです。

1. すべての数値はベンダー実施

Alibabaは自社モデルと競合モデルの両方を評価しています。評価側は次の要素を選択できます。

  • ベンチマークのバージョン
  • プロンプト戦略
  • サンプリング設定
  • リトライポリシー
  • モデル呼び出し時のツール設定

これらは不正を意味するものではありません。しかし、設定次第で結果は変わります。

2. 多くのコーディング評価はClaude Codeハーネスを使用

Alibabaは、多くのコーディングベンチマークをClaude Codeエージェントハーネスで実行したと説明しています。Qwen 3.8-MaxはAnthropic互換APIを介してこのハーネスに接続されました。

この方法には2つの見方があります。

  • 同一の広く使われるハーネスで比較するため、公平性がある
  • スコアは「Qwen単体」ではなく「Claude Code内で実行したQwen」の結果になる

エージェント評価では、モデルだけでなくハーネス、ツール定義、リトライ、実行時間制限が結果に影響します。

3. 一部のベンチマークはQwenチームが構築

以下の評価はQwenチームによって構築されています。

  • QwenSWEBench
  • QwenQoderBench
  • CoWorkBench
  • RecreationBench

自社製ベンチマークに価値がないわけではありません。ただし、SWE-bench Proのような公開評価と同じ種類の証拠ではありません。数値を引用する前に、そのベンチマークが独立したものか、ベンダー製かを確認してください。

4. Fable 5の脚注

Alibabaのテーブルには、Fable 5について「結果にはフォールバックが含まれる場合があります」という脚注があります。

これは、少なくとも1つの競合モデルの数値が、単一モデルによるクリーンな実行を反映していない可能性を示します。技術的な原因が何であれ、比較結果を単純な順位表として扱わない理由になります。

この問題はAlibabaだけに限りません。Anthropic、OpenAI、Googleを含む各ベンダーが、自社の方法論で評価テーブルを公開しています。Kimi K3ベンチマーク分析でも、同様のパターンを確認できます。

ベンダーの比較表を読むためのチェックリスト

次回ベンチマーク表を見るときは、次の順序で確認してください。

  1. 誰が評価を実行したか?

    自己申告のスコアか、第三者による評価かを区別します。

  2. どのハーネスと設定を使ったか?

    エージェント評価では、ハーネス名、ツール、リトライ、制限時間を確認します。

  3. ベンダー自身が作ったベンチマークか?

    自社製評価と公開評価を同じ重みで扱わないようにします。

  4. 脚注を読んだか?

    フォールバック、モデルバージョン、評価日、設定差が小さく記載されている場合があります。

  5. 掲載されていない評価は何か?

    公開された項目だけでなく、前世代の表から消えた項目も確認します。前世代モデルの比較と照らし合わせると、変化を追跡できます。

  6. 独立評価を待てるか?

    通常は数日から1週間で、コミュニティまたは第三者の評価が出始めます。

独自の評価を実行する

公開ベンチマークを読むより実用的なのは、自分のプロダクションプロンプトで比較することです。

Qwen 3.8-MaxはAlibaba Cloud Model StudioでモデルID qwen3.8-max として利用でき、公式モデルページによるとOpenAI互換APIとAnthropic互換APIの両方に対応しています。

最小構成: 2モデルを同じ入力で比較する

まず、Qwen 3.8-Maxと現在の基準モデルに同じリクエストを送ります。比較対象はQwen3.7-Max、Kimi K3、Claude、GPTなど、実際に置き換え候補になるモデルを選んでください。

リクエストボディの例です。

{
  "model": "qwen3.8-max",
  "reasoning_effort": "xhigh",
  "messages": [
    {
      "role": "system",
      "content": "回答は有効なJSONのみで返してください。"
    },
    {
      "role": "user",
      "content": "以下の問い合わせを分類し、category、priority、summaryを返してください。..."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

重要なのは、ベンダー提供の汎用プロンプトではなく、実際のアプリケーションで使う入力をそのまま使うことです。

テストケースは20〜30件から始める

最初の評価セットには、次のようなケースを含めます。

  • 正常な代表入力
  • 長文入力
  • 曖昧な入力
  • 複数条件を含む入力
  • JSONやSQLなど構造化出力が必要な入力
  • エラー処理が必要な入力
  • 低レイテンシが必要な入力

各テストケースに、モデル名ではなく要件ベースのアサーションを追加します。

- レスポンスが有効なJSONである
- category / priority / summary が存在する
- priority が定義済みの列挙値に含まれる
- summary が指定文字数以内である
- 応答時間が許容しきい値以下である
Enter fullscreen mode Exit fullscreen mode

Apidogで比較する手順

Apidogでは、次の構成で比較できます。

  1. Model Studioのチャット補完エンドポイント用リクエストを作成する
  2. モデルIDをqwen3.8-maxに設定する
  3. 比較対象モデル向けに同一リクエストを複製する
  4. 実プロンプトを20〜30件のテストシナリオとして保存する
  5. JSON形式、必須フィールド、値の制約、レイテンシにアサーションを追加する
  6. 両方のシナリオを連続実行し、合格率と応答時間を比較する

これにより、Alibabaの一般化されたワークロードではなく、自分のワークロードに対する一次データを取得できます。

Qwen 3.8-Maxで追加確認する項目

Qwen 3.8-Maxでは、特に次の2点を確認してください。

  1. reasoning_effort: xhighの影響

    モデルはデフォルトでreasoning_effort: xhighになっています。実際にデプロイする設定で、品質だけでなくコストとレイテンシも測定してください。

  2. Anthropic互換エンドポイントの挙動

    Anthropic互換APIを使用する予定なら、OpenAI互換APIとは別のテストセットとして実行してください。Alibaba自身のコーディングベンチマークの多くも、この形式を使用しています。

Apidogを無料でダウンロードし、両方のエンドポイントを環境として設定すれば、独立リーダーボードの公開を待たずに比較を始められます。

よくある質問

Qwen 3.8のベンチマーク数値は独立して検証されていますか?

いいえ。2026年8月3日時点で公開されている数値はAlibaba自身のテーブルによるものです。執筆時点ではArtificial AnalysisやコミュニティのリーダーボードはQwen 3.8-Maxを評価していませんでした。独立評価が出るまでは、ベンダーの主張として扱うべきです。

Qwen 3.8-Maxの最高のベンチマーク結果は何ですか?

主要なフラッグシップ比較ではPaperBenchの93.0です。GPT-5.6 Solの90.5、Fable 5の88.8、Claude Opus 4.8の80.3を上回っています。マルチモーダル評価では、MathVisionの95.2とOCR関連項目が特に強い結果です。

Qwen 3.8-Maxが明確に劣る点はどこですか?

HLEでは43.6で、4つのフラッグシップモデルの中で最下位です。Fable 5の53.3を大きく下回っています。SWE-bench ProでもFable 5の80.0に対して67.7であり、DeepSWEでも後れを取っています。

Qwen 3.8はQwen 3.7-Maxよりどのくらい改善していますか?

Alibabaのテーブルでは、主な改善は次のとおりです。

ベンチマーク Qwen3.7-Max Qwen 3.8-Max
Terminal Bench 2.1 74.5 86.6
SWE-bench Pro 60.6 67.7
PaperBench 64.8 93.0

アップグレードが価値を持つかは、価格、モダリティ、レイテンシ、そして自分のタスクでの合格率によって決まります。Qwen 3.8とQwen 3.7の比較も判断材料として参照してください。

Top comments (0)