2週間にわたり、Qwen 3.8に関する記事には重要な欠落がありました。7月のプレスプレビューではフロンティア級モデルが約束されたものの、スコアが公開されず、初期の報道は使用感に依存していました。2026年8月3日、AlibabaはQwen 3.8-Maxの公式リリース投稿で、Claude Opus 4.8、Fable 5、GPT-5.6 Sol、Qwen3.7-Maxとのベンチマークを公開しました。Gemini 3.1 ProおよびGPT-5.6 Solとのマルチモーダル比較も含まれています。
この記事では、公開テーブルから読み取れる勝敗、解釈時の注意点、そして自分のAPIワークロードで再現可能な評価を行う手順を整理します。モデルのパラメータ、価格、アクセス方法を先に確認したい場合は、Qwen 3.8-Max解説を参照してください。
前提: 以下のスコアはすべてAlibabaが公開したテーブルに基づいています。脚注によると、リーダーボードのデータは2026年8月3日時点のものです。執筆時点で独立評価は公開されていませんでした。
ベンチマークテーブルの概要
Alibabaが公開した主要なテキストモデルの比較です。いずれも数値が高いほど良い評価です。
| ベンチマーク | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity’s Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
出典はAlibabaがベンダーとして実施した評価です。この点は、スコアそのものと同じくらい重要です。
Qwen 3.8-Maxが優位に立つ点
PaperBench: 93.0で首位
研究論文の結果をモデルが再現できるかを測るPaperBenchでは、Qwen 3.8-Maxは93.0でした。
- GPT-5.6 Sol: 90.5
- Fable 5: 88.8
- Claude Opus 4.8: 80.3
- Qwen3.7-Max: 64.8
Qwen3.7-Maxから28ポイント以上伸びています。世代間の変化として非常に大きいため、実運用で研究支援や論文再現を想定する場合は、独自のタスクで再確認すべき項目です。
IFBench: 指示追従で大差
IFBenchではQwen 3.8-Maxが82.8でした。Qwen以外で最も近いGPT-5.6 Solは72.7です。
| モデル | IFBench |
|---|---|
| Qwen 3.8-Max | 82.8 |
| Qwen3.7-Max | 79.1 |
| GPT-5.6 Sol | 72.7 |
| Fable 5 | 63.5 |
| Claude Opus 4.8 | 62.2 |
Qwen3.7-Maxも79.1を記録しているため、指示追従はQwen系列で継続して強い領域に見えます。構造化出力、必須フィールド、複数条件を含むプロンプトを多用するアプリケーションでは、優先的に検証する価値があります。
Terminal Bench 2.1: Claudeを上回るが首位ではない
Terminal Bench 2.1では、Qwen 3.8-Maxは86.6でした。
- GPT-5.6 Sol: 88.8
- Qwen 3.8-Max: 86.6
- Claude Opus 4.8: 84.6
- Fable 5: 84.6
Claude Opus 4.8とFable 5を上回る一方、GPT-5.6 Solには届いていません。したがって、この結果は「エージェント的なターミナルタスクで競争力がある」ことを示しますが、全項目で優位という意味ではありません。
マルチモーダル評価
Alibabaの別のマルチモーダルテーブルでは、Qwen 3.8-Maxは以下の結果を報告しています。
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
- 多くのOCR項目で首位
この比較にはOpus 4.8やFable 5が直接含まれていないため、テキストモデルの比較とは分けて読む必要があります。一方で、視覚的推論、OCR、文書インテリジェンスを必要とするワークロードでは、明確な差別化ポイントです。
Kimi K3はテキストのみのモデルであるため、比較する場合はモダリティの差も考慮してください。Qwen 3.8とKimi K3の比較では、この違いを詳しく扱っています。
Qwen 3.8-Maxが劣る点
Alibabaのテーブルには、Qwen 3.8-Maxが明確に後れを取る項目も残されています。
HLE: 43.6で4モデル中最下位
Humanity’s Last Exam(HLE)は、幅広い知識を問うフロンティアベンチマークです。
| モデル | HLE |
|---|---|
| Fable 5 | 53.3 |
| GPT-5.6 Sol | 47.2 |
| Claude Opus 4.8 | 45.7 |
| Qwen 3.8-Max | 43.6 |
| Qwen3.7-Max | 41.4 |
Qwen3.7-Maxの41.4より改善しているものの、Fable 5とは約10ポイント差です。広範な知識問題や難度の高い推論問題が主なユースケースであれば、この点は無視できません。
SWE-bench Pro: Fable 5との差が大きい
SWE-bench Proでは、Qwen 3.8-Maxは67.7です。
- Fable 5: 80.0
- Claude Opus 4.8: 69.2
- Qwen 3.8-Max: 67.7
- GPT-5.6 Sol: 64.6
- Qwen3.7-Max: 60.6
Qwen3.7-Maxからは改善しています。しかし、深いソフトウェア工学タスクではFable 5に12ポイント以上離されています。
DeepSWEと難しいエージェントタスク
DeepSWEでも、Alibabaのテーブル上ではQwen 3.8-Maxはフロンティアモデルに後れを取ります。公開結果からは、次のように整理できます。
- ターミナル駆動のエージェントタスクでは競争力がある
- 深いソフトウェア工学評価では後れを取る
- マルチモーダルや文書インテリジェンスでは強い
Alibabaの公式料金ページによると、価格は100万トークンあたり入力2ドル、出力6ドルです。この価格帯で見ると強力な結果ですが、全面的なフロンティア首位と結論づけるには不十分です。
ベンチマークを読むときの4つの注意点
ベンダーのベンチマークは、採用判断の材料にはなります。ただし、実測値ではなく、まずはベンダーによる主張として扱うべきです。
1. すべての数値はベンダー実施
Alibabaは自社モデルと競合モデルの両方を評価しています。評価側は次の要素を選択できます。
- ベンチマークのバージョン
- プロンプト戦略
- サンプリング設定
- リトライポリシー
- モデル呼び出し時のツール設定
これらは不正を意味するものではありません。しかし、設定次第で結果は変わります。
2. 多くのコーディング評価はClaude Codeハーネスを使用
Alibabaは、多くのコーディングベンチマークをClaude Codeエージェントハーネスで実行したと説明しています。Qwen 3.8-MaxはAnthropic互換APIを介してこのハーネスに接続されました。
この方法には2つの見方があります。
- 同一の広く使われるハーネスで比較するため、公平性がある
- スコアは「Qwen単体」ではなく「Claude Code内で実行したQwen」の結果になる
エージェント評価では、モデルだけでなくハーネス、ツール定義、リトライ、実行時間制限が結果に影響します。
3. 一部のベンチマークはQwenチームが構築
以下の評価はQwenチームによって構築されています。
- QwenSWEBench
- QwenQoderBench
- CoWorkBench
- RecreationBench
自社製ベンチマークに価値がないわけではありません。ただし、SWE-bench Proのような公開評価と同じ種類の証拠ではありません。数値を引用する前に、そのベンチマークが独立したものか、ベンダー製かを確認してください。
4. Fable 5の脚注
Alibabaのテーブルには、Fable 5について「結果にはフォールバックが含まれる場合があります」という脚注があります。
これは、少なくとも1つの競合モデルの数値が、単一モデルによるクリーンな実行を反映していない可能性を示します。技術的な原因が何であれ、比較結果を単純な順位表として扱わない理由になります。
この問題はAlibabaだけに限りません。Anthropic、OpenAI、Googleを含む各ベンダーが、自社の方法論で評価テーブルを公開しています。Kimi K3ベンチマーク分析でも、同様のパターンを確認できます。
ベンダーの比較表を読むためのチェックリスト
次回ベンチマーク表を見るときは、次の順序で確認してください。
誰が評価を実行したか?
自己申告のスコアか、第三者による評価かを区別します。どのハーネスと設定を使ったか?
エージェント評価では、ハーネス名、ツール、リトライ、制限時間を確認します。ベンダー自身が作ったベンチマークか?
自社製評価と公開評価を同じ重みで扱わないようにします。脚注を読んだか?
フォールバック、モデルバージョン、評価日、設定差が小さく記載されている場合があります。掲載されていない評価は何か?
公開された項目だけでなく、前世代の表から消えた項目も確認します。前世代モデルの比較と照らし合わせると、変化を追跡できます。独立評価を待てるか?
通常は数日から1週間で、コミュニティまたは第三者の評価が出始めます。
独自の評価を実行する
公開ベンチマークを読むより実用的なのは、自分のプロダクションプロンプトで比較することです。
Qwen 3.8-MaxはAlibaba Cloud Model StudioでモデルID qwen3.8-max として利用でき、公式モデルページによるとOpenAI互換APIとAnthropic互換APIの両方に対応しています。
最小構成: 2モデルを同じ入力で比較する
まず、Qwen 3.8-Maxと現在の基準モデルに同じリクエストを送ります。比較対象はQwen3.7-Max、Kimi K3、Claude、GPTなど、実際に置き換え候補になるモデルを選んでください。
リクエストボディの例です。
{
"model": "qwen3.8-max",
"reasoning_effort": "xhigh",
"messages": [
{
"role": "system",
"content": "回答は有効なJSONのみで返してください。"
},
{
"role": "user",
"content": "以下の問い合わせを分類し、category、priority、summaryを返してください。..."
}
]
}
重要なのは、ベンダー提供の汎用プロンプトではなく、実際のアプリケーションで使う入力をそのまま使うことです。
テストケースは20〜30件から始める
最初の評価セットには、次のようなケースを含めます。
- 正常な代表入力
- 長文入力
- 曖昧な入力
- 複数条件を含む入力
- JSONやSQLなど構造化出力が必要な入力
- エラー処理が必要な入力
- 低レイテンシが必要な入力
各テストケースに、モデル名ではなく要件ベースのアサーションを追加します。
- レスポンスが有効なJSONである
- category / priority / summary が存在する
- priority が定義済みの列挙値に含まれる
- summary が指定文字数以内である
- 応答時間が許容しきい値以下である
Apidogで比較する手順
Apidogでは、次の構成で比較できます。
- Model Studioのチャット補完エンドポイント用リクエストを作成する
- モデルIDを
qwen3.8-maxに設定する - 比較対象モデル向けに同一リクエストを複製する
- 実プロンプトを20〜30件のテストシナリオとして保存する
- JSON形式、必須フィールド、値の制約、レイテンシにアサーションを追加する
- 両方のシナリオを連続実行し、合格率と応答時間を比較する
これにより、Alibabaの一般化されたワークロードではなく、自分のワークロードに対する一次データを取得できます。
Qwen 3.8-Maxで追加確認する項目
Qwen 3.8-Maxでは、特に次の2点を確認してください。
reasoning_effort: xhighの影響
モデルはデフォルトでreasoning_effort: xhighになっています。実際にデプロイする設定で、品質だけでなくコストとレイテンシも測定してください。Anthropic互換エンドポイントの挙動
Anthropic互換APIを使用する予定なら、OpenAI互換APIとは別のテストセットとして実行してください。Alibaba自身のコーディングベンチマークの多くも、この形式を使用しています。
Apidogを無料でダウンロードし、両方のエンドポイントを環境として設定すれば、独立リーダーボードの公開を待たずに比較を始められます。
よくある質問
Qwen 3.8のベンチマーク数値は独立して検証されていますか?
いいえ。2026年8月3日時点で公開されている数値はAlibaba自身のテーブルによるものです。執筆時点ではArtificial AnalysisやコミュニティのリーダーボードはQwen 3.8-Maxを評価していませんでした。独立評価が出るまでは、ベンダーの主張として扱うべきです。
Qwen 3.8-Maxの最高のベンチマーク結果は何ですか?
主要なフラッグシップ比較ではPaperBenchの93.0です。GPT-5.6 Solの90.5、Fable 5の88.8、Claude Opus 4.8の80.3を上回っています。マルチモーダル評価では、MathVisionの95.2とOCR関連項目が特に強い結果です。
Qwen 3.8-Maxが明確に劣る点はどこですか?
HLEでは43.6で、4つのフラッグシップモデルの中で最下位です。Fable 5の53.3を大きく下回っています。SWE-bench ProでもFable 5の80.0に対して67.7であり、DeepSWEでも後れを取っています。
Qwen 3.8はQwen 3.7-Maxよりどのくらい改善していますか?
Alibabaのテーブルでは、主な改善は次のとおりです。
| ベンチマーク | Qwen3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
アップグレードが価値を持つかは、価格、モダリティ、レイテンシ、そして自分のタスクでの合格率によって決まります。Qwen 3.8とQwen 3.7の比較も判断材料として参照してください。

Top comments (0)