ほとんどのモデル発表では、コーディング能力は「HumanEval のスコア」や「バイナリ検索の実装例」のような形で示されます。しかし、Alibaba が Qwen 3.8-Max で掲げたのは、優れた関数を書けることではありません。数週間にわたってソフトウェアプロジェクトを単独で進め、イシュー作成、プルリクエストのマージ、機能リリースまで実行できる、という主張です。
これは大胆な主張であり、精査が必要です。この記事では、Alibaba が発表時に公開した 3 つのコーディングショーケース、関連するベンチマーク、そして Claude Code、Codex、Qoder、Qwen Code、OpenClaw から qwen3.8-max を実際に利用する設定を解説します。あわせて、生成コードが呼び出す API をテスト・モックする方法も紹介します。
モデル自体が初めてなら、まずは Qwen 3.8とは何か を確認してください。総パラメータ数は 2.4T、アクティブパラメータ数は 95B、コンテキストウィンドウは 1M トークンで、リリース後 1 週間以内にオープンウェイトの提供が約束されています。この記事ではコーディング面に絞ります。以下はすべて 2026 年 8 月 3 日時点の情報です。
Alibabaが実際に主張していること
公式の Qwen 3.8 リリース投稿で Alibaba が示しているのは、コード断片を生成する能力を超えた自律性です。
Qwen 3.8-Max は、長期的なエンジニアリングタスクのコンテキストを維持し、計画を立て、数日にわたって実装し、失敗から回復し、レビュー可能な成果物を納品できるモデルとして位置付けられています。
この主張で注目すべきポイントは 3 つあります。
デモの実行期間が長い
16 日間の実行は、20 分程度のエージェントベンチマークとは別の問題です。この規模では、エラーからの回復、コンテキスト管理、作業方針のドリフトが重要になります。1 つのデモは公開リポジトリで確認できる
コミット、PR、イシュー、実装コードを自分で確認できます。多くのベンダーショーケースでは得られない検証材料です。競合製品のハーネスを使っている
Alibaba は多くのコーディングベンチマークを Claude Code ハーネスで実行し、設定も公開しています。同じ構成をローカルで再現できます。
ただし、重要な前提があります。この記事で扱う数値はすべて Alibaba 自身の発表資料によるものです。2026 年 8 月上旬時点では独立検証は存在しません。ショーケースは監査済みの証拠ではなく、ベンダーデモとして扱うべきです。
3つのコーディングショーケース
oh-my-cli:16日間の自律開発
もっとも目立つデモは、コマンドラインツールを構築する oh-my-cli です。Alibaba は Qwen 3.8-Max を無人で実行し、7 月 30 日時点で次の結果を示しました。
- 実行期間:16 日間
- コミット:265 件
- プルリクエスト:127 件
- イシュー:151 件
これらのイシュー、PR、作業、クローズ処理はすべてモデル自身が行ったとされています。
リポジトリは qwen-code-dev-bot/oh-my-cli として公開されています。このショーケースで最も実用的なのは、数値をそのまま信じる必要がない点です。
監査する場合は、次の観点で確認してください。
- PR は参照しているイシューを本当に解決しているか
- クローズするためだけの人工的なタスクを作っていないか
- 回帰を発生させた後、どのように検出・修正しているか
- コミットが小さくレビュー可能な単位になっているか
- テストの追加や更新が変更内容に対応しているか
このような履歴は、単発のベンチマークスコアよりも、長時間動かしたときの信頼性を判断する材料になります。
論文再現実行:研究コード向けのデモ
2 つ目のデモは、機械学習論文をゼロから再現する研究コードです。
Alibaba の発表によると、この実行では以下が行われました。
- 実行時間:約 125 時間
- 生成コード:約 7,600 行
- GPU トレーニング:33 ラウンド
モデルは論文内の知見を 6 件再現し、AIME24 では論文が報告した結果を 2.7 ポイント上回ったとされています。
研究再現では、環境依存、脚注に隠れたハイパーパラメータ、サイレントな実装バグなどが問題になります。長時間のトレーニングを繰り返し、結果を比較しながら修正する能力は、単純なコード補完とは異なるものです。
このデモは、後述する Qwen 3.8-Max の PaperBench スコアと対応しています。
天池コンテスト:人間チームとの24時間対決
3 つ目は、Alibaba の天池プラットフォーム上で実施された 24 時間のデータサイエンスコンペティションです。
モデルは実行中に 45 回提出し、各スコアを次の改善へフィードバックして、最終的に精度 0.853 を記録しました。参加した 526 チームのうち 458 チームを上回ったとされています。
この結果は「優勝」ではありませんが、参加チームの約 87% を上回ったという点で、印象的かつ比較的率直な結果です。また、短い制限時間の中で仮説、実装、提出、評価を繰り返す能力も示しています。
一方で、天池は Alibaba 自身のプラットフォームです。デモが実際のコンテスト形式であったとしても、会場をベンダーが管理していた点は考慮する必要があります。
デモの背景にあるコーディングベンチマーク
Alibaba は発表時にベンチマーク表を公開しました。コーディング関連の主要な数値は次のとおりです。
| ベンチマーク | Qwen 3.8-Max | 最高の競合他社(Alibabaの表による) |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8(GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0(Fable 5) |
| PaperBench | 93.0 | 90.5(GPT-5.6 Sol) |
読み取るべきポイントは 3 つです。
Terminal Bench 2.1:86.6
Alibaba の表では、Claude Opus 4.8 と Fable 5 の84.6を上回っています。ターミナル操作を伴うエージェント作業の結果であり、oh-my-cliデモと対応します。SWE-bench Pro:67.7
リポジトリ規模のバグ修正では劣勢です。同じ表で Fable 5 は80.0を記録しており、差は 12 ポイント以上あります。既存コードベースのイシュー修正という日常的なタスクに最も近い評価で、Qwen 3.8-Max が首位ではないことを示します。PaperBench:93.0
比較対象を上回る、このモデルの最も強い主要スコアです。論文再現デモの主張を直接補強する数値です。
なお、Alibaba はこれらのコーディングベンチマークの多くを Claude Code ハーネスで実行しており、競合モデルの実行も含まれています。また表の脚注では、Fable 5 の結果にフォールバックが含まれる可能性が示されています。
エージェントベンチマークでは、ハーネスの違いがスコアに大きく影響します。ベンダーが特定ハーネス上で実行した表は、比較材料の 1 つであって最終判断ではありません。
ただし実務面では、Claude Code を使う開発者にとって再現しやすい構成が公開されている、という利点でもあります。
今日からQwen 3.8で実際にコーディングする方法
Qwen 3.8-Max は Alibaba Cloud Model Studio で一般公開されており、Alibaba は 5 つのコーディングツール向け設定を公開しています。
すべての構成で DashScope API キーが必要です。キーは home.qwencloud.com から取得します。
公式 Model Studio 料金ページによると、料金は以下です。
- 入力:100 万トークンあたり 2 ドル
- 出力:100 万トークンあたり 6 ドル
- 1M コンテキスト全体で同一料金
Claude Code
Qwen 3.8-Max は Anthropic 互換 API エンドポイントを提供しています。Claude Code を接続するには、以下の環境変数を設定します。
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
設定後は通常どおり Claude Code を起動します。
claude
Claude Code からのリクエストは、Claude モデルではなく Qwen 3.8-Max にルーティングされます。Alibaba がコーディングベンチマークの多くで利用したハーネスであり、発表内容を試すには最も近い構成です。
Codex
Codex ではプロバイダー設定を追加します。
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
API キーを環境変数に設定します。
export DASHSCOPE_API_KEY=your-dashscope-api-key
Codex の設定では Anthropic 互換ではなく、OpenAI 互換エンドポイントを使用します。モデルと API キーは同じですが、プロトコル形式が異なります。
Qoder、Qwen Code、OpenClaw
残りの 3 ツールは次のように設定します。
Qoder CLI
Alibaba のエージェント型コーディングツールです。モデルとしてqwen3.8-maxを選択します。Qwen Code
Qwen チームのオープンソース CLI です。DASHSCOPE_API_KEYを設定してモデルを選択します。以前の Qwen コーディングモデルを使ったことがある場合、追加の変更はほとんどありません。OpenClaw
公式設定ではモデル ID を指定し、maxTokensを65536に設定します。これはモデルの最大出力長でもあります。
各ツールの最新設定は、ブログ記事に固定された内容ではなく、Qwen 3.8 の公式リリース投稿で確認してください。
推論努力をタスク別に設定する
Qwen 3.8-Max は reasoning_effort パラメータをサポートします。
-
xhigh:デフォルト mediumlow
コーディングでは、この設定がコストと品質に直接影響します。
| タスク | 推奨設定 | 理由 |
|---|---|---|
| 複数ファイルの変更 | xhigh |
依存関係と変更範囲を分析する必要があるため |
| デバッグ、原因調査 | xhigh |
仮説検証とログ解析に推論が必要なため |
| 実装前の設計・計画 | xhigh |
後戻りを減らしやすいため |
| リネーム | low |
機械的な編集であるため |
| コメント・docstring の追加 | low |
深い推論が不要な場合が多いため |
| 単純なフォーマット修正 | low |
速度とコストを優先できるため |
推論トークンは出力トークンとして課金され、100 万トークンあたり 6 ドルです。xhigh はデフォルトですが、長時間のエージェント実行ではコストが大きくなる可能性があります。
単純な編集に xhigh を使い続けると、メリットが少ないままコストだけが増えます。まずはタスクを分類し、必要な場面でだけ高い推論努力を使う運用が安全です。
Qwen 3.8-Max がタスクに対して過剰な場合は、専用コーディングモデルである Qwen3 Coder や、高速・低コスト向けの Qwen3 Coder Flash も選択肢です。他のオープンウェイトモデルについては、Kimi K3がコーディング作業をどのように処理するか も参考になります。
モデルが構築するものをテストする:Apidogのステップ
自律コーディングのデモには、よく見落とされるギャップがあります。
モデルは API を呼び出すコードを生成できますが、その API 呼び出しが正しいかどうかは別問題です。コードがコンパイルできても、次のような問題は残ります。
- 間違ったエンドポイントを呼び出している
-
429 Too Many Requestsを誤って処理している - 本番環境ではバリデーションに失敗するリクエストボディを送信している
- 認証トークンの更新フローを実装できていない
- エラー応答を正常レスポンスとして扱っている
このギャップを埋めるには、次の 2 つを実践してください。
1. 生成コードが呼び出すエンドポイントを直接テストする
Qwen 3.8-Max に API サービスや API クライアントを生成させる場合、関連する OpenAPI 仕様を Apidog にインポートし、エンドポイントを直接検証します。
最低限、以下を確認しましょう。
- 正常レスポンス
- 認証あり・なしのリクエスト
- 不正なリクエストボディ
- 必須フィールドの欠落
-
4xxおよび5xxエラー - レート制限時の動作
- 空配列・巨大ペイロードなどのエッジケース
長時間のエージェント実行で 2 日後に誤った前提を見つけるより、API テスト時点で検出する方がはるかに安価です。
Qwen 3.8-Max 自身の API を統合前に評価する場合は、Qwen 3.8 APIガイドを確認してください。OpenAI 互換・Anthropic 互換の両プロトコル設定を扱っており、Apidog ではストリーミングレスポンスや推論差分も確認できます。
2. 長時間のエージェント実行では本番APIをモックする
自律実行が長くなるほど、本番インフラに対するライブ API 呼び出しは危険になります。
特に、16 日間の無人エージェント実行を本番 API に接続する場合、以下のリスクがあります。
- レート制限への到達
- 意図しないデータ変更
- 外部 API の想定外の請求
- テストデータの混入
- 失敗した再試行による重複リクエスト
- 不完全な実装による本番障害
Apidog のモックサーバーを使うと、実システムに触れずに現実的なレスポンスをエージェントへ返せます。
実装フローは次のとおりです。
- API 仕様を Apidog に登録する
- 正常系・認証エラー・バリデーションエラー・レート制限のモックレスポンスを作成する
- エージェント実行中は生成コードのベース URL をモック URL に向ける
- PR とテスト結果を人間がレビューする
- 承認後にのみ実際のベース URL へ切り替える
Apidogを無料でダウンロードすれば、数分でモック環境を作成できます。
自律性を高めるほど、API レイヤーは制御面になります。すべてのコミットをリアルタイムでレビューできなくても、エージェントが通信できる先を制限することは可能です。
よくある質問(FAQ)
Qwen 3.8はコーディングに適していますか?
Alibaba 自身の数値では、エージェント型・研究スタイルのコーディングでは強い結果を示しています。
- Terminal Bench 2.1:
86.6 - PaperBench:
93.0
一方、リポジトリ規模のバグ修正を評価する SWE-bench Pro では 67.7 であり、同じ表にある Fable 5 の 80.0 を下回っています。
すべてベンダー公開値で独立検証はありませんが、発表資料に基づく評価では、長期の自律作業や研究再現には強い一方、従来型のイシュー修正では首位ではありません。
Claude CodeでQwen 3.8を使用できますか?
はい。以下を設定してください。
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Alibaba 自身がこの構成を公開しており、コーディングベンチマークの多くを Claude Code ハーネスで実行しています。
Qwen 3.8でのコーディングにはどれくらいの費用がかかりますか?
料金は以下です。
- 入力:100 万トークンあたり 2 ドル
- 出力:100 万トークンあたり 6 ドル
思考トークンは出力として課金されます。デフォルトの xhigh は多くの推論トークンを生成する可能性があるため、長時間のエージェント実行では表示価格以上のコストを見込むべきです。
詳細な比較は、Qwen 3.8ベンチマークの内訳と、そこから参照できる料金情報を確認してください。
16日間のoh-my-cli実行は本当に自律的でしたか?
それは Alibaba の主張です。ただし、他の多くのベンダーデモと異なり、成果物を確認できます。
2026 年 7 月 30 日時点で、qwen-code-dev-bot/oh-my-cli リポジトリには以下が含まれているとされています。
- 265 コミット
- 127 PR
- 151 イシュー
コード品質や PR の妥当性が「自律開発」という主張をどこまで裏付けるかは、実際にリポジトリを読み、自分の基準で判断してください。公開履歴を確認できることが、このショーケースを単なるスクリーンショットより検証しやすくしている点です。



Top comments (0)