DEV Community

Cover image for クウェン3.8 コーディング向け:16日間の自律稼働とクロードコード連携
Akira
Akira

Posted on • Originally published at apidog.com

クウェン3.8 コーディング向け:16日間の自律稼働とクロードコード連携

ほとんどのモデル発表では、コーディング能力は「HumanEval のスコア」や「バイナリ検索の実装例」のような形で示されます。しかし、Alibaba が Qwen 3.8-Max で掲げたのは、優れた関数を書けることではありません。数週間にわたってソフトウェアプロジェクトを単独で進め、イシュー作成、プルリクエストのマージ、機能リリースまで実行できる、という主張です。

今すぐApidogを試す

これは大胆な主張であり、精査が必要です。この記事では、Alibaba が発表時に公開した 3 つのコーディングショーケース、関連するベンチマーク、そして Claude Code、Codex、Qoder、Qwen Code、OpenClaw から qwen3.8-max を実際に利用する設定を解説します。あわせて、生成コードが呼び出す API をテスト・モックする方法も紹介します。

モデル自体が初めてなら、まずは Qwen 3.8とは何か を確認してください。総パラメータ数は 2.4T、アクティブパラメータ数は 95B、コンテキストウィンドウは 1M トークンで、リリース後 1 週間以内にオープンウェイトの提供が約束されています。この記事ではコーディング面に絞ります。以下はすべて 2026 年 8 月 3 日時点の情報です。

Alibabaが実際に主張していること

公式の Qwen 3.8 リリース投稿で Alibaba が示しているのは、コード断片を生成する能力を超えた自律性です。

Qwen 3.8-Max は、長期的なエンジニアリングタスクのコンテキストを維持し、計画を立て、数日にわたって実装し、失敗から回復し、レビュー可能な成果物を納品できるモデルとして位置付けられています。

Qwen 3.8-Max のコーディング能力に関する図

この主張で注目すべきポイントは 3 つあります。

  1. デモの実行期間が長い

    16 日間の実行は、20 分程度のエージェントベンチマークとは別の問題です。この規模では、エラーからの回復、コンテキスト管理、作業方針のドリフトが重要になります。

  2. 1 つのデモは公開リポジトリで確認できる

    コミット、PR、イシュー、実装コードを自分で確認できます。多くのベンダーショーケースでは得られない検証材料です。

  3. 競合製品のハーネスを使っている

    Alibaba は多くのコーディングベンチマークを Claude Code ハーネスで実行し、設定も公開しています。同じ構成をローカルで再現できます。

ただし、重要な前提があります。この記事で扱う数値はすべて Alibaba 自身の発表資料によるものです。2026 年 8 月上旬時点では独立検証は存在しません。ショーケースは監査済みの証拠ではなく、ベンダーデモとして扱うべきです。

3つのコーディングショーケース

oh-my-cli:16日間の自律開発

もっとも目立つデモは、コマンドラインツールを構築する oh-my-cli です。Alibaba は Qwen 3.8-Max を無人で実行し、7 月 30 日時点で次の結果を示しました。

  • 実行期間:16 日間
  • コミット:265 件
  • プルリクエスト:127 件
  • イシュー:151 件

これらのイシュー、PR、作業、クローズ処理はすべてモデル自身が行ったとされています。

リポジトリは qwen-code-dev-bot/oh-my-cli として公開されています。このショーケースで最も実用的なのは、数値をそのまま信じる必要がない点です。

監査する場合は、次の観点で確認してください。

  • PR は参照しているイシューを本当に解決しているか
  • クローズするためだけの人工的なタスクを作っていないか
  • 回帰を発生させた後、どのように検出・修正しているか
  • コミットが小さくレビュー可能な単位になっているか
  • テストの追加や更新が変更内容に対応しているか

このような履歴は、単発のベンチマークスコアよりも、長時間動かしたときの信頼性を判断する材料になります。

論文再現実行:研究コード向けのデモ

2 つ目のデモは、機械学習論文をゼロから再現する研究コードです。

Alibaba の発表によると、この実行では以下が行われました。

  • 実行時間:約 125 時間
  • 生成コード:約 7,600 行
  • GPU トレーニング:33 ラウンド

論文再現実行のデモ

モデルは論文内の知見を 6 件再現し、AIME24 では論文が報告した結果を 2.7 ポイント上回ったとされています。

研究再現では、環境依存、脚注に隠れたハイパーパラメータ、サイレントな実装バグなどが問題になります。長時間のトレーニングを繰り返し、結果を比較しながら修正する能力は、単純なコード補完とは異なるものです。

このデモは、後述する Qwen 3.8-Max の PaperBench スコアと対応しています。

天池コンテスト:人間チームとの24時間対決

3 つ目は、Alibaba の天池プラットフォーム上で実施された 24 時間のデータサイエンスコンペティションです。

モデルは実行中に 45 回提出し、各スコアを次の改善へフィードバックして、最終的に精度 0.853 を記録しました。参加した 526 チームのうち 458 チームを上回ったとされています。

天池コンテストの結果

この結果は「優勝」ではありませんが、参加チームの約 87% を上回ったという点で、印象的かつ比較的率直な結果です。また、短い制限時間の中で仮説、実装、提出、評価を繰り返す能力も示しています。

一方で、天池は Alibaba 自身のプラットフォームです。デモが実際のコンテスト形式であったとしても、会場をベンダーが管理していた点は考慮する必要があります。

デモの背景にあるコーディングベンチマーク

Alibaba は発表時にベンチマーク表を公開しました。コーディング関連の主要な数値は次のとおりです。

ベンチマーク Qwen 3.8-Max 最高の競合他社(Alibabaの表による)
Terminal Bench 2.1 86.6 88.8(GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0(Fable 5)
PaperBench 93.0 90.5(GPT-5.6 Sol)

読み取るべきポイントは 3 つです。

  • Terminal Bench 2.1:86.6

    Alibaba の表では、Claude Opus 4.8 と Fable 5 の 84.6 を上回っています。ターミナル操作を伴うエージェント作業の結果であり、oh-my-cli デモと対応します。

  • SWE-bench Pro:67.7

    リポジトリ規模のバグ修正では劣勢です。同じ表で Fable 5 は 80.0 を記録しており、差は 12 ポイント以上あります。既存コードベースのイシュー修正という日常的なタスクに最も近い評価で、Qwen 3.8-Max が首位ではないことを示します。

  • PaperBench:93.0

    比較対象を上回る、このモデルの最も強い主要スコアです。論文再現デモの主張を直接補強する数値です。

なお、Alibaba はこれらのコーディングベンチマークの多くを Claude Code ハーネスで実行しており、競合モデルの実行も含まれています。また表の脚注では、Fable 5 の結果にフォールバックが含まれる可能性が示されています。

エージェントベンチマークでは、ハーネスの違いがスコアに大きく影響します。ベンダーが特定ハーネス上で実行した表は、比較材料の 1 つであって最終判断ではありません。

ただし実務面では、Claude Code を使う開発者にとって再現しやすい構成が公開されている、という利点でもあります。

今日からQwen 3.8で実際にコーディングする方法

Qwen 3.8-Max は Alibaba Cloud Model Studio で一般公開されており、Alibaba は 5 つのコーディングツール向け設定を公開しています。

すべての構成で DashScope API キーが必要です。キーは home.qwencloud.com から取得します。

公式 Model Studio 料金ページによると、料金は以下です。

  • 入力:100 万トークンあたり 2 ドル
  • 出力:100 万トークンあたり 6 ドル
  • 1M コンテキスト全体で同一料金

Claude Code

Qwen 3.8-Max は Anthropic 互換 API エンドポイントを提供しています。Claude Code を接続するには、以下の環境変数を設定します。

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

設定後は通常どおり Claude Code を起動します。

claude
Enter fullscreen mode Exit fullscreen mode

Claude Code からのリクエストは、Claude モデルではなく Qwen 3.8-Max にルーティングされます。Alibaba がコーディングベンチマークの多くで利用したハーネスであり、発表内容を試すには最も近い構成です。

Codex

Codex ではプロバイダー設定を追加します。

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Enter fullscreen mode Exit fullscreen mode

API キーを環境変数に設定します。

export DASHSCOPE_API_KEY=your-dashscope-api-key
Enter fullscreen mode Exit fullscreen mode

Codex の設定では Anthropic 互換ではなく、OpenAI 互換エンドポイントを使用します。モデルと API キーは同じですが、プロトコル形式が異なります。

Qoder、Qwen Code、OpenClaw

残りの 3 ツールは次のように設定します。

  • Qoder CLI

    Alibaba のエージェント型コーディングツールです。モデルとして qwen3.8-max を選択します。

  • Qwen Code

    Qwen チームのオープンソース CLI です。DASHSCOPE_API_KEY を設定してモデルを選択します。以前の Qwen コーディングモデルを使ったことがある場合、追加の変更はほとんどありません。

  • OpenClaw

    公式設定ではモデル ID を指定し、maxTokens65536 に設定します。これはモデルの最大出力長でもあります。

各ツールの最新設定は、ブログ記事に固定された内容ではなく、Qwen 3.8 の公式リリース投稿で確認してください。

推論努力をタスク別に設定する

Qwen 3.8-Max は reasoning_effort パラメータをサポートします。

  • xhigh:デフォルト
  • medium
  • low

コーディングでは、この設定がコストと品質に直接影響します。

タスク 推奨設定 理由
複数ファイルの変更 xhigh 依存関係と変更範囲を分析する必要があるため
デバッグ、原因調査 xhigh 仮説検証とログ解析に推論が必要なため
実装前の設計・計画 xhigh 後戻りを減らしやすいため
リネーム low 機械的な編集であるため
コメント・docstring の追加 low 深い推論が不要な場合が多いため
単純なフォーマット修正 low 速度とコストを優先できるため

推論トークンは出力トークンとして課金され、100 万トークンあたり 6 ドルです。xhigh はデフォルトですが、長時間のエージェント実行ではコストが大きくなる可能性があります。

単純な編集に xhigh を使い続けると、メリットが少ないままコストだけが増えます。まずはタスクを分類し、必要な場面でだけ高い推論努力を使う運用が安全です。

Qwen 3.8-Max がタスクに対して過剰な場合は、専用コーディングモデルである Qwen3 Coder や、高速・低コスト向けの Qwen3 Coder Flash も選択肢です。他のオープンウェイトモデルについては、Kimi K3がコーディング作業をどのように処理するか も参考になります。

モデルが構築するものをテストする:Apidogのステップ

自律コーディングのデモには、よく見落とされるギャップがあります。

モデルは API を呼び出すコードを生成できますが、その API 呼び出しが正しいかどうかは別問題です。コードがコンパイルできても、次のような問題は残ります。

  • 間違ったエンドポイントを呼び出している
  • 429 Too Many Requests を誤って処理している
  • 本番環境ではバリデーションに失敗するリクエストボディを送信している
  • 認証トークンの更新フローを実装できていない
  • エラー応答を正常レスポンスとして扱っている

このギャップを埋めるには、次の 2 つを実践してください。

1. 生成コードが呼び出すエンドポイントを直接テストする

Qwen 3.8-Max に API サービスや API クライアントを生成させる場合、関連する OpenAPI 仕様を Apidog にインポートし、エンドポイントを直接検証します。

最低限、以下を確認しましょう。

  1. 正常レスポンス
  2. 認証あり・なしのリクエスト
  3. 不正なリクエストボディ
  4. 必須フィールドの欠落
  5. 4xx および 5xx エラー
  6. レート制限時の動作
  7. 空配列・巨大ペイロードなどのエッジケース

長時間のエージェント実行で 2 日後に誤った前提を見つけるより、API テスト時点で検出する方がはるかに安価です。

Qwen 3.8-Max 自身の API を統合前に評価する場合は、Qwen 3.8 APIガイドを確認してください。OpenAI 互換・Anthropic 互換の両プロトコル設定を扱っており、Apidog ではストリーミングレスポンスや推論差分も確認できます。

2. 長時間のエージェント実行では本番APIをモックする

自律実行が長くなるほど、本番インフラに対するライブ API 呼び出しは危険になります。

特に、16 日間の無人エージェント実行を本番 API に接続する場合、以下のリスクがあります。

  • レート制限への到達
  • 意図しないデータ変更
  • 外部 API の想定外の請求
  • テストデータの混入
  • 失敗した再試行による重複リクエスト
  • 不完全な実装による本番障害

Apidog のモックサーバーを使うと、実システムに触れずに現実的なレスポンスをエージェントへ返せます。

実装フローは次のとおりです。

  1. API 仕様を Apidog に登録する
  2. 正常系・認証エラー・バリデーションエラー・レート制限のモックレスポンスを作成する
  3. エージェント実行中は生成コードのベース URL をモック URL に向ける
  4. PR とテスト結果を人間がレビューする
  5. 承認後にのみ実際のベース URL へ切り替える

Apidogを無料でダウンロードすれば、数分でモック環境を作成できます。

自律性を高めるほど、API レイヤーは制御面になります。すべてのコミットをリアルタイムでレビューできなくても、エージェントが通信できる先を制限することは可能です。

よくある質問(FAQ)

Qwen 3.8はコーディングに適していますか?

Alibaba 自身の数値では、エージェント型・研究スタイルのコーディングでは強い結果を示しています。

  • Terminal Bench 2.1:86.6
  • PaperBench:93.0

一方、リポジトリ規模のバグ修正を評価する SWE-bench Pro では 67.7 であり、同じ表にある Fable 5 の 80.0 を下回っています。

すべてベンダー公開値で独立検証はありませんが、発表資料に基づく評価では、長期の自律作業や研究再現には強い一方、従来型のイシュー修正では首位ではありません。

Claude CodeでQwen 3.8を使用できますか?

はい。以下を設定してください。

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Alibaba 自身がこの構成を公開しており、コーディングベンチマークの多くを Claude Code ハーネスで実行しています。

Qwen 3.8でのコーディングにはどれくらいの費用がかかりますか?

料金は以下です。

  • 入力:100 万トークンあたり 2 ドル
  • 出力:100 万トークンあたり 6 ドル

思考トークンは出力として課金されます。デフォルトの xhigh は多くの推論トークンを生成する可能性があるため、長時間のエージェント実行では表示価格以上のコストを見込むべきです。

詳細な比較は、Qwen 3.8ベンチマークの内訳と、そこから参照できる料金情報を確認してください。

16日間のoh-my-cli実行は本当に自律的でしたか?

それは Alibaba の主張です。ただし、他の多くのベンダーデモと異なり、成果物を確認できます。

2026 年 7 月 30 日時点で、qwen-code-dev-bot/oh-my-cli リポジトリには以下が含まれているとされています。

  • 265 コミット
  • 127 PR
  • 151 イシュー

コード品質や PR の妥当性が「自律開発」という主張をどこまで裏付けるかは、実際にリポジトリを読み、自分の基準で判断してください。公開履歴を確認できることが、このショーケースを単なるスクリーンショットより検証しやすくしている点です。

Top comments (0)