DEV Community

Cover image for Qwen 3.8 vs Kimi K3: 中国の2大オープンモデル徹底比較
Akira
Akira

Posted on • Originally published at apidog.com

Qwen 3.8 vs Kimi K3: 中国の2大オープンモデル徹底比較

2026年7月は、オープンウェイトのフロンティアモデルにとって「二強の月」でした。Moonshot AIは7月16日にKimi K3を出荷し、その3日後にAlibabaがQwen 3.8-Maxのプレビューを公開、8月上旬には一般提供を開始しました。両者は兆パラメータ級の混合エキスパート(MoE)モデルで、Claude Code風のエージェントハーネスに接続でき、米国フロンティアラボより低価格です。

今すぐApidogを試す

ただし、実装時に重要なのは「今日ダウンロードできるか」「画像を扱えるか」「実ワークロードで月額いくらか」です。本記事では、2026年8月3日時点で検証可能な情報を比較します。Qwen 3.8-Maxの仕様は、Qwen 3.8-Max解説も参照してください。

注意:両モデルを同一条件で比較した独立ベンチマークは、執筆時点ではありません。この記事のベンチマーク値は各ベンダー公表値であり、参考情報として扱ってください。

タイムライン:今日セルフホストできるのはどちらか

「オープンウェイト」は両モデルで意味が異なるため、リリース順序が重要です。

  • Kimi K3

    • 2026年7月16日:ローンチ
    • 2026年7月27日:Hugging Faceでウェイト公開
    • MXFP4版は594 GB
    • 今日すぐダウンロード、量子化、セルフホストが可能
  • Qwen 3.8-Max

    • 2026年7月19日:プレビュー公開
    • 2026年8月上旬:Alibaba Cloud Model Studioで一般提供開始
    • 公式Qwenリリース投稿では、Hugging FaceとModelScopeでのウェイト公開を「来週」と案内
    • 2026年8月3日時点では、ウェイトは未公開

セルフホスティングが必須条件なら、現時点の選択肢はKimi K3です。

パラメータ:どちらも兆規模MoE、Qwenはやや小型

どちらもスパースMoEです。総パラメータ数だけでなく、トークンごとに有効になるアクティブパラメータ数を見る必要があります。

仕様 Qwen 3.8-Max Kimi K3
総パラメータ数 2.4兆 2.8兆
トークンあたりのアクティブパラメータ数 950億 1,040億
アクティベーション比率 約4% 約3.7%
アーキテクチャベース Qwen 3.5基盤、MoE MoE
オープンウェイト形式 公開予定(約8月10日) MXFP4、Hugging Faceで594 GB

Qwen 3.8-Maxは、K3より総パラメータ数が4,000億少なく、アクティブパラメータ数も90億少ない構成です。ただし、アクティブパラメータ数がそのまま性能差になるわけではありません。

実装上は、主に推論提供コストとホスティング要件に影響します。K3の594 GB MXFP4ウェイトは、長いコンテキスト用のKVキャッシュを考慮しなくても、マルチノード運用を検討する規模です。Qwen 3.8-Maxも、公開時には同等クラスのウェイトサイズになると考えられます。

多くのチームでは、通常はホスト型APIを使い、セルフホストはコンプライアンス、監査、研究用途に限定することになるでしょう。

オープン性:公開済みウェイトと公開予定ウェイトは違う

Kimi K3

Kimi K3のウェイトはすでに公開されています。リポジトリとライセンスを確認し、ファイルを取得して自前の環境で実行できます。

これにより、次の選択肢が生まれます。

  • サードパーティホスティング
  • コミュニティ量子化
  • ファインチューニング
  • 固定したモデルバージョンの監査
  • ベンチマーク対象モデルが後から置き換わらない運用

Qwen 3.8-Max

Qwen 3.8-Maxは、Qwen-Maxクラスとして初のオープンウェイトモデルになる見込みです。これまでAlibabaのMaxティアはAPI専用でした。

ただし、Hugging FaceまたはModelScopeのリポジトリが実際に公開されるまでは、Qwen 3.8-Maxは「オープンウェイトを予定しているAPIモデル」です。

現時点の結論:オープン性ではKimi K3が優位です。

モダリティ:画像を扱うならQwen 3.8-Max

ここは明確な差分です。

Qwen 3.8-Maxは、公式設定で以下の入力モダリティをサポートします。

{
  "input_modalities": ["text", "image"]
}
Enter fullscreen mode Exit fullscreen mode

つまり、テキストだけでなく画像入力をAPIから利用できます。

Alibabaは200ページ超のPDF理解や、メモリーグラフによる100時間動画理解もデモしています。ただし、これらはブログ上のデモであり、文書化済みのAPI入力形式と同一視すべきではありません。実装判断では、確実に文書化されている画像入力を基準にしてください。

Kimi K3はテキストモデルです。以下のようなワークロードでは、別途ビジョンモデルが必要になります。

  • スクリーンショット解析
  • スキャンPDFの内容抽出
  • UI理解
  • 画像を使うコンピュータ操作エージェント

テキストのみのコーディングやエージェント用途なら、この差は重要ではありません。一方で、ドキュメントインテリジェンスやUI操作エージェントではQwen 3.8-Maxが有利です。

コンテキスト、出力、API互換性

Qwen 3.8-Maxは以下を提供します。

  • コンテキストウィンドウ:1,000,000トークン
  • 最大出力:65,536トークン
  • 推論制御:reasoning_effort
    • デフォルト:xhigh
    • 選択肢:mediumlow
  • 思考出力:デフォルトで保持
  • 思考モードと非思考モード:同一料金体系

Alibaba Cloud Model Studioでは、北京、シンガポール、米国バージニアのリージョンベースURLを利用できます。また、OpenAI互換とAnthropic互換の両方のプロトコルを提供しています。

Qwen 3.8-MaxをClaude Code風のハーネスに接続する場合は、Anthropic互換エンドポイントを使います。

export ANTHROPIC_BASE_URL="https://<DashScopeのAnthropic互換エンドポイント>"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

利用可能なモデルとリージョンはModel Studioモデルページで確認してください。

複数リージョンを切り替える場合は、ApidogでベースURLごとに環境を作成しておくと便利です。リクエスト本文を変更せず、環境変数だけで接続先を切り替えられます。

Kimi K3もAnthropicプロトコルに対応し、Claude Codeスタイルのハーネスに統合できます。エンドポイント仕様や現在の制限は、更新される可能性があるためKimi K3解説で確認してください。

価格:出力トークンが多いならQwenが有利

公開価格は100万トークンあたり次の通りです。

料金 Qwen 3.8-Max Kimi K3
入力 $2.00 $3.00
出力 $6.00 $15.00
キャッシュヒット入力 $0.20 $0.30
ティアリング 1Mコンテキストまでフラット Moonshotの公開スケジュールによる

公式Model Studio料金ページによると、Qwen 3.8-Maxはゼロから100万トークンまでフラット料金です。

  • 入力:$2 / 100万トークン
  • 出力:$6 / 100万トークン
  • 明示的なキャッシュ作成:入力料金の125%
  • キャッシュヒット:入力料金の10%
  • 無料クォータ:100万トークン、シンガポールリージョン限定、有効期限90日

Kimi K3は以下の料金です。

  • キャッシュヒット:$0.30 / 100万トークン
  • 入力:$3 / 100万トークン
  • 出力:$15 / 100万トークン

コストをワークロード別に見る

入力中心でキャッシュが効くケース

長いシステムプロンプトや同一ドキュメントを繰り返し使う場合、キャッシュヒット料金の差は小さくなります。

  • Qwen:$0.20
  • K3:$0.30

出力中心のエージェントケース

コード生成、ツール呼び出し、長い推論を繰り返すエージェントでは、出力価格の差が効きます。

  • Qwen:$6
  • K3:$15

K3の出力料金はQwenの2.5倍です。出力トークンが多いエージェントループでは、定価ベースでQwen 3.8-Maxが有利です。

ただしQwenでは、reasoning_effort のデフォルトがxhighです。思考トークンも出力として課金されるため、単純な入出力トークン見積もりより実コストが増える可能性があります。Qwen 3.8料金内訳で、タスク別のコスト例を確認できます。

ベンチマーク:ベンダー表は比較材料であって結論ではない

現時点で確認できることは次の通りです。

存在する情報

  • AlibabaがQwen 3.8-MaxとClaude Opus 4.8、Fable 5、GPT-5.6 Sol、Qwen 3.7-Maxを比較したベンチマーク表
  • MoonshotがKimi K3とフロンティアモデルを比較した発表表

存在しない情報

  • Qwen 3.8-MaxとKimi K3を同一ハーネス、同一プロンプト、同一設定で比較した独立評価
  • 執筆時点でのQwen 3.8-MaxのArtificial Analysis数値
  • 両ベンダーによる相互ベンチマーク

Alibaba公表値は以下です。

ベンチマーク Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

Alibabaの表を見る限り、Qwen 3.8-MaxはPaperBench、指示追従のIFBench、マルチモーダル評価で強い結果を示しています。一方で、SWE-bench ProではFable 5に大きく差を付けられ、HLEでは表中のすべてのモデルを下回っています。

Moonshotの発表表では、Kimi K3は主要項目でClaude Opus 4.8を上回る一方、Fable 5とGPT-5.6 Solには全体として遅れるとされています。詳細はKimi K3 vs Claude Opus 4.8比較を参照してください。

ベンダーごとにハーネス、足場、サンプリング設定が異なるため、別々の表を横断してスコアだけを比較するのは危険です。Alibabaの数値はQwen 3.8ベンチマーク分析でも確認できます。

Apidogで自分のワークロードを直接比較する

独立評価がないなら、自分のプロダクトタスクで比較するのが最も実用的です。両モデルともOpenAI互換のチャット完了エンドポイントを提供しているため、ApidogでA/Bテストできます。

1. 環境を2つ作る

以下の2環境を用意します。

  • qwen-3.8-max

    • DashScopeベースURL
    • Qwen APIキー
    • モデルID:qwen3.8-max
  • kimi-k3

    • MoonshotベースURL
    • Moonshot APIキー
    • K3モデルID

2. 共通リクエストを保存する

実際の業務タスクを使って、1つのリクエストを作成します。なぞなぞや一般的なベンチマーク用プロンプトではなく、次のようなタスクが有効です。

  • 実リポジトリのバグ修正指示
  • PRレビュー
  • API仕様からのSDKコード生成
  • エラーログの原因分析
  • 長い設計書からの実装計画作成
  • スクリーンショットを含むUI不具合解析

OpenAI互換形式の例です。

{
  "model": "{{model}}",
  "messages": [
    {
      "role": "system",
      "content": "You are a senior software engineer. Return an implementation plan and code changes."
    },
    {
      "role": "user",
      "content": "{{prompt}}"
    }
  ],
  "stream": true
}
Enter fullscreen mode Exit fullscreen mode

3. 同じペイロードを両環境へ送る

環境を切り替えるだけで、同一ペイロードをQwenとK3に送信できます。比較対象として記録する項目は次の通りです。

  • HTTPステータス
  • 初回トークンまでのレイテンシ
  • 完了までのレイテンシ
  • 出力トークン数
  • ツール呼び出し形式
  • JSONやコードブロックの安定性
  • タスク完了率
  • 推論テキストのストリーミング挙動

SSEレスポンスも確認してください。UIで思考トークンを表示する場合、各モデルのストリーム形式の違いが実装に影響します。

4. アサーションを追加して継続評価する

気分的な比較で終わらせず、再実行できる評価にします。

- response.status === 200
- response.body に期待するキーが含まれる
- レスポンスがJSONスキーマに一致する
- レイテンシが上限以内
- 出力に必須キーワードまたは必須コード変更が含まれる
Enter fullscreen mode Exit fullscreen mode

ベンダーがモデルを更新したタイミングで同じテストを回せば、回帰や改善を検知できます。Apidogをダウンロードして、まず10個の実プロンプトを両エンドポイントに送ってください。ベンダー表だけを見るより、導入判断に必要な情報が得られます。

スコアカード

今日の勝者 注意点
合計・アクティブパラメータ Qwen 3.8-Max 2.4兆/950億で、K3の2.8兆/1,040億よりスリム。性能の優劣を直接示すものではなく、主に提供コストの目安
今日のオープンウェイト Kimi K3 Hugging Faceで594 GB MXFP4版を公開済み。Qwenは約8月10日公開予定
モダリティ Qwen 3.8-Max テキストと画像入力に対応。動画・長文ドキュメントの主張はブログデモであり、文書化済み入力形式ではない
コンテキストウィンドウ Qwen 3.8-Max 1Mトークンのフラットティア、最大出力65,536トークン
価格 Qwen 3.8-Max $2/$6のフラット料金。xhigh推論の思考トークンは実コストを増加させる
ベンチマーク 判断不可 両方ともベンダー実施。独立した直接比較はない
ハーネス互換性 引き分け 両方ともAnthropic互換エンドポイント経由でClaude Codeスタイルのハーネスに統合可能
約束の実績 Kimi K3 K3はローンチ11日後にウェイト公開。Qwenは未実現

どちらをいつ選ぶか

Kimi K3を選ぶケース

次の条件に当てはまるなら、Kimi K3が適しています。

  • 今週中にウェイトを自社ハードウェアで動かしたい
  • 固定バージョンを監査できるモデルが必要
  • コンプライアンス要件でセルフホストが必要
  • ワークロードが完全にテキスト中心
  • 長い入力をキャッシュして繰り返す処理が中心

Qwen 3.8-Maxを選ぶケース

次の条件では、Qwen 3.8-Maxが有力です。

  • 画像、スクリーンショット、文書を扱う
  • コード生成やエージェントループで出力トークンが多い
  • 1Mトークンのコンテキストを使いたい
  • ティアード料金を避けたい
  • Anthropic互換またはOpenAI互換の両方で接続したい

オープンウェイトだけが判断基準の場合

Qwenのウェイト公開予定である約8月10日頃まで待つのが合理的です。公開が実現すれば、判断軸はオープン性ではなく、ライセンス、量子化品質、モダリティ、価格、自社評価結果に移ります。

結論として、開発者は短期間のうちに、安価でハーネス互換性を持つ2つのフロンティア候補を得ました。ただし、ベンダーのスコア表だけでロードマップを決めるべきではありません。導入前に、同じ実プロンプトを両方のエンドポイントへ送り、品質、レイテンシ、トークン消費、運用上の扱いやすさを比較してください。

よくある質問

Kimi K3はQwen 3.8-Maxよりオープンですか?

現時点では、はい。K3のウェイトは2026年7月27日からHugging Faceで公開されており、594 GBのMXFP4形式で取得できます。Qwen 3.8-Maxは約8月10日の公開予定ですが、2026年8月3日時点では未公開です。

Alibabaが公開を実現すれば、両方ともオープンウェイトのフロンティアモデルになります。その後はライセンス条件、量子化品質、コミュニティサポートが主な差分になります。それまでは、セルフホストできるのはK3です。手順はローカルK3ガイドを参照してください。

コーディング用途では、Qwen 3.8-MaxとKimi K3のどちらが優れていますか?

現時点では断定できません。両ベンダーはエージェントコーディングで強い数値を公開していますが、評価条件が異なり、独立した直接比較はありません。

導入判断には、自社リポジトリの実タスクを使って比較してください。特に以下を測定すると有効です。

  • パッチ適用成功率
  • テスト通過率
  • 変更範囲の正確さ
  • ツール呼び出し成功率
  • レイテンシ
  • トークン消費量

Claude Codeで両モデルを使えますか?

はい。両モデルともAnthropic互換エンドポイントを提供しています。

Qwen 3.8-Maxでは、DashScopeのAnthropic互換エンドポイントをANTHROPIC_BASE_URLに設定し、ANTHROPIC_MODEL=qwen3.8-maxを指定します。K3もMoonshotのエンドポイントを使って同じパターンで統合できます。

この互換性があるため、既存のClaude Codeスタイルのハーネスを大きく変更せずにA/Bテストできます。

典型的なエージェントワークロードではどちらが安いですか?

定価ではQwen 3.8-Maxが安価です。

  • Qwen 3.8-Max:入力$2、出力$6
  • Kimi K3:入力$3、出力$15

エージェントループは出力トークンが増えやすいため、出力料金の差は大きくなります。ただし、K3は入力キャッシュヒットが$0.30であり、入力中心かつ適切にキャッシュされたワークロードでは差が縮まります。

また、Qwenのデフォルトxhigh推論では思考トークンも出力として課金されます。表示価格だけで決めず、自分の入力・出力・キャッシュ比率で試算してください。

Top comments (0)