2026年7月は、オープンウェイトのフロンティアモデルにとって「二強の月」でした。Moonshot AIは7月16日にKimi K3を出荷し、その3日後にAlibabaがQwen 3.8-Maxのプレビューを公開、8月上旬には一般提供を開始しました。両者は兆パラメータ級の混合エキスパート(MoE)モデルで、Claude Code風のエージェントハーネスに接続でき、米国フロンティアラボより低価格です。
ただし、実装時に重要なのは「今日ダウンロードできるか」「画像を扱えるか」「実ワークロードで月額いくらか」です。本記事では、2026年8月3日時点で検証可能な情報を比較します。Qwen 3.8-Maxの仕様は、Qwen 3.8-Max解説も参照してください。
注意:両モデルを同一条件で比較した独立ベンチマークは、執筆時点ではありません。この記事のベンチマーク値は各ベンダー公表値であり、参考情報として扱ってください。
タイムライン:今日セルフホストできるのはどちらか
「オープンウェイト」は両モデルで意味が異なるため、リリース順序が重要です。
-
Kimi K3
- 2026年7月16日:ローンチ
- 2026年7月27日:Hugging Faceでウェイト公開
- MXFP4版は594 GB
- 今日すぐダウンロード、量子化、セルフホストが可能
-
Qwen 3.8-Max
- 2026年7月19日:プレビュー公開
- 2026年8月上旬:Alibaba Cloud Model Studioで一般提供開始
- 公式Qwenリリース投稿では、Hugging FaceとModelScopeでのウェイト公開を「来週」と案内
- 2026年8月3日時点では、ウェイトは未公開
セルフホスティングが必須条件なら、現時点の選択肢はKimi K3です。
パラメータ:どちらも兆規模MoE、Qwenはやや小型
どちらもスパースMoEです。総パラメータ数だけでなく、トークンごとに有効になるアクティブパラメータ数を見る必要があります。
| 仕様 | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| 総パラメータ数 | 2.4兆 | 2.8兆 |
| トークンあたりのアクティブパラメータ数 | 950億 | 1,040億 |
| アクティベーション比率 | 約4% | 約3.7% |
| アーキテクチャベース | Qwen 3.5基盤、MoE | MoE |
| オープンウェイト形式 | 公開予定(約8月10日) | MXFP4、Hugging Faceで594 GB |
Qwen 3.8-Maxは、K3より総パラメータ数が4,000億少なく、アクティブパラメータ数も90億少ない構成です。ただし、アクティブパラメータ数がそのまま性能差になるわけではありません。
実装上は、主に推論提供コストとホスティング要件に影響します。K3の594 GB MXFP4ウェイトは、長いコンテキスト用のKVキャッシュを考慮しなくても、マルチノード運用を検討する規模です。Qwen 3.8-Maxも、公開時には同等クラスのウェイトサイズになると考えられます。
多くのチームでは、通常はホスト型APIを使い、セルフホストはコンプライアンス、監査、研究用途に限定することになるでしょう。
オープン性:公開済みウェイトと公開予定ウェイトは違う
Kimi K3
Kimi K3のウェイトはすでに公開されています。リポジトリとライセンスを確認し、ファイルを取得して自前の環境で実行できます。
これにより、次の選択肢が生まれます。
- サードパーティホスティング
- コミュニティ量子化
- ファインチューニング
- 固定したモデルバージョンの監査
- ベンチマーク対象モデルが後から置き換わらない運用
Qwen 3.8-Max
Qwen 3.8-Maxは、Qwen-Maxクラスとして初のオープンウェイトモデルになる見込みです。これまでAlibabaのMaxティアはAPI専用でした。
ただし、Hugging FaceまたはModelScopeのリポジトリが実際に公開されるまでは、Qwen 3.8-Maxは「オープンウェイトを予定しているAPIモデル」です。
現時点の結論:オープン性ではKimi K3が優位です。
モダリティ:画像を扱うならQwen 3.8-Max
ここは明確な差分です。
Qwen 3.8-Maxは、公式設定で以下の入力モダリティをサポートします。
{
"input_modalities": ["text", "image"]
}
つまり、テキストだけでなく画像入力をAPIから利用できます。
Alibabaは200ページ超のPDF理解や、メモリーグラフによる100時間動画理解もデモしています。ただし、これらはブログ上のデモであり、文書化済みのAPI入力形式と同一視すべきではありません。実装判断では、確実に文書化されている画像入力を基準にしてください。
Kimi K3はテキストモデルです。以下のようなワークロードでは、別途ビジョンモデルが必要になります。
- スクリーンショット解析
- スキャンPDFの内容抽出
- UI理解
- 画像を使うコンピュータ操作エージェント
テキストのみのコーディングやエージェント用途なら、この差は重要ではありません。一方で、ドキュメントインテリジェンスやUI操作エージェントではQwen 3.8-Maxが有利です。
コンテキスト、出力、API互換性
Qwen 3.8-Maxは以下を提供します。
- コンテキストウィンドウ:1,000,000トークン
- 最大出力:65,536トークン
- 推論制御:
reasoning_effort- デフォルト:
xhigh - 選択肢:
medium、low
- デフォルト:
- 思考出力:デフォルトで保持
- 思考モードと非思考モード:同一料金体系
Alibaba Cloud Model Studioでは、北京、シンガポール、米国バージニアのリージョンベースURLを利用できます。また、OpenAI互換とAnthropic互換の両方のプロトコルを提供しています。
Qwen 3.8-MaxをClaude Code風のハーネスに接続する場合は、Anthropic互換エンドポイントを使います。
export ANTHROPIC_BASE_URL="https://<DashScopeのAnthropic互換エンドポイント>"
export ANTHROPIC_MODEL="qwen3.8-max"
利用可能なモデルとリージョンはModel Studioモデルページで確認してください。
複数リージョンを切り替える場合は、ApidogでベースURLごとに環境を作成しておくと便利です。リクエスト本文を変更せず、環境変数だけで接続先を切り替えられます。
Kimi K3もAnthropicプロトコルに対応し、Claude Codeスタイルのハーネスに統合できます。エンドポイント仕様や現在の制限は、更新される可能性があるためKimi K3解説で確認してください。
価格:出力トークンが多いならQwenが有利
公開価格は100万トークンあたり次の通りです。
| 料金 | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| 入力 | $2.00 | $3.00 |
| 出力 | $6.00 | $15.00 |
| キャッシュヒット入力 | $0.20 | $0.30 |
| ティアリング | 1Mコンテキストまでフラット | Moonshotの公開スケジュールによる |
公式Model Studio料金ページによると、Qwen 3.8-Maxはゼロから100万トークンまでフラット料金です。
- 入力:$2 / 100万トークン
- 出力:$6 / 100万トークン
- 明示的なキャッシュ作成:入力料金の125%
- キャッシュヒット:入力料金の10%
- 無料クォータ:100万トークン、シンガポールリージョン限定、有効期限90日
Kimi K3は以下の料金です。
- キャッシュヒット:$0.30 / 100万トークン
- 入力:$3 / 100万トークン
- 出力:$15 / 100万トークン
コストをワークロード別に見る
入力中心でキャッシュが効くケース
長いシステムプロンプトや同一ドキュメントを繰り返し使う場合、キャッシュヒット料金の差は小さくなります。
- Qwen:$0.20
- K3:$0.30
出力中心のエージェントケース
コード生成、ツール呼び出し、長い推論を繰り返すエージェントでは、出力価格の差が効きます。
- Qwen:$6
- K3:$15
K3の出力料金はQwenの2.5倍です。出力トークンが多いエージェントループでは、定価ベースでQwen 3.8-Maxが有利です。
ただしQwenでは、reasoning_effort のデフォルトがxhighです。思考トークンも出力として課金されるため、単純な入出力トークン見積もりより実コストが増える可能性があります。Qwen 3.8料金内訳で、タスク別のコスト例を確認できます。
ベンチマーク:ベンダー表は比較材料であって結論ではない
現時点で確認できることは次の通りです。
存在する情報
- AlibabaがQwen 3.8-MaxとClaude Opus 4.8、Fable 5、GPT-5.6 Sol、Qwen 3.7-Maxを比較したベンチマーク表
- MoonshotがKimi K3とフロンティアモデルを比較した発表表
存在しない情報
- Qwen 3.8-MaxとKimi K3を同一ハーネス、同一プロンプト、同一設定で比較した独立評価
- 執筆時点でのQwen 3.8-MaxのArtificial Analysis数値
- 両ベンダーによる相互ベンチマーク
Alibaba公表値は以下です。
| ベンチマーク | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 |
| HLE | 43.6 | 45.7 | 53.3 | 47.2 |
Alibabaの表を見る限り、Qwen 3.8-MaxはPaperBench、指示追従のIFBench、マルチモーダル評価で強い結果を示しています。一方で、SWE-bench ProではFable 5に大きく差を付けられ、HLEでは表中のすべてのモデルを下回っています。
Moonshotの発表表では、Kimi K3は主要項目でClaude Opus 4.8を上回る一方、Fable 5とGPT-5.6 Solには全体として遅れるとされています。詳細はKimi K3 vs Claude Opus 4.8比較を参照してください。
ベンダーごとにハーネス、足場、サンプリング設定が異なるため、別々の表を横断してスコアだけを比較するのは危険です。Alibabaの数値はQwen 3.8ベンチマーク分析でも確認できます。
Apidogで自分のワークロードを直接比較する
独立評価がないなら、自分のプロダクトタスクで比較するのが最も実用的です。両モデルともOpenAI互換のチャット完了エンドポイントを提供しているため、ApidogでA/Bテストできます。
1. 環境を2つ作る
以下の2環境を用意します。
-
qwen-3.8-max- DashScopeベースURL
- Qwen APIキー
- モデルID:
qwen3.8-max
-
kimi-k3- MoonshotベースURL
- Moonshot APIキー
- K3モデルID
2. 共通リクエストを保存する
実際の業務タスクを使って、1つのリクエストを作成します。なぞなぞや一般的なベンチマーク用プロンプトではなく、次のようなタスクが有効です。
- 実リポジトリのバグ修正指示
- PRレビュー
- API仕様からのSDKコード生成
- エラーログの原因分析
- 長い設計書からの実装計画作成
- スクリーンショットを含むUI不具合解析
OpenAI互換形式の例です。
{
"model": "{{model}}",
"messages": [
{
"role": "system",
"content": "You are a senior software engineer. Return an implementation plan and code changes."
},
{
"role": "user",
"content": "{{prompt}}"
}
],
"stream": true
}
3. 同じペイロードを両環境へ送る
環境を切り替えるだけで、同一ペイロードをQwenとK3に送信できます。比較対象として記録する項目は次の通りです。
- HTTPステータス
- 初回トークンまでのレイテンシ
- 完了までのレイテンシ
- 出力トークン数
- ツール呼び出し形式
- JSONやコードブロックの安定性
- タスク完了率
- 推論テキストのストリーミング挙動
SSEレスポンスも確認してください。UIで思考トークンを表示する場合、各モデルのストリーム形式の違いが実装に影響します。
4. アサーションを追加して継続評価する
気分的な比較で終わらせず、再実行できる評価にします。
- response.status === 200
- response.body に期待するキーが含まれる
- レスポンスがJSONスキーマに一致する
- レイテンシが上限以内
- 出力に必須キーワードまたは必須コード変更が含まれる
ベンダーがモデルを更新したタイミングで同じテストを回せば、回帰や改善を検知できます。Apidogをダウンロードして、まず10個の実プロンプトを両エンドポイントに送ってください。ベンダー表だけを見るより、導入判断に必要な情報が得られます。
スコアカード
| 軸 | 今日の勝者 | 注意点 |
|---|---|---|
| 合計・アクティブパラメータ | Qwen 3.8-Max | 2.4兆/950億で、K3の2.8兆/1,040億よりスリム。性能の優劣を直接示すものではなく、主に提供コストの目安 |
| 今日のオープンウェイト | Kimi K3 | Hugging Faceで594 GB MXFP4版を公開済み。Qwenは約8月10日公開予定 |
| モダリティ | Qwen 3.8-Max | テキストと画像入力に対応。動画・長文ドキュメントの主張はブログデモであり、文書化済み入力形式ではない |
| コンテキストウィンドウ | Qwen 3.8-Max | 1Mトークンのフラットティア、最大出力65,536トークン |
| 価格 | Qwen 3.8-Max | $2/$6のフラット料金。xhigh推論の思考トークンは実コストを増加させる |
| ベンチマーク | 判断不可 | 両方ともベンダー実施。独立した直接比較はない |
| ハーネス互換性 | 引き分け | 両方ともAnthropic互換エンドポイント経由でClaude Codeスタイルのハーネスに統合可能 |
| 約束の実績 | Kimi K3 | K3はローンチ11日後にウェイト公開。Qwenは未実現 |
どちらをいつ選ぶか
Kimi K3を選ぶケース
次の条件に当てはまるなら、Kimi K3が適しています。
- 今週中にウェイトを自社ハードウェアで動かしたい
- 固定バージョンを監査できるモデルが必要
- コンプライアンス要件でセルフホストが必要
- ワークロードが完全にテキスト中心
- 長い入力をキャッシュして繰り返す処理が中心
Qwen 3.8-Maxを選ぶケース
次の条件では、Qwen 3.8-Maxが有力です。
- 画像、スクリーンショット、文書を扱う
- コード生成やエージェントループで出力トークンが多い
- 1Mトークンのコンテキストを使いたい
- ティアード料金を避けたい
- Anthropic互換またはOpenAI互換の両方で接続したい
オープンウェイトだけが判断基準の場合
Qwenのウェイト公開予定である約8月10日頃まで待つのが合理的です。公開が実現すれば、判断軸はオープン性ではなく、ライセンス、量子化品質、モダリティ、価格、自社評価結果に移ります。
結論として、開発者は短期間のうちに、安価でハーネス互換性を持つ2つのフロンティア候補を得ました。ただし、ベンダーのスコア表だけでロードマップを決めるべきではありません。導入前に、同じ実プロンプトを両方のエンドポイントへ送り、品質、レイテンシ、トークン消費、運用上の扱いやすさを比較してください。
よくある質問
Kimi K3はQwen 3.8-Maxよりオープンですか?
現時点では、はい。K3のウェイトは2026年7月27日からHugging Faceで公開されており、594 GBのMXFP4形式で取得できます。Qwen 3.8-Maxは約8月10日の公開予定ですが、2026年8月3日時点では未公開です。
Alibabaが公開を実現すれば、両方ともオープンウェイトのフロンティアモデルになります。その後はライセンス条件、量子化品質、コミュニティサポートが主な差分になります。それまでは、セルフホストできるのはK3です。手順はローカルK3ガイドを参照してください。
コーディング用途では、Qwen 3.8-MaxとKimi K3のどちらが優れていますか?
現時点では断定できません。両ベンダーはエージェントコーディングで強い数値を公開していますが、評価条件が異なり、独立した直接比較はありません。
導入判断には、自社リポジトリの実タスクを使って比較してください。特に以下を測定すると有効です。
- パッチ適用成功率
- テスト通過率
- 変更範囲の正確さ
- ツール呼び出し成功率
- レイテンシ
- トークン消費量
Claude Codeで両モデルを使えますか?
はい。両モデルともAnthropic互換エンドポイントを提供しています。
Qwen 3.8-Maxでは、DashScopeのAnthropic互換エンドポイントをANTHROPIC_BASE_URLに設定し、ANTHROPIC_MODEL=qwen3.8-maxを指定します。K3もMoonshotのエンドポイントを使って同じパターンで統合できます。
この互換性があるため、既存のClaude Codeスタイルのハーネスを大きく変更せずにA/Bテストできます。
典型的なエージェントワークロードではどちらが安いですか?
定価ではQwen 3.8-Maxが安価です。
- Qwen 3.8-Max:入力$2、出力$6
- Kimi K3:入力$3、出力$15
エージェントループは出力トークンが増えやすいため、出力料金の差は大きくなります。ただし、K3は入力キャッシュヒットが$0.30であり、入力中心かつ適切にキャッシュされたワークロードでは差が縮まります。
また、Qwenのデフォルトxhigh推論では思考トークンも出力として課金されます。表示価格だけで決めず、自分の入力・出力・キャッシュ比率で試算してください。
Top comments (0)