Kimiをすでに導入している場合、2026年7月16日にリリースされるKimi K3について、実用的な判断が必要になります。これは移行すべきアップグレードなのか、それとも現時点ではスキップできる、より大規模で高価なモデルなのか。Kimi K2.7 CodeはK2系列のコーディング特化モデルで、多くのチームがエージェントやCIに組み込んでいます。一方のK3は、Moonshotの新しいフラッグシップです。新しいアテンション設計、2.8兆パラメータのMoE、100万トークンのコンテキストウィンドウを備えています。本記事では、両者の違いを実装・運用の観点で整理し、移行判断とA/Bテストの進め方を説明します。
両モデルはOpenAI互換APIを提供しています。プロダクションコードを書き換える前に、Apidogでkimi-k3とkimi-k2-7-codeへ同じリクエストを送信し、出力品質、レイテンシー、トークン使用量を比較してください。まずは結論です。
TL;DR: 移行判断の要点
- K3は大規模な汎用フラッグシップモデルです。 K2系列の約1兆パラメータクラスに対し、K3は総計2.8兆パラメータのMixture-of-Experts(MoE)モデルです。
- K3のコンテキストは最大100万トークンです。 大規模リポジトリ、テスト、ログをまとめて渡すワークロードで効果が出やすくなります。
- アーキテクチャも変わっています。 Kimi Delta Attention、Attention Residuals、Stable LatentMoEを採用し、896エキスパート中16エキスパートをトークンごとにアクティブ化します。
- K3の料金はフラッグシップ価格です。 入力はキャッシュヒット時が$0.30/M、キャッシュミス時が$3/M、出力は$15/Mです。
- K3が常に最上位というわけではありません。 Moonshot自身の説明では、Claude Fable 5とGPT-5.6 Solを総合的には下回ります。
- 移行するべきケース: コンテキスト不足、長時間エージェント、コード以外の推論、共有コンテキストの高い再利用率。
- K2.7 Codeに留まるべきケース: 狭いコードタスクで既に品質基準を満たしており、コストやレイテンシーを優先する場合。
K2.7 CodeとK3は用途が違う
スペックだけで比較する前に、モデルの位置付けを分けて考えてください。
Kimi K2.7 Codeは、K2、K2 Thinking、K2.5、K2.6から続くK2系列のコーディング特化リリースです。コード生成、修正、エージェント型開発に最適化されており、「API経由でコードを書き、直す」ワークロードに向いています。正確な仕様や価格は、Kimi K2.7 Codeとは何かを確認してください。
K3はコーディング専用モデルではありません。Moonshotの「最も高性能な」汎用フラッグシップであり、コーディングは能力の一部です。
つまり、比較対象は「旧コーダーと新コーダー」ではなく、次の2つです。
- K2.7 Code: コスト効率を重視したコーディングスペシャリスト
- K3: 大規模コンテキストと長期エージェント実行を狙う汎用フラッグシップ
この違いが、移行判断の中心になります。
世代間で変わったこと
スケール: 総パラメータ数は約3倍
K3は総計2.8兆パラメータのMoEモデルです。K2.7 Codeが属するK2系列は約1兆パラメータクラスのため、総パラメータ数は約3倍です。
ただし、総パラメータ数だけで推論コストを判断しないでください。MoEモデルでは、すべてのパラメータが各トークンで実行されるわけではありません。MoonshotはK3のアクティブパラメータ数を公開していませんが、896人のエキスパートのうち16人をアクティブ化する構成を公開しています。
したがって、2.8兆パラメータ = すべてのリクエストで2.8兆パラメータを実行するという意味ではありません。
新しいアテンションアーキテクチャ
K3は単純なスケールアップではなく、アーキテクチャも更新されています。
Kimi Delta Attention
ハイブリッドな線形アテンション機構です。標準的な二次アテンションより長いシーケンスに対してスケールしやすく、100万トークンのコンテキストを実用化する要素の一つです。Attention Residuals
Moonshotは、標準的な残差接続のドロップイン代替として説明しています。Stable LatentMoE
896人のエキスパートからトークンごとに16人をアクティブ化するMoEフレームワークです。
MoonshotはKimi K2と比較して、スケーリング効率が約2.5倍向上したと報告しています。K2.7 Codeにはこの再設計は含まれていないため、差は単なるモデルサイズではなく、設計世代の違いでもあります。
コンテキスト: 最大1,048,576トークン
K3は1,048,576トークン、つまり約100万トークンのコンテキストウィンドウをサポートします。
実装上は、以下のような作業で差が出ます。
- モノレポの複数パッケージを横断する変更
- テスト、CIログ、設計ドキュメントを含めた障害調査
- 長いツール呼び出し履歴を持つエージェント
- 複数サービスにまたがるリファクタリング
K2.7 Codeでコンテキスト上限による切り捨てが起きているなら、K3へ移行する最も明確な理由になります。
位置付け: コード特化から汎用フラッグシップへ
K2.7 Codeはコーディング特化ですが、K3は汎用フラッグシップです。Moonshotは、長時間の自律実行や多段階問題への対応をK3の用途として挙げています。
ただし、ベンダーの事例が自分のワークロードに再現するとは限りません。長期エージェント実行が重要なら、実際のタスクで状態保持、ツール選択、リトライ回数、最終成功率を測定してください。
料金: キャッシュ設計が重要
K3の公称価格は以下です。
| 種別 | 料金 |
|---|---|
| 入力(キャッシュヒット) | $0.30 / 100万トークン |
| 入力(キャッシュミス) | $3 / 100万トークン |
| 出力 | $15 / 100万トークン |
入力ではキャッシュヒットとミスで10倍の差があります。
たとえば、毎回同じシステムプロンプト、リポジトリ要約、ツール定義を送るエージェントなら、キャッシュヒット率が高くなり、実効入力コストは$0.30/Mに近づきます。一方で、毎回まったく異なる大量コンテキストを送る単発処理では、$3/Mを前提に見積もる必要があります。
キャッシュを含む料金の考え方は、Kimi K3の価格設定も参照してください。
Kimi K3 vs Kimi K2.7 Code
| 項目 | Kimi K2.7 Code | Kimi K3 |
|---|---|---|
| 位置付け | K2系列のコーディング特化リリース | 汎用フラッグシップ、エージェント型コーディングにも対応 |
| 世代 | K2系列 | K3世代 |
| 総パラメータ数 | 約1兆パラメータクラス | 総計2.8兆パラメータ(MoE) |
| アクティブパラメータ数 | K2.7 Codeの記事を参照 | 未公開、896エキスパート中16がアクティブ |
| アテンション設計 | K2世代のアテンション | Kimi Delta Attention + Attention Residuals |
| MoEフレームワーク | K2世代のMoE | Stable LatentMoE |
| コンテキストウィンドウ | K2.7 Codeの記事を参照 | 1,048,576トークン |
| モデルID | kimi-k2-7-code |
kimi-k3 |
| API互換性 | OpenAI SDK互換 | OpenAI SDK互換 |
| 公称価格 | K2.7 Codeの記事を参照 | 入力 $0.30/$3、出力 $15/M |
| オープンウェイト | K2.7 Codeの情報を参照 | 2026年7月27日頃に公開予定 |
| 独立評価 | K2.7 Codeの情報を参照 | Artificial Analysis Intelligence Index 57、189モデル中4位 |
| 主な用途 | コストを把握しやすい狭いコードタスク | 大規模コンテキスト、長時間の汎用・コーディング作業 |
K2.7 Codeの正確な仕様を確認する場合は、Kimi K2.7 Codeとは何かおよびKimi K2.7 Code APIガイドを確認してください。
K3は最先端モデルの中でどこに位置するか
「2.8兆パラメータのフラッグシップ」という表現だけで、K3を常に最高性能と判断するべきではありません。
Moonshot自身の発表では、K3はClaude Fable 5とGPT-5.6 Solを総合的には下回るとされています。特定ベンチマークで競争力を示す、または一部で上回ることはあっても、全面的な優位性を主張するものではありません。
Artificial Analysisの評価では、K3はIntelligence Index 57で189モデル中4位です。また、出力速度は毎秒約62トークンとされ、価格帯の中では遅い部類です。
Moonshot公開のコーディングベンチマークでは、結果は混在しています。
| ベンチマーク | K3 | Fable 5 |
|---|---|---|
| DeepSWE | 67.5 | 70.0 |
| Terminal-Bench 2.1 | 88.3 | 84.6 |
K3は強力な候補ですが、「すべてのクローズドモデルを上回る」とは扱わないでください。詳細は公式Kimi K3発表記事と、Kimi K3ベンチマーク分析を確認してください。
重要なのは、K3が最上位モデルすべてに勝てるかではなく、現在使っているK2.7 Codeより自分のタスクで改善するかです。
K3へ移行する判断基準
次のいずれかに当てはまる場合、K3をA/Bテストする価値があります。
1. コンテキスト上限に達している
大規模リポジトリ、サービス横断の変更、長い実行履歴でK2.7 Codeの入力が切り捨てられるなら、K3の100万トークンコンテキストは直接的な改善になります。
確認する指標:
- プロンプト切り捨ての発生率
- コンテキスト圧縮・要約の回数
- リポジトリ全体を対象とするタスクの成功率
- 追加の検索・再送信が必要になった回数
2. 長時間のエージェント実行が中心
多数のツール呼び出し、複数ファイルの更新、テスト失敗からの修正を繰り返すエージェントでは、状態保持が重要です。
確認する指標:
- タスク完了までのツール呼び出し回数
- ループや無意味なリトライの発生率
- 中間状態の見失いによる失敗率
- 最終パッチのテスト通過率
3. コード以外の推論も必要
プロダクトがコード生成だけでなく、要件整理、設計判断、ログ分析、障害原因の説明も扱うなら、コーディング専用モデルより汎用フラッグシップが適する場合があります。
4. キャッシュヒット率が高い
大きなシステムプロンプト、共通ツール定義、リポジトリコンテキストを複数リクエストで再利用するなら、K3のキャッシュヒット時入力価格が有利に働く可能性があります。
K2.7 Codeに留まる判断基準
以下に該当するなら、K2.7 Codeを維持する選択は合理的です。
1. 狭いコードタスクで既に品質基準を満たしている
CIの修正ボット、限定されたファイルの変更、定型的なコード生成などで、K2.7 Codeが十分に機能しているなら、より大きなモデルへ移る理由はありません。
「十分な品質を、より低いコストで得られる」ことは明確な最適化です。
2. キャッシュ再利用率が低く、コストが重要
毎回異なるコンテキストを渡す単発タスクでは、K3のキャッシュミス入力$3/Mと出力$15/Mが効きます。キャッシュヒットを期待できないなら、実効コストを必ず計測してください。
3. レイテンシーが最優先
K3は約62トークン/秒と評価されています。インタラクティブな補完、チャット、短時間で返すUIでは、品質差より待ち時間が重要になることがあります。
4. 自己ホスティングが必須
K3の完全なモデルウェイトは、Moonshotによると2026年7月27日頃に公開予定です。自己ホスティングを前提にする場合、予定ではなく実際のリリースを確認してください。MoonshotのHugging Faceで公開状況を確認できます。
実運用での選び方
シナリオ1: 中規模リポジトリのCI修正ボット
K2.7 Codeでテストが通り、コストも予算内で、コンテキスト上限にも達していないなら、K3へ移行する必要はありません。
このケースでは次を優先してください。
- テスト通過率
- 1ジョブあたりのコスト
- 修正完了までの平均時間
- 不要なファイル変更の割合
失敗率が上がる、対象リポジトリが大きくなる、または複数サービスをまたぐ変更が増えるタイミングでK3を再評価します。
シナリオ2: 大規模モノレポの自律リファクタリング
このケースはK3を検証する価値があります。
- コード、テスト、設定、ログを一度に渡しやすい
- 長いツール呼び出し履歴を保持しやすい
- 多数ファイルの変更を伴う長時間タスクに適している
まずは本番移行ではなく、過去の実チケットや既知のリファクタリング課題を使ったオフライン評価から始めてください。
実装の詳細は、Kimi K3コーディングとKimi K3 APIガイドを参照してください。K2系列の情報が必要なら、K2.6解説も役立ちます。
コミット前にK2.7 CodeとK3をA/Bテストする
両モデルはOpenAI SDK互換です。モデルIDを切り替え、同一の入力を送って比較できます。
まず、比較条件を固定してください。
- システムプロンプト
- ユーザープロンプト
- 温度
- ツール定義
- 最大出力トークン
- リトライ設定
- 対象タスク
Node.jsの実装例です。
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.MOONSHOT_API_KEY,
baseURL: process.env.MOONSHOT_BASE_URL,
});
const request = {
messages: [
{
role: "system",
content:
"あなたはコード修正エージェントです。変更理由、変更内容、テスト手順を簡潔に示してください。",
},
{
role: "user",
content:
"このテスト失敗を修正してください。変更は最小限にし、修正後の差分を提示してください。",
},
],
temperature: 0,
};
async function run(model) {
const startedAt = performance.now();
const response = await client.chat.completions.create({
model,
...request,
});
return {
model,
latencyMs: Math.round(performance.now() - startedAt),
content: response.choices[0]?.message?.content,
usage: response.usage,
};
}
const results = await Promise.all([
run("kimi-k2-7-code"),
run("kimi-k3"),
]);
console.dir(results, { depth: null });
比較では、次の3項目を必ず記録してください。
出力品質
正しい修正か、テストが通るか、不要な変更がないか、レビュー可能な差分かを評価します。レイテンシー
初回トークンまでの時間、完了までの時間、エージェント全体の実行時間を分けて測定します。トークン消費と実効コスト
入出力トークン数だけでなく、キャッシュヒット率を含めて比較します。
評価結果を表にする
タスクごとに、最低限次の形式で記録すると判断しやすくなります。
| タスク | モデル | 成功 | テスト通過 | レイテンシー | 入力トークン | 出力トークン | キャッシュ状況 | コメント |
|---|---|---|---|---|---|---|---|---|
| CI修正 | K2.7 Code | ✅ | ✅ | |||||
| CI修正 | K3 | ✅ | ✅ | |||||
| モノレポ変更 | K2.7 Code | |||||||
| モノレポ変更 | K3 |
Apidogを使うと、両方のリクエストを保存し、環境変数でモデルIDを切り替え、ストリーミングレスポンス、ツール呼び出しペイロード、トークン使用量を確認できます。
セットアップにはApidogをダウンロードしてください。エディタ内で作業する場合は、VS Code内のApidog統合も利用できます。
結論
K3はK2.7 Codeの単なる改名ではありません。総パラメータ数を約3倍の2.8兆へ増やし、Kimi Delta Attention、Attention Residuals、Stable LatentMoEを採用し、コンテキストを100万トークンへ拡張しています。
ただし、移行は自動ではありません。
- 大規模コンテキスト、汎用推論、長時間エージェント実行が必要なら、K3を検証する
- 狭いコードタスクでK2.7 Codeが十分なら、そのまま使い続ける
- 料金はキャッシュヒット率で大きく変わるため、必ず実ワークロードで測定する
- レイテンシーが重要なら、品質だけでなく応答時間も評価する
最終的には、同じプロンプトと同じ評価基準で両モデルを実行し、成功率、レイテンシー、トークン消費の証拠に基づいて選択してください。
よくある質問
コーディングにはどちらが適していますか?
狭い範囲のコード生成・修正でコストを重視するなら、K2.7 Codeは強力な選択肢です。大規模リポジトリ、長期エージェント、多段階のコード変更では、K3の100万トークンコンテキストと汎用性が有利になる可能性があります。実際のタスクで比較してください。
Kimi K3はK2.7 Codeより高価ですか?
K3の公称価格は、キャッシュヒット入力が$0.30/M、キャッシュミス入力が$3/M、出力が$15/Mです。タスクごとのコストは、キャッシュヒット率、入力サイズ、出力の長さによって変わります。モデルIDの変更だけで切り替えられるため、実ワークロードで実効コストを比較するのが確実です。
Kimi K3はオープンソースですか?
リリース時点では、K3はAPIおよびアプリで利用可能です。Moonshotによると、完全なモデルウェイトは2026年7月27日頃に公開予定です。自己ホスティングの計画では、実際の公開状況を確認してください。
K3はClaude Fable 5やGPT-5.6 Solより優れていますか?
Moonshot自身の説明では、K3は総合的に両モデルを下回ります。一部ベンチマークでは競争力や優位性を示していますが、常に最上位という位置付けではありません。K3は強力なオープンウェイト候補ですが、自分のタスクでの品質、速度、コストを比較して採用判断をしてください。

Top comments (0)