DEV Community

cognitalk
cognitalk

Posted on

Kimi K3如何在扩大模型规模的同时,将推理和训练成本降到最低


https://www.youtube.com/watch?v=nUyV6eJ2ejs
这支视频对月之暗面(Moonshot AI)发布的 Kimi K3 论文进行了深度解读,核心围绕 “如何在扩大模型规模的同时,将推理和训练成本降到最低” 这一技术主线展开。

视频主要从发展背景、四大核心架构创新、性能与性价比表现三个方面进行了详细剖析:


1. 行业背景:打破开源模型的“参数天花板”

  • 开源瓶颈:过去18个月里,开源模型(如 DeepSeek V3、Qwen、GLM、Llama 等)的预训练参数大多卡在 1 万亿(1T) 左右,行业主要靠推理端算力(如强化学习、思维链、Agent 循环等)来提升智能 [00:00]。
  • K3 的突破:如果基础模型规模停滞,开源社区的上限会被封死。Kimi K3 是近期首个打破这一瓶颈的开源模型,直接将参数量推到了 2.88 万亿(2.88T)(约 K2 的 3 倍),并实现了真正可训练和强化学习的 100 万 Token 长上下文 [00:55]。

2. 核心架构革新(四大关键技术)

视频重点分析了 K3 为解决“大模型极难且极贵部署”所采用的四大关键技术:

① 极高稀疏度的 MoE 架构(Ultra-Sparse MoE)

  • 结构设计:包含 896 个路由专家(Routed Experts),单 Token 仅激活 16 个(激活率仅 ~1.8%)[02:00]。
  • 对比 K2:K2 是 384 个专家中激活 8 个。K3 模型总参数接近 3 倍,但激活比例反而更低 [02:16]。
  • 加深而非加宽:残差流维度保持为 7,168 不变,但层数从 61 层增加到 93 层。算力效率比 K2 提升了约 2.5 倍 [02:36]。

② 隐空间路由与分位数负载均衡(SL-MoE & Quantile Balancing)

  • Stable Latent MoE(隐空间 MoE):2.88T 的模型权重跨节点/GPU 分布,跨节点传输 Token 极耗网络带宽。K3 在将 Token 路由给专家之前,先将其降维压缩(7,168 维降至 3,584 维,刚好减半),传输完毕再还原,网络通信流量减半 [03:51]。
  • Quantile Balancing(分位数平衡):传统偏置调整容易产生震荡。K3 采用 Top-(k+1) 路由,直接根据专家得分分布计算分位数阈值来动态平衡专家负载,无需额外的辅助损失(Auxiliary Loss)或超参数调优 [05:12]。

③ Kimi Delta Attention(KDA 混合注意力)

  • 解决二次方复杂度:100 万 Token 的传统 Attention 成本高昂。K3 采用线性注意力(Linear Attention)与 Gated Delta Net 的升级版——Kimi Delta Attention (KDA) [06:07]。
  • 逐通道衰减(Per-channel Decay):传统的衰减率是全记忆统一的,而 KDA 实现逐通道(Per-channel)控制。某些维度可记忆 40 万 Token,某些维度 20 Token 之后即丢弃 [07:14]。
  • 交错层设计(3:1 比例):线性注意力有信息压缩损失,因此 K3 采用 3 层 KDA + 1 层全局注意力(MLA) 的交错设计(69 层 KDA + 24 层 MLA),最后再加一层全局注意力 [07:50]。
  • 无需位置编码:由于 KDA 的衰减机制本身具备位置敏感性,全局 Attention 层无需额外使用 RoPE 或 ALiBi,免去了长上下文插值微调的麻烦 [08:22]。

④ 注意力残差(Attention Residuals / AttnRes)

  • 深层网络的传输瓶颈:93 层的深层网络容易导致信息在逐层传递时被不断覆盖修改(类似传话游戏)[09:08]。
  • 机制:每一层都可以通过小型的 Query 机制直接从前面所有层的输出中检索所需信息(类似“图书卡”可直接调取第 4 层的内容,而无需逐层透传)[09:45]。
  • 分块控制成本:为了防止保留所有层输出导致显存爆炸,K3 将 93 层拆分为 8 个 Block(每块 12 层) 进行分块检索,既控制了显存,又解开了深层传递限制 [10:11]。

3. Benchmark 表现与极致性价比

  • 能力侧重:视频强调,Kimi K3 的总体得分虽未全盘超越 Claude 3.5/3.7 或 GPT-5 类顶尖闭源模型,但在 搜索浏览(BrowseComp)、深度 QA(DeepSearch QA)、研究(Research Rubrics)、Agent 工具调用(MCP Mark)和长流程编程(SWE Marathon) 等领域均登顶第一 [10:53]。
  • 极高性价比
  • 在 Coding 评估中,K3 取得 91.2% 的高分(单任务成本仅 $2.3),而 GPT 对应版本成本翻倍,比 Claude 顶级模式便宜一个数量级 [11:40]。
  • 在 GPQA 上,性能极其接近顶级闭源模型,但成本低 13% 至 2.6 倍 [11:58]。

4. 总结评价(核心亮点)

作者总结 K3 最值得关注的三点:

  1. 打破开源参数瓶颈:证明了 3 万亿级参数量的预训练模型在开源领域也是完全可行的 [12:22]。
  2. 架构设计极具系统性:稀疏 MoE、隐空间路由、KDA 和 Blocked Residuals 共同构成了极高的结构化推理效率 [12:38]。
  3. 完全开源:整个 2.88T 权重完全公开,大幅缩小了“能看论文”与“能在本地/私有云实际运行”之间的差距 [12:56]。

Top comments (0)