DEV Community

jianjun Liu
jianjun Liu

Posted on

Kimi K3 登顶 MMLU-Pro 全球第一 (89.2%) — 95% 比 GPT-5 便宜

月之暗面(Moonshot AI)刚刚发布 Kimi K3 模型,MMLU-Pro 全球第一 (89.2%),超过 GPT-5 (87.8%) 和 Claude 4 Opus。关键是:输入价格 $0.50/M tokens,GPT-5 是 $10.00/M,便宜 20 倍

如果你是开发者、创业者、或者在用 GPT-4o/Claude 跑业务,这条信息跟你直接相关。

K3 是什么?

Kimi K3 是月之暗面 7 月 17 日发布的旗舰模型。核心参数:

  • 2.8 万亿总参数(MoE 架构,每 token 激活 32B)
  • 256K 上下文窗口
  • MMLU-Pro 89.2%(目前全球第一)
  • HumanEval+ 94.7%(代码能力)
  • GSM8K 96.4%(数学能力)
  • $0.50/M 输入 tokens,$2.00/M 输出 tokens
  • 7 月 27 日开源(7 天后)

为什么资本市场慌了?

K3 跑分出来后,英伟达股价跌了 2%。逻辑很简单:如果中国 AI 模型能用 1/20 的成本达到 GPT-5 水平,全球 AI 算力需求增长预期就要打折扣。GPU 不需要那么多了,英伟达承压。

这 2% 是不是过度反应不好说,但底层趋势是真实的——K3 不是孤例,是中国新一代高效大模型的先头部队。

怎么用 K3?(90% 人的痛点)

问题来了:月之暗面官方 K3 API 有几个门槛:

  1. 需要国内手机号 + 实名认证
  2. 只支持支付宝/微信,没有国际信用卡
  3. 文档只有中文
  4. 海外访问慢、偶发掉线

对 95% 的海外开发者和外卡用户来说,这是堵墙

解决方案:TokenEase

我们做了一件事:TokenEase — 一个 OpenAI 兼容的 API 网关,让你邮箱注册、信用卡付款、直接调 K3(以及 DeepSeek V4、GLM-5.1、Qwen-Plus、豆包、腾讯混元)。

from openai import OpenAI

client = OpenAI(
    base_url="https://tokenease.io/v1",
    api_key="sk-你的key"  # 注册送 $1 免费额度
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "用3句话解释量子纠缠"}]
)
print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

就这样,原来调 GPT-4o 的代码改一行 base_url 就能调 K3。LangChain、LlamaIndex、Dify、Coze 全部直接用。

真实测试:20 道 LeetCode 中等题

我自己用 K3 跑了 20 道 LeetCode 中等难度,一次通过率 85%。同样题目 GPT-4o 大概 70%。

256K 上下文很爽。我把一个 3 万行的 Python 项目整个扔进去(18 万 tokens),让它分析架构并给出重构建议,输出质量比预期高很多。之前用 128K 模型得分批喂,体验完全不一样。

价格对比(每百万 tokens)

模型 输入 输出 上下文 MMLU-Pro
Kimi K3 $0.50 $2.00 256K 89.2%
DeepSeek V4 $0.27 $1.10 128K 86.5%
GLM-5.1 $0.30 $1.20 128K 85.9%
GPT-5 $10.00 $30.00 128K 87.8%
Claude 4 Opus $15.00 $75.00 200K 88.1%

K3 不是最便宜的国产模型(DeepSeek 更便宜),但它是第一个在 MMLU-Pro 上明确超过 GPT-5 的

老实说 K3 的 3 个缺点

  1. 长上下文延迟 — 200K+ 输入时,首 token 延迟 8-12 秒。实时对话限制在 16K 以内。
  2. 英文创意写作 — GPT-4o 写英文更自然。K3 中文明显强,英文略逊。
  3. Function calling — K3 支持但 schema 验证比 OpenAI 严,需要清理 tool 定义。

现在该做什么?

如果你的产品还没测过 K3:

  1. tokenease.io 注册 — 邮箱即可,$1 免费额度(约 200 万输入 tokens)
  2. 拿你最难的 prompt 试 — 那种在 GPT-4o 上失败的题目
  3. 跟踪开源发布 — 7 月 27 日 K3 权重开放,要自部署的等那天

中国大模型这一波是真的。K3 只是最新证明。


声明:我在 TokenEase 工作。文中跑分数据来自 Artificial Analysis 和月之暗面官方发布说明,2026 年 7 月。

Top comments (0)