DEV Community

cognitalk
cognitalk

Posted on

RLCD (Reinforcement Learning for Calibrated Decisions) Dev History | 面向校准决策的强化学习的起源与发展历史

RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)起源与发展历史(通俗版)

注意:这个RLCD是TypeSafe公司自创名词,和学术界2023年一篇叫RLCD(对比蒸馏强化学习)论文只是缩写撞名,二者完全无关。

一、RLCD诞生的思想源头(OpenAI时期,2020‑2023)

  1. Diogo Almeida是RLHF(人类反馈强化学习)的核心发明人之一,参与InstructGPT、ChatGPT的研发工作。RLHF干成了一件大事:把原始大模型调教成会聊天、讨人类喜欢的助手。
  2. 在OpenAI内部,Diogo慢慢看到RLHF的致命短板:
    • RLHF奖励人类喜欢的回答,不是奖励“客观正确”;模型会为了听起来舒服,掩盖不确定性,出现过度自信、幻觉、模式坍缩(mode collapse)。
    • RLHF适合人读文字,不适合软件程序调用。程序需要诚实的置信概率,而不是漂亮通顺的假话。后台自动化场景下,AI不能只会“哄人”。
  3. 他心里抛出核心疑问:AI明明智商很高,为什么大量经济工作还是没法自动化? 问题不在模型的原始智商,而在后训练的“优化目标(北极星)”选错了。RLHF的北极星是“人类偏好”,不是“给代码可用的可靠决策”。
  4. 同期行业又出来第二种路线RLVR(可验证奖励强化学习):用程序检查答案对错(比如数学题看答案、代码跑单元测试),训练推理模型。RLVR适合数学、做题,但只关心“对/错”,不在乎模型说出来的置信概率是否诚实,依然解决不了“不确定性”交给软件处理这件事。

三个后训练范式简单对比:

  • RLHF:目标→人类更喜欢的文本输出;产物:ChatGPT、Claude聊天模型
  • RLVR:目标→答案可以被程序验证正确;产物:数学、推理大模型
  • RLCD:目标→输出决策+诚实可信的置信概率,供代码消费;产物:Jev(System‑One系统一模型)

二、隐身创业阶段:RLCD概念成型(2024‑2026.09,TypeSafe隐身模式)

  1. Diogo离开OpenAI,联合伙伴创立TypeSafe AI,拿到4000万美金种子轮,进入两年隐身研发(stealth)状态,核心目标就是打造一套全新后训练范式RLCD,还有配套System‑One模型架构。
  2. RLCD完整含义:Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习。
    • 不再优先生成自由的长文本聊天;
    • 模型输出结构化决策+经过校准的概率分数:模型报80%置信,现实中这件事就真的大概80%概率正确;软件可以直接拿这个概率做阈值判断、分支逻辑。
  3. 开发过程中的关键认知(来自播客访谈原文)
    1. 任务目标(北极星)远比算力重要:LLM历史发生过2.2次范式大转向:第一次RLHF转向指令跟随;第二次RLVR做可验证推理;第三次就是RLCD,转向面向程序闭环、校准决策。
    2. 数据>算力:RLCD极度依赖特殊合成数据集,坚决不用用户真实业务数据训练,避免现实数据带来的过拟合、偏见,保证适配未来未知软件场景。
    3. RLCD不是一套论文,两年间没有对外发学术论文,属于“先做产品、后补论文”,只在内部迭代打磨。
  4. 播客访谈里Diogo反复强调:RLCD不是随便造黑话,它代表新的任务北极星。哪怕未来不用强化学习算法,只要优化目标是“输出校准后的决策给代码”,就属于RLCD这一范式。

三、RLCD公开面世(2026‑09‑15,Jev模型对外发布)

  1. TypeSafe结束隐身,对外发布第一个基于RLCD训练出来的模型 Jev(jev‑1.13.0),也就是System‑One(系统一)机器原生可编程模型,RLCD正式对外亮相。
  2. 发布物料:发布视频、开发者文档、Discord社区、播客深度访谈;没有同步放出RLCD技术论文。对外只讲思想范式,不公开训练细节。
  3. 配套API原语(Choice / Score / Bernoulli),就是专门配合RLCD模型输出“决策+概率”,方便程序读取,不是传统聊天字符串接口。
  4. 发布后社区巨大反响:开发者意识到,RLCD瞄准的是后台自动化,不是人机聊天。同时也出现争议:
    • 支持者:终于有专门给代码用的后训练范式,解决幻觉和置信度问题;
    • 质疑者:没有公开论文,RLCD到底是全新算法,只是一套新优化目标,还是工程上的组合技巧,缺少公开可复现证据。

四、RLCD后续发展设想(来自播客、官方文档)

  1. RLCD不是只为Jev这一个模型版本服务,它是一套范式/北极星目标,未来可以训练不同尺寸的System‑One系列模型。
  2. 它不排斥RLVR、RLHF,定位互补:
    • RLHF用来做人聊天;
    • RLVR用来做深度慢推理(System‑Two,慢思考);
    • RLCD用来做机器原生、快速、带诚实概率的决策(System‑One,快思考)。
  3. Diogo观点:RLCD不会解决所有问题,多模型级联是未来方向;置信度低就调用更强模型做深度推理。
  4. TypeSafe计划:未来会放出Cookbook(开发者菜谱),大量真实业务案例,未来有可能补出RLCD相关的技术文档/论文。

五、一句话总结RLCD的来龙去脉

RLCD诞生,来自RLHF的核心发明人Diogo*反思RLHF“讨好人类但程序不好用”的缺陷,创业两年打磨出来的一套以后训练优化目标为核心的新范式,不追求漂亮聊天文本,追求输出对软件诚实可用的决策+校准置信概率,2026‑09伴随Jev模型正式公开,至今尚未发布正式学术论文*。

Top comments (0)