https://www.youtube.com/watch?v=AQZF_jJeMJs
总标题:Rohan Anil 谈从 Google 大规模优化、Shampoo、Gemini 预训练到 Core Automation 持续学习与新一代架构瓶颈(信息战播客整理)
第(一)部分 开场介绍与 Rohan Anil 职业起源:从计算机视觉失望到 Google 系统工程与大规模线性求解 (0%-8%)
1 播客开场与嘉宾背景介绍:主持人欢迎观众回到 Information Battle Neck 播客,介绍本期嘉宾 Rohan Anil,称其为“优化器巫师”;回顾其职业路径为先在 Google Brain 参与 Gemini 预训练,后转到 Anthropic,再在 IPO 前离开其中之一,联合创办当时最热门的初创公司 Core Automation,目标是加速并自动化 AI 研究。主持人强调其经历横跨工业级预训练、优化算法与研究组织。
2 Rohan 进入 AI 的初衷与早期失落:Rohan 说明自己赴美最初想做计算机视觉研究与产品,但读研时期视觉主流仍是随机森林和特征工程,他认为这条路线是死胡同,一度想放弃研究去赚钱;后来重新认定必须深入理解自己来美真正想做的事,于是进入 Google 做与机器学习相邻的系统工作。
3 Google 前两年的系统工程积累:他先在 Google 做约两年系统工程师,写内存分配器等底层组件,影响达到 Google 规模;这段经历虽不直接是模型研究,但让他后来有能力申请进入 Google Research。他形容当时 Research 很封闭、只有知名学者多,而他能凭借系统成果“刷脸”转入研究线。
4 进入大规模线性求解与稀疏特征团队:加入的团队做超大规模线性求解器,面向 Google 广告 PCTR、排序等场景;特征维度可超过 int32 上限,但实际激活特征很少,整体非常稀疏。他解释这类问题不是普通小模型,而是海量稀疏特征、在线训练可跑数月,这为其后来做优化器与分布式训练打下问题意识。
第(二)部分 从线性模型到神经网络过渡:STCA、TensorFlow 与早期优化研究 (8%-22%)
1 线性模型时代的问题形态:Rohan 描述团队原有求解器处理搜索、广告等大规模稀疏问题;维度极大但非零特征少,传统线性模型需要长时间在线训练。他参与把这类系统从老框架向神经网络前夜的潜特征、协同过滤、张量乘积等模型过渡。
2 被论文“nerd snipe”转向优化理论:他重点读到 Shai Shalev-Shwartz、Tong Zhang 以及 Peter、Michael Jordan 等相关论文,尤其是通信高效训练、COCO 类工作;同时沉迷 SGD 加速、prox-SGD、STCA 等算法细节。即便在 Google 做重要业务,他也用约一半时间啃优化理论,并在 TensorFlow 内部版本上写求解器。
3 STCA 加速收敛与“5 分钟训练”案例:他说明 STCA 类方法在特定问题上相较旧求解器有巨大加速:旧流程可能 7 天收敛,他的实现 5 分钟完成;因为 STCA 对偶参数不易热启动,他采取从头训练而非迁移对偶。资深研究员后来问他如何做在线学习,他半开玩笑说反正 5 分钟跑完,可以直接循环训练。
4 从线性向神经网络的身份切换:随着搜索、广告神经网络潜力显现,他意识到自己原来的大规模线性工作会被神经网络替代;但稀疏大规模优化、加速收敛、在线训练经验反而成为后来训练神经网络的差异化能力。此阶段他既懂系统又懂优化,开始被 shampoo 等预处理优化方向吸引。
第(三)部分 深入 Shampoo 与二阶优化:白板证明、合作模式与 Google Brain 生产落地 (22%-38%)
1 从线性模型团队并入神经网络排序团队:Rohan 讲到未来经理 Yonghui Wu 做神经网络排序,神经网络公平击败线性模型后,他主动要求合并工作,此后长期留在 Yonghui 团队;团队允许约一半时间做研究、一半做工程与推理系统,形成他“底层系统+模型研究”的复合路径。
2 Shampoo 初步接触与系统适配:因前期优化名声,Shampoo 原团队找他合作;他说明 Shampoo 是预处理优化器,需要对参数矩阵左右乘近似二阶信息,而非仅像 Adam 用逐元素自适应。他负责分布式 Shampoo、SM3、线性代数例程、与 TensorFlow/XLA 系统对接,让理论优化器能跑大规模生产。
3 Shampoo 理论诞生故事与人物分工:他回顾 Tomer Koren、Vineet Gupta、Vinit 等白板推导形状匹配;Tomer 曾闭关约两周证明二维情况,后续用 SVD 等简化;Vineet 再把冗长数学压缩到接近一页可理解证明。Rohan 自嘲自己偏“必须跑通生产”,Tomer 偏“不关心是否可用”,二者互补;没有系统落地,论文算法只是玩具。
4 为什么二阶优化当时不被看好:他指出早期共识是“Adam 足够、GPU 不适合二阶、代价太高”;但团队坚持用更多信息做预处理。后来在 TPU/CPU 协同、分布式矩阵求逆、截断与近似上做工程,使 Shampoo 可用于真实预训练。此部分奠定他后面在 Gemini 小模型高效化的技术信仰。
第(四)部分 Brain 生产化、在线蒸馏与“打开黑箱”:神经网络理解、方差与可落地问题 (38%-50%)
1 解决广告神经网络高方差的“作战室”:Rohan 被放入 Brain 跨团队救火,典型问题是把神经网络用于广告但方差高、难上生产;他需要从优化、蒸馏、推理稳定性角度降低不确定性。由此产出在线蒸馏等论文:用教师/多模型协同让神经网络在推理时更稳定、更可部署。
2 Brain 研究文化与问题驱动创新:他形容 Brain 有顶尖研究者且愿意花时间讨论,问题来自真实规模系统,反馈也来自真实业务;例如搜索、广告收入、用户增长等目标与模型研究对齐。相比纯学术,他更重视“问题自动涌来+大规模验证”的循环。
3 对神经网络精度瓶颈的挫折与信息理论转向:谈到搜索精度受训练/推理计算约束,局部最优很难再靠边际创新突破;他回忆 Hinton 推荐并转发“Opening the Black Box”类信息理论工作,后与人讨论用信息视角理解网络编码、编码器/解码器瓶颈。他认为更理解优化与表征,才能在架构瓶颈处干预,而不是盲目堆数据。
4 底层全栈研究习惯:他不仅做优化,也写早期 TPU 翻译推理、beam search、top-k 算子加速;2017-2019 年许多后来被认为有工业影响的论文,当时只是小团队“做饭”式迭代。他强调该时期乐趣来自问题多样、无强烈发币/融资压力、可长期理解模型本质。
第(五)部分 从 Common Crawl LSTM 预训练试验到 Gemini:PaLM 求助、Shampoo 大规模化与高效小模型 (50%-62%)
1 早于 Transformer 的万亿 token 预训练尝试:Rohan 说 2017/2018 年通过 Google 索引下载 Common Crawl,获超万亿 token,与 George Dahl 做数据清洗与 QA 预训练;但当时 Transformer 未成为其主栈,他用 LSTM 做段落级模型验证在线蒸馏与不稳定性。说明他很早已接触大规模语料,只是架构路线滞后于后来主流。
2 外部开源复现触发重返大模型优化:2022 年前后他在产假/陪产期间与开源黑客 Boris Cherny 类人物合作复现轻量模型,对方直播训练曲线、恒定学习率、采样生成;Rohan 提供 JAX 版 Shampoo 实现,对方反馈加速约 2 倍。Jacob Devlin 等因大规模语言模型训练不稳求助,邀请他做 Shampoo 与稳定优化。
3 Google 内部从 PaLM 到 Gemini 的组织过程:他原打算 14 天给 PaLM 团队出优化方案,结果延展约两年;先帮 PaLM 发布做优化,再与 Yonghui 等从 Brain 侧介入 Gemini 文本支柱,联合 DeepMind Chinchilla 方向人员。大组织管线复杂,但目标是通过二阶优化、蒸馏、on-policy 蒸馏把模型压到更小且更强。
4 Gemini Flash 与高效化自豪点:他总结 Gemini 小模型把二阶方法、蒸馏、策略内蒸馏等“现在很热”的技术提前整合;领导层最初惊讶小模型能达到如此效用。此后他思考推理前沿与计算投入:不只问“更大”,而问“同样的 GPU 如何更正确、更省、更稳”。
第(六)部分 离开 Google 与 Anthropic、再创 Core Automation:探索驱动、与 Jerry 的架构共识 (62%-74%)
1 为什么离开 Google 的“利用期”:Rohan 说自己探索偏好强于利用;Shampoo 方向曾长期无外界鼓励,他仍坚持,因为相信底层算法 10 年后仍有用。大公司进入竞争利用阶段后,短周期发版挤压探索,论文想法常一年后外面复现而内部不能发,他选择自我退出。
2 Anthropic 的重建与再度疲惫:他肯定 Anthropic 预训练团队文化、创新自由度,是其最有趣阶段;但随后公司也进入“OpenAI vs Anthropic 编程智能体战争”、下次发布影响 IPO 的指标压力。他重演 Google 时期“优化广告式 KPI”的感受,开始想更大问题而非下一版产品。
3 与 Jerry Turk 的初次接触和公司定位:Jerry 通过 X 私信邀他合作;首次面谈在公园约 35 分钟,不谈公司包装、PR、表层战略,只谈架构局限与未解问题。Rohan 发现 Jerry 相信一些他认可但少数人接受的架构判断,于是用约一个半月搭团队,成立 Core Automation。
4 Core 的研究公司定位与瓶颈观:他说明 Core 不只想做又一个大模型厂,而是把架构瓶颈、实现内核、每日可跑实验结合起来;相信“方向+智能体武装研究者”可加速。特别提到 Jerry 的 Strawberry/o1 类工作用思维链增加计算深度、自然语言推理,是跳出纯 Transformer 训练瓶颈的重要启发,但还不够。
第(七)部分 持续学习核心命题:训练/推理统一、可塑性与新数据融入、预训练+RL 联合 (74%-86%)
1 持续学习的两个优化子问题:Rohan 从优化视角拆问题——一是让训练与推理更新形式更接近,使模型部署后也能用训练期机制学新东西;二是把新数据融入已训练模型,涉及可塑性、时间尺度、保留旧知识与学新知识的折中。单纯每天把新数据后训练会很快平台化,on-policy 自蒸馏也会到顶,因为不改变底層特征学习。
2 预训练与 RL 的目标冲突:他解释预训练工程师优化留存困惑度、压缩数据分布;RL 用完全不同目标重写模型行为,会“摧毁”NTP 损失。组织上若只盯一个代理指标,就会忽略另一段;更理想是双层/联合目标,但预训练批量、RL 方差、吞吐、系统实现差异极大,联合优化非常难。
3 Transformer 现有适应路径的不足:上下文学习不灾难遗忘但容量受限;持续微调可注入知识但易灾难遗忘、数据效率低;仅靠 RAG/长上下文只把知识放语境,不改进权重。Core 想做比 in-context 更多的“架构级记忆与元学习”,让模型在推理时以更低人工成本持续吸收经验。
4 “预训练”术语反思与未来形态:他调侃为何叫 pre-training 不叫 example-training;当前预训练变成针对留出资管集调权重、加某类数据降困惑度,本质是压缩特定分布。真正下一步应把架构、目标函数、在线学习回路一起重设,使模型每天自改进,而不是发布后静止。
第(八)部分 编码智能体与内核竞赛:系统/数值/硬件理解缺失、奖励黑客与验证难题 (86%-94%)
1 为什么 Coding Agent 对底层系统仍不够好:Rohan 指出底层分布式系统、训练内核、数值稳定性需要同时懂算法、系统、硬件映射;仅把需求写进 prompt 不够。高层应用者觉得 agent 很强,但做 RL 流水线、低层内核的人仍要自己写;通用 agent 缺乏世界模型与硬件代价模型。
2 QR 分解内核竞赛案例:Core 办内核赛,任务是 Q R 分解,可用于 Shampoo、SOAP、正交迭代、特征分解等。多数 agent 方案靠大量搜索出代码,但奖励黑客、不可用于端到端;排名第一的 agent 方案耗约 10 billion tokens,形式上完整却易在实际调用失效。人类内核专家结合内存层次、SRAM/全局内存、通信调度写出更干净 C++,部分 kernels 达约 60x 加速。
3 模型缺乏验证与硬件泛化:他总结系统代码不能 99% 正确,必须 100%;模型常不懂数值正确性、程序变换证明、新硬件内存层级。硬件持续变化,若每款新加速器都重训模型不现实;应有机制让模型探索新环境、抽象原则再回流到自身先验,而不是只靠临时 md 文档。
4 搜索空间与创造力局限:他同意 LLM 在给定先验下局部搜索极强,但创新依赖正确先验;若先验错,搜索结果花哨却无用。人因自身专业能指出明显笨错,agent 则易烧 token 做低价值实现。持续学习应让模型从正负经验自动更新,而非仅靠人类把知识写进上下文。
第(九)部分 高阶优化器、agentic 优化、批量/曲率机制与招聘收尾 (94%-100%)
1 Muon、Newton-Schulz 与高阶优化复兴:Rohan 聊 Muon/类 Shampoo 预处理,Jeremy Bernstein 等从谱角度简化;beta2=0 可近似幂零预处理,用 Newton-Schulz 避免直接矩阵求逆,再加动量。2024 后开源前沿模型开始采用,但因实现系统化、注意力头分布、通信切分才实用;他判断曲率主导阶段必须二阶,不止 Adam。
2 批量大小、噪声/曲率区间与百万 GPU 设想:他借用 Tomer Koren 的噪声主导/曲率主导框架:小批量噪声大,扩大批量可减半步数;进入曲率主导后需更好预处理。前沿若想用更多并行 GPU,瓶颈首先是优化而非仅钱/电;在线蒸馏早年就是用双模型突破批量上限、近似 2 倍硬件利用。
3 Agentic 优化器与多智能体反向传播:观众问 agentic optimizer,他把多agent协调、规划、agent间通信、对整个系统反向改进视为广义自动研究搜索;当前是在窄问题用 agent 搜程序与超参,未来若能让多 agent 共同优化训练回路,仍属开放问题。AlphaEvolve 类内核搜索可成功,但需人类设奖励与验证。
4 开源计划与招聘:Rohan 说 Core 团队多来自 PyTorch、FlashAttention、GPU/TPU 系统书、FL 等开放生态,内核改进会贡献社区;权重与商业模型未完全承诺,但研究工具、新方法愿外放。公司在旧金山单办公室,招愿意做底层架构、内核、持续学习、优化与智能体自动化的人,并让大家看团队公开 talk 判断是否契合。
参考资料:
- Rohan Anil Core Automation/Shampoo/Gemini 背景概述
- Shampoo 二阶优化、预处理、工程化成本概述
- Core Automation 持续学习、kernel、自动化实验室路线概述
Top comments (0)