https://www.youtube.com/watch?v=KT4n-z_4QJU
OpenAI Astra 架构传闻辨析:循环深度与循环 Transformer 技术详解
第(一)部分 开场引入与传闻背景介绍(0% - 12%)
1 视频开场与更新预告:主持人向大家问好并切入主题,说明今天打开新闻时被 OpenAI 的 Astra 模型刷屏。Astra 是据传即将发布的模型,而它登上新闻的原因是有传闻称其架构采用了"循环深度"(Recurrent Depth)或"循环 Transformer"(Loop Transformers)。主持人提到自己平时在博客和 YouTube 频道上经常覆盖大语言模型架构相关的讨论,因此认为有必要快速录制一期视频,对该架构的相关说法进行解释和辟谣。同时他补充说明,"Reasoning from Scratch"模型系列的第二期视频仍计划在本周内录制,本期可视作"练手之作",因为他觉得自己有些生疏了。
2 信息来源说明:传闻出自《The Information》——一家经常能提供有趣内幕的媒体。该媒体通常在行业内消息非常灵通,拥有接触闭源实验室幕后人员的渠道,因此经常能拿到早期的独家消息。主持人强调,这些信息目前仅是《The Information》的单方面说法,并未得到 OpenAI 的官方确认,因此传闻的真实性尚不可知,但出于讨论需要,可以暂且假设它为真来进行技术分析。
3 传闻核心内容引述:主持人逐句引述了《The Information》的报道原文。报道指出,OpenAI 正在使用的这项新技术被称为"循环深度"或"循环 Transformer",它允许 AI 模型通过多次处理同一段文本来改进答案(此处主持人埋下伏笔,表示"多次处理文本"的表述不够精确,准确说法应是多次处理中间表征,后续会在讲清架构后展开)。报道还指出,与当前商用 SOTA 模型不同——后者会通过"思维链"(Chain of Thought)以文字形式展示思考过程——新技术以一种模糊 AI 推理过程的方式工作,使得模型为完成任务所采取的步骤无法轻易被人类读取或理解。
第(二)部分 循环 Transformer 基础架构解析——以 Nanbeige4.2-3B 为例(12% - 38%)
1 案例模型背景:主持人引出约两个月前讨论过的 Nanbeige4.2-3B 模型,这是一个近期相当受欢迎的前沿级开源权重模型,其技术报告中明确提到了使用了循环 Transformer。主持人此前已经画好了该架构的示意图,借此可以直接展示循环 Transformer 的一种具体实现方式。
2 架构图示讲解:从图示上看,整个结构与常规 Transformer 几乎一模一样。新加入的部分用浅蓝色(青色)箭头标出——这条箭头从 22 层堆叠块的末端指回开头,意味着同一组 22 层会被重复执行一次。标准流程是:输入经嵌入层后依次通过 22 层,但在循环 Transformer 中,完成第一次 22 层后并不直接进入输出层,而是回到起点再走一遍同样的 22 层。主持人用拼接示意图进一步说明:本质上是先 22 层、再 22 层,输入被处理了两次。
3 权重共享机制:在标准 Transformer 中,每一层块虽然组件结构相同,但各自拥有一套独立的权重参数;而在循环 Transformer 中,这 22 层块被重复使用,即只用一套权重完成了两次前向传播。
4 采用该架构的动机:这种做法与"在不显著增加参数量的前提下让架构变得更深、更大"密切相关。如果不考虑嵌入层和线性输出层(这两层通常很大,占据整体尺寸的相当比例),单看中间的 22 层:如果直接做一个 44 层的架构,参数量大约会翻倍;而采用右侧"复用同一组 22 层"的方案,参数量并不会变大。不过,由于在训练和推理时输入确实要流过 44 层,反向传播也要穿过 44 层,所以计算成本仍然比左侧非循环版本更贵;但在存储和将模型权重加载进 RAM 的环节上更便宜,因为只需保存和加载 22 套独特权重而非 44 套。主持人顺带提及,图中还有很多其他细节,相关背景可参考他的"LLM Architecture Gallery"以及配套文章。
5 训练策略:从零训练优于改造:Nanbeige4.2-3B 的技术报告未能提供循环与非循环版本的详细消融实验,主持人表示理解——单纯训练一个架构已经十分昂贵,若要做成严谨的科学对照研究,消融实验本身可能就要花费数十万乃至上百万美元。但他们至少跑了若干次迭代,结论明确:"从零训练"(from-scratch)的方案显著优于"改造"(retrofitting)方案。所谓改造,是指先按常规方式训练完一个标准架构,训练结束后再把它改成循环 Transformer(即让 22 层块循环两次)。这种做法性能会很差,因为许多架构高度依赖训练期间所见到的分布;哪怕只改动一个小环节(例如把 GELU 激活换成 SwiGLU,每层输出就会有细微变化),即使配合归一化层,性能也会大幅劣化。因此先训练、后改造的路径效果不好,从零开始就按循环架构训练才显著更优,这与直觉相符。
6 循环次数选择:两次是最佳性价比:有观众可能会问,为什么是循环两次而不是三次或四次?原因是两次循环"性价比最高"。实验表明,两遍配置在实验中提供了最有利的权衡——保留了约 75% 的 token 效率,同时带来显著的容量提升;而增加更多遍数只能带来边际性的额外改善,存在明显的收益递减效应,重复过多模型并不会有太大提升。
7 KV 缓存的处理:由于有效层数从 22 层变成 44 层,即便第二批层与第一批共享权重,每一"有效层"仍需独立的 KV 缓存条目,因为中间值是不同的——即使权重共享,第 1 层与第 23 层(即第二次循环的第 1 层)的输入和输出都不一样,每一对对应的重复层都是如此。他们做过实验尝试在重复层间朴素地共享 KV 缓存,结果发现性能变差。因此,为了最优性能,应为每一个有效层存储独立的 KV 缓存条目。换句话说,可以将 KV 缓存大小减半来节省空间,但代价是性能不如完整 KV 缓存。从 KV 缓存的角度看,应把这个循环 Transformer 视为每个有效层都有独立缓存。
第(三)部分 Mixture-of-Recursions:动态循环次数方案(38% - 62%)
1 另一种实现思路的引出:除了 Nanbeige4.2-3B 那种所有 token 固定循环相同次数的做法,还有另一种主持人认为"相当酷"的实现方式,叫做 Mixture-of-Recursions(递归混合)。无论是 Nanbeige4.2-3B 还是这种方法,都可以追溯到 2018 年首次提出该思想的《Universal Transformers》论文。
2 核心思想:Token 级动态循环次数:论文中的图展示了与前述类似的递归块多次循环的结构。在 Nanbeige4.2-3B 中,所有 token 都是固定走两遍;而在 Mixture-of-Recursions 中则取决于路由决策——例如棕色 token 走两遍,有些 token 走三遍,有些 token 只走一遍。另一张图更直观地展示:对于给定的文本,部分 token 只经过一次循环,部分经过多次循环。以序列位置为例,第一个位置("people"这个 token)经历了 3 步,即穿过 22 层块三次;绿色 token 是"一步 token",只走一遍 22 层块,不会执行第二、第三次循环;红色 token 则像 Nanbeige4.2-3B 那样走两遍(44 层)。这种设计比 Nanbeige4.2-3B 更具动态性:在可视化上,第一次循环的全部 token 会被计算,第二次循环中只有部分被计算,第三次循环中计算的 token 更少;而在常规 Transformer 中,只会看到最上面那一部分被计算。
3 路由器机制:其工作方式借鉴了 Mixture-of-Experts(专家混合)的思路。系统中有一个路由器(router),由它来决定某个 token 是否应该被送入下一轮循环。第一轮循环自然看到所有 token,第二轮只看到其中一部分,第三轮看到的更少。本质上路由器是一个学习出来的小模块,决定每个 token 走几轮循环。这与 MoE 类似——MoE 中有一个专家路由器将 token 分发给不同专家;而这里只有一个路由器,决定每个 token 究竟走"仅循环 1 次"、"循环 1+2 次"还是"循环 1+2+3 次"。论文给出了两种实现建议(一个路由器 vs 每个循环各一个路由器),二者基本达成同样的效果,仅是工程实现上的差异。
4 验证损失实验结果:论文将该方法与 vanilla Transformer(普通 Transformer)以及 recursive Transformer(固定循环次数,类似 Nanbeige4.2-3B)进行对比,以验证损失(validation loss)作为衡量指标。实验覆盖从 1.35 亿到 17 亿参数的四种模型规模。观察图表可以发现几个有趣现象:
- Vanilla Transformer 其实略优于 fixed recursive Transformer(二者非常接近,vanilla 稍好)。主持人对此评论道:这说明结果很大程度上取决于训练数据和超参数设置,他相信 Nanbeige 团队确实观察到了收益,否则不会采用这种方案;而在这篇论文的设置下,看起来用循环 Transformer 反而稍差。
- 但当采用蓝色的 Mixture-of-Recursions 方法时,验证损失显著更低。
- 对于最小的模型,vanilla Transformer 反而是最好的——模型很小时,搞这种循环 Transformer 可能并不划算。
- 模型的规模越大,Mixture-of-Recursions 带来的收益差距越明显(小模型差距约 0.4,较大模型差距约 0.8–0.9)。因此主持人推断:模型越大,Mixture-of-Recursions 这种方法的收益可能越高。
5 注意力与 KV 缓存的权衡:这种设计引出了一个新的问题——如何处理注意力和 KV 缓存。假设一个 query 到达第 3 层,但并非所有前置 token 都走到了第 3 层(有些只走到第 1 层,有些只走到第 2 层)。那么在第 3 层做注意力时,要么无法关注到所有前置 token,要么可以关注到所有前置 token——这取决于 KV 缓存的存储策略,本质上又是一种权衡。这类似于 sliding-window attention(滑动窗口注意力)和 DeepSeek Sparse Attention(DeepSeek 稀疏注意力)的思路:若追求最大性能,就让 query 关注所有前置 token,但成本更高、KV 缓存更大;若考虑到收益递减,可以做出战略性取舍,决定不需要所有 token(比如仅带来 3% 建模性能提升却成本高得多的场景),此时采用滑动窗口或稀疏注意力更为合适。循环 Transformer 中注意力的计算方式,也可以类比这种"对所有 token 计算注意力"与"仅对真正到达该层的 token 计算注意力"之间的权衡。
第(四)部分 对"思维链不可读"说法的辨析(62% - 82%)
1 回到《The Information》引述的第二个断言:主持人把话题拉回传闻的第二部分——即"模型不再展示太多思维链,且无法轻易被人类读取和理解"。主持人明确表示:他个人并不认为这种说法必然成立。
2 循环深度 ≠ 隐藏思维链:通常推理模型会通过生成更多 token(即中间解释)来消耗更多推理时计算量。而 Transformer 块里多了几层,并不意味着模型在推理链中产生的 token 变少了——当然,"层多了导致 token 减少"这是一个值得研究的课题。主持人以 OpenAI 自家的模型系列举例:目前 GPT-5.6 有 Luna、Terra、Sol 三种不同规模,他打赌 Sol 是更大的模型,层数很可能比 Luna 多。但 Sol 是否就"展示更少的推理"呢?更大的模型在中间表征中可以进行更多计算,因此在基准测试(如解同一道题)中达到同等性能时,所需推理时扩展(inference-time scaling)少于小模型——小模型可能需要更多 token 或更多推理计算。然而,这并不意味着更大的 Sol 模型就不再使用推理链,也不意味着那些推理链变得难以解释。主持人将循环 Transformer 技术类比于此:仅仅因为我们将层重复多次,并不代表模型现在拥有了"模糊的推理链",更可能是它用更少的 token 就能搞定,因为它更"聪明"、不需要那么多 token。这就好比人类:考试中如果没怎么复习或很疲惫,解一道较难的题就需要更大的草稿纸,写更多内容、划掉重来、犯错后才能得到正确答案;而如果休息充分、复习扎实,需要写下来的东西就更少,虽然能更精确地解释自己是如何得出结果的,但通常也不意味着可以不加思考就直接给出最终答案。从这个意义上说,循环 Transformer 思路并不会"遮蔽"推理链,只是可能让推理链更加紧凑而已。
3 与递归自我改进(Recursive Self-Improvement)的区别:社交媒体上有观众提问这是否与"递归自我改进"有关,主持人明确否认。递归自我改进指的是模型从根本上改进自身,这是一个完全不同的概念;而循环 Transformer 本质上只是把同一个 Transformer 块循环过多次,并没有从根本上改变什么,更像是一种扩展(scaling)技术——相当于增加了层数,是对架构的一种微调(因为复用了 Transformer 块,甚至可能加上路由机制)。目前并不清楚 OpenAI 是否使用了路由,因为循环 Transformer 有多种形态,但总体而言它是一种扩展技术。
第(五)部分 理论溯源与多种变体梳理(82% - 94%)
1 追溯至 Universal Transformers:为了完整性,主持人指出循环 Transformer 的思想可以追溯到 2018 年(相当早)的《Universal Transformers》论文。如果用 Universal Transformers 的视角来看 Nanbeige4.2-3B,后者几乎是对该思想的一种简化:Nanbeige4.2-3B 是把同一组 22 层堆叠重复一次,而 Universal Transformer 则是把同一层重复 T 次。因此可以说,Nanbeige4.2-3B 是 Universal Transformer 的一个"风味"(flavor);而我们前面讨论的 Mixture-of-Recursions 也是 Universal Transformer 的一个风味,区别在于它有一个路由器,在单个 token 级别上决定每个 token 的循环步数 T。
2 2025 年论文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》:主持人介绍了另一篇相关论文,思想同样回溯到 Universal Transformer。论文左图与 Nanbeige4.2-3B 类似(只是表现形式不同)——同样是 22 层堆叠,隐藏激活(hidden state)传入第二个 22 层堆叠,本质上属于固定循环。而论文提出的"潜在推理"(latent reasoning)修改版与之相似,主要区别在于:它还将原始输入传回这些中间状态。可以理解为在层之间使用了许多残差连接,把输入不断传回。除了常规 Transformer 已有的潜在状态(latent state)外,还额外传回输入。所有这些方案彼此关联,都可追溯到 Universal Transformer 的思想。
第(六)部分 视频总结与后续预告(94% - 100%)
1 总结立场:主持人重申本期视频有些即兴,但希望观众喜欢这个关于循环 Transformer 如何工作的简短讲解。再次强调一切基于传闻——目前并不能确定 OpenAI Astra 是否真的采用了循环 Transformer 思路。主持人表明自己的观点:即便 Astra 真的用了循环深度/循环 Transformer 方法,这也不会从本质上改变思维链的任何东西;而且鉴于相关思想在学术文献中早已被提出,这也并非特别新颖的想法。
2 开放邀请与下期预告:主持人向可能就职于 OpenAI 并愿意分享信息的观众发出邀请,表示自己很有兴趣了解更多细节。最后预告下一期内容是"Reasoning from Scratch"系列的第二期视频,希望观众保持期待,我们下期再见。
Top comments (0)