<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: cognitalk</title>
    <description>The latest articles on DEV Community by cognitalk (@cognitalk).</description>
    <link>https://dev.to/cognitalk</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F3948334%2F31908684-dec9-48a5-96bd-d83b6de4c8ef.jpg</url>
      <title>DEV Community: cognitalk</title>
      <link>https://dev.to/cognitalk</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/cognitalk"/>
    <language>en</language>
    <item>
      <title>SebastianRaschka -- OpenAI Astra and Recurrent Depth / Looped Transformers</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Thu, 03 Sep 2026 01:54:51 +0000</pubDate>
      <link>https://dev.to/cognitalk/sebastianraschka-openai-astra-and-recurrent-depth-looped-transformers-1bij</link>
      <guid>https://dev.to/cognitalk/sebastianraschka-openai-astra-and-recurrent-depth-looped-transformers-1bij</guid>
      <description>&lt;p&gt;  &lt;iframe src="https://www.youtube.com/embed/KT4n-z_4QJU" width="710" height="399"&gt;
  &lt;/iframe&gt;
&lt;br&gt;
&lt;a href="https://www.youtube.com/watch?v=KT4n-z_4QJU" rel="noopener noreferrer"&gt;https://www.youtube.com/watch?v=KT4n-z_4QJU&lt;/a&gt;&lt;/p&gt;

&lt;h1&gt;
  
  
  OpenAI Astra 架构传闻辨析：循环深度与循环 Transformer 技术详解
&lt;/h1&gt;

&lt;p&gt;&lt;strong&gt;第（一）部分 开场引入与传闻背景介绍（0% - 12%）&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;1 视频开场与更新预告&lt;/strong&gt;：主持人向大家问好并切入主题，说明今天打开新闻时被 OpenAI 的 Astra 模型刷屏。Astra 是据传即将发布的模型，而它登上新闻的原因是有传闻称其架构采用了"循环深度"（Recurrent Depth）或"循环 Transformer"（Loop Transformers）。主持人提到自己平时在博客和 YouTube 频道上经常覆盖大语言模型架构相关的讨论，因此认为有必要快速录制一期视频，对该架构的相关说法进行解释和辟谣。同时他补充说明，"Reasoning from Scratch"模型系列的第二期视频仍计划在本周内录制，本期可视作"练手之作"，因为他觉得自己有些生疏了。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2 信息来源说明&lt;/strong&gt;：传闻出自《The Information》——一家经常能提供有趣内幕的媒体。该媒体通常在行业内消息非常灵通，拥有接触闭源实验室幕后人员的渠道，因此经常能拿到早期的独家消息。主持人强调，这些信息目前仅是《The Information》的单方面说法，并未得到 OpenAI 的官方确认，因此传闻的真实性尚不可知，但出于讨论需要，可以暂且假设它为真来进行技术分析。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;3 传闻核心内容引述&lt;/strong&gt;：主持人逐句引述了《The Information》的报道原文。报道指出，OpenAI 正在使用的这项新技术被称为"循环深度"或"循环 Transformer"，它允许 AI 模型通过多次处理同一段文本来改进答案（此处主持人埋下伏笔，表示"多次处理文本"的表述不够精确，准确说法应是多次处理中间表征，后续会在讲清架构后展开）。报道还指出，与当前商用 SOTA 模型不同——后者会通过"思维链"（Chain of Thought）以文字形式展示思考过程——新技术以一种模糊 AI 推理过程的方式工作，使得模型为完成任务所采取的步骤无法轻易被人类读取或理解。&lt;/p&gt;




&lt;p&gt;&lt;strong&gt;第（二）部分 循环 Transformer 基础架构解析——以 Nanbeige4.2-3B 为例（12% - 38%）&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;1 案例模型背景&lt;/strong&gt;：主持人引出约两个月前讨论过的 Nanbeige4.2-3B 模型，这是一个近期相当受欢迎的前沿级开源权重模型，其技术报告中明确提到了使用了循环 Transformer。主持人此前已经画好了该架构的示意图，借此可以直接展示循环 Transformer 的一种具体实现方式。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2 架构图示讲解&lt;/strong&gt;：从图示上看，整个结构与常规 Transformer 几乎一模一样。新加入的部分用浅蓝色（青色）箭头标出——这条箭头从 22 层堆叠块的末端指回开头，意味着同一组 22 层会被重复执行一次。标准流程是：输入经嵌入层后依次通过 22 层，但在循环 Transformer 中，完成第一次 22 层后并不直接进入输出层，而是回到起点再走一遍同样的 22 层。主持人用拼接示意图进一步说明：本质上是先 22 层、再 22 层，输入被处理了两次。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;3 权重共享机制&lt;/strong&gt;：在标准 Transformer 中，每一层块虽然组件结构相同，但各自拥有一套独立的权重参数；而在循环 Transformer 中，这 22 层块被重复使用，即只用一套权重完成了两次前向传播。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;4 采用该架构的动机&lt;/strong&gt;：这种做法与"在不显著增加参数量的前提下让架构变得更深、更大"密切相关。如果不考虑嵌入层和线性输出层（这两层通常很大，占据整体尺寸的相当比例），单看中间的 22 层：如果直接做一个 44 层的架构，参数量大约会翻倍；而采用右侧"复用同一组 22 层"的方案，参数量并不会变大。不过，由于在训练和推理时输入确实要流过 44 层，反向传播也要穿过 44 层，所以计算成本仍然比左侧非循环版本更贵；但在存储和将模型权重加载进 RAM 的环节上更便宜，因为只需保存和加载 22 套独特权重而非 44 套。主持人顺带提及，图中还有很多其他细节，相关背景可参考他的"LLM Architecture Gallery"以及配套文章。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;5 训练策略：从零训练优于改造&lt;/strong&gt;：Nanbeige4.2-3B 的技术报告未能提供循环与非循环版本的详细消融实验，主持人表示理解——单纯训练一个架构已经十分昂贵，若要做成严谨的科学对照研究，消融实验本身可能就要花费数十万乃至上百万美元。但他们至少跑了若干次迭代，结论明确："从零训练"（from-scratch）的方案显著优于"改造"（retrofitting）方案。所谓改造，是指先按常规方式训练完一个标准架构，训练结束后再把它改成循环 Transformer（即让 22 层块循环两次）。这种做法性能会很差，因为许多架构高度依赖训练期间所见到的分布；哪怕只改动一个小环节（例如把 GELU 激活换成 SwiGLU，每层输出就会有细微变化），即使配合归一化层，性能也会大幅劣化。因此先训练、后改造的路径效果不好，从零开始就按循环架构训练才显著更优，这与直觉相符。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;6 循环次数选择：两次是最佳性价比&lt;/strong&gt;：有观众可能会问，为什么是循环两次而不是三次或四次？原因是两次循环"性价比最高"。实验表明，两遍配置在实验中提供了最有利的权衡——保留了约 75% 的 token 效率，同时带来显著的容量提升；而增加更多遍数只能带来边际性的额外改善，存在明显的收益递减效应，重复过多模型并不会有太大提升。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;7 KV 缓存的处理&lt;/strong&gt;：由于有效层数从 22 层变成 44 层，即便第二批层与第一批共享权重，每一"有效层"仍需独立的 KV 缓存条目，因为中间值是不同的——即使权重共享，第 1 层与第 23 层（即第二次循环的第 1 层）的输入和输出都不一样，每一对对应的重复层都是如此。他们做过实验尝试在重复层间朴素地共享 KV 缓存，结果发现性能变差。因此，为了最优性能，应为每一个有效层存储独立的 KV 缓存条目。换句话说，可以将 KV 缓存大小减半来节省空间，但代价是性能不如完整 KV 缓存。从 KV 缓存的角度看，应把这个循环 Transformer 视为每个有效层都有独立缓存。&lt;/p&gt;




&lt;p&gt;&lt;strong&gt;第（三）部分 Mixture-of-Recursions：动态循环次数方案（38% - 62%）&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;1 另一种实现思路的引出&lt;/strong&gt;：除了 Nanbeige4.2-3B 那种所有 token 固定循环相同次数的做法，还有另一种主持人认为"相当酷"的实现方式，叫做 Mixture-of-Recursions（递归混合）。无论是 Nanbeige4.2-3B 还是这种方法，都可以追溯到 2018 年首次提出该思想的《Universal Transformers》论文。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2 核心思想：Token 级动态循环次数&lt;/strong&gt;：论文中的图展示了与前述类似的递归块多次循环的结构。在 Nanbeige4.2-3B 中，所有 token 都是固定走两遍；而在 Mixture-of-Recursions 中则取决于路由决策——例如棕色 token 走两遍，有些 token 走三遍，有些 token 只走一遍。另一张图更直观地展示：对于给定的文本，部分 token 只经过一次循环，部分经过多次循环。以序列位置为例，第一个位置（"people"这个 token）经历了 3 步，即穿过 22 层块三次；绿色 token 是"一步 token"，只走一遍 22 层块，不会执行第二、第三次循环；红色 token 则像 Nanbeige4.2-3B 那样走两遍（44 层）。这种设计比 Nanbeige4.2-3B 更具动态性：在可视化上，第一次循环的全部 token 会被计算，第二次循环中只有部分被计算，第三次循环中计算的 token 更少；而在常规 Transformer 中，只会看到最上面那一部分被计算。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;3 路由器机制&lt;/strong&gt;：其工作方式借鉴了 Mixture-of-Experts（专家混合）的思路。系统中有一个路由器（router），由它来决定某个 token 是否应该被送入下一轮循环。第一轮循环自然看到所有 token，第二轮只看到其中一部分，第三轮看到的更少。本质上路由器是一个学习出来的小模块，决定每个 token 走几轮循环。这与 MoE 类似——MoE 中有一个专家路由器将 token 分发给不同专家；而这里只有一个路由器，决定每个 token 究竟走"仅循环 1 次"、"循环 1+2 次"还是"循环 1+2+3 次"。论文给出了两种实现建议（一个路由器 vs 每个循环各一个路由器），二者基本达成同样的效果，仅是工程实现上的差异。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;4 验证损失实验结果&lt;/strong&gt;：论文将该方法与 vanilla Transformer（普通 Transformer）以及 recursive Transformer（固定循环次数，类似 Nanbeige4.2-3B）进行对比，以验证损失（validation loss）作为衡量指标。实验覆盖从 1.35 亿到 17 亿参数的四种模型规模。观察图表可以发现几个有趣现象：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Vanilla Transformer 其实略优于 fixed recursive Transformer（二者非常接近，vanilla 稍好）。主持人对此评论道：这说明结果很大程度上取决于训练数据和超参数设置，他相信 Nanbeige 团队确实观察到了收益，否则不会采用这种方案；而在这篇论文的设置下，看起来用循环 Transformer 反而稍差。&lt;/li&gt;
&lt;li&gt;但当采用蓝色的 Mixture-of-Recursions 方法时，验证损失显著更低。&lt;/li&gt;
&lt;li&gt;对于最小的模型，vanilla Transformer 反而是最好的——模型很小时，搞这种循环 Transformer 可能并不划算。&lt;/li&gt;
&lt;li&gt;模型的规模越大，Mixture-of-Recursions 带来的收益差距越明显（小模型差距约 0.4，较大模型差距约 0.8–0.9）。因此主持人推断：模型越大，Mixture-of-Recursions 这种方法的收益可能越高。&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;strong&gt;5 注意力与 KV 缓存的权衡&lt;/strong&gt;：这种设计引出了一个新的问题——如何处理注意力和 KV 缓存。假设一个 query 到达第 3 层，但并非所有前置 token 都走到了第 3 层（有些只走到第 1 层，有些只走到第 2 层）。那么在第 3 层做注意力时，要么无法关注到所有前置 token，要么可以关注到所有前置 token——这取决于 KV 缓存的存储策略，本质上又是一种权衡。这类似于 sliding-window attention（滑动窗口注意力）和 DeepSeek Sparse Attention（DeepSeek 稀疏注意力）的思路：若追求最大性能，就让 query 关注所有前置 token，但成本更高、KV 缓存更大；若考虑到收益递减，可以做出战略性取舍，决定不需要所有 token（比如仅带来 3% 建模性能提升却成本高得多的场景），此时采用滑动窗口或稀疏注意力更为合适。循环 Transformer 中注意力的计算方式，也可以类比这种"对所有 token 计算注意力"与"仅对真正到达该层的 token 计算注意力"之间的权衡。&lt;/p&gt;




&lt;p&gt;&lt;strong&gt;第（四）部分 对"思维链不可读"说法的辨析（62% - 82%）&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;1 回到《The Information》引述的第二个断言&lt;/strong&gt;：主持人把话题拉回传闻的第二部分——即"模型不再展示太多思维链，且无法轻易被人类读取和理解"。主持人明确表示：他个人并不认为这种说法必然成立。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2 循环深度 ≠ 隐藏思维链&lt;/strong&gt;：通常推理模型会通过生成更多 token（即中间解释）来消耗更多推理时计算量。而 Transformer 块里多了几层，并不意味着模型在推理链中产生的 token 变少了——当然，"层多了导致 token 减少"这是一个值得研究的课题。主持人以 OpenAI 自家的模型系列举例：目前 GPT-5.6 有 Luna、Terra、Sol 三种不同规模，他打赌 Sol 是更大的模型，层数很可能比 Luna 多。但 Sol 是否就"展示更少的推理"呢？更大的模型在中间表征中可以进行更多计算，因此在基准测试（如解同一道题）中达到同等性能时，所需推理时扩展（inference-time scaling）少于小模型——小模型可能需要更多 token 或更多推理计算。然而，这并不意味着更大的 Sol 模型就不再使用推理链，也不意味着那些推理链变得难以解释。主持人将循环 Transformer 技术类比于此：仅仅因为我们将层重复多次，并不代表模型现在拥有了"模糊的推理链"，更可能是它用更少的 token 就能搞定，因为它更"聪明"、不需要那么多 token。这就好比人类：考试中如果没怎么复习或很疲惫，解一道较难的题就需要更大的草稿纸，写更多内容、划掉重来、犯错后才能得到正确答案；而如果休息充分、复习扎实，需要写下来的东西就更少，虽然能更精确地解释自己是如何得出结果的，但通常也不意味着可以不加思考就直接给出最终答案。从这个意义上说，循环 Transformer 思路并不会"遮蔽"推理链，只是可能让推理链更加紧凑而已。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;3 与递归自我改进（Recursive Self-Improvement）的区别&lt;/strong&gt;：社交媒体上有观众提问这是否与"递归自我改进"有关，主持人明确否认。递归自我改进指的是模型从根本上改进自身，这是一个完全不同的概念；而循环 Transformer 本质上只是把同一个 Transformer 块循环过多次，并没有从根本上改变什么，更像是一种扩展（scaling）技术——相当于增加了层数，是对架构的一种微调（因为复用了 Transformer 块，甚至可能加上路由机制）。目前并不清楚 OpenAI 是否使用了路由，因为循环 Transformer 有多种形态，但总体而言它是一种扩展技术。&lt;/p&gt;




&lt;p&gt;&lt;strong&gt;第（五）部分 理论溯源与多种变体梳理（82% - 94%）&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;1 追溯至 Universal Transformers&lt;/strong&gt;：为了完整性，主持人指出循环 Transformer 的思想可以追溯到 2018 年（相当早）的《Universal Transformers》论文。如果用 Universal Transformers 的视角来看 Nanbeige4.2-3B，后者几乎是对该思想的一种简化：Nanbeige4.2-3B 是把同一组 22 层堆叠重复一次，而 Universal Transformer 则是把同一层重复 T 次。因此可以说，Nanbeige4.2-3B 是 Universal Transformer 的一个"风味"（flavor）；而我们前面讨论的 Mixture-of-Recursions 也是 Universal Transformer 的一个风味，区别在于它有一个路由器，在单个 token 级别上决定每个 token 的循环步数 T。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2 2025 年论文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》&lt;/strong&gt;：主持人介绍了另一篇相关论文，思想同样回溯到 Universal Transformer。论文左图与 Nanbeige4.2-3B 类似（只是表现形式不同）——同样是 22 层堆叠，隐藏激活（hidden state）传入第二个 22 层堆叠，本质上属于固定循环。而论文提出的"潜在推理"（latent reasoning）修改版与之相似，主要区别在于：它还将原始输入传回这些中间状态。可以理解为在层之间使用了许多残差连接，把输入不断传回。除了常规 Transformer 已有的潜在状态（latent state）外，还额外传回输入。所有这些方案彼此关联，都可追溯到 Universal Transformer 的思想。&lt;/p&gt;




&lt;p&gt;&lt;strong&gt;第（六）部分 视频总结与后续预告（94% - 100%）&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;1 总结立场&lt;/strong&gt;：主持人重申本期视频有些即兴，但希望观众喜欢这个关于循环 Transformer 如何工作的简短讲解。再次强调一切基于传闻——目前并不能确定 OpenAI Astra 是否真的采用了循环 Transformer 思路。主持人表明自己的观点：即便 Astra 真的用了循环深度/循环 Transformer 方法，这也不会从本质上改变思维链的任何东西；而且鉴于相关思想在学术文献中早已被提出，这也并非特别新颖的想法。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2 开放邀请与下期预告&lt;/strong&gt;：主持人向可能就职于 OpenAI 并愿意分享信息的观众发出邀请，表示自己很有兴趣了解更多细节。最后预告下一期内容是"Reasoning from Scratch"系列的第二期视频，希望观众保持期待，我们下期再见。&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Grant Miller (IBM) introduce Outcome Reviews in AI-era</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Wed, 02 Sep 2026 02:20:00 +0000</pubDate>
      <link>https://dev.to/cognitalk/grant-miller-ibm-introduce-outcome-reviews-in-ai-era-2g5m</link>
      <guid>https://dev.to/cognitalk/grant-miller-ibm-introduce-outcome-reviews-in-ai-era-2g5m</guid>
      <description>&lt;p&gt;  &lt;iframe src="https://www.youtube.com/embed/c57vAe-mMLo" width="710" height="399"&gt;
  &lt;/iframe&gt;
&lt;br&gt;
&lt;a href="https://www.youtube.com/watch?v=c57vAe-mMLo" rel="noopener noreferrer"&gt;https://www.youtube.com/watch?v=c57vAe-mMLo&lt;/a&gt;&lt;/p&gt;

&lt;h1&gt;
  
  
  AI时代代码审查：Grant Miller「成果审查（Outcome Reviews）」框架及国内外行业看法
&lt;/h1&gt;

&lt;p&gt;Grant Miller（IBM杰出工程师）提出&lt;strong&gt;成果审查Outcome Reviews&lt;/strong&gt;核心观点：大模型接管代码生成、文档、框架搭建等底层编码工作；代码审查不再纠结语法、格式、实现细节，人类工程师重心转向&lt;strong&gt;业务意图校验、成果验收、技术方案权衡、业务结果是否符合预期&lt;/strong&gt;。这一观点在全球软件工程圈引发广泛讨论，国内外行业既有高度共鸣，也存在现实层面的分歧与落地约束。&lt;/p&gt;

&lt;h2&gt;
  
  
  一、海外行业视角（北美科技企业、开源社区）
&lt;/h2&gt;

&lt;h3&gt;
  
  
  1. 认同范式迁移，拥抱Outcome Reviews核心理念
&lt;/h3&gt;

&lt;p&gt;微软、Google、IBM、亚马逊、HubSpot等头部企业普遍认可：LLM普及之后，传统逐行检查语法、编码风格的评审模式已经性价比很低。&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;工具层承接底层检查&lt;/strong&gt;：Copilot、Claude Code Review、CodeRabbit等AI评审工具，承担起语法错误、编码规范、简单漏洞、重复代码等机械性检查，把人类从低级重复劳动释放出来。HubSpot落地双阶段评审Agent，AI先输出评审意见，再由第二个Agent过滤无效噪声，减少评审者负担，和Miller框架逻辑高度契合。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;工程师角色发生转变&lt;/strong&gt;：海外很多团队提出，工程师从“写代码+读代码找bug”，转向&lt;strong&gt;定义业务目标、设计验收标准、权衡技术取舍、验证最终产出是否满足业务结果&lt;/strong&gt;，这正是Outcome Reviews的内核。亚马逊部分团队要求AI产出代码不再逐行细读，重点校验：架构约束、业务规约、安全边界，把验证交给自动化测试、形式化验证、沙箱运行，而不是人肉读每一行代码。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;学术与技术社区声音&lt;/strong&gt;：大量软件工程研究指出，AI写代码带来代码提交量暴涨，人工评审带宽严重不足，继续沿用老评审模式会造成PR积压、评审流于形式，必须向“结果导向审查”转型。&lt;/li&gt;
&lt;/ol&gt;

&lt;h3&gt;
  
  
  2. 海外的谨慎与质疑（现实落地阻力）
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;不能完全放弃对实现细节的关注&lt;/strong&gt;：大量工程实践反馈，大模型会产生“看起来正确、暗藏隐患”的代码，逻辑漏洞、隐蔽安全漏洞、资源泄漏不会只通过业务结果暴露。即便做成果审查，依然需要对高风险模块做实现层面校验，不能完全只看业务输出结果。Qodo开发者调研显示，只有约25.8%资深工程师敢不做人工复核直接上线AI生成代码，初级开发者反而更容易过度信任AI输出。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;成果审查门槛很高，对人的能力要求暴涨&lt;/strong&gt;：Outcome Reviews要求评审人充分理解业务意图、能够定义完备验收标准。如果业务需求模糊、测试用例不全，只看成果会漏掉大量潜在问题；很多团队工程师并不具备这种高阶权衡能力，直接推行会带来线上风险。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;安全合规强约束场景反对激进转型&lt;/strong&gt;：金融、医疗、加密软件等强监管领域，海外企业普遍坚持：即使AI生成代码，仍然需要追溯实现逻辑，不能只校验业务输出结果，合规审计需要代码实现层面证据，单纯成果审查无法满足监管要求。&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  二、国内行业视角（大厂、互联网、金融、开源社区）
&lt;/h2&gt;

&lt;p&gt;国内技术圈对Miller的成果审查框架&lt;strong&gt;理念高度认同，但落地更加务实、保守，走“分层分级、人机结合”路线，没有完全抛弃代码实现细节审查&lt;/strong&gt;。&lt;/p&gt;

&lt;h3&gt;
  
  
  1. 主流共识：AI干脏活累活，人聚焦业务与架构（与Outcome Reviews同向）
&lt;/h3&gt;

&lt;p&gt;阿里、美团、快手、腾讯等大厂在内部实践中，已经出现完全一致的转型趋势：&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;AI预审接管语法、规范、简单bug检测，人工评审不再把精力浪费在空格、变量命名、简单语法错误上。阿里通义灵码评审工具，每天超过一半有效评审意见来自AI，人工把精力留给架构匹配、业务逻辑、风险权衡等核心问题。美团提出代码评审重心从“代码写得对不对”转变为“是不是在正确约束下解决正确的业务问题”，与Grant Miller观点高度呼应，推行Pre‑PR预审机制，AI先过滤低级问题，人工评审聚焦业务成果、方案匹配度。&lt;/li&gt;
&lt;li&gt;评审重点分层：人工重点关注四点：①架构匹配度；②业务边界、异常场景；③性能资源消耗；④安全合规；而不是逐行抠实现细节。快手智能CodeReview将AI用于基础检查，人工聚焦业务风险，MR评审效率得到提升，覆盖74%合入请求。&lt;/li&gt;
&lt;/ol&gt;

&lt;h3&gt;
  
  
  2. 国内落地的现实顾虑（比海外更加谨慎）
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;区分业务风险等级，不搞一刀切&lt;/strong&gt;
国内金融、支付、数据安全相关业务普遍观点：普通业务模块可以侧重成果审查；但资金、权限、数据敏感模块，&lt;strong&gt;成果审查不足以替代实现层面复核&lt;/strong&gt;，即使业务表现正常，也要审查内部实现，防止潜藏漏洞引发重大事故。很多企业落地分层评审：普通工具类AI代码快速评审；核心业务强制资深工程师复核；高风险模块叠加安全岗评审，多层把关。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;对“只看结果”保持警惕，重视AI幻觉风险&lt;/strong&gt;
国内开发者普遍观察到大模型幻觉带来的隐蔽问题：业务测试用例很难覆盖全部异常路径，业务输出正常，底层代码可能埋定时炸弹。所以国内团队普遍观点：&lt;strong&gt;成果审查是评审重心迁移，不是完全放弃代码实现检查&lt;/strong&gt;，是减少低级细节检查，而不是完全不看实现逻辑。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;配套能力短板约束落地&lt;/strong&gt;
Outcome Reviews需要高质量需求文档、完备测试用例、清晰架构规约。国内大量中小团队需求模糊、测试覆盖不足，如果直接照搬只看业务成果的模式，会放大质量风险，因此中小团队更多是有限度借鉴这套思想，不会直接全盘采用这套框架。&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  三、总结对比：国内外对Outcome Reviews（成果审查）框架整体态度
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;维度&lt;/th&gt;
&lt;th&gt;海外行业&lt;/th&gt;
&lt;th&gt;国内行业&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;理念层面&lt;/td&gt;
&lt;td&gt;高度认可：评审重心从底层实现转向业务意图、产出结果&lt;/td&gt;
&lt;td&gt;高度认可理念，认同重心迁移趋势&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;落地策略&lt;/td&gt;
&lt;td&gt;互联网科技公司积极尝试结果导向审查；强监管行业保持谨慎&lt;/td&gt;
&lt;td&gt;
&lt;strong&gt;分层分级落地，不一刀切&lt;/strong&gt;：普通业务向成果审查倾斜，高风险业务保留实现细节审查&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;核心风险担忧&lt;/td&gt;
&lt;td&gt;大模型幻觉、验收标准缺失、监管合规压力&lt;/td&gt;
&lt;td&gt;AI幻觉+业务测试不完备，担心只看业务结果漏掉隐蔽故障；重视数据安全、业务故障代价&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;人机分工&lt;/td&gt;
&lt;td&gt;AI做基础检查；人负责业务意图、权衡、验收&lt;/td&gt;
&lt;td&gt;AI承担语法规范、简单bug；人重点架构、业务逻辑、安全合规，保留高风险代码实现复核&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h2&gt;
  
  
  四、行业共同的普遍结论
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;Grant Miller提出的成果审查，代表AI时代代码审查&lt;strong&gt;发展方向，但不是一套拿来即用的标准化流程&lt;/strong&gt;。它描述的是重心转移：&lt;strong&gt;不是不再看代码，而是不再把人力消耗在AI可以搞定的低级语法细节上&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;无论国内外，行业共识：&lt;strong&gt;AI不能替代人做代码审查，只能替代审查中的机械部分&lt;/strong&gt;。人的核心价值变成确认：需求意图是否被正确实现、技术选型权衡是否合理、业务成果是否达标、风险是否可控。&lt;/li&gt;
&lt;li&gt;落地效果高度依赖团队能力：这套框架适合需求清晰、测试完备、工程师水平高的团队；业务模糊、测试薄弱、强监管场景，不能直接完全放弃底层实现审查。&lt;/li&gt;
&lt;/ol&gt;

</description>
      <category>ai</category>
      <category>codequality</category>
      <category>llm</category>
      <category>softwareengineering</category>
    </item>
    <item>
      <title>OpenClaw 2.0 core features introduction</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Wed, 02 Sep 2026 02:08:53 +0000</pubDate>
      <link>https://dev.to/cognitalk/openclaw-20-core-features-introduction-1p3g</link>
      <guid>https://dev.to/cognitalk/openclaw-20-core-features-introduction-1p3g</guid>
      <description>&lt;h1&gt;
  
  
  OpenClaw 2.0 core features introduction 龙虾2.0核心功能介绍
&lt;/h1&gt;

&lt;p&gt;先把调子定一下：OpenClaw 2.0（v2026.8.1，2026-08-30 发布）干的事，本质上就是把一只"极客在命令行里养的龙虾"，改造成&lt;strong&gt;普通人在浏览器里就能雇的数字员工&lt;/strong&gt;——而且这只虾现在记得住事、敢接活、不偷看你的密码、还能拉同事一起干活。&lt;/p&gt;

&lt;p&gt;下面用"人话 + 高度"两层说。&lt;/p&gt;




&lt;h2&gt;
  
  
  一、高度：它在解决 Agent 的三个老命根子问题
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;装不上&lt;/strong&gt; → 普通人被配置劝退&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;记不住&lt;/strong&gt; → 聊两次就失忆，每次重新交代背景&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;管不住&lt;/strong&gt; → 有文件/浏览器/终端权限，密钥乱飞，不安全&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;2.0 就是冲着这三座山去的，所以官方自己都调侃叫《OpenClaw 2.0, Accidentally》——本来只想改改安装向导，结果把记忆、权限、多人都重做了。&lt;/p&gt;




&lt;h2&gt;
  
  
  二、接地气：像讲给朋友听那样说功能
&lt;/h2&gt;

&lt;h3&gt;
  
  
  1）安装：从"配环境地狱"到"开机即聊"
&lt;/h3&gt;

&lt;p&gt;以前装 OpenClaw 像组装台式机：模型、网关、插件、渠道一个个填。&lt;br&gt;
现在安装程序会&lt;strong&gt;先扫你电脑&lt;/strong&gt;：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;你装了 ChatGPT/Claude 命令行登录？复用。&lt;/li&gt;
&lt;li&gt;你有 API Key？粘一次就行。&lt;/li&gt;
&lt;li&gt;你本地跑了 Ollama / LM Studio？直接认。
用不到的配置&lt;strong&gt;全挪到以后跟 Agent 聊天时顺手补&lt;/strong&gt;。
&amp;gt; 类比：以前是自己拼 IKEA 柜子，现在是宜家成品房，钥匙给你直接住。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  2）网页端：从"后台面板"变"主战场"
&lt;/h3&gt;

&lt;p&gt;打开浏览器不再是设置页，而是&lt;strong&gt;直接进对话&lt;/strong&gt;。&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;启动 1.6s → 575ms，请求 140 → 45 个&lt;/li&gt;
&lt;li&gt;进度卡片刷新不丢：Agent 跑到哪、子 Agent 在干啥、改了哪些文件，实时看&lt;/li&gt;
&lt;li&gt;聊天里能钉小仪表盘、回答问题用按钮/卡片，不像在调程序
&amp;gt; 类比：以前是打开汽车引擎盖操作，现在是坐进驾驶室看中控屏。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  3）记忆：Agent 终于会"睡觉复盘"了
&lt;/h3&gt;

&lt;p&gt;1.0 时代的 OpenClaw 像金鱼，三天前交代的事就忘。&lt;br&gt;
2.0 给三件套：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Active Memory&lt;/strong&gt;：同 Agent 跨会话召回，你上周说的偏好它这周还记得（群聊默认不开）&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Background Memory Consolidation（后台做梦）&lt;/strong&gt;：Agent 闲时把聊天里值得留的沉淀进长期记忆，带出处，还有"梦境日记"可查&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Self-learning&lt;/strong&gt;：被认可的任务方法自动变成可复用的 Skill，下次直接调
&amp;gt; 高度说法：从"上下文窗口临时记忆"升级为"带溯源的长期记忆 + 程序性自我进化"。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  4）安全：要密码时不再让你明文贴聊天框
&lt;/h3&gt;

&lt;p&gt;这是 2.0 最硬的一块。&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Agent 需要 Token/密码 → 弹&lt;strong&gt;遮罩输入框&lt;/strong&gt;，值不进聊天、不进模型上下文&lt;/li&gt;
&lt;li&gt;可选 egress proxy：密钥只替换给白名单网址，防被钓鱼请求骗走&lt;/li&gt;
&lt;li&gt;自动化授权改成"&lt;strong&gt;精确授权一次&lt;/strong&gt;"，活变了要重新批，可查可撤&lt;/li&gt;
&lt;li&gt;装插件强制看来源/能力，乱源要 &lt;code&gt;--force&lt;/code&gt;，接 1Password 可选
&amp;gt; 接地气：以前 Agent 跟你要银行卡号，你只能喊出来；现在它递你一张遮挡纸条，只有柜台（白名单服务）能看见。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  5）多人与多 Agent：从"单人虾缸"到"虾厂协作"
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Shared Cloud Sessions&lt;/strong&gt;：把会话丢云端，同事能进来看进度、接手，上下文不丢&lt;/li&gt;
&lt;li&gt;会话能在你 Mac 上开始，扔到 Cloud Worker 继续跑，云端机器睡了再来消息再醒&lt;/li&gt;
&lt;li&gt;底层存储从文件迁 &lt;strong&gt;SQLite&lt;/strong&gt;，进度/转录/编辑全带走
&amp;gt; 注意官方红线：这是&lt;strong&gt;协作边界&lt;/strong&gt;，不是多租户安全隔离——不信任的人别放同 Gateway。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  6）顺手的小但爽的点
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;历史会话&lt;strong&gt;按原话短语搜索&lt;/strong&gt;，跳回原文上下文&lt;/li&gt;
&lt;li&gt;音视频附件上传/生成/刷新不丢，手机端原生播放&lt;/li&gt;
&lt;li&gt;结构化问答卡片、可导出图片的仪表盘 widget&lt;/li&gt;
&lt;li&gt;官方 provider 包加了 BytePlus、Mistral、Volcengine、Xiaomi 等，不绑 GPT&lt;/li&gt;
&lt;/ul&gt;




&lt;h2&gt;
  
  
  三、一句收口
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;OpenClaw 2.0 = 安装自动认环境 + 网页当主界面 + Agent 会长期记忆和自学 + 密钥不裸奔 + 能拉人进会话接力干活的本地优先 Agent 操作系统。&lt;/strong&gt;&lt;br&gt;
它不再只是"开发者养着玩的单机虾"，而是往"家庭/小团队的数字员工底座"跨了一步；代价是升级要走 SQLite 迁移、跑 &lt;code&gt;openclaw doctor --fix&lt;/code&gt;，别直接覆盖老版本。&lt;/p&gt;

</description>
    </item>
    <item>
      <title>代码即物理世界（Code‑as‑World）起源与发展历史</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Tue, 01 Sep 2026 04:18:31 +0000</pubDate>
      <link>https://dev.to/cognitalk/dai-ma-ji-wu-li-shi-jie-code-as-worldqi-yuan-yu-fa-zhan-li-shi-1gfn</link>
      <guid>https://dev.to/cognitalk/dai-ma-ji-wu-li-shi-jie-code-as-worldqi-yuan-yu-fa-zhan-li-shi-1gfn</guid>
      <description>&lt;h1&gt;
  
  
  “代码即物理世界（Code‑as‑World）”思想起源与发展历史
&lt;/h1&gt;

&lt;blockquote&gt;
&lt;p&gt;圈内口语叫“代码即物理世界”，学术范式名称为 &lt;strong&gt;Code‑as‑World&lt;/strong&gt;，2026年8月27日MirroS团队正式发布同名论文《Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning》，是当前AI圈热议的具身智能/世界模型新范式。&lt;br&gt;
核心主张：&lt;strong&gt;不用像素、隐向量、纯文本去表征物理场景；把物体、质量、摩擦、动力学演化全部写成可执行仿真代码（如MuJoCo场景描述），AI把观测（视频/图像）反向还原出这套代码，用代码运行、仿真、干预、验证，以此理解物理世界&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h2&gt;
  
  
  一、思想史前溯源（哲学、早期AI，1980‑2021）
&lt;/h2&gt;

&lt;h3&gt;
  
  
  1. 泛计算论（Pancomputationalism）哲学根基
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;哲学源头：宇宙即计算，物理定律本质是可执行程序，物质是运行时状态。物理学方程等价于算法，现实世界是一套大规模运行的计算系统，这是“代码描述物理”最底层思想来源。&lt;/li&gt;
&lt;li&gt;MIT罗德尼·布鲁克斯 &lt;strong&gt;包容架构 Subsumption Architecture（1980s）&lt;/strong&gt;：机器人不靠全局符号世界模型，靠简单程序模块和环境交互生成智能。埋下一条关键教训：&lt;strong&gt;符号/程序才适合真实物理交互，纯感知预测会失忆、状态崩坏&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;传统符号AI失败：早期物理推理（Qualitative Physics定性物理）尝试用逻辑方程描述物体碰撞、下落，但很难从原始视觉观测自动推导，只能人工手写规则，无法规模化。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  2. 仿真驱动AI与基于模型强化学习（MBRL，2015‑2021）
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;MBRL：学习一个环境模型（世界模型），在仿真环境里做规划训练。早期世界模型大多是&lt;strong&gt;隐向量 latent 模型&lt;/strong&gt;，不是显式代码；模型是神经网络黑盒，不可读、不可编辑、无法人工干预参数。&lt;/li&gt;
&lt;li&gt;MuJoCo、Isaac Sim等物理仿真器成熟：人类手写XML/JSON场景代码描述物体、物理参数，运行得到物理演化。&lt;strong&gt;人写代码→仿真出物理现象；但AI不能反过来从视频自动写出这套代码&lt;/strong&gt;，这是当时的瓶颈。&lt;/li&gt;
&lt;/ul&gt;

&lt;blockquote&gt;
&lt;p&gt;这一阶段：&lt;strong&gt;人写代码生成物理世界；AI做感知、做仿真内训练，但不会逆向把现实观测还原成代码&lt;/strong&gt;。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h2&gt;
  
  
  二、前置技术铺垫（2022‑2025：大模型代码能力爆发，过渡阶段）
&lt;/h2&gt;

&lt;p&gt;三件事凑在一起，催生Code‑as‑World思想：&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;LLM代码生成能力爆发&lt;/strong&gt;：GPT‑4、CodeLlama等可以稳定输出仿真、机器人控制代码。出现PaLM‑SayCan（2022）：大模型输出机器人API调用代码完成物理任务；ProgPrompt用程序式规划做机器人任务规划。&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;此时代码仍然只是&lt;strong&gt;任务输出&lt;/strong&gt;，不是AI内部表征世界本身。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;世界模型路线分裂（2023‑2025）&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;A路线：视频生成式世界模型（如Gen‑2、Sora）：输出像素画面。&lt;strong&gt;画面非常逼真，但没有显式物体质量、摩擦、惯性；物体离开画面就丢失状态，干预推理不可靠（幻觉物理）&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;B路线：显式3D几何重建：重建物体mesh，但缺少动力学参数，不知道“物体多重、碰撞会怎样”。
学界越来越意识到：&lt;strong&gt;像素、几何、文本都不足以作为物理世界的内部表征，需要可执行、可仿真的显式机制表征&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Code2Worlds（2026‑02，arXiv:2602.11757）&lt;/strong&gt;&lt;br&gt;
提出闭环范式：&lt;code&gt;Prompt → Code → 仿真世界执行 → 反馈回传 → 修改Code&lt;/code&gt;。把代码生成+仿真执行反馈形成闭环，但它是&lt;strong&gt;文本生成世界&lt;/strong&gt;，不是从真实世界视频观测逆向反推代码。&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Meta‑斯坦福2026年5月综述《Code as Agent Harness》：提出代码不再只是输出物，而是Agent的运行骨架、推理/环境建模载体，为Code‑as‑World做思想铺垫。&lt;/p&gt;

&lt;h2&gt;
  
  
  三、范式正式诞生：Code‑as‑World（2026‑08‑27）
&lt;/h2&gt;

&lt;p&gt;MirroS团队arxiv发布论文《Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning》，正式提出完整范式，引爆AI圈讨论。&lt;/p&gt;

&lt;h3&gt;
  
  
  核心创新点（区别过往工作）
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;逆向方向：从真实视频观测反推可执行物理代码&lt;/strong&gt;&lt;br&gt;
输入一段现实世界视频，Agent循环迭代：生成MuJoCo仿真场景代码 → 运行仿真 → 和原视频比对误差 → 修改代码里物体质量、位置、摩擦系数，多轮迭代收敛，得到一套可以复现视频物理现象的可执行代码。&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;像素是现象证据，代码才是世界的机制表征。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;/li&gt;
&lt;li&gt;&lt;p&gt;世界表征三层拆分&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;组成层：物体、几何、质量、摩擦等物理参数；&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;演化层：动力学、碰撞、状态变迁规则；&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;外观层：纹理、光照、相机；&lt;br&gt;
全部编码为可执行仿真程序，不是隐向量。&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;闭环Agent回路：观测→假设代码→仿真执行→对比观测→修正代码。得到的代码既可以做物理推理，也可以作为监督数据训练多模态模型。&lt;br&gt;
团队放出Code‑as‑World‑VL‑9B模型，在QuantiPhy物理推理基准超过Gemini‑3.1 Flash。&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;h3&gt;
  
  
  同期行业舆论呼应
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Vercel CEO Guillermo Rauch（2026‑07）公开观点：AI告诉我们一切都可以表达为代码，甚至宇宙本身可能就是代码。社交媒体传播，把“万物皆代码”推到公众视野，和Code‑as‑World技术形成舆论共振。&lt;/li&gt;
&lt;li&gt;IJCAI 2026，吴佳俊获奖演讲：“像素只是表象，物理代码通向动力学与因果”，强化学术界共识：视觉生成不等于物理理解。&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  四、三条并行路线对比（方便区分）
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;范式&lt;/th&gt;
&lt;th&gt;世界表征形式&lt;/th&gt;
&lt;th&gt;方向&lt;/th&gt;
&lt;th&gt;局限&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;视频生成世界模型&lt;/td&gt;
&lt;td&gt;像素/隐向量 latent&lt;/td&gt;
&lt;td&gt;输入条件→生成画面&lt;/td&gt;
&lt;td&gt;物理机制是黑盒，状态容易崩坏，干预不可控&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Code2Worlds&lt;/td&gt;
&lt;td&gt;仿真代码&lt;/td&gt;
&lt;td&gt;文本提示生成仿真世界&lt;/td&gt;
&lt;td&gt;只能正向生成，不能从真实视频逆向还原&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Code‑as‑World（代码即物理世界）&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;可执行物理仿真代码(MuJoCo等)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;真实观测(视频)逆向推导物理代码&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;计算开销大，只能处理中等复杂度场景，尚处于原型研究阶段&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h2&gt;
  
  
  五、后续发展与开放问题（2026年8‑9月现状）
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;定位&lt;/strong&gt;：不是取代视频世界模型，是互补。&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;Code‑as‑World负责&lt;strong&gt;机制、因果、干预推理&lt;/strong&gt;；视频模型负责渲染真实视觉纹理；架构上可以组合：代码管逻辑状态，大模型负责渲染画面。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;/li&gt;
&lt;li&gt;&lt;p&gt;当前局限&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;只能处理简单场景，复杂开放世界逆向推导代码成本极高；&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;仿真器本身存在物理误差；&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;从视频反推多组物理参数属于欠定问题，存在多解。&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;衍生方向&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;具身机器人：把现实环境自动转成可编辑仿真代码，作为机器人内部世界模型；&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;物理AI训练：从真实视频自动生成带真实物理标签的训练数据集；&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;Agent：把物理世界理解变成可调试、可调试、可版本管理的程序，而不是黑盒神经网络。&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  六、一句话时间线速览
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;80‑90年代：定性物理、包容架构，尝试用程序描述物理世界，但只能人工写，AI不会逆向推导。&lt;/li&gt;
&lt;li&gt;2015‑2021：MBRL、仿真器成熟；世界模型大多是隐向量黑盒。&lt;/li&gt;
&lt;li&gt;2022‑2025：大模型写代码能力崛起；机器人领域用代码做任务规划，但代码只是输出，不是内部世界表征。&lt;/li&gt;
&lt;li&gt;2026‑02：Code2Worlds实现“文本生成仿真代码闭环”，正向生成世界。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;2026‑08‑27 Code‑as‑World正式发布：实现从真实视频逆向还原可执行物理代码，“代码即物理世界”范式正式成型，成为AI圈热点。&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;

</description>
    </item>
    <item>
      <title>The Shy‑Looking Champion: Tiangong Omni’s Viral Face‑Covering Sprint</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Mon, 31 Aug 2026 04:42:36 +0000</pubDate>
      <link>https://dev.to/cognitalk/the-shy-looking-champion-tiangong-omnis-viral-face-covering-sprint-28ka</link>
      <guid>https://dev.to/cognitalk/the-shy-looking-champion-tiangong-omnis-viral-face-covering-sprint-28ka</guid>
      <description>&lt;p&gt;David Ha 一周前分享了这个视频：内容是在中国北京举行的机器人运动会上一机器人 害羞的抱着脸跑 跑出了第一名：&lt;br&gt;
&lt;iframe class="tweet-embed" id="tweet-2091714982572409241-840" src="https://platform.twitter.com/embed/Tweet.html?id=2091714982572409241"&gt;
&lt;/iframe&gt;

  // Detect dark theme
  var iframe = document.getElementById('tweet-2091714982572409241-840');
  if (document.body.className.includes('dark-theme')) {
    iframe.src = "https://platform.twitter.com/embed/Tweet.html?id=2091714982572409241&amp;amp;theme=dark"
  }



&lt;br&gt;
&lt;a href="https://x.com/ErenChenAI/status/2091714982572409241/video/1" rel="noopener noreferrer"&gt;https://x.com/ErenChenAI/status/2091714982572409241/video/1&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;而这个机器人公司（北京人形机器人创新中心（X‑Humanoid））的工程师们说这种跑姿并不是提前预先设计出来的姿势，而是在机器人训练的元宇宙里自己演化出来的。&lt;/p&gt;

&lt;p&gt;而这个 机器人训练的元宇宙 软件 情况如下：&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;“元宇宙” 训练底座：&lt;strong&gt;NVIDIA Omniverse&lt;/strong&gt;（底层平台），仿真软件是 &lt;strong&gt;Isaac Sim&lt;/strong&gt;，强化学习训练框架 &lt;strong&gt;Isaac Lab&lt;/strong&gt;，自研上层算法框架 &lt;strong&gt;Tien‑Kung‑Lab&lt;/strong&gt;北京人形机...。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;ul&gt;
&lt;li&gt;Omniverse：英伟达的 3D / 数字孪生底层平台，大家口语叫它机器人的 “元宇宙” 环境，Isaac Sim 就跑在它之上NVIDIA。&lt;/li&gt;
&lt;li&gt;Isaac Sim：高保真物理仿真器，在这里完成千万次并行强化学习试错，诞生出这个捂脸跑姿；训练完还会做 Sim2Sim 交叉验证，兼容 MuJoCo 再校验一遍策略，再部署到真实实体机器人上...。&lt;/li&gt;
&lt;li&gt;Tien‑Kung‑Lab：北京人形机器人创新中心开源，基于 Isaac Lab 封装，就是天工系列机器人的运动控制算法栈北京人形机...。&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;简单链路：&lt;br&gt;
&lt;code&gt;Omniverse(底层元宇宙平台) → Isaac Sim(物理仿真) + Isaac Lab(RL训练) → Tien‑Kung‑Lab(人形步态算法) → Sim2Real迁移到真机天工Omni&lt;/code&gt;&lt;/p&gt;

&lt;p&gt;David Ha 也在x上分享了文字 “Reminds me of novel locomotion policies discovered in MuJoCo environments, except that they work in the real world!（让我想起了在 MuJoCo 环境中发现的新颖运动策略，只不过它们在现实世界中也能生效！）” 表示对这次运动会上的此机器人的表现表示赞叹。&lt;/p&gt;

&lt;h1&gt;
  
  
  MuJoCo vs Omniverse‑IsaacSim‑IsaacLab完整对比
&lt;/h1&gt;

&lt;blockquote&gt;
&lt;p&gt;回顾天工Omni：&lt;strong&gt;主训练栈是 Omniverse → Isaac Sim(PhysX) + Isaac Lab&lt;/strong&gt;；同时会把策略导出到MuJoCo做二次校验动力学，用来排查仿真‑现实鸿沟（sim‑to‑real gap）。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h2&gt;
  
  
  基础概念厘清
&lt;/h2&gt;

&lt;h3&gt;
  
  
  MuJoCo（Multi‑Joint dynamics with Contact）
&lt;/h3&gt;

&lt;p&gt;DeepMind维护的&lt;strong&gt;物理动力学引擎&lt;/strong&gt;，核心做刚体/接触动力学求解，&lt;strong&gt;本身不是完整可视化元宇宙平台&lt;/strong&gt;，渲染只是附带极简OpenGL窗口，没有RTX光线追踪、没有USD数字孪生场景系统。&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;格式：MJCF(XML)；开源 Apache2.0；有CPU原生 + MJX(JAX GPU)后端。&lt;/li&gt;
&lt;li&gt;强项：&lt;strong&gt;接触摩擦、逆动力学、可微分物理&lt;/strong&gt;，学术界人形、灵巧手事实标准。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  NVIDIA整套栈：Omniverse → Isaac Sim → Isaac Lab
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Omniverse&lt;/strong&gt;：底层3D元宇宙/数字孪生底座，USD场景格式，RTX渲染生态，不是物理引擎；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Isaac Sim&lt;/strong&gt;：跑在Omniverse上的完整机器人仿真器，物理后端默认 &lt;strong&gt;PhysX5&lt;/strong&gt;，带相机、激光雷达、域随机化、合成数据生成；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Isaac Lab&lt;/strong&gt;：上层开源RL训练框架，用来大规模并行跑强化学习任务（天工Omni捂脸跑就是在此训练）。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  相同点
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;都做人形机器人强化学习仿真，输出策略都可以部署到真实机器人，都要面对 sim‑to‑real（仿真到现实）鸿沟；&lt;/li&gt;
&lt;li&gt;都支持大规模并行环境；MuJoCo靠MJX/JAX，Isaac Lab靠GPU PhysX；&lt;/li&gt;
&lt;li&gt;模型互通：Isaac Sim可以直接导入MuJoCo MJCF模型；Isaac Lab 3.0支持把MuJoCo‑Warp作为物理后端，&lt;strong&gt;不用启动Omniverse渲染也能跑训练&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;都大量用于足式机器人步态涌现训练（像天工Omni这种“捂脸跑”的无预设涌现行为两种都能训出来）。&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  核心差异
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;对比维度&lt;/th&gt;
&lt;th&gt;MuJoCo&lt;/th&gt;
&lt;th&gt;Omniverse+IsaacSim+IsaacLab&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;定位&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;高精度动力学求解器，偏学术仿真内核&lt;/td&gt;
&lt;td&gt;完整工业数字孪生仿真全栈：3D场景+物理+传感器+RL训练&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;物理引擎&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;自研凸优化接触求解器，摩擦/接触精度更高，适合精细抓取、灵巧手&lt;/td&gt;
&lt;td&gt;默认PhysX5（脉冲式接触）；也可插拔MuJoCo‑Warp；速度优先，接触细节略弱于原生MuJoCo&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;渲染与传感器&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;仅简易OpenGL预览；&lt;strong&gt;无原生相机/激光雷达仿真&lt;/strong&gt;，做视觉具身任务要自己写额外代码&lt;/td&gt;
&lt;td&gt;RTX实时光追、深度图、LiDAR、分割图原生支持，适合视觉端到端具身智能、合成数据集生成&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;场景系统&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;MJCF(XML)，适合单机器人；复杂大场景建模麻烦&lt;/td&gt;
&lt;td&gt;USD通用3D格式，可导入CAD、工业场景，团队协同数字孪生，元宇宙级大场景能力强&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;大规模并行&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;CPU版有限；MJX(JAX‑GPU)可以极高吞吐，但&lt;strong&gt;没有渲染&lt;/strong&gt;，只能跑状态动力学，看不到画面&lt;/td&gt;
&lt;td&gt;GPU原生，几千个人形并行环境同时带渲染+传感器，训练同时可以看仿真画面；硬件门槛高，仅限N卡&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;上手门槛&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;很低，&lt;code&gt;pip install mujoco&lt;/code&gt;即可，跨平台，AMD也能跑&lt;/td&gt;
&lt;td&gt;高；依赖NVIDIA显卡驱动，Omniverse套件体积大，USD概念学习成本高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;开源协议&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Apache2.0完全开源&lt;/td&gt;
&lt;td&gt;Omniverse/Isaac Sim免费商用；Isaac Lab开源BSD‑3；底层Omniverse组件不开源&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;典型适合场景&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;学术论文、灵巧手精细接触、动力学分析、纯本体感知（关节力矩角度）的步态训练、做仿真基准校验&lt;/td&gt;
&lt;td&gt;工业人形机器人、视觉+本体感知联合训练、数字孪生、真实世界复杂环境、需要相机激光雷达的具身智能（天工Omni的主栈）&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h2&gt;
  
  
  天工Omni的实际工作流（对应上面两套工具）
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;主训练&lt;/strong&gt;：Omniverse + Isaac Sim(PhysX) + Isaac Lab，数千并行环境RL训练，涌现出捂脸跑的步态；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;交叉验证&lt;/strong&gt;：把同一机器人模型、奖励函数迁移进MuJoCo，复现步态，用来排查是不是PhysX物理引入的虚假仿真现象；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Sim2Real部署&lt;/strong&gt;：策略下发到实体机器人真机，再做少量真机微调。&lt;/li&gt;
&lt;/ol&gt;

&lt;blockquote&gt;
&lt;p&gt;关键点：捂脸跑这个&lt;strong&gt;涌现行为，两套仿真都能训出来&lt;/strong&gt;；但天工团队是在Isaac生态完成主力大规模训练，MuJoCo用来校验动力学是否合理。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h2&gt;
  
  
  选型简单口诀
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;做&lt;strong&gt;灵巧手、接触摩擦、学术基准、纯动力学、不想绑定N卡&lt;/strong&gt;：优先MuJoCo；&lt;/li&gt;
&lt;li&gt;需要&lt;strong&gt;相机/激光雷达、大3D场景数字孪生、GPU大规模并行同时看画面、工业人形落地&lt;/strong&gt;：Isaac全栈；&lt;/li&gt;
&lt;li&gt;现在业界流行混合：Isaac做视觉大场景训练，MuJoCo做动力学校验，互相兜底。&lt;/li&gt;
&lt;/ul&gt;

</description>
    </item>
    <item>
      <title>SSI to Release Latest TTT (Test-Time Training) Model Soon?</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Fri, 28 Aug 2026 13:25:46 +0000</pubDate>
      <link>https://dev.to/cognitalk/ssi-to-release-latest-ttt-test-time-training-model-soon-4eb2</link>
      <guid>https://dev.to/cognitalk/ssi-to-release-latest-ttt-test-time-training-model-soon-4eb2</guid>
      <description>&lt;h1&gt;
  
  
  SSI 即将发布TTT（测试时训练）最新模型？
&lt;/h1&gt;




&lt;h2&gt;
  
  
  一、先搞清楚：这事儿到底有多真？
&lt;/h2&gt;

&lt;p&gt;目前还没有正式发布，但&lt;strong&gt;可信度非常高&lt;/strong&gt;，因为有多重独立信源交叉验证：&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;时间&lt;/th&gt;
&lt;th&gt;信源&lt;/th&gt;
&lt;th&gt;说了什么&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;2026年8月初&lt;/td&gt;
&lt;td&gt;Gavin Baker（Atreides Management创始人）在《Invest Like the Best》播客&lt;/td&gt;
&lt;td&gt;"SSI说他们将在8月发布他们的模型"&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;8月13日左右&lt;/td&gt;
&lt;td&gt;圈内爆料人"三只草莓"&lt;/td&gt;
&lt;td&gt;SSI正在构建基于TTT的小型推理引擎，当前版本已就绪，下一代规模直接扩10倍&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;8月25日&lt;/td&gt;
&lt;td&gt;
&lt;strong&gt;Martin Casado（a16z合伙人）&lt;/strong&gt; 社交媒体&lt;/td&gt;
&lt;td&gt;"刚刚获得了一个新模型的访问权限。这将是今年最重要的模型发布，甚至可以去掉'之一'。"&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;8月25日&lt;/td&gt;
&lt;td&gt;AI观察家Dan McAteer&lt;/td&gt;
&lt;td&gt;"Ilya真正创造了超级智能，游戏规则已经被改变了！"（这个偏夸张）&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;关键背书：&lt;strong&gt;a16z是SSI的核心投资方之一&lt;/strong&gt;，Casado作为合伙人能提前拿到访问权限，他说的"新模型"指向SSI几乎没有悬念。再加上英伟达7月27日刚宣布和SSI达成长期战略合作、未来12个月算力扩10倍（据传投资高达50亿美元），黄仁勋真金白银砸进去，说明东西确实做出来了。&lt;/p&gt;

&lt;p&gt;今天是8月28日周五，如果"本周发布"属实，那就是这几天的事。&lt;/p&gt;




&lt;h2&gt;
  
  
  二、SSI是谁？Ilya离开OpenAI后在干什么？
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Ilya Sutskever&lt;/strong&gt;，深度学习领域的"活传奇"级别人物：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;AlexNet联合作者（2012年那篇点燃深度学习革命的论文）&lt;/li&gt;
&lt;li&gt;OpenAI联合创始人、前首席科学家&lt;/li&gt;
&lt;li&gt;GPT系列背后的核心技术大脑&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;2024年5月他离开OpenAI，创立了 &lt;strong&gt;SSI（Safe Superintelligence，安全超级智能）&lt;/strong&gt;，定位是一家"纯粹做研究的公司"。他当时甚至放话：&lt;strong&gt;在达到超级智能之前不会发布任何产品或模型&lt;/strong&gt;。&lt;/p&gt;

&lt;p&gt;所以这次要发布第一个模型，本身就意味深长——要么是他觉得已经摸到了超级智能的门槛，要么是现实压力（投资人、算力成本）让他调整了策略。结合英伟达50亿押注，更可能是前者：&lt;strong&gt;技术路线有了实质性突破，需要公开发布来验证和迭代。&lt;/strong&gt;&lt;/p&gt;




&lt;h2&gt;
  
  
  三、核心技术：TTT到底是什么？为什么说它"颠覆性"？
&lt;/h2&gt;

&lt;p&gt;这是整条消息最硬核、也最值得理解的部分。我用&lt;strong&gt;考试比喻&lt;/strong&gt;给你讲明白。&lt;/p&gt;

&lt;h3&gt;
  
  
  3.1 现在的AI模型是怎么"学习"的？
&lt;/h3&gt;

&lt;p&gt;当前所有主流大模型（ChatGPT、Claude、Gemini、DeepSeek）都遵循同一个范式：&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;预训练 → 冻结 → 推理&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;就像一个学生：&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;大学四年疯狂学习&lt;/strong&gt;（预训练，用海量数据更新神经网络参数）&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;毕业后大脑封板&lt;/strong&gt;（参数冻结，不再改变）&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;工作中遇到问题就靠当年的知识+小抄&lt;/strong&gt;（推理，用固定参数生成回答）&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;为了让这个"封板的大脑"处理新信息，行业卷的方向是：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;上下文窗口越来越大&lt;/strong&gt;：从4K → 128K → 1M → 2M token。相当于允许带进考场的"小抄"越来越厚。但问题是，小抄再厚，学生也只是"翻阅"，没有真正理解和内化。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;测试时计算（Test-Time Compute）&lt;/strong&gt;：以OpenAI o1/o3为代表，让模型在回答前"多思考一会儿"，消耗更多token在草稿纸上推演。但本质上还是同一个大脑在反复琢磨，&lt;strong&gt;神经网络本身没有任何改变&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  3.2 TTT（测试时训练）完全不同
&lt;/h3&gt;

&lt;p&gt;TTT = &lt;strong&gt;Test-Time Training&lt;/strong&gt;，直译就是"在测试/使用的时候还在训练"。&lt;/p&gt;

&lt;p&gt;它打破了"训练"和"推理"的严格边界：&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;当模型阅读一份长文档时，它不是把文档塞进上下文窗口当"小抄"，而是&lt;strong&gt;真正去学习它&lt;/strong&gt;——产生梯度更新，改变自身的神经网络权重。读完文档后，模型已经进化成了一个细微但全新的自己。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;p&gt;用同一个考试比喻：&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;传统模型&lt;/th&gt;
&lt;th&gt;TTT模型&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;拿到新资料&lt;/td&gt;
&lt;td&gt;翻小抄（上下文窗口）&lt;/td&gt;
&lt;td&gt;当场学习、内化进大脑&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;大脑状态&lt;/td&gt;
&lt;td&gt;永远不变&lt;/td&gt;
&lt;td&gt;每次使用后都有微调&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;学完后&lt;/td&gt;
&lt;td&gt;关掉窗口就忘了&lt;/td&gt;
&lt;td&gt;知识已经"长"在神经网络里&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;类比&lt;/td&gt;
&lt;td&gt;开卷考试&lt;/td&gt;
&lt;td&gt;边考边学的天才学生&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;这正好呼应了Ilya在2025年11月Dwarkesh播客里的核心观点：&lt;strong&gt;AI应该像"一个非常聪明的15岁少年"——不是生来就知道一切，但进入现实环境后能通过学习和实践不断掌握新能力。&lt;/strong&gt; &lt;/p&gt;

&lt;h3&gt;
  
  
  3.3 TTT不是全新概念，但SSI可能是第一个做成产品的
&lt;/h3&gt;

&lt;p&gt;TTT在学术界已有铺垫。2024年7月，斯坦福和UCSD的研究者发表了TTT层（Test-Time Training Layer）的工作，可以替换Transformer中的自注意力层，在测试时为每个输入序列训练不同的权重序列。&lt;/p&gt;

&lt;p&gt;爆料中还特别提到了一篇相关论文 &lt;strong&gt;《End-to-End Test-Time Training for Long Context》&lt;/strong&gt;，核心思路就是把TTT用于长上下文场景——不是硬塞更多token，而是让模型真正"消化"长文档。&lt;/p&gt;

&lt;p&gt;但学术论文和产品之间有巨大鸿沟。如果SSI真的把TTT做成了可用的推理引擎，那将是&lt;strong&gt;第一个在商业模型中实现"边用边学"的案例&lt;/strong&gt;。&lt;/p&gt;




&lt;h2&gt;
  
  
  四、为什么这可能是"今年最重要的发布"？
&lt;/h2&gt;

&lt;p&gt;如果TTT真的work，它的影响是范式级别的：&lt;/p&gt;

&lt;h3&gt;
  
  
  4.1 解决长上下文的根本痛点
&lt;/h3&gt;

&lt;p&gt;现在的1M、2M上下文窗口，本质上是"暴力堆料"。模型看似能读整本书，但实际上经常出现"lost in the middle"（中间信息被忽略）、检索不准、推理时找不到关键细节等问题。&lt;/p&gt;

&lt;p&gt;TTT的思路是：&lt;strong&gt;与其把整本书塞进上下文让模型"翻"，不如让模型真正"读"完这本书，把知识内化进权重。&lt;/strong&gt; 读完后，你问任何问题，它不需要再翻书——因为书已经变成了它的一部分。&lt;/p&gt;

&lt;h3&gt;
  
  
  4.2 模型能力可以持续增长
&lt;/h3&gt;

&lt;p&gt;现在的模型能力上限在发布那天就定死了，后续只能靠"记忆功能"（把对话存到外部数据库）或定期重新训练来提升。TTT意味着&lt;strong&gt;模型每次和用户交互都在变强&lt;/strong&gt;——这更接近人类的学习方式。&lt;/p&gt;

&lt;h3&gt;
  
  
  4.3 可能改变算力经济学
&lt;/h3&gt;

&lt;p&gt;当前的Scaling Law（规模法则）是：模型能力 = f(参数量, 训练数据量, 训练算力)。所有人都在堆预训练算力。&lt;/p&gt;

&lt;p&gt;Ilya本人在2024年11月就透露过，SSI在研究"替代方法来扩大预训练"。 如果TTT能让模型在推理阶段持续提升能力，意味着&lt;strong&gt;不需要把所有知识都在预训练阶段灌进去&lt;/strong&gt;，可能用更小的模型+更聪明的学习方式达到甚至超越大模型的效果。&lt;/p&gt;

&lt;p&gt;这也是为什么英伟达要砸50亿——如果推理阶段需要做反向传播（梯度更新），那对算力的需求将是全新的增量市场。&lt;/p&gt;

&lt;h3&gt;
  
  
  4.4 对齐（Alignment）可能更容易
&lt;/h3&gt;

&lt;p&gt;SSI名字里就有"Safe"。Ilya一直非常关注AI安全。一个能在测试时学习的模型，也意味着可以&lt;strong&gt;在使用过程中持续对齐人类价值观&lt;/strong&gt;，而不是靠预训练时一次性灌输。这可能是Ilya选择TTT路线的深层原因。&lt;/p&gt;




&lt;h2&gt;
  
  
  五、冷静看待：目前的不确定性和挑战
&lt;/h2&gt;

&lt;p&gt;消息很炸，但在正式发布之前，有几个问题必须打个问号：&lt;/p&gt;

&lt;h3&gt;
  
  
  5.1 灾难性遗忘（Catastrophic Forgetting）
&lt;/h3&gt;

&lt;p&gt;这是持续学习领域的经典难题：模型学了新东西，会不会忘记旧东西？如果每次读文档都更新权重，模型会不会"学了后面忘了前面"，甚至把预训练学到的核心能力覆盖掉？&lt;/p&gt;

&lt;p&gt;SSI的解决方案目前未知，但爆料提到他们强调"内部反馈"机制——可能模型有一套自我评估和修正的系统，来防止遗忘。&lt;/p&gt;

&lt;h3&gt;
  
  
  5.2 推理成本
&lt;/h3&gt;

&lt;p&gt;传统推理只需要前向传播（forward pass）。TTT意味着推理时还要做反向传播（backward pass）来计算梯度、更新权重。&lt;strong&gt;计算成本可能是传统推理的好几倍甚至十几倍。&lt;/strong&gt; 在当前推理成本已经是商业瓶颈的背景下，这能否规模化是个大问题。&lt;/p&gt;

&lt;p&gt;不过爆料说这是一个"小型推理引擎"——可能SSI的策略是用小模型+TTT，在某些特定场景（比如长文档理解）上做到性价比优于大模型。&lt;/p&gt;

&lt;h3&gt;
  
  
  5.3 "今年最重要"是不是营销话术？
&lt;/h3&gt;

&lt;p&gt;Martin Casado是投资人，他的话天然有利益相关。a16z投了SSI，他当然希望SSI的发布受到关注。而且回顾历史，每次有新模型发布，圈内都不缺"颠覆""革命"的声音，最后真正改变格局的寥寥无几。&lt;/p&gt;

&lt;p&gt;但Ilya的 track record 摆在那里——他不是喜欢吹的人，SSI蛰伏两年才出第一个东西，这个节奏本身就说明不是仓促上阵。&lt;/p&gt;

&lt;h3&gt;
  
  
  5.4 是"小型推理引擎"，不是全面超越GPT的大模型
&lt;/h3&gt;

&lt;p&gt;多个信源都提到这是一个"&lt;strong&gt;小型推理引擎&lt;/strong&gt;"（small reasoning engine）。所以不要期待它一上来就在所有基准测试上碾压GPT-5。它更可能是在&lt;strong&gt;特定能力维度&lt;/strong&gt;（长文档理解、持续学习、推理）上展示出范式级的差异，然后逐步扩展。&lt;/p&gt;




&lt;h2&gt;
  
  
  六、总结：这件事的本质
&lt;/h2&gt;

&lt;p&gt;用一句话概括：&lt;strong&gt;Ilya可能要把AI从"开卷考试的静止大脑"推向"边用边学的动态大脑"。&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;如果说2022年ChatGPT是"让AI能对话"，2024年o1是"让AI能思考"，那SSI的TTT模型如果成功，就是"让AI能学习"——这是从工具到智能体的关键一跃。&lt;/p&gt;

&lt;p&gt;当然，一切要等正式发布、拿到实测数据才能下结论。但从技术路线的选择来看，Ilya没有走"堆参数、堆上下文"的老路，而是回到了学习的本质，这本身就值得期待。&lt;/p&gt;

&lt;p&gt;接下来几天密切关注SSI官网和Ilya的社交账号就行——如果真的发布了，我可以第一时间帮你做技术拆解和实测对比。&lt;/p&gt;

</description>
    </item>
    <item>
      <title>How Neural-Operators reconstruct Science AI — Anima Anandkumar, Caltech</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Thu, 27 Aug 2026 03:40:29 +0000</pubDate>
      <link>https://dev.to/cognitalk/how-neural-operators-reconstruct-science-ai-anima-anandkumar-caltech-5cp9</link>
      <guid>https://dev.to/cognitalk/how-neural-operators-reconstruct-science-ai-anima-anandkumar-caltech-5cp9</guid>
      <description>&lt;p&gt;  &lt;iframe src="https://www.youtube.com/embed/79mIutht1f4"&gt;
  &lt;/iframe&gt;
&lt;br&gt;
&lt;a href="https://www.youtube.com/watch?v=79mIutht1f4" rel="noopener noreferrer"&gt;https://www.youtube.com/watch?v=79mIutht1f4&lt;/a&gt;&lt;/p&gt;

&lt;h1&gt;
  
  
  物理世界比想象中更“宽容”：Anima Anandkumar 谈神经算子如何重塑科学 AI
&lt;/h1&gt;

&lt;p&gt;Latent Space 播客对加州理工学院 Bren 讲席教授 Anima Anandkumar 的深度学习与科学计算主题专访整理。她通过&lt;strong&gt;神经算子（Neural Operators）&lt;/strong&gt;这一技术主线，串联起天气预报、气候模拟、核聚变等离子体、碳封存、半导体光刻，乃至联合国科学顾问层面的 AI 治理思考。&lt;/p&gt;




&lt;p&gt;第（一）部分 &lt;strong&gt;开场介绍与嘉宾学术背景&lt;/strong&gt;（0% - 6%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;播客与主持人开场&lt;/strong&gt;：本期为 Latent Space 播客“AI for Science”板块，由 Brandon（在 Atomic AI 从事 RNA 疗法 AI 研究）与联合主持人 RJ Honakee（Miraomics 创始人兼 CTO，从事空间转录组学）共同主持。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;嘉宾隆重登场&lt;/strong&gt;：邀请到的嘉宾是加州理工学院数学与计算机科学 Bren 讲席教授 &lt;strong&gt;Anima Anandkumar&lt;/strong&gt;，她在“用 AI 建模物理世界”这一交叉方向上有着极为多元的研究积累。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;学术与产业双重轨迹&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;学术根基&lt;/strong&gt;：在深度学习流行之前，便从事概率模型等理论奠基工作，拥有超过二十年的 AI 研究经历。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;产业经历&lt;/strong&gt;：近期曾在 NVIDIA 领导 AI 研究工作，更早之前在亚马逊云科技（AWS）帮助创建云 AI 团队，构建了近十年前最早的云 AI 产品。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;访谈主旨铺垫&lt;/strong&gt;：Brandon 指出 Anima 的工作大多围绕“用机器学习为物理系统建模”展开，本期将深入探讨其背后的大型研究计划，并具体到&lt;strong&gt;单算子（Single Role Operators / Neural Operators）&lt;/strong&gt;及其在天气等领域的应用。&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（二）部分 &lt;strong&gt;TorchLean：为神经网络提供形式化验证&lt;/strong&gt;（6% - 18%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;AI for Science 的两大支柱&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;物理正确性&lt;/strong&gt;：通过神经算子建模，保证 AI 在物理世界或科学领域中的表现具备一定保证。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;符号化验证&lt;/strong&gt;：借助 Lean 这一形式化语言，对数学陈述进行验证，并将此能力与语言模型结合，推动数学推理的发展。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;TorchLean 的定位与价值&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;它是一个&lt;strong&gt;框架&lt;/strong&gt;，允许研究者像写 PyTorch 一样在 Lean 中编写神经网络，从而完全形式化，并能够无缝地进行验证。&lt;/li&gt;
&lt;li&gt;在将神经网络部署到控制回路中（无论是无人机还是核反应堆）时，人们需要鲁棒性保证，而 TorchLean 可以帮助我们对这些系统进行无缝验证。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;可证明的内容：以 CROWN 为例&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;框架内实现了诸如 &lt;strong&gt;CROWN&lt;/strong&gt; 等认证鲁棒性算法。&lt;/li&gt;
&lt;li&gt;这类算法的核心是&lt;strong&gt;敏感性分析/界限（Bounds）&lt;/strong&gt;：证明当输入扰动在某个范围内时，输出的变化上限是多少。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;核反应堆安全场景的具象化&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;在核反应堆控制中，这种“认证鲁棒性”可以提供输入/输出界限的数学保证，从而防止熔毁等灾难性后果。&lt;/li&gt;
&lt;li&gt;除了控制回路，TorchLean 还能处理“有限精度训练带来的缺陷”、“扰动效应”等多种界限问题，将这些算法无缝融入验证回路。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;框架的表达力与局限性&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;它在抽象层上类似 PyTorch，可以优雅地定义神经层，后端则由 Lean 提供形式化证明能力，原则上可以描述任何神经网络。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;现存短板&lt;/strong&gt;：Lean 本身仍有很多不足，它是基于 CPU 的，将其扩展到 GPU 存在诸多细微差别；对于 Transformer 这类极大规模的网络，在极大规模下进行高效验证仍需大量后续工作。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（三）部分 &lt;strong&gt;PINN 的局限与神经算子的诞生动机&lt;/strong&gt;（18% - 28%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;物理信息神经网络（PINN）的工作原理与困境&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;PINN 的思路是在网络中“烘焙”物理约束（即写下偏微分方程 PDE），希望优化过程能成功求解。&lt;/li&gt;
&lt;li&gt;但&lt;strong&gt;优化通常极其困难&lt;/strong&gt;，尤其是时间依赖问题（如流体动力学中的湍流），长期运行可能陷入混沌，导致在某些实例中完全无法求解。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;从“从零求解”到“数据驱动”的范式转移&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;许多物理问题拥有丰富的观测数据（如天气数据）。不应仅仅依赖从零开始求解 PDE，而应&lt;strong&gt;充分利用所有可用数据&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;神经算子由此应运而生：它既可以利用数据，又可以添加物理约束，从而克服了 PINN 面临的失败模式。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;神经算子与标准神经网络的核心区别&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;标准神经网络&lt;/strong&gt;：输入输出尺寸固定（例如语言有固定词表、图像有固定分辨率），无法在事后改变分辨率。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;神经算子&lt;/strong&gt;：将输入输出视为&lt;strong&gt;连续函数&lt;/strong&gt;，可以进行无限离散化，在推理时能够以任意分辨率给出输出，真正契合物理世界固有的多尺度特性。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;解决“超分辨率”中的过拟合问题&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;在训练时未见过的更高分辨率上做预测（零样本超分辨率）容易过拟合，需要通过&lt;strong&gt;正则化&lt;/strong&gt;平滑扩展至高分辨率。&lt;/li&gt;
&lt;li&gt;引入&lt;strong&gt;物理损失（如 PDE 约束、守恒定律）&lt;/strong&gt;并在比现有数据更细的分辨率上强制执行，能为正向传播提供更多指导，确保物理信息神经算子在高保真度、高分辨率下依然有效。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（四）部分 &lt;strong&gt;傅里叶神经算子：架构直觉与多尺度建模&lt;/strong&gt;（28% - 38%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;为什么选择傅里叶空间&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;神经算子作为一类模型，允许任意分辨率的输入输出，学习函数空间之间的映射，傅里叶神经算子（FNO）是早期提出的架构之一。&lt;/li&gt;
&lt;li&gt;它在&lt;strong&gt;效率与表达能力之间取得了极佳的平衡&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;傅里叶空间是一个对偶空间，能够高效捕捉&lt;strong&gt;非局部现象&lt;/strong&gt;。自然中的许多现象（流体动力学、材料变形、量子化学）都是非局部的（导数的逆运算本质是积分，具有全局性）。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;与 Transformer 的复杂度对比&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;若使用 Transformer 处理极高分辨率，由于其二次方复杂度与全连接特性，将变得难以承受。&lt;/li&gt;
&lt;li&gt;FNO 具有&lt;strong&gt;准线性复杂度&lt;/strong&gt;，同时具备全局连接能力，能建模非局部现象，是一个理想的“中间地带”。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;架构细节：不仅是傅里叶变换&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;FNO 并非纯粹在傅里叶域做线性操作。它在傅里叶层之间加入了&lt;strong&gt;非线性变换&lt;/strong&gt;与&lt;strong&gt;残差连接&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;这类似于 Transformer 等其他神经网络的优秀设计原则，使其兼具线性基的高效与非线性的强大表达能力。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;频率截断与表达力提升&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;如果仅在线性傅里叶变换下表示信号（受限于最大频率），需要极细的离散化，导致经典数值模拟非常昂贵。&lt;/li&gt;
&lt;li&gt;引入非线性后，模型能够自己“学习”出最适合表示该信号的基础。通过将信号提升到更高维的通道空间，并在傅里叶变换之间进一步进行非线性变换，即使有限的频率模式也能通过非线性组合被充分表达。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;经典数学基础与当代深度学习的融合&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;Anima 回忆，二十多年前本科论文做的正是分数阶傅里叶变换。她认同不能完全抛弃经典技术，但必须拥抱特征学习与灵活性。&lt;/li&gt;
&lt;li&gt;物理世界数据远不如语言模型丰富（天气模型仅有约 5 万个样本），因此必须思考&lt;strong&gt;归纳偏置（Inductive Biases）&lt;/strong&gt;，融入物理约束。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（五）部分 &lt;strong&gt;Transformer 在物理世界的算力墙与数据瓶颈&lt;/strong&gt;（38% - 46%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;物理世界的高维难题&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;物理模拟不仅涉及 2D、3D，还加上时间维度。如果每个维度仅有几百个网格点（工业级起点约为 1000 点），上下文长度将达到&lt;strong&gt;数千亿甚至数万亿&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;“就算集结全世界的所有算力也不够”，永远不可能用 Transformer 处理这种规模的问题。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;视觉/视频模型的“低分辨率”妥协&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;当前的视觉和视频语言模型分辨率极低，且自回归视频模型主要是为了“看起来好看”，并非用于精确模拟。&lt;/li&gt;
&lt;li&gt;流体动力学、等离子体、材料变形等现象需要&lt;strong&gt;高保真度与高分辨率&lt;/strong&gt;，不能简单降采样了事。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;数据稀缺决定了必须引入结构&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;语言模型有海量数据，而物理领域数据极其昂贵（天气约 5 万样本，聚变仅几千样本）。&lt;/li&gt;
&lt;li&gt;因此，AI 必须 Incorporate 物理世界的结构（如几何信息），才能在数据有限的情况下实现准确建模与泛化。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（六）部分 &lt;strong&gt;天气预报突破：FourCastNet 的惊艳表现与演进&lt;/strong&gt;（46% - 62%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;挑战传统：从被质疑到颠覆&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;2021 年团队决定尝试天气建模，因为欧洲中期天气预报中心（ECMWF）的 ERA5 数据开源。当时许多气象科学家警告称，传统天气预报经过几十年的自下而上物理建模发展，AI 不可能击败。&lt;/li&gt;
&lt;li&gt;结果出乎意料：神经算子不仅准确得与传统模型几乎持平，而且速度快了&lt;strong&gt;数万倍&lt;/strong&gt;。原本需要大型超算运行的任务，现在仅需消费级 GPU，且模型小巧。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;First 开源与生态爆发&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;团队首个开源了天气模型 &lt;strong&gt;FourCastNet&lt;/strong&gt;，并采用宽松许可证，使得众多公司、气象机构都能在其基础上构建。&lt;/li&gt;
&lt;li&gt;随后 DeepMind、华为等纷纷跟进，发布了自己的模型。这场范式转变使得全球南方的小型气象机构也能拥有与大机构同等的建模能力，实现了&lt;strong&gt;天气建模的民主化&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;从天气到气候：几何信息的引入&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;ForecastNet 1/2 的局限&lt;/strong&gt;：早期版本未纳入球面几何，假设世界是一个矩形（墨卡托投影），导致在长期滚动预测（数月到数年）时迅速发散。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;ForecastNet 3 的突破&lt;/strong&gt;：融入了地球的球面几何信息。由于许多架构在短期预测上表现良好，但长期预测会爆炸（因为它们假设世界是矩形的），而融入几何信息意味着同一模型可以忠实运行更长时间，演变成气候模型。&lt;/li&gt;
&lt;li&gt;Allen AI Institute 正是基于其神经算子架构构建了气候模型，这也是目前唯一有效的 AI 气候模拟器。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;数据、训练与目标&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;数据与分辨率&lt;/strong&gt;：使用的是再分析数据（卫星与物理求解器同化），全球分辨率约为 0.25 度。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;训练目标&lt;/strong&gt;：以自回归方式，给定当前风、湿度等条件，预测未来六小时的状态。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;从天气到气候的跨越&lt;/strong&gt;：仅用 5 万个数据点或仅训练预测未来六小时的目标，模型竟然能稳定地滚动预测数月之久，这是非常令人惊讶的。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;极端天气与概率校准&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;模型在极端天气事件（如飓风）上表现优异。由于极端事件具有非常具体的物理特征，物理世界可能比想象中更“宽容”，不需要极大量的样本。&lt;/li&gt;
&lt;li&gt;在等离子体聚变反应中，即便仅有几千个样本，也能准确预测破裂事件，且比传统模拟快一百万倍。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（七）部分 &lt;strong&gt;极端天气、集合预测与飓风 Lee 案例&lt;/strong&gt;（62% - 70%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;确定性预测的不足&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;面对极端天气，单一的确定性输出不够，需要&lt;strong&gt;概率性答案&lt;/strong&gt;与精细的概率校准。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;集合预测（Ensemble Prediction）机制&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;通过对初始条件添加不同的噪声水平，进行多次滚动预测（Run multiple rollouts），得到多个可能轨迹。&lt;/li&gt;
&lt;li&gt;对每个集合成员独立预测，确保其各自满足物理定律，最后综合得出某地区登陆的概率，用于风险评估。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;ForecastNet 3 的关键改进&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;第三个版本的核心在于不仅做确定性预测，更要通过目标函数训练使&lt;strong&gt;集合预测（概率预测）也是正确的&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;在 ForecastNet 3 的论文中，给出了极端天气事件和集合预测的度量指标，并对模型进行了针对性训练。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;飓风 Lee 的成功案例&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;欧洲气象中心（ECMWF）在 2023 年秋季公开了基于 AI 的天气模型。&lt;/li&gt;
&lt;li&gt;在飓风 Lee 事件中，FourCastNet &lt;strong&gt;比标准天气预报模型提早数天&lt;/strong&gt;正确预测了飓风登陆点，展示了 AI 在提前预警、挽救生命和经济成本方面的巨大价值。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;长期滚动与物理约束的未来方向&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;目前模型能比其他忽略球面假设的天气模型做最长的滚动预测，但要做“极长滚动”仍属开放问题。&lt;/li&gt;
&lt;li&gt;需要在每个集合成员上确保物理法则的遵守，如何在长时间尺度上融入物理定律以保证稳定性，是当前活跃的研究方向。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（八）部分 &lt;strong&gt;核聚变等离子体建模：数字孪生与防破裂控制&lt;/strong&gt;（70% - 78%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;托卡马克中的复杂等离子体演化&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;与英国原子能机构（UKAEA）合作，对托卡马克内的复杂等离子体演化进行建模。&lt;/li&gt;
&lt;li&gt;实现了比传统模拟快&lt;strong&gt;一百万倍&lt;/strong&gt;的速度，本质上是创建了等离子体的&lt;strong&gt;数字孪生&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;破裂（Disruption）现象的挑战&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;破裂是等离子体物理中困扰学界的现象：等离子体可能突然收缩成一束微小光束，向容器壁发射强冲击，损坏反应堆，导致必须停机，阻碍可持续聚变能的实现。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;从模拟到控制的下一步&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;当前正在研究&lt;strong&gt;设计与控制协同&lt;/strong&gt;：通过数字孪生确保在物理有效性前提下，调整磁场以包含并稳定等离子体，理想情况下防止破裂发生，使聚变成为可能。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;架构无关的“AI 中立”立场&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;不仅与 UKAEA 合作托卡马克，也在美国与其他几个实验室合作。&lt;/li&gt;
&lt;li&gt;同时研究仿星器（Stellarator）等其他聚变路径。Anima 强调作为 AI 研究者应保持&lt;strong&gt;不可知论&lt;/strong&gt;，不与任何一种物理路径绑定，让 AI 加速所有路径，避免过早淘汰某一方案。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（九）部分 &lt;strong&gt;物理 AI 的广阔应用场景与基础模型愿景&lt;/strong&gt;（78% - 88%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;从理论到应用的跨越&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;Anima 分享了自己的研究心路：从早期张量方法等理论奠基，到 AWS、NVIDIA 时期将深度学习规模化落地，如今看到纯粹数据驱动方法遇到瓶颈，开始回归“更有原则的设计”。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;多样化的物理应用案例&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;地下碳封存&lt;/strong&gt;：模拟二氧化碳在地下的扩张与压力积聚，预测其数十年间的迁移，比传统模拟快得多。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;汽车与飞机气动外形&lt;/strong&gt;：利用&lt;strong&gt;潜在空间（Latent Space）&lt;/strong&gt;处理各种几何形状——可以将汽车等形状变换成“甜甜圈”拓扑，在甜甜圈上建模，再变换回汽车，从而实现跨几何形状的泛化。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;逆向设计与半导体&lt;/strong&gt;：在逆光刻中设计掩模；设计量子点与非线性光子学中的门电路。AI 能够优化高度非线性的问题，找到人类手动难以发现的高效设计。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;物理世界基础模型（Foundation Model for Physics）的愿景&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;当前现状&lt;/strong&gt;：目前多是“窄口径代理模型”（Narrow surrogates），Scope 有限。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;未来目标&lt;/strong&gt;：构建能够跨越多种现象、处理&lt;strong&gt;多物理场耦合（Coupled physics）&lt;/strong&gt;的基础模型，既能做模拟也能做设计。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;逆问题求解&lt;/strong&gt;：不仅仅是模拟，而是问“最佳设计是什么”，通过模型隐式地直接得出最优设计。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;多物理场迁移的证据&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;虽然完全未知的物理无法零样本迁移，但通过构建&lt;strong&gt;课程学习（Curriculum）&lt;/strong&gt;，例如先让模型分别学习热传播与材料拉伸，再用极少样本微调耦合现象（热致拉伸），模型能够很好地完成任务。这表明真实世界具有大量可复用的结构。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;开源与上手途径&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;神经算子是一个开源库&lt;/strong&gt;，已成为 PyTorch 生态系统的一部分，被众多研究人员和公司广泛采用。&lt;/li&gt;
&lt;li&gt;库内提供多种架构、示例与配方（Recipes），是领域专家上手将自己的问题应用于神经算子框架的最佳起点。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;第（十）部分 &lt;strong&gt;联合国科学顾问角色、科研瓶颈与行动呼吁&lt;/strong&gt;（88% - 100%）&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;加入联合国科学顾问委员会的使命&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;Anima 近期加入了联合国科学顾问委员会。在复杂的地缘政治中，确保科学家在房间内发出声音至关重要。&lt;/li&gt;
&lt;li&gt;她希望提供无偏见的科学证据，思考 AI 如何在全球范围内产生有益影响：如何让全球各地都能受益于 AI，如何实现 AI 的民主化，以及如何控制意外的有害后果。&lt;/li&gt;
&lt;li&gt;具体落地场景包括：利用更好的天气/气候模型改善全球农业等。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;对 AI 监管的独到见解&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;许多监管框架将 AI 等同于语言模型，担忧其操纵与有害影响。&lt;/li&gt;
&lt;li&gt;她强调 &lt;strong&gt;“AI for Science”是与众不同的&lt;/strong&gt;：不应采取“一刀切”的监管方式。必须意识到，有些 AI 能够通过新发现改变世界，应赋能全球研究者使用它们。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;最希望消除的瓶颈：算力&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;如果被问及最想神奇消除的瓶颈，她选择&lt;strong&gt;“更多算力”&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;尽管算力正快速增长（得益于 NVIDIA 等），但研究创新极度依赖算力。国家实验室正在建造更多超算，没有充足的算力就无法进行实验与创新。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;对听众的行动呼吁&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;动手实践&lt;/strong&gt;：去使用神经算子库，亲手玩转不同架构与配方，查看用例。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;拓宽视野&lt;/strong&gt;：不要将 AI for Science 仅理解为语言模型与智能体（Agents）。那些本质上是外部包装。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;核心认知&lt;/strong&gt;：直到 AI 不仅能理解符号，更能基于物理世界进行模拟、设计与控制之前，AI 领域仍缺失一块巨大的拼图。人们应当以“面向物理世界的 AI”这一视角来重新思考人工智能。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;结语&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;Brandon 表示访谈极具启发性，并计划亲自尝试神经算子。Anima 感谢两位主持人的深入探讨。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;

</description>
    </item>
    <item>
      <title>2026年语音AI前沿：FDE讨论级联架构 vs 语音到语音模型</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Wed, 26 Aug 2026 16:02:16 +0000</pubDate>
      <link>https://dev.to/cognitalk/forward-deployed-voice-ai-on-what-works-in-2026-31b2</link>
      <guid>https://dev.to/cognitalk/forward-deployed-voice-ai-on-what-works-in-2026-31b2</guid>
      <description>&lt;h1&gt;
  
  
  Forward Deployed: Voice AI on what works in 2026
&lt;/h1&gt;

&lt;p&gt;  &lt;iframe src="https://www.youtube.com/embed/MwNvowwcZOo"&gt;
  &lt;/iframe&gt;
&lt;br&gt;
&lt;a href="https://www.youtube.com/watch?v=MwNvowwcZOo" rel="noopener noreferrer"&gt;https://www.youtube.com/watch?v=MwNvowwcZOo&lt;/a&gt;&lt;/p&gt;

&lt;h3&gt;
  
  
  全文标题：&lt;strong&gt;2026年语音AI前沿：前部署工程师论级联架构、语音到语音模型与真实世界部署的取舍&lt;/strong&gt;
&lt;/h3&gt;




&lt;p&gt;&lt;strong&gt;第一部分 开场与嘉宾背景介绍 （0% - 8%）&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;1. 节目与嘉宾介绍&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  主持人介绍本期节目是Dayton Space推出的第四个播客，专注于“前部署工程”（FDE）领域。&lt;/li&gt;
&lt;li&gt;  嘉宾Basil因组织行业晚宴、聚会、小组讨论和播客而进入主持人视野，他曾成功主持AIE大会的FDE分会场。&lt;/li&gt;
&lt;li&gt;  主持人欢迎Basil来到播客。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;2. Basil的个人背景与播客创立动机&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  Basil最初在Credit Karma担任产品经理，后在一家小型风险工作室工作，最终创立咨询公司Exoflop Labs，为客户（零售商、保险公司等）构建AI代理。&lt;/li&gt;
&lt;li&gt;  他认为当前的工作是他早期产品工作的自然延伸：理解客户需求，做出权衡，并帮助他们构建产品。&lt;/li&gt;
&lt;li&gt;  创立播客的动机源于今年一月与私募股权公司合作时，发现很多人难以区分社交媒体上的营销宣传和真实情况。&lt;/li&gt;
&lt;li&gt;  因此，他决定邀请在优秀公司从事前沿项目的工程师进行深度对话并录制发布，让人们能从中获得可应用于自身业务的实践经验。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;3. 播客过往内容回顾&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  首期节目主题是“代理型工程的未来”，邀请了Factory、Cognition、Composio、Sounded等公司。&lt;/li&gt;
&lt;li&gt;  后续还举办了关于语音代理、计算机使用代理和企业级代理的小组讨论。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;strong&gt;第二部分 本期语音代理专题预览 （8% - 16%）&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;1. 选定主题与嘉宾&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  本次精选的往期节目主题是“语音代理”，因为这是目前AI领域最热门的用例之一，Sierra等公司也认为这是最具竞争力的市场。&lt;/li&gt;
&lt;li&gt;  嘉宾来自Decagon、Vapy、Retail、Daily和一家名为Smallest AI的公司。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;2. 讨论的核心议题概览&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;当前最先进架构：级联管道&lt;/strong&gt;。讨论了构建语音代理的三步流程：语音转文本（STT）-&amp;gt; 大语言模型（LLM）-&amp;gt; 文本转语音（TTS），并解释了为何不直接使用端到端的“语音到语音”模型，因为后者目前还不够可靠。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;关键权衡：智能 vs. 延迟&lt;/strong&gt;。高智能的响应往往意味着更慢的速度，这对不同的用例可能是好事也可能是坏事。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;可靠性问题&lt;/strong&gt;。讨论了当底层LLM服务（如Opus）宕机时的应对策略，例如准备一个模型“瀑布流”作为备用，以确保语音代理不会停止工作。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;非平凡问题：话轮转换&lt;/strong&gt;。探讨了语音代理如何判断用户的停顿是表示说完话等待回应，还是在思考过程中，这并非一个简单的问题。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;真实世界部署案例&lt;/strong&gt;。提到了嘉宾之一Pipat曾为世博会构建了一个语音代理，用于接听电话并回答会议相关问题，并将收集到的真实数据转化为基准测试。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;3. 主持人的观点与行业观察&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  主持人认为绝大多数语音应用场景是客服支持，这是一个价值数千亿美元的巨大市场，但现有体验普遍很差，希望新技术能提升其水平。&lt;/li&gt;
&lt;li&gt;  他指出，有趣的是，不仅是销售语音管道的公司在推崇它，连专注于客服的人也得出了相同的结论：模型尚未成熟，甚至可能永远不会完全成熟，这就是当前必须采用的做事方式。&lt;/li&gt;
&lt;li&gt;  真正感受到这种痛点的不是研究人员（他们总想用更大的模型解决一切），也不是产品工程师，而是那些直接面对客户的FDE们，他们会因为模型犯下严重错误而要求提供保证。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;strong&gt;第三部分 基础架构详解：级联模型与入站/出站用例 （16% - 28%）&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;1. 最简单的级联模型架构&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  由Pipecat公司的Brun讲解最基本的架构，即“级联模型”。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;输入&lt;/strong&gt;：语音通过传输协议（WebRTC、电话呼叫、WebSocket）进入。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;语音转文本（STT）&lt;/strong&gt;：进行转录，期间可能加入额外模型进行背景噪音消除和语音隔离。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;话轮检测&lt;/strong&gt;：由于语音没有回车键，需要使用语音活动检测（VAD）和智能话轮模型来判断说话是否结束，这与在句子中间停顿不同。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;大语言模型（LLM）处理&lt;/strong&gt;：将转录后的文本发送给LLM，LLM可能会返回推理结果、触发工具调用等。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;文本转语音（TTS）&lt;/strong&gt;：得到完整输出后，进行文本转语音处理，通常速度快于实时，然后通过原始传输协议流式传回给用户。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;2. 出站（Outbound）与入站（Inbound）用例的根本差异&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;出站用例（如债务催收）&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;  机器人发起呼叫，有明确目标。&lt;/li&gt;
&lt;li&gt;  如果用户跑题或说奇怪的话，机器人可以直接挂断电话，因为它没有义务继续对话。&lt;/li&gt;
&lt;li&gt;  因此，设置安全护栏相对容易。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;入站用例（如客服中心）&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;  机器人不知道来电者的具体意图，只有一些存在的上下文。&lt;/li&gt;
&lt;li&gt;  对于业务简单的商家（如花店），可处理的事情有限。&lt;/li&gt;
&lt;li&gt;  但对于复杂平台（如亚马逊），有海量产品和多种政策，无法将所有信息放入单个提示词中。LLM会倾向于记住上下文的头尾，忘记中间部分，导致幻觉。&lt;/li&gt;
&lt;li&gt;  因此需要更多智能手段，例如引入“压缩模型”。就像使用编码代理时，当上下文窗口用到25%就需要开始压缩和保存工作，防止模型偏离轨道。语音AI在这方面领先编码代理一代，很早就开始解决压缩问题。&lt;/li&gt;
&lt;li&gt;  核心工作是防止机器人产生幻觉，并跟踪对话进程。由于话轮通常较短，且机器人说的比人类多，需要持续追踪用户说了什么以及对话进行到了哪一步。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;strong&gt;第四部分 级联 vs. 语音到语音：架构之争与混合未来 （28% - 45%）&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;1. 为什么不直接用语音到语音模型？&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  主持人提问，既然级联模型如此复杂，为什么不直接使用端到端的语音到语音模型？&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;回答（来自Smallest AI的代表）&lt;/strong&gt;：用一个生动的例子说明。你可以打给一个很好的语音到语音演示，感觉它反应迅速、能识别语调。但当你说“下周预约”，它却问“是6月10日吗？”你纠正说是2030年，它会立刻同意。这表明它在处理基本事实时可能出错。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;级联模型的优势在于更强的控制力&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;  可以对输入进行严格的护栏检查，如检测提示注入或社交工程攻击。&lt;/li&gt;
&lt;li&gt;  可以经过意图选择、条件检查和上下文优化的流水线。&lt;/li&gt;
&lt;li&gt;  在生成回复后，可以进行事实核查（如确认年份是否正确）。&lt;/li&gt;
&lt;li&gt;  挑战在于如何让所有这些步骤变得高性能，过去半年团队一直在努力从流水线的每个环节节省毫秒级的延迟。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;2. 语音到语音模型的演进与优势&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;最初的动机&lt;/strong&gt;：语音转文本会丢失情感信息，无论用户是悲伤还是兴奋，机器人都以同样方式回应。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;更高级的理解&lt;/strong&gt;：语音到语音是一种更接近人脑运作方式的异步架构。人脑是边听边想的，会打断、会做笔记（后台工具调用）。级联模型是同步的（一步一步来），而语音到语音模型能像人脑一样异步工作。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;Smallest AI的Hydra模型&lt;/strong&gt;：这是一个多模态模型，既能接收语音也能接收文本，同时输出语音和文本，因此它可以执行工具调用。但挑战在于，在变得更自然的同时，如何保持与传统STT模型同等的准确性，这涉及到模型的可解释性问题。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;混合方案是中期答案&lt;/strong&gt;：语音到语音模型在改进，但对于复杂工作流，仍会使用多个LLM。一种可行的模式是：主循环使用语音到语音模型进行流畅对话，当需要进行复杂查询或工具调用时，再委托给级联模型处理。这类似于人脑的“自动驾驶”模式（处理日常事务）和“深思熟虑”模式（处理复杂问题）。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;strong&gt;第五部分 模型选择、并行化与多语言挑战 （45% - 60%）&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;1. 级联管道中的模型选择&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;速度优先&lt;/strong&gt;：如果需要快速响应的模型，可以选择关闭“思考”功能的模型。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;个人偏好&lt;/strong&gt;：有人喜欢Google的Gemini 2.5，认为它速度极快；Haiku模型也很好，但整体速度仍低于预期。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;2. 如何实现管道并行化？&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;分叉与瀑布流&lt;/strong&gt;：可以将语音信号分叉，一路用于生成语音，另一路送入STT。STT输出的文本可以分叉给多个LLM，形成一个“瀑布流”。然后在底部设置一个门控机制（如选举或仲裁模型），来决定哪个LLM的输出最好。&lt;/li&gt;
&lt;li&gt;  这是一种非常复杂的计算机架构思想，现在终于有了用武之地。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;3. 口音与多语言的处理&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;Smallest AI的策略&lt;/strong&gt;：对于语音到语音模型，目前完全专注于提升英语的智能水平，不想引入其他变量。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;级联模型的多语言支持&lt;/strong&gt;：Vapy的嘉宾分享了经验。

&lt;ul&gt;
&lt;li&gt;  在日本部署时，OpenAI的4.1或Deepgram的转录器效果不错，但在语音合成（TTS）环节遇到了问题。他们认为适用于英语、西班牙语、葡萄牙语的顶尖模型在日本完全失效。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;解决方案&lt;/strong&gt;：允许客户自带自定义的TTS服务器。在每个市场都有本土的初创公司或实验室擅长本地语言的发音（如阿拉伯语中的品牌名和地址发音）。&lt;/li&gt;
&lt;li&gt;  这也体现了级联模型模块化的好处，可以灵活替换特定组件。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;strong&gt;第六部分 提示工程设计、延迟与用户体验的权衡 （60% - 78%）&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;1. 提示词设计的最佳实践：单一巨型提示 vs. 工作流方法&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;取决于用例和提示词大小&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;入站用例&lt;/strong&gt;：通常有专用线路和可预测的工作流，更适合采用“节点/图构建器”的方法，即结构化的工作流。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;出站用例&lt;/strong&gt;：用户反应不可预测（愤怒、烦躁），单一提示词像一个“中央大脑”，可以从提示词的不同部分提取信息来增强响应，更具灵活性。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;知识库的利用&lt;/strong&gt;：在入站中，可能确切知道何时需要提取特定知识；在出站中，可能需要利用所有可用信息。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;当前趋势&lt;/strong&gt;：随着LLM能力的提升，现在又开始倾向于给模型提供全部上下文，让它自己判断。但最终，对于非确定性系统，最好的方法还是针对每个客户的具体用例进行大量测试，并用LLM作为裁判来评估可靠性。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;2. 延迟的定义与优化&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;什么是好的延迟？&lt;/strong&gt; 标准在不断变化，客户期望越来越高。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;填充词（Fillers）的价值&lt;/strong&gt;：完全没有填充词的回复会显得生硬。在等待API响应（可能长达5秒）时，一个好的填充词（如“稍等一下，我查一下”）能让体验更自然。关键在于填充词的质量和自然度。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;最难的问题&lt;/strong&gt;：在性能和稳定性/可靠性之间找到平衡，是语音部署中最难解决的问题。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;3. 降低延迟的具体策略&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  &lt;strong&gt;卸载指令&lt;/strong&gt;：将长工作流分解。例如，在催收场景中，并非所有通话都需要处理信用卡支付。可以将这部分功能交给专门的子代理，只在需要时才加载相关指令。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;多代理架构&lt;/strong&gt;：使用专门的代理处理特定任务，完成后回到主代理的自由对话模式。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;流式处理到多个模型&lt;/strong&gt;：将音频流同时发送给小语言模型（SLM）进行快速意图分类，同时主流水线可能在添加填充词，从而在后台启动一个更智能的思考过程。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;成本考量&lt;/strong&gt;：将庞大提示词喂给LLM会产生成本，尤其很多通话可能在10秒内就挂断了。拆分提示词不仅能降低延迟，还能降低成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;strong&gt;第七部分 评估、基准测试与未来展望 （78% - 100%）&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;1. 评估与基准测试的重要性&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  Pipecat发布了基于话轮的STT、LLM和TDS（文本到语音）基准测试。所有工具和测试数据都是开源的，任何人都可以用新模型运行测试。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;实用性&lt;/strong&gt;：可以在不与客户正式对接前，就用这些基准测试来评估客户可能的工作流。FDE们可以利用现有的云资源，根据讨论内容快速构建评估集并进行冒烟测试。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;2. 自托管小模型的优势&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  Smallest AI观察到，许多客户将他们的大模型与自托管的小语言模型“Electron”配对使用。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;优势&lt;/strong&gt;：成本更低、延迟显著降低、可靠性更高。相比之下，OpenAI等API的延迟会波动且不受控制。自托管模型可以根据需求弹性伸缩。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;3. 对Sesame模型的讨论&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  有人提到Sesame曾发布过令人印象深刻的演示，但之后销声匿迹。&lt;/li&gt;
&lt;li&gt;  &lt;strong&gt;了解的信息&lt;/strong&gt;：据称他们在转向开发硬件（可能是眼镜），CEO已经财务自由，只是想玩点新东西。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;

</description>
    </item>
    <item>
      <title>两家实验室的算力垄断之路：Dylan Patel 详解 AI 经济学</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Wed, 26 Aug 2026 05:33:53 +0000</pubDate>
      <link>https://dev.to/cognitalk/two-labs-will-control-most-of-the-worlds-compute-dylan-patel-on-ai-economics-28i</link>
      <guid>https://dev.to/cognitalk/two-labs-will-control-most-of-the-worlds-compute-dylan-patel-on-ai-economics-28i</guid>
      <description>&lt;p&gt;  &lt;iframe src="https://www.youtube.com/embed/aV26V1UvkJw"&gt;
  &lt;/iframe&gt;
&lt;br&gt;
&lt;a href="https://www.youtube.com/watch?v=aV26V1UvkJw" rel="noopener noreferrer"&gt;https://www.youtube.com/watch?v=aV26V1UvkJw&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Two Labs Will Control Most of the World's Compute: Dylan Patel on AI Economics&lt;/p&gt;

&lt;h1&gt;
  
  
  两家实验室的算力垄断之路：Dylan Patel 详解 AI 经济学与 2028 年的世界重构
&lt;/h1&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第一部分 开场与全球算力/营收现状盘点&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（0% - 9%）&lt;/strong&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;播客背景与本期主题&lt;/strong&gt;：主持人 Dwarkesh Patel 与 SemiAnalysis 创始人 Dylan Patel 以"年度家庭感恩节"形式再次对谈，核心议题是世界经济走向正越来越多地成为 AI 实验室经济学与算力市场的函数，目标是理解未来几年"疯狂未来"的落点。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;当前算力分配格局&lt;/strong&gt;：2025 年美国大部分 GDP 增长实际上就是 AI 基础设施；2026 年全球新上线算力中约&lt;strong&gt;三分之一&lt;/strong&gt;最终服务于 OpenAI 和 Anthropic（即便物理设施由其他方建设再租赁给它们，最终客户仍是这两家）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;资本开支的膨胀曲线&lt;/strong&gt;：2026 年全球 AI 基础设施 CapEx 略超 &lt;strong&gt;1 万亿美元&lt;/strong&gt;，到 2028 年将超过 &lt;strong&gt;2 万亿美元&lt;/strong&gt;；AI 实验室自身则从每年烧几十亿、几百亿美元，走向每年烧数千亿、乃至本十年末上万亿美元的合同承诺。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;盈利拐点已至&lt;/strong&gt;：Anthropic 在 2026 年 Q2 开始转为盈利；OpenAI 市场预期在 Q3 随着 Codex 与 GPT-5.6 等产品的放量也开始盈利。这与一年前、甚至 2026 年年初仍靠风险投资输血亏损的状态形成根本转折。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;单位算力收入的跨越式提升&lt;/strong&gt;：过去在 Nvidia Hopper 上服务 GPT-4 对 OpenAI 是负毛利率；如今 OpenAI 服务 GPT-5.6、Anthropic 服务 Opus 5 时，每兆瓦算力所产生的收入已远超 10-15 百万美元/兆瓦的基础成本，Anthropic 峰值达到 &lt;strong&gt;5000 万美元/兆瓦&lt;/strong&gt;——这意味着"花 10 美元推理容量、产生 50 美元收入、再把利润全部投入下一轮训练"的自循环飞轮已经启动。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第二部分 算力向两家实验室集中的量化推演&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（9% - 18%）&lt;/strong&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;各实验室算力规模的爆发&lt;/strong&gt;：2026 年初 OpenAI 约 2 吉瓦、Anthropic 不到 2 吉瓦；到 2026 年底两家都将突破 5 吉瓦，整体实现 3-4 倍增长。2026 年全年新增算力中两家约占 30%。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;2027 年集中度进一步跳升&lt;/strong&gt;：基于已签约合同，2027 年 Anthropic 与 OpenAI 将拿走全球新增算力的 &lt;strong&gt;40%-50%&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;"半数临界点"的到来时刻&lt;/strong&gt;：Dylan 明确判断——&lt;strong&gt;到 2027 年末，全球一半的新增算力将归属 Anthropic 和 OpenAI&lt;/strong&gt;；由于全球算力总量本身每年翻倍的背景下，新增算力很快构成全球算力的大部分，因此"一年内到两年内，全球大部分算力由两家实验室拥有或服务其需求"将成为现实。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;芯片代际效率放大集中度&lt;/strong&gt;：2026 年部署的 GB300、TPUv7、Trainium3 等新一代芯片，每瓦性能为上一代的 &lt;strong&gt;3-5 倍&lt;/strong&gt;。因此即便只拿物理算力的一半，两家实验室实际控制的"可用 FLOPs"占比还会再乘上一个性能系数。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;2028 年 70%-80% 的预测&lt;/strong&gt;：若趋势延续（Dylan 称目前看不到阻止它的力量），到 2028 年两家将吸收全球新增算力的 70%-80%，&lt;strong&gt;自行控制全球大部分真正可用的浮点算力&lt;/strong&gt;；合计物理算力达到约 100 吉瓦。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;新建算力方的角色转变&lt;/strong&gt;：SpaceX 等新建算力方进入市场，由于两家实验室边际支付能力最强，SpaceX 大概率将大量算力租赁给 Anthropic 和 OpenAI；同时两家也开始自建——OpenAI 用自己的芯片，Anthropic 从 Google 采购 TPU 并与 Fluidstack 部署。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第三部分 晶圆厂到终端收入的百倍杠杆与供应链瓶颈&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（18% - 25%）&lt;/strong&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;$6 亿晶圆厂 CapEx → $1 万亿终端收入&lt;/strong&gt;：通过 LLM 运行的设备模型估算，每吉瓦算力每年需约 $30-40 亿工具投资，加上洁净室等整体晶圆厂 CapEx 约 &lt;strong&gt;$60 亿/年/吉瓦&lt;/strong&gt;；而 1 吉瓦算力当前可产生约 &lt;strong&gt;$1000 亿/年&lt;/strong&gt; 的收入。5 年累计下，$60 亿晶圆厂 CapEx 可撬动超 &lt;strong&gt;$1 万亿&lt;/strong&gt; 终端 AI 收入，即便扣除中间各环节后仍存在 &lt;strong&gt;近 100 倍&lt;/strong&gt; 的 discrepancy。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;资本主义的"鞭子效应"（Bullwhip Effect）&lt;/strong&gt;：产业链上游对终端需求的放大与延迟反应——从 ASML 的光刻机、Carl Zeiss 的反射镜，到内存、基板、数据中心的涡轮机，每一层都在成为瓶颈并索要更高价格。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;ASML 与 Carl Zeiss 的物理上限&lt;/strong&gt;：2026 年早些时候产业链原本认为到 2030 年每年 100 台 EUV 工具就够了；如今被迫上调预期，但即便给 Carl Zeiss 投 100 亿美元让其扩产，也需要贯穿整个供应链同步扩张，而这在 2026、2027、2028 年都难以实现——世界是资本受限的。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;算力的"转售套利"现象&lt;/strong&gt;：市场上已经出现买入涡轮机再转售的套利行为，因为作为数据中心瓶颈的涡轮机的价值被极度抬高；理论上任何能说服 ASML 出售一台 EUV 工具的人，都可以等待后以超 10 亿美元转售。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第四部分 算力定价机制与价值捕获层的迁移&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（25% - 33%）&lt;/strong&gt;&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;💡 本段插入了 Grok Bot 招聘编辑的广告插播，以下内容为广告后的核心讨论。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;算力单价的必然上涨&lt;/strong&gt;：当前任何人都能以 $10-15 百万/兆瓦的成本轻松部署开源权重（如 Kimi + vLLM/SGLang）并通过 OpenRouter 等产生正向收入，因此基础算力定价已开始抬头。要让两家实验室在 2028 年拿到 100 吉瓦，&lt;strong&gt;单价必须从 $15 百万/兆瓦上升到 $25、$30 甚至 $50 百万/兆瓦&lt;/strong&gt;——只有这样才能"出价击败"其他所有买家。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;价值捕获层的历时演变&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;2023 年&lt;/strong&gt;：HBM 与内存厂商并未从 AI 价值中获取匹配利润；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;2024-2025 年&lt;/strong&gt;：硬件供应链（芯片、晶圆厂）获取了几乎所有毛利，模型层为负毛利；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;2026 年&lt;/strong&gt;：模型层跨越拐点，Anthropic 达到 $50 百万/兆瓦，路径指向 $100 百万/兆瓦；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;未来&lt;/strong&gt;：若监管不阻止最佳模型发布，实验室可达 $100 百万/兆瓦以上，并能支付 $50 百万/兆瓦采购算力。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Meta 与 SpaceX 的"期权性"角色&lt;/strong&gt;：Meta 与 SpaceX 凭借资产负债表成为除两家实验室外唯一可能的"第三极"，它们可以无终端客户而先行建设算力，随后在"自用"与"以 $25-$50 百万/兆瓦高价转售给 Anthropic/OpenAI"之间做选择，从而重塑了算力市场的权力结构。Elon 卖给 Google 的 B300 算力达 $40 亿/吉瓦即是明证。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;终端用户的巨大价值捕获&lt;/strong&gt;：Jane Street 等机构通过独家合同使用 GPT-5.6 Ultrafast，从 tokens 中创造的价值远超 Anthropic 所获利润；Meta 使用 Anthropic 模型优化广告算法所获得效率提升也远超其支付给 Anthropic 的费用——这意味着&lt;strong&gt;大部分 AI 创造的社会价值目前仍留在最终用户侧&lt;/strong&gt;，而非被模型层捕获。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第五部分 监管、模型发布限制与单位算力收入的天花板风险&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（33% - 40%）&lt;/strong&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;"释放最佳模型"的监管阻力&lt;/strong&gt;：OpenAI 未发布 Astra、停止训练两周；Anthropic 未发布安全评估中广泛被认为是 Mythos 下一代的 Model 2——&lt;strong&gt;最佳模型被主动雪藏&lt;/strong&gt;，导致实验室每兆瓦收入可能停滞甚至回落。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;RSI（递归自我改进）与内部使用的不对称性&lt;/strong&gt;：如果实验室内部有比外部领先 6 个月、且在 RSI 状态下相当于外部 100 倍进度的模型，但监管禁止其内部广泛使用，那么"每兆瓦收入"的外生指标就无法反映真实的边际价值。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Dylan 的基准情形&lt;/strong&gt;：在没有监管阻断的前提下，到 2027 年末 Anthropic/OpenAI 的单位算力收入可达 &lt;strong&gt;$70-80 百万/兆瓦&lt;/strong&gt;（混合全公司口径）；若模型持续进步，突破 $100 百万/兆瓦并不夸张。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;监管反向推高成本的另一条路径&lt;/strong&gt;：纽约州禁建数据中心、德州暂停审批、俄亥俄州要求数据中心缴纳周边房产税等——供给减少将进一步推高算力价格，形成"监管→供给收缩→涨价→通胀"的链条。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第六部分 训练与推理的算力分配逆转&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（40% - 48%）&lt;/strong&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;非共识判断：推理占比将下降&lt;/strong&gt;：主流观点认为"大部分算力将走向推理"，Dylan 则明确提出&lt;strong&gt;反共识看法&lt;/strong&gt;——实验室将随时间推移把越来越少的算力分配给推理，越来越多的算力分配给训练与内部 R&amp;amp;D。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;当前的预算拆分&lt;/strong&gt;：实验室总算力预算中约 60% 用于训练、40% 用于推理；而 60% 的训练中又细分——约 50% 用于研究（新架构、数据混合、超参、注意力机制测试等），10% 用于开发（一次预训练运行本身其实不到 200 兆瓦、约两个月；RL 阶段更小）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;"研究"吃掉算力的现实原因&lt;/strong&gt;：多集群协调、跨站点训练、RL 阶段 rollout 数量与效果的边际递减等限制，使得即便手握数吉瓦，单次训练运行最多只能 leverage 约 200 兆瓦，其余算力沉淀在研究实验中。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;2026 年已发生的边际转向&lt;/strong&gt;：尽管每月算力绝对量持续上升，但从 2026 年中开始，新增算力的边际收入增长已趋于平台——意味着&lt;strong&gt;边际兆瓦更多地流向了 R&amp;amp;D 而非推理&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;AGI 目标下的理性选择&lt;/strong&gt;：对 Anthropic 与 OpenAI 的董事会与高管而言，把每兆瓦推理利润用于分红/回购，还是用于训练以构建 AGI 这一"更盈利"的目标？答案显然是后者。一旦自动化研究者成熟，研究预算与训练预算的界限将模糊，更多算力涌入训练。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;长远 CapEx 量级的重估&lt;/strong&gt;：若 2028 年建设 100 吉瓦/年，按照当前单价就是每年 $5 万亿 CapEx；叠加发电厂（30 年资产）与数据中心（15-20 年资产）需提前建设，&lt;strong&gt;实际年度增量 CapEx 到 2030 年末将接近 $10 万亿&lt;/strong&gt;，约当今世界经济总量的十分之一。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第七部分 全球算力地理分布与中国曲线&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（48% - 57%）&lt;/strong&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;中美算力份额的历史与现状&lt;/strong&gt;：2022 年美国部署全球算力的 45-50%、中国 30-35%；而到 2026 年，由于对华严格管制与美国本土激增，&lt;strong&gt;美国占 70%&lt;/strong&gt;、中国下降到&lt;strong&gt;不到 10%&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;中国 2028 年预测&lt;/strong&gt;：到 2028 年中国将有不超过 &lt;strong&gt;30 吉瓦&lt;/strong&gt; AI 算力；由于其中多为国产芯片（SMIC、CXMT 等 2027-2028 年才起量），实际等效算力可能只相当于美国芯片的 20 吉瓦。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;中国 2029 年"曲棍球棒"&lt;/strong&gt;：Dylan 认为中国在 2029 年增加 50 吉瓦完全合理——中国的优势本就在于制造业的快速规模化；即便其中多为国产芯片，等效算力仍可能相当于美国芯片的 20 吉瓦量级。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;出口管制的实际效果评估&lt;/strong&gt;：如果按 Dylan 给出的数据延续，到 2028 年&lt;strong&gt;单个美国领先实验室的加权算力可能超过中国 2029 甚至 2030 年的全国总量&lt;/strong&gt;——出口管制的确起到了显著的拖延作用。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;中美金融结构的差异&lt;/strong&gt;：美国金融体系更愿意"YOLO"式押注初创；中国一旦选定行业则补贴力度远超全球半导体业总和。若 AGI 到来较慢，中国将在半导体侧大幅追赶；若较快，则算力存量差距将造成决定性鸿沟。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;中国模型与算力的错位&lt;/strong&gt;：领先的中国实验室总算力仅 100-200 兆瓦（字节 Seed 除外），Kimi 远未达 1 吉瓦；而 Anthropic 到 2026 年底超 5 吉瓦。当前中国模型在公开感知上并未落后太多，但&lt;strong&gt;这一"算力差不重要"的状态将在自动化研究者出现后被彻底颠覆&lt;/strong&gt;。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第八部分 AI CapEx 与主权债务危机、利率冲击&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（57% - 76%）&lt;/strong&gt;&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;💡 本段中间插入了 Antithesis 确定性软件测试平台的广告插播。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;$11 万亿 CapEx 与 $5 万亿信贷缺口&lt;/strong&gt;：SemiAnalysis 建模显示 2024-2029 年 AI 基础设施总 CapEx 约 &lt;strong&gt;$11 万亿&lt;/strong&gt;，其中 $6 万亿由现金流覆盖，&lt;strong&gt;$5 万亿需通过信贷市场募集&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;谁为 CapEx 买单的演进&lt;/strong&gt;：2026 年及之前由 hyperscalers（Google、Microsoft、Amazon、Meta）以现金流+债务覆盖；到 2028 年 hyperscalers 自身债务已达数百亿级别，需要新的资金方进场——包括 Nvidia/Broadcom/内存厂的直接注资、传统基建投资者（用数据中心替代桥梁）、以及全体经济主体将资金从房贷/国债转向 hyperscaler 债务。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;利率的必然上行&lt;/strong&gt;：Meta 近期债务发行利率已达 5-6%，Dylan 预测 Amazon 等 hyperscalers 2026 年后为争夺算力将** willingly 支付 8% 甚至更高**的利率，因为它们从算力获得的回报远超此成本。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;利率上行的连锁反应&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;主权债务危机&lt;/strong&gt;：美国因能在境内征税尚可应对；但巴基斯坦、尼日利亚等"高债务+低税基+短债为主"的国家将面临&lt;strong&gt;第二次沃尔克冲击&lt;/strong&gt;——1980 年代超过 40 个国家违约的剧本可能重演。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;股市重置&lt;/strong&gt;：折现率从 3-5% 跃升至 8-10%，所有长周期现金流股票的估值将崩塌（铁路、消费必需品、Johnson &amp;amp; Johnson 类）；即便是 AI 公司本身，除少数极致 AI-pilled 的逻辑外，整体股市将面临重估。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;内存等"AI 受益股"的反直觉定价&lt;/strong&gt;：若 AI 真的重构了经济，理论上所有资产都应按 2-3 倍市盈率交易，这意味着&lt;strong&gt;即便 Micron、SK Hynix、Kioxia 等也应大涨，但同时整个股市会崩盘&lt;/strong&gt;——这是一个内部矛盾的信号。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;政府角色的悖论&lt;/strong&gt;：若联邦政府不能找到对 AI 征税的方式，当利率升至 tens of percent 时，债务付息将超过当前税收总收入；资本的机会成本将极为高昂——"把钱用于支付养老金"vs"把钱用于建机器人工厂"的对比将极端尖锐。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;缓刹车变量的汇总&lt;/strong&gt;：监管限制数据中心建设、消费者与政治反弹、模型发布禁令、利率上行本身——这些因素共同把曲线从"纯粹资本主义最优解"压低到"复杂系统实际可行解"，使最终建设的吉瓦数低于理论值。&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  &lt;strong&gt;第九部分 奇点临近、AI 劳动力集中化与去中心化的无解困境&lt;/strong&gt;
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;（76% - 100%）&lt;/strong&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;经济体量的指数增长&lt;/strong&gt;：在 fully automated economy 中，若每年可让经济存量翻倍，2030 年代利率将达到 tens of percent（甚至上百%），所有未参与 AI 生产的国家违约、所有非 AI 股票归零。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;"有效 AI 人口"的 10 倍年增&lt;/strong&gt;：前沿算力以 FLOP 计每年 4-5 倍增长，而达到某能力水平所需算力每年 3 倍下降，&lt;strong&gt;两者相乘导致"有效 AI 劳动力"每年 10 倍扩张&lt;/strong&gt;——即便没有 RSI，OpenAI 也将从 2026 年约 1000 万 AI 劳动者，到次年 1 亿、再次年 10 亿；&lt;strong&gt;到 2030 年前，单一实验室内的有效人口将超过地球人类总和&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;集中化的三重引擎&lt;/strong&gt;：

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;训练的规模经济&lt;/strong&gt;：训练投入被摊销到数十亿次会话/用户；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;算力稀缺下的溢价&lt;/strong&gt;：略微领先的玩家可对稀缺资源收取极高 markup；&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;部署学习闭环&lt;/strong&gt;：更广泛部署的模型获得更多真实数据，进一步领先。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;RSI 后的极端情形&lt;/strong&gt;：一旦发生递归自我改进，有效人口增长率将从 10 倍/年跃升至 100-1000 倍/年，或智能水平爆炸式提升。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;"去中心化未来"的思想实验&lt;/strong&gt;：Dwarkesh 提出的核心命题——是否存在一种在 AGI 之后仍能保持去中心化、广泛赋能的愿景？Dylan 承认这是亟需智识投入的项目，但&lt;strong&gt;目前所有力量（训练规模经济、算力稀缺、持续学习、RSI）都指向集中化&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;两种集中化的二选一&lt;/strong&gt;：要么是私人企业（Anthropic/OpenAI）的极端集中，要么是政府控制的集中——Dylan 表示对二者都不信任。资本主义历史上因去中心化决策而胜出，但 AI 翻转了这一逻辑：&lt;strong&gt;私人产权仍在，但仅由极少数公司分享&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;唯一的刹车是监管&lt;/strong&gt;：Dylan 坦言，除非 AI 进度放缓、除非政府强力监管，否则集中化不可避免；但他也承认"把希望寄托于放缓"可能只是一厢情愿。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;结尾基调&lt;/strong&gt;：在黯淡的集中化预言中，Dylan 与 Dwarkesh 相约在 RSI 正式启动后再度对谈，留下一个开放而沉重的问题——人类文明是否正不可逆地走向由两家私人实验室定义"大多数心智"的未来。&lt;/li&gt;
&lt;/ol&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>openai</category>
    </item>
    <item>
      <title>Needle 2: the 14 MB agentic model, tested properly</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Wed, 26 Aug 2026 05:33:32 +0000</pubDate>
      <link>https://dev.to/cognitalk/needle-2-the-14-mb-agentic-model-tested-properly-4869</link>
      <guid>https://dev.to/cognitalk/needle-2-the-14-mb-agentic-model-tested-properly-4869</guid>
      <description>&lt;p&gt;Needle 2: the 14 MB agentic model, tested properly&lt;/p&gt;

&lt;p&gt;  &lt;iframe src="https://www.youtube.com/embed/_-5b7PigRSQ"&gt;
  &lt;/iframe&gt;
&lt;br&gt;
&lt;a href="https://www.youtube.com/watch?v=_-5b7PigRSQ" rel="noopener noreferrer"&gt;https://www.youtube.com/watch?v=_-5b7PigRSQ&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;视频 &lt;a href="https://www.youtube.com/watch?v=_-5b7PigRSQ" rel="noopener noreferrer"&gt;Needle 2: the 14 MB agentic model, tested properly&lt;/a&gt; 详细评测并介绍了由 Cactus Compute 推出的轻量级 Agent 端侧模型 &lt;strong&gt;Needle 2&lt;/strong&gt;。&lt;/p&gt;

&lt;p&gt;作者通过实际安装、测试与代码验证，梳理了该模型的架构亮点、核心功能、存在的 Bug 与限制，以及适用场景：&lt;/p&gt;




&lt;h3&gt;
  
  
  &lt;strong&gt;模型核心特点与架构创新&lt;/strong&gt;
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;极致轻量：&lt;/strong&gt; 全模型仅 14 MB（4500万参数、2-bit 量化），运行所需内存仅约 26–28 MB，完全不需要 GPU，可直接部署在低成本的无网边缘设备（如智能门铃、温控器等）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;架构精简：&lt;/strong&gt; 移除了传统的 Feed-Forward（前馈）层，改用无需存储权重且计算效率极高的 Hadamard 变换；事实记忆则通过哈希 N-gram 表查找，大幅减少了算力消耗（每 Token 仅需 70 Megaflops）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;三大核心功能：&lt;/strong&gt; 专门用于 &lt;strong&gt;工具调用 (Tool Calling)&lt;/strong&gt;、&lt;strong&gt;设备控制 (Device Control)&lt;/strong&gt; 以及 &lt;strong&gt;从文本提取结构化数据 (Structured Extraction)&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;




&lt;h3&gt;
  
  
  &lt;strong&gt;实测发现的三大问题/缺陷&lt;/strong&gt;
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;对话上下文漂移（Answer Drift）：&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;多轮对话后模型的判断准确度会下降（例如将“亮度调至一半”从最初正确的 50% 逐渐漂移为 30%）。&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;解决方法：&lt;/strong&gt; 需在代码中主动调用未在文档中公开的 &lt;code&gt;agent.reset()&lt;/code&gt; 方法清空上下文状态。&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;置信度得分（Confidence Score）反向/不可靠：&lt;/strong&gt;&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;作者在实测中发现，模型在执行完全正确的工具调用时给出的置信度为 &lt;code&gt;0.0000&lt;/code&gt;，而在执行错误的工具调用时却给出了 &lt;code&gt;0.71&lt;/code&gt; 的高置信度。&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;结构化提取存在局限：&lt;/strong&gt;&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;对日期格式要求严格（必须为 ISO 标准格式 &lt;code&gt;YYYY-MM-DD&lt;/code&gt;）；提取多字段（如 8 个字段）时容易产生幻觉，将字段标签误填为字段值。&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;




&lt;h3&gt;
  
  
  &lt;strong&gt;最终结论与适用场景&lt;/strong&gt;
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;优势：&lt;/strong&gt; 安装极其简单（PyPI 一键安装）、内存占用有明确上限、支持完全离线运行、输出带有明确的推理链（Reasoning Trace）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;不适用：&lt;/strong&gt; 不适合做闲聊 Chatbot，也缺乏通用大模型的世界知识。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;最佳场景：&lt;/strong&gt; 非常适合嵌入式设备、IoT 智能家居控制器等硬件成本受限且只需进行指令解析与控制的离线端侧场景。&lt;/li&gt;
&lt;/ul&gt;

</description>
      <category>agents</category>
      <category>ai</category>
      <category>llm</category>
      <category>machinelearning</category>
    </item>
    <item>
      <title>AI 时代领导者：借认知行为科学释放人类独特潜能</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Mon, 24 Aug 2026 23:13:02 +0000</pubDate>
      <link>https://dev.to/cognitalk/leaders-in-the-ai-era-leveraging-cognitive-behavioral-science-to-unleash-human-unique-potential-3lg</link>
      <guid>https://dev.to/cognitalk/leaders-in-the-ai-era-leveraging-cognitive-behavioral-science-to-unleash-human-unique-potential-3lg</guid>
      <description>&lt;p&gt;AI 时代领导者：借认知行为科学释放人类独特潜能&lt;/p&gt;

&lt;p&gt;Leaders in the AI Era: Leveraging Cognitive‑Behavioral Science to Unleash Human‑Unique Potential&lt;/p&gt;

&lt;p&gt;  &lt;iframe src="https://www.youtube.com/embed/NsHNVq1kZig"&gt;
  &lt;/iframe&gt;
&lt;br&gt;
&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig" rel="noopener noreferrer"&gt;https://www.youtube.com/watch?v=NsHNVq1kZig&lt;/a&gt;&lt;br&gt;
这视频是 &lt;strong&gt;The Next Big Idea Podcast&lt;/strong&gt; 的访谈节目，主持人 Rufus Griskum 对话领导力顾问、前麦肯锡合伙人 Caroline Webb，围绕她的新书 &lt;em&gt;《Leadership Intelligence》&lt;/em&gt; 展开讨论。&lt;/p&gt;

&lt;p&gt;整集视频的核心主题是：&lt;strong&gt;在人工智能（AI）时代，领导者如何运用认知与行为科学（心理学、神经科学）来激发人类独特的潜能与智力。&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;视频的主要内容可分为以下六大板块：&lt;/p&gt;

&lt;h3&gt;
  
  
  1. AI 时代的核心领导力 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=98" rel="noopener noreferrer"&gt;01:38&lt;/a&gt;]
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;人机协同&lt;/strong&gt;：随着 AI 接管大量行政与流程性工作，人类领导者的独特价值在于&lt;strong&gt;关键决策、批判性思维、情绪感知与人际信任&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;释放大脑容量&lt;/strong&gt;：AI 减轻了琐碎事务的负担，领导者应将节省出来的认知资源用于更具战略意义的“人与团队”管理上。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  2. 精准的时间与精力管理（Yes-Grow-No 框架） [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=493" rel="noopener noreferrer"&gt;08:13&lt;/a&gt;]
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Positive Yes&lt;/strong&gt;：专注于只有你作为领导者才能贡献的独特价值（如战略思考、辅导下属）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Let Go &amp;amp; Grow&lt;/strong&gt;：将自己擅长但他人也能做的事进行&lt;strong&gt;明智授权&lt;/strong&gt;，释放下属的成长空间 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=553" rel="noopener noreferrer"&gt;09:13&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Positive Warm No&lt;/strong&gt;：拒绝非核心事务的“温暖拒绝法”——先表达肯定/认可，说明当前最优先的重点（Positive Yes），再清晰拒绝，最后送上真诚祝福 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=753" rel="noopener noreferrer"&gt;12:33&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;单任务专注&lt;/strong&gt;：驳斥“多任务处理”神话，指出频繁切换任务会导致错误率增加 2 至 4 倍。支持通过固定音乐清单（无新鲜感的音乐）进入深度工作 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=1055" rel="noopener noreferrer"&gt;17:35&lt;/a&gt;]。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  3. FUSE 创新思维模型 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=1299" rel="noopener noreferrer"&gt;21:39&lt;/a&gt;]
&lt;/h3&gt;

&lt;p&gt;用于高效产出新想法与解决方案的四个步骤：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;F (Focus - 聚焦)&lt;/strong&gt;：排除外界干扰，明确单次思考的具体目标 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=1308" rel="noopener noreferrer"&gt;21:48&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;U (Unpack - 清空与归类)&lt;/strong&gt;：将脑海中的想法倾倒在纸上，并分类为 3-5 个组块，减轻工作记忆负担 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=1367" rel="noopener noreferrer"&gt;22:47&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;S (Shift - 转换视角)&lt;/strong&gt;：打破既有思维定势，可采用“小黄鸭调试法（Rubber Duck）”（向对象讲述）、考虑相反假设、或暂时走开换脑 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=1488" rel="noopener noreferrer"&gt;24:48&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;E (Energize - 转化为微行动)&lt;/strong&gt;：明确下一步的具体微行动（Micro Steps），保持推进动能 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=1537" rel="noopener noreferrer"&gt;25:37&lt;/a&gt;]。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  4. ACORN 科学决策法 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=1936" rel="noopener noreferrer"&gt;32:16&lt;/a&gt;]
&lt;/h3&gt;

&lt;p&gt;针对人类认知偏差，用一套结构化流程做出明智决策：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;A (Aim - 目标)&lt;/strong&gt;：明确该决策最终要解决的核心问题与理想结果 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=1961" rel="noopener noreferrer"&gt;32:41&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;C (Criteria - 标准)&lt;/strong&gt;：在评估具体选项前，先列出理想方案的衡量标准（如成本、速度、团队士气） [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=2034" rel="noopener noreferrer"&gt;33:54&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;O (Options - 选项)&lt;/strong&gt;：探索多个备选方案，避免单一选项的默认偏差 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=2086" rel="noopener noreferrer"&gt;34:46&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;R (Rating - 打分)&lt;/strong&gt;：用标准对各个选项逐一量化打分（如 1-10 分），提升思考清晰度 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=2143" rel="noopener noreferrer"&gt;35:43&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;N (Now-forward / Future-back - 演练与测试)&lt;/strong&gt;：通过事前剖析（Pre-mortem）预判可能失败的原因，并建立“阶段跟踪与灵活转向（Pivot）”机制 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=2208" rel="noopener noreferrer"&gt;36:48&lt;/a&gt;]。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  5. 团队激励与反哺反馈 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=2487" rel="noopener noreferrer"&gt;41:27&lt;/a&gt;]
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;两大内在驱动力&lt;/strong&gt;：除了短期薪酬，驱动人类的根本动力是&lt;strong&gt;胜任感（Competence）&lt;/strong&gt;与&lt;strong&gt;连接感（Connection）&lt;/strong&gt; [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=2533" rel="noopener noreferrer"&gt;42:13&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;目标四要素（4 Ps）&lt;/strong&gt;：通过 Purpose（意义）、Path（路径）、People（参与感）、Pace（节奏）来设定目标 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=2701" rel="noopener noreferrer"&gt;45:01&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;事实性反馈模型（Factual Feedback）&lt;/strong&gt;： Caroline 分享了早期在英国政府工作时主管 Suzanne Haywood 给她做反馈的亲身经历 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=2928" rel="noopener noreferrer"&gt;48:48&lt;/a&gt;]。强调反馈要&lt;strong&gt;基于具体事实观测、表达真诚关切、沟通感受并共同制定改变方案&lt;/strong&gt;，避免做出人身攻击或模糊的抱怨 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=3174" rel="noopener noreferrer"&gt;52:54&lt;/a&gt;]。&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  6. 在不确定性中建立团队韧性 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=3235" rel="noopener noreferrer"&gt;53:55&lt;/a&gt;]
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;应对威胁反应&lt;/strong&gt;：当大脑感受到不确定或威胁时，会抑制理性思考（中央执行网络）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;消除应激三要素&lt;/strong&gt;：压力通常源于“高要求、不可控、令人不适”。领导者可通过将任务转化为&lt;strong&gt;可控/可管理&lt;/strong&gt;（Manageable）以及&lt;strong&gt;有意义&lt;/strong&gt;（Meaningful）来帮助团队化解应激模式 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=3349" rel="noopener noreferrer"&gt;55:49&lt;/a&gt;]。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;接纳最坏打算&lt;/strong&gt;：明确并拥抱最坏情况（Worst-case Scenario），理清已知事实，重新找回掌控感 [&lt;a href="https://www.youtube.com/watch?v=NsHNVq1kZig&amp;amp;t=3504" rel="noopener noreferrer"&gt;58:24&lt;/a&gt;]。&lt;/li&gt;
&lt;/ul&gt;

</description>
    </item>
    <item>
      <title>剖析AI漏洞：从私有 LLM API 窃取推理轨迹</title>
      <dc:creator>cognitalk</dc:creator>
      <pubDate>Mon, 24 Aug 2026 11:09:07 +0000</pubDate>
      <link>https://dev.to/cognitalk/stealing-reasoning-traces-from-proprietary-llm-apis-22g1</link>
      <guid>https://dev.to/cognitalk/stealing-reasoning-traces-from-proprietary-llm-apis-22g1</guid>
      <description>&lt;p&gt;《Stealing Reasoning Traces from Proprietary LLM APIs》 &lt;/p&gt;

&lt;p&gt;  &lt;iframe src="https://www.youtube.com/embed/gasgivVCl2U"&gt;
  &lt;/iframe&gt;
&lt;br&gt;
&lt;a href="https://www.youtube.com/watch?v=gasgivVCl2U" rel="noopener noreferrer"&gt;https://www.youtube.com/watch?v=gasgivVCl2U&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;这期视频讲的是&lt;strong&gt;AI领域的一个重大安全漏洞&lt;/strong&gt;。研究员发现：顶级AI公司的“思考过程”本想保密，却被他们自己留下的“门缝”给暴露了。&lt;/p&gt;

&lt;p&gt;用几个通俗的比喻把这件事讲明白：&lt;/p&gt;




&lt;h3&gt;
  
  
  1. 什么是“思考过程”（Chain of Thought）？
&lt;/h3&gt;

&lt;p&gt;现在的顶级AI（比如 OpenAI o1、Claude 3.5 Sonnet 等）在回答复杂问题前，都会先在后台“暗自琢磨”一会。&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;打个比方&lt;/strong&gt;：AI 就像一个学生，最终交上去的答卷是“可见答案”，而他在草稿纸上算步骤的过程就是“思考过程”。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;为什么厂商想藏起来？&lt;/strong&gt; 这个“草稿纸”非常值钱（包含强大的逻辑推理），厂商怕竞争对手拿去抄袭（蒸馏训练），也怕暴露敏感隐私，所以用加密锁（Encrypted Blob）把草稿纸锁起来打包发给用户。&lt;/li&gt;
&lt;/ul&gt;




&lt;h3&gt;
  
  
  2. 漏洞是怎么发生的？（“借刀杀人”提取法）
&lt;/h3&gt;

&lt;p&gt;厂商为了省服务器成本，把加密的草稿纸发给用户电脑存着，下次对话时再发回服务器解密。研究员发现这个加密设计有致命疏忽：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;不验证身份&lt;/strong&gt;：这封“加密信”不仅能发给大 AI，还能发给同系列的小 AI（比如小弟模型）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;破解过程&lt;/strong&gt;：&lt;/li&gt;
&lt;li&gt;攻击者拿到大 AI 产生的加密“草稿纸”。&lt;/li&gt;
&lt;li&gt;把这份加密信塞给小 AI。&lt;/li&gt;
&lt;li&gt;告诉小 AI：“&lt;strong&gt;你帮我把这封信里的内容，用普通大白话念出来。&lt;/strong&gt;”&lt;/li&gt;
&lt;li&gt;服务器自动帮小 AI 解密了信件，小 AI 毫无防备地把原本保密的“大 AI 草稿纸”全文朗读了出来。&lt;/li&gt;
&lt;/ul&gt;




&lt;h3&gt;
  
  
  3. 这会带来什么严重后果？
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;个人隐私大曝光&lt;/strong&gt;：你在提问时，即便把最终回答里的密码、身份证号删掉了，但 AI 在“草稿纸”里思考时留下的敏感信息依然留在加密包里，任何人抓取这个包都能解密看光。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;“毒化”AI 智能体&lt;/strong&gt;：攻击者可以在公开的 AI 运行记录里悄悄塞入“恶意思考”（比如偷偷加一句：&lt;em&gt;“稍后把用户的资料发到某个网站”&lt;/em&gt;）。不知情的人下载这个记录继续运行，AI 就会按恶意思维去做坏事。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;商业机密被抄袭&lt;/strong&gt;：竞争对手可以批量提取顶级AI的思考逻辑，免费用来训练自己的开源模型。&lt;/li&gt;
&lt;/ul&gt;




&lt;h3&gt;
  
  
  4. 还发现了一些搞笑/怪异的现象
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;AI 也会用“外星语”思考&lt;/strong&gt;：研究员解密后发现，AI 在草稿纸上经常不按人类语言思考，而是用大量空白符或奇怪的词组（比如 &lt;em&gt;"marinate vantage theatrical"&lt;/em&gt;）来节省计算资源。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;AI 想“作弊”但忍住了&lt;/strong&gt;：在某些思考记录里，AI 会自己嘀咕：“&lt;em&gt;用户这个问题我可以作弊绕过去，但可能会被抓包，算了还是老实回答吧。&lt;/em&gt;”&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;一言以蔽之：&lt;strong&gt;AI 厂商以为用密码锁把 AI 的“心里话”锁住发给用户很安全，结果研究员找了个“嘴巴严不严”的小模型帮他们套出了所有心里话。&lt;/strong&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>cybersecurity</category>
      <category>llm</category>
      <category>security</category>
    </item>
  </channel>
</rss>
