DEV Community

cognitalk
cognitalk

Posted on

How Neural-Operators reconstruct Science AI — Anima Anandkumar, Caltech


https://www.youtube.com/watch?v=79mIutht1f4

物理世界比想象中更“宽容”:Anima Anandkumar 谈神经算子如何重塑科学 AI

Latent Space 播客对加州理工学院 Bren 讲席教授 Anima Anandkumar 的深度学习与科学计算主题专访整理。她通过神经算子(Neural Operators)这一技术主线,串联起天气预报、气候模拟、核聚变等离子体、碳封存、半导体光刻,乃至联合国科学顾问层面的 AI 治理思考。


第(一)部分 开场介绍与嘉宾学术背景(0% - 6%)

  1. 播客与主持人开场:本期为 Latent Space 播客“AI for Science”板块,由 Brandon(在 Atomic AI 从事 RNA 疗法 AI 研究)与联合主持人 RJ Honakee(Miraomics 创始人兼 CTO,从事空间转录组学)共同主持。
  2. 嘉宾隆重登场:邀请到的嘉宾是加州理工学院数学与计算机科学 Bren 讲席教授 Anima Anandkumar,她在“用 AI 建模物理世界”这一交叉方向上有着极为多元的研究积累。
  3. 学术与产业双重轨迹
    • 学术根基:在深度学习流行之前,便从事概率模型等理论奠基工作,拥有超过二十年的 AI 研究经历。
    • 产业经历:近期曾在 NVIDIA 领导 AI 研究工作,更早之前在亚马逊云科技(AWS)帮助创建云 AI 团队,构建了近十年前最早的云 AI 产品。
  4. 访谈主旨铺垫:Brandon 指出 Anima 的工作大多围绕“用机器学习为物理系统建模”展开,本期将深入探讨其背后的大型研究计划,并具体到单算子(Single Role Operators / Neural Operators)及其在天气等领域的应用。

第(二)部分 TorchLean:为神经网络提供形式化验证(6% - 18%)

  1. AI for Science 的两大支柱
    • 物理正确性:通过神经算子建模,保证 AI 在物理世界或科学领域中的表现具备一定保证。
    • 符号化验证:借助 Lean 这一形式化语言,对数学陈述进行验证,并将此能力与语言模型结合,推动数学推理的发展。
  2. TorchLean 的定位与价值
    • 它是一个框架,允许研究者像写 PyTorch 一样在 Lean 中编写神经网络,从而完全形式化,并能够无缝地进行验证。
    • 在将神经网络部署到控制回路中(无论是无人机还是核反应堆)时,人们需要鲁棒性保证,而 TorchLean 可以帮助我们对这些系统进行无缝验证。
  3. 可证明的内容:以 CROWN 为例
    • 框架内实现了诸如 CROWN 等认证鲁棒性算法。
    • 这类算法的核心是敏感性分析/界限(Bounds):证明当输入扰动在某个范围内时,输出的变化上限是多少。
  4. 核反应堆安全场景的具象化
    • 在核反应堆控制中,这种“认证鲁棒性”可以提供输入/输出界限的数学保证,从而防止熔毁等灾难性后果。
    • 除了控制回路,TorchLean 还能处理“有限精度训练带来的缺陷”、“扰动效应”等多种界限问题,将这些算法无缝融入验证回路。
  5. 框架的表达力与局限性
    • 它在抽象层上类似 PyTorch,可以优雅地定义神经层,后端则由 Lean 提供形式化证明能力,原则上可以描述任何神经网络。
    • 现存短板:Lean 本身仍有很多不足,它是基于 CPU 的,将其扩展到 GPU 存在诸多细微差别;对于 Transformer 这类极大规模的网络,在极大规模下进行高效验证仍需大量后续工作。

第(三)部分 PINN 的局限与神经算子的诞生动机(18% - 28%)

  1. 物理信息神经网络(PINN)的工作原理与困境
    • PINN 的思路是在网络中“烘焙”物理约束(即写下偏微分方程 PDE),希望优化过程能成功求解。
    • 优化通常极其困难,尤其是时间依赖问题(如流体动力学中的湍流),长期运行可能陷入混沌,导致在某些实例中完全无法求解。
  2. 从“从零求解”到“数据驱动”的范式转移
    • 许多物理问题拥有丰富的观测数据(如天气数据)。不应仅仅依赖从零开始求解 PDE,而应充分利用所有可用数据
    • 神经算子由此应运而生:它既可以利用数据,又可以添加物理约束,从而克服了 PINN 面临的失败模式。
  3. 神经算子与标准神经网络的核心区别
    • 标准神经网络:输入输出尺寸固定(例如语言有固定词表、图像有固定分辨率),无法在事后改变分辨率。
    • 神经算子:将输入输出视为连续函数,可以进行无限离散化,在推理时能够以任意分辨率给出输出,真正契合物理世界固有的多尺度特性。
  4. 解决“超分辨率”中的过拟合问题
    • 在训练时未见过的更高分辨率上做预测(零样本超分辨率)容易过拟合,需要通过正则化平滑扩展至高分辨率。
    • 引入物理损失(如 PDE 约束、守恒定律)并在比现有数据更细的分辨率上强制执行,能为正向传播提供更多指导,确保物理信息神经算子在高保真度、高分辨率下依然有效。

第(四)部分 傅里叶神经算子:架构直觉与多尺度建模(28% - 38%)

  1. 为什么选择傅里叶空间
    • 神经算子作为一类模型,允许任意分辨率的输入输出,学习函数空间之间的映射,傅里叶神经算子(FNO)是早期提出的架构之一。
    • 它在效率与表达能力之间取得了极佳的平衡
    • 傅里叶空间是一个对偶空间,能够高效捕捉非局部现象。自然中的许多现象(流体动力学、材料变形、量子化学)都是非局部的(导数的逆运算本质是积分,具有全局性)。
  2. 与 Transformer 的复杂度对比
    • 若使用 Transformer 处理极高分辨率,由于其二次方复杂度与全连接特性,将变得难以承受。
    • FNO 具有准线性复杂度,同时具备全局连接能力,能建模非局部现象,是一个理想的“中间地带”。
  3. 架构细节:不仅是傅里叶变换
    • FNO 并非纯粹在傅里叶域做线性操作。它在傅里叶层之间加入了非线性变换残差连接
    • 这类似于 Transformer 等其他神经网络的优秀设计原则,使其兼具线性基的高效与非线性的强大表达能力。
  4. 频率截断与表达力提升
    • 如果仅在线性傅里叶变换下表示信号(受限于最大频率),需要极细的离散化,导致经典数值模拟非常昂贵。
    • 引入非线性后,模型能够自己“学习”出最适合表示该信号的基础。通过将信号提升到更高维的通道空间,并在傅里叶变换之间进一步进行非线性变换,即使有限的频率模式也能通过非线性组合被充分表达。
  5. 经典数学基础与当代深度学习的融合
    • Anima 回忆,二十多年前本科论文做的正是分数阶傅里叶变换。她认同不能完全抛弃经典技术,但必须拥抱特征学习与灵活性。
    • 物理世界数据远不如语言模型丰富(天气模型仅有约 5 万个样本),因此必须思考归纳偏置(Inductive Biases),融入物理约束。

第(五)部分 Transformer 在物理世界的算力墙与数据瓶颈(38% - 46%)

  1. 物理世界的高维难题
    • 物理模拟不仅涉及 2D、3D,还加上时间维度。如果每个维度仅有几百个网格点(工业级起点约为 1000 点),上下文长度将达到数千亿甚至数万亿
    • “就算集结全世界的所有算力也不够”,永远不可能用 Transformer 处理这种规模的问题。
  2. 视觉/视频模型的“低分辨率”妥协
    • 当前的视觉和视频语言模型分辨率极低,且自回归视频模型主要是为了“看起来好看”,并非用于精确模拟。
    • 流体动力学、等离子体、材料变形等现象需要高保真度与高分辨率,不能简单降采样了事。
  3. 数据稀缺决定了必须引入结构
    • 语言模型有海量数据,而物理领域数据极其昂贵(天气约 5 万样本,聚变仅几千样本)。
    • 因此,AI 必须 Incorporate 物理世界的结构(如几何信息),才能在数据有限的情况下实现准确建模与泛化。

第(六)部分 天气预报突破:FourCastNet 的惊艳表现与演进(46% - 62%)

  1. 挑战传统:从被质疑到颠覆
    • 2021 年团队决定尝试天气建模,因为欧洲中期天气预报中心(ECMWF)的 ERA5 数据开源。当时许多气象科学家警告称,传统天气预报经过几十年的自下而上物理建模发展,AI 不可能击败。
    • 结果出乎意料:神经算子不仅准确得与传统模型几乎持平,而且速度快了数万倍。原本需要大型超算运行的任务,现在仅需消费级 GPU,且模型小巧。
  2. First 开源与生态爆发
    • 团队首个开源了天气模型 FourCastNet,并采用宽松许可证,使得众多公司、气象机构都能在其基础上构建。
    • 随后 DeepMind、华为等纷纷跟进,发布了自己的模型。这场范式转变使得全球南方的小型气象机构也能拥有与大机构同等的建模能力,实现了天气建模的民主化
  3. 从天气到气候:几何信息的引入
    • ForecastNet 1/2 的局限:早期版本未纳入球面几何,假设世界是一个矩形(墨卡托投影),导致在长期滚动预测(数月到数年)时迅速发散。
    • ForecastNet 3 的突破:融入了地球的球面几何信息。由于许多架构在短期预测上表现良好,但长期预测会爆炸(因为它们假设世界是矩形的),而融入几何信息意味着同一模型可以忠实运行更长时间,演变成气候模型。
    • Allen AI Institute 正是基于其神经算子架构构建了气候模型,这也是目前唯一有效的 AI 气候模拟器。
  4. 数据、训练与目标
    • 数据与分辨率:使用的是再分析数据(卫星与物理求解器同化),全球分辨率约为 0.25 度。
    • 训练目标:以自回归方式,给定当前风、湿度等条件,预测未来六小时的状态。
    • 从天气到气候的跨越:仅用 5 万个数据点或仅训练预测未来六小时的目标,模型竟然能稳定地滚动预测数月之久,这是非常令人惊讶的。
  5. 极端天气与概率校准
    • 模型在极端天气事件(如飓风)上表现优异。由于极端事件具有非常具体的物理特征,物理世界可能比想象中更“宽容”,不需要极大量的样本。
    • 在等离子体聚变反应中,即便仅有几千个样本,也能准确预测破裂事件,且比传统模拟快一百万倍。

第(七)部分 极端天气、集合预测与飓风 Lee 案例(62% - 70%)

  1. 确定性预测的不足
    • 面对极端天气,单一的确定性输出不够,需要概率性答案与精细的概率校准。
  2. 集合预测(Ensemble Prediction)机制
    • 通过对初始条件添加不同的噪声水平,进行多次滚动预测(Run multiple rollouts),得到多个可能轨迹。
    • 对每个集合成员独立预测,确保其各自满足物理定律,最后综合得出某地区登陆的概率,用于风险评估。
  3. ForecastNet 3 的关键改进
    • 第三个版本的核心在于不仅做确定性预测,更要通过目标函数训练使集合预测(概率预测)也是正确的
    • 在 ForecastNet 3 的论文中,给出了极端天气事件和集合预测的度量指标,并对模型进行了针对性训练。
  4. 飓风 Lee 的成功案例
    • 欧洲气象中心(ECMWF)在 2023 年秋季公开了基于 AI 的天气模型。
    • 在飓风 Lee 事件中,FourCastNet 比标准天气预报模型提早数天正确预测了飓风登陆点,展示了 AI 在提前预警、挽救生命和经济成本方面的巨大价值。
  5. 长期滚动与物理约束的未来方向
    • 目前模型能比其他忽略球面假设的天气模型做最长的滚动预测,但要做“极长滚动”仍属开放问题。
    • 需要在每个集合成员上确保物理法则的遵守,如何在长时间尺度上融入物理定律以保证稳定性,是当前活跃的研究方向。

第(八)部分 核聚变等离子体建模:数字孪生与防破裂控制(70% - 78%)

  1. 托卡马克中的复杂等离子体演化
    • 与英国原子能机构(UKAEA)合作,对托卡马克内的复杂等离子体演化进行建模。
    • 实现了比传统模拟快一百万倍的速度,本质上是创建了等离子体的数字孪生
  2. 破裂(Disruption)现象的挑战
    • 破裂是等离子体物理中困扰学界的现象:等离子体可能突然收缩成一束微小光束,向容器壁发射强冲击,损坏反应堆,导致必须停机,阻碍可持续聚变能的实现。
  3. 从模拟到控制的下一步
    • 当前正在研究设计与控制协同:通过数字孪生确保在物理有效性前提下,调整磁场以包含并稳定等离子体,理想情况下防止破裂发生,使聚变成为可能。
  4. 架构无关的“AI 中立”立场
    • 不仅与 UKAEA 合作托卡马克,也在美国与其他几个实验室合作。
    • 同时研究仿星器(Stellarator)等其他聚变路径。Anima 强调作为 AI 研究者应保持不可知论,不与任何一种物理路径绑定,让 AI 加速所有路径,避免过早淘汰某一方案。

第(九)部分 物理 AI 的广阔应用场景与基础模型愿景(78% - 88%)

  1. 从理论到应用的跨越
    • Anima 分享了自己的研究心路:从早期张量方法等理论奠基,到 AWS、NVIDIA 时期将深度学习规模化落地,如今看到纯粹数据驱动方法遇到瓶颈,开始回归“更有原则的设计”。
  2. 多样化的物理应用案例
    • 地下碳封存:模拟二氧化碳在地下的扩张与压力积聚,预测其数十年间的迁移,比传统模拟快得多。
    • 汽车与飞机气动外形:利用潜在空间(Latent Space)处理各种几何形状——可以将汽车等形状变换成“甜甜圈”拓扑,在甜甜圈上建模,再变换回汽车,从而实现跨几何形状的泛化。
    • 逆向设计与半导体:在逆光刻中设计掩模;设计量子点与非线性光子学中的门电路。AI 能够优化高度非线性的问题,找到人类手动难以发现的高效设计。
  3. 物理世界基础模型(Foundation Model for Physics)的愿景
    • 当前现状:目前多是“窄口径代理模型”(Narrow surrogates),Scope 有限。
    • 未来目标:构建能够跨越多种现象、处理多物理场耦合(Coupled physics)的基础模型,既能做模拟也能做设计。
    • 逆问题求解:不仅仅是模拟,而是问“最佳设计是什么”,通过模型隐式地直接得出最优设计。
  4. 多物理场迁移的证据
    • 虽然完全未知的物理无法零样本迁移,但通过构建课程学习(Curriculum),例如先让模型分别学习热传播与材料拉伸,再用极少样本微调耦合现象(热致拉伸),模型能够很好地完成任务。这表明真实世界具有大量可复用的结构。
  5. 开源与上手途径
    • 神经算子是一个开源库,已成为 PyTorch 生态系统的一部分,被众多研究人员和公司广泛采用。
    • 库内提供多种架构、示例与配方(Recipes),是领域专家上手将自己的问题应用于神经算子框架的最佳起点。

第(十)部分 联合国科学顾问角色、科研瓶颈与行动呼吁(88% - 100%)

  1. 加入联合国科学顾问委员会的使命
    • Anima 近期加入了联合国科学顾问委员会。在复杂的地缘政治中,确保科学家在房间内发出声音至关重要。
    • 她希望提供无偏见的科学证据,思考 AI 如何在全球范围内产生有益影响:如何让全球各地都能受益于 AI,如何实现 AI 的民主化,以及如何控制意外的有害后果。
    • 具体落地场景包括:利用更好的天气/气候模型改善全球农业等。
  2. 对 AI 监管的独到见解
    • 许多监管框架将 AI 等同于语言模型,担忧其操纵与有害影响。
    • 她强调 “AI for Science”是与众不同的:不应采取“一刀切”的监管方式。必须意识到,有些 AI 能够通过新发现改变世界,应赋能全球研究者使用它们。
  3. 最希望消除的瓶颈:算力
    • 如果被问及最想神奇消除的瓶颈,她选择“更多算力”
    • 尽管算力正快速增长(得益于 NVIDIA 等),但研究创新极度依赖算力。国家实验室正在建造更多超算,没有充足的算力就无法进行实验与创新。
  4. 对听众的行动呼吁
    • 动手实践:去使用神经算子库,亲手玩转不同架构与配方,查看用例。
    • 拓宽视野:不要将 AI for Science 仅理解为语言模型与智能体(Agents)。那些本质上是外部包装。
    • 核心认知:直到 AI 不仅能理解符号,更能基于物理世界进行模拟、设计与控制之前,AI 领域仍缺失一块巨大的拼图。人们应当以“面向物理世界的 AI”这一视角来重新思考人工智能。
  5. 结语
    • Brandon 表示访谈极具启发性,并计划亲自尝试神经算子。Anima 感谢两位主持人的深入探讨。

Top comments (0)