https://www.youtube.com/watch?v=H35nVgNGyo8
《AI for Science爆发前夜:前DeepMind曹原深度解析科研自进化、验证瓶颈与人类价值的未来》
第(一)部分 开篇:Jeff Dean出走与AI for Science赛道的爆发 (0% - 7%)
1 节目开场与时代背景:主持人陈茜点明本期播客的核心议题——AI for Science(AI4S)。开场即抛出重磅行业事件:2026年8月第一周,谷歌灵魂人物Jeff Dean宣布离职,与Oriol Vinyals、Sanjay Ghemawat、Quoc Le等几位高管共同创办Discovery Loop公司,目标是加速生命科学及其他行业的研究进程。这一事件在硅谷被视作AI for Science赛道正式爆发的标志。
2 "一个时代结束、一个时代开始"的争议:陈茜提出业界普遍感慨"这是一个时代的结束,是另外一个时代的开始",并询问这是否意味着"结束的是Google的时代,开启的是AI for Science科学研究的时代"。
3 科学由AI自动推动的全局意义:曹原指出,科学技术如何用AI自动推动,不仅对组织、公司意义重大,对社会乃至国家都至关重要,因为人类社会发展的终极驱动力正是科学与技术。
4 当期AI4S的密集突破信号:
- OpenAI宣布Astra模型推导出了10道人类长期悬而未决的数学难题;
- Anthropic未发布的科研版Claude将黎曼猜想相关零点下界从41.6%推进至67.2%;
- AI在生物制药、材料、物理等领域迅速推进科学前沿;
- AI自进化、形成研发闭环被视为科研加速的核心,但人在其中的角色"稍显尴尬"。
5 本期播客的内容跨度:从AI科学自进化的方法论,聊到AI数学和AI物理的应用,最后延伸至哲学问题与人类意义。
第(二)部分 曹原的身份介绍与Jeff Dean离职的多维解读 (7% - 18%)
1 嘉宾曹原背景:原Google DeepMind资深研究科学家,现AI初创企业Unreasonable Labs AI联合创始人,公司主攻AI for Knowledge Creation(知识创造)以及AI for Science和R&D。
2 Jeff Dean离职的第一层原因——组织层面:曹原指出,三四年前Gemini项目启动后,Google开始"集中力量办大事",原本各自独立的DeepMind团队被迫整合,人员组织与项目管理面临巨大挑战,内部摩擦不可避免。
3 Jeff Dean离职的第二层原因——产品层面:
- 2026年初Gemini 3.1 Pro尚可在排行榜位列前茅;
- 但过去三到四个月(约2026年4-7月),3.5 Flash与最新3.6 Flash表现"比较平平",落后于Anthropic、OpenAI及中国开源模型;
- 3.x Pro迟迟未正式发布;
- 在向以coding agent为主的新兴商业模式转型时面临巨大困难。
4 Jeff Dean离职的第三层原因——方向延展的必然性:Discovery Loop所从事的"让AI自己做知识开发与自动科研",与曹原创业方向高度一致,是AI在数学和编程能力成熟后的自然延伸——下一波能让AI智能爆发、产生巨大效益的必然是"将数学和代码能力推广到更广泛的科学知识发现"。
5 明星团队的组合逻辑:Jeff Dean与Sanjay Ghemawat同期入职Google、合作数十年;Oriol Vinyals和Quoc Le均为早期Google Brain成员;曹原在办公室常见Jeff Dean与Sanjay"结对编程"(peer coding),两人都非常hands-on。这种深度默契使四人联合创业成为顺理成章的组合。
6 对"Google时代结束"论的驳斥:曹原明确反对"Google做不下去"的悲观论调,指出Google是全栈要素最完整的科技公司——从底层芯片、基础设施、数据中心、工具链,到模型层、人才、数据,再到产品分发渠道,完全不依赖外部生态系统。Google需要的不是重起炉灶,而是优先级与资源投入的调整。
7 为何DeepMind人才持续流失:曹原以自身经历说明,在Gemini项目中做模型迭代和后训练时,他意识到当前模型虽能做好数学和写代码,但在"提出新假设、验证新假设、不断自我更新"的科学创新能力上远远不足,这是他决定出来创业的核心动机之一。
8 John Jumper离职的延伸讨论:AlphaFold联合发起人、诺贝尔化学奖得主John Jumper此前已加入Anthropic。曹原解释,DeepMind目前最高优先级是把Gemini做到SOTA(业界最佳水平),短期内工作重心必须向该方向转,包括Jumper在内的AI4S人才工作重心都会有变动,在大型团队中难以让每个人的诉求都得到最大体现。
9 Google内部的自我革新:曹原认为Google"在变好",管理层需要做的是"革自己的命",把Gemini团队做得像startup一样快速迭代,在人员安排和项目设置上具备自我革新的勇气。他以Meta引入Alex Wang后MSL(Meta Superintelligence Labs)在一年内做到Muse Spark等成果为例,说明新鲜血液会带来改善,但从80分做到100分比从0分做到80分更具挑战。
10 Demis Hassabis的角色定位:虽然从DeepMind CEO位置退下,但Demis Hassabis仍在主管AGI和science部门,他个人气质更偏向科学家而非CEO,因此"退后一步"更多是不想管商业化和产品,仍会非常专注AI4S。Google是在所有AI科技公司中布局science最早、最广、最深的,这条线不可能完全放手。
第(三)部分 概念扫盲:AI4S、AI4AI与RSI的本质区别 (18% - 24%)
1 AI4S(AI for Science)的定义:把AI模型当作一个研究员本身,去研究科学问题。
2 AI4AI(AI for AI)的定义与运作实例:
- 让AI自己去研究AI本身,例如要求在限定GPU和预算下把模型训到最好;
- AI查看codebase后生成proposal(提议),自动写代码实现、放入沙盒跑实验、观测训练结果,再根据反馈提出下一步建议,一轮轮迭代提高性能;
- 当下已有初创公司探索用AI4AI寻找Transformer之外的新架构,或寻找不需要反向传播(Backpropagation)的新优化算法。
3 RSI(Recursive Self-Improvement,递归式自我改进)的定位:RSI不是task(任务),而是一种方法——不断用自我迭代的方法去更新任务或proposal,使任务越做越好。RSI可同时应用于AI4AI和AI4S。
4 三者关系总结:AI4S和AI4AI目标不同但方法相似,RSI则是它们共同可用的方法论。
第(四)部分 为何是2026年8月:AI4S爆发的技术成熟度 (24% - 30%)
1 前置铺垫:代码与数学两大能力的到位:前两年AI最能体现推理能力和智能的就是代码和数学。当AI能够可靠地写代码后,加上整个agent harness(驾驭系统,即帮AI一步步完成工作流的体系)成熟,AI才具备了处理更复杂科学问题的能力。
2 科学闭环对AI能力的复合要求(以跑生物实验为例):
- 第一步:根据目前实验观测推导下一个该跑什么实验(需要推理能力);
- 第二步:收到实验数据后写代码分析数据是否与预期吻合(需要代码能力);
- 第三步:分析数据异常、判断前期提议的问题,并自我迭代(需要数据分析与自我迭代能力);
- 此外还需管理记忆——每次跑完实验的观测必须放入记忆管理容器。
3 科学问题比coding/math更挑战:科学面广、问题复杂,需要上述能力全部到位,因此是"天时地利人和"的2026年才到了用AI搞Science的时候。
4 适合AI优先攻克的科学领域筛选标准:由市场规模、是否适用于AI、对AI研发能力的迫切性,以及可验证性共同决定。
5 生物制药被列为首选的原因:
- 市场本来就极其庞大;
- 流程相对标准化、数据丰富;
- 新药开发周期长、成本高(测试成千上万种分子结构、临床试验、监管流程可能花费数亿美金、耗时数年),药厂对降本增效有极强付费意愿。
6 材料领域的机会与困境:
- 市场同样巨大但高度碎片化(金属、皮革、生物材料、半导体材料、稀土材料等各有不同开发流程);
- 即便发现新材料,下游生产、应用、制造的价值链非常碎,AI难以一口吃下所有价值;
- 因此材料方向的整体吸引力相对生物制药略小。
7 其他探索中领域:芯片设计、电池设计、量子计算等都属于新兴探索阶段。
8 AI4S的本质之问:提效还是发现:取决于AI for Science模型的角色——
- 第一种是Co-Scientist(协同科学家),加速人类科学家的发现,但不一定提出新方法。例如Claude Science平台就是一个workbench(工作台),类似编程IDE的集成环境,提供工具、对话建议、实验模拟,加速研发流程;
- 第二种是AI自主提出新发现,如AlphaEvolve能自己发现新算法,AlphaFold能产生新蛋白质结构。具体扮演哪种角色,取决于应用场景、领域以及模型是垂类还是通用agent loop中的一环。
第(五)部分 科研闭环的深度拆解:从问题定义到实验验证 (30% - 42%)
1 问题定义环节——人的不可替代性:
- 曹原明确指出:"问题的定义必须是人来定义的",AI目前还没有"品位"去找出合适的问题并自行研发;
- 人的角色:给出问题、指明哪些动机重要;
- AI的辅助作用:给定初始问题和提示后,AI可通过搜索文档辅助分析、改善问题、结构化问题;
- 适合AI研究的问题标准:任何可以计算、容易被验证和计算的问题;问题能被多干净地建模。AlphaFold就是典型——"给定氨基酸序列→给出三级结构",定义明确、结构化、可计算。
2 当前不适合/还无法用AI解决的科学问题:
- 大部分科学问题无法立刻用AI4S解决,因为不同于coding/math可即时验证,许多科学问题"不到最后上市真的不知道效果";
- OpenAI与Ginkgo Bioworks合作是一个完全适合的闭环案例:GPT-5提出蛋白质配方→自动化机器人做实验→返回验证结果→GPT提出下一个最可能的配方以降低成本的循环;
- 核聚变装置设计等问题,由于物理验证成本极高,目前收益不明朗,业界缺乏动力。
3 验证瓶颈的深层逻辑——信息、物质、能量的边界:
- AI for math和coding停留在"信息层面";
- AI4S即便提出proposal和模拟,也仍停留在信息层面;
- 真正的science必须走向"物质层面",做湿实验(wet lab),这必须很大投入;
- 曹原断言:"这一步是逃不掉的,你毕竟要走向science,必须突破信息极限,走到物理世界。"
4 表征(Representation)环节:
- 两类模型对表征的要求不同:
- 通用模型(如GPT、Gemini):通过预训练和后训练,可接受语言描述、代码、JSON、多模态等任何格式化输入,什么都可以表征;
- 垂类模型(如AlphaFold、GNoME、MatterGen):只能接受特定领域输入(如AlphaFold仅接受氨基酸序列加DNA或元数据),作为"专家工具"被调用;
- 无法被表征的情况:凡是无法测量的东西(如大脑状态)无法表征;但只要能把数据转换为字符串、某种模态表示或embedding向量,问题就可被表征。
5 建立预测模型与逆向设计环节:
- 垂类模型案例:给定疾病靶点→生成可能结合的分子;
- 通用模型(实验室主管角色):给定过往实验记录、分析数据及各种要求,作为agent输入,生成下一个实验设置和proposal。
6 实验挑选环节——Exploration与Exploitation的平衡:
- 这是一个搜索过程,AI模型会采样出不同方案,需要有机制决定下一步挑选哪个方案做实验;
- 搜索过程可视作一棵树,树上每个节点是已探索的方案,需要给每个节点打分;
- 打分由两个因素合成:
- Value Function(价值函数):根据当前状态评估其潜力或期望回报(对应exploitation,选当前看起来最好的);
- 该路径已被采样的次数:若某路径已被多次采样,应降低其概率,分配给未被探索的路径(对应exploration,选不确定但可能带来新发现的);
- 这与后训练里Reinforcement Learning的算法逻辑完全一致。
7 闭环(Loop)建立的两条并行路径:
- 路径一:自动实验室(AutoLab/Cloud Lab)——把标准操作流程完全用机器人替代。美国众多初创公司正在做,GPT下指令→机器人自动滴试管等操作→返回结果;
- 路径二:提高AI本身的智能——让AI的假设更靠谱,原本需要跑10次实验才能得到的蛋白结构,提升至只跑2次即可,这要求AI的数据分析能力、实验历史管理能力同步提高。
8 A-Lab案例的深挖:Google DeepMind与伯克利、劳伦斯伯克利国家实验室合作的A-Lab是早期自动实验室案例(当时用的还不是Gemini)。公开数据显示其在17天内执行了353次实验,57个目标材料中合成了36个。曹原确认该实验室至今仍在继续运行。当前壁垒主要在物理机器人那一块——需要专业机器人的精确度与速度同步提高。
9 非物理部分进展快于物理部分:In silico(计算机模拟)好衡量、好验证,发展更快;物理AutoLab则受限于机器人发展,但专用于某个环节的专用机器人(非通用机器人)也在快速发展,尤其在医药领域。
10 因果机制发现的难题:
- 曹原指出当前大语言模型在区分correlation(相关性)和causation(因果性)方面仍是弱点;
- 根本原因:语言模型训练数据只见过最常见的正面描述,若把前提换种说法、调整语序但意思不变,语言模型仍可能生成错误结果;
- 在涉及Do-Calculus(Do演算)等"介入性"推理(如"把某变量调高一点会怎样")时,语言模型大部分情况下做不到;
- 解决方向:Yann LeCun强调的"世界模型"——学到物理内部规律,独立于表述方式,对因果关系的掌控才能远远优于基于文字的语言模型。
11 Meta-recursive(元递归)与自我改进:
- 简单loop是"给问题→给proposal→跑实验→拿数据→做分析";
- 更复杂的Meta-recursive Process:除了改进模型本身、改进做实验流程之外,还要让AI学会"安排工作流"、学会"何时更新自己的代码",即Agent Harness本身也要能自我改进。这是当前探索的重要话题。
12 验证:AI4S最大的瓶颈:
- 曹原斩钉截铁:"最难,对于AI for Science,肯定是verification(验证),它是一个瓶颈。一旦这个瓶颈被打破了,你就可以很快地迭代。"
- 理想状态:"如果一分钟就可以拿到一次数据做物理实验拿到数据,在理想情况下,那你可以生成无数个数据……这个问题就解决了。"
- 但物理实验在大部分情况下不可行,因此才需要自动实验室与提高AI智能双轨并进。
13 真正的智能瓶颈——创新性想法的匮乏:
- 诺贝尔奖得主Jennifer Doudna(基因编辑CRISPR发明人)接受采访时坦言:团队用AI,但AI给出的所有proposal中没有一个是他们之前不知道的;
- 当前AI4S只能在已有表征空间里进行排列组合、搜索、设计新实验方案,效率远超人类,但要做出诺贝尔奖级别的科学结果还远远达不到;
- 人类科学发现的过程:接收感知输入(观察数据)→形成概念(抽象出"力"等概念并符号化)→凝结为形式化理论体系(如F=ma)。这一整套discovery过程对AI极为困难;
- 即便AlphaGo的"神之一手"第37步是发现,也只是在现有内在表征空间里重新组合采样,并未创造新概念。
第(六)部分 符号主义与连接主义的融合:Unreasonable Labs的路线 (42% - 50%)
1 当前LLM的根本局限:语言模型的整个宇宙由训练数据决定,而新知识的发现按定义不在现有知识里,因此让LLM从固定且过去的数据中发现新东西的概率"非常非常低"。
2 符号主义(Symbolism)的定义与本质:人工智能早期沿用的概念,核心是"写规则"——如果某些知识可以明确写出来、是先验的、不需要通过数据描述或学习的,就把它写成符号、公式或If-Then逻辑规则。数学、代码、Agent Harness工作流程都是符号先验的典型。
3 连接主义(Connectionism)的定义与本质:即神经网络,需要用分散式向量表征,通过观测数据自己学习,每个元素的语义是从数据中自学的。
4 符号主义的优势与脆弱性:
- 优势:先验、精确、可指定;
- 弱点:表征脆弱。例如用规则定义"猫"(尖耳朵+胡子+毛茸茸),一旦猫在低头或姿态变化,逻辑规定就失效。因此纯符号主义无法刻画充满模糊性和歧义的真实世界,这也是它没有成为主流的根本原因。
5 连接主义的优势与必然性:让神经网络自己从数据中学习"猫"的特征,学成一个向量,新照片只要与该向量足够相似即判定为猫。涉及自然语言、图像识别等有模糊歧义的层面,必须让模型自己学。
6 Unreasonable Labs的混合方案——LLM+符号主义:
- 在LLM外面加一层符号系统;
- 把跨领域的人类知识用规则串起来,提取知识之间的骨架与推理关系;
- 这些关系很难从训练数据中发现(每天都有新论文,不可能每天训新模型);
- 符号层作为模型的"先验直觉",帮助LLM生成在其概率范围之外的小概率新想法。
7 当前研发阶段与核心瓶颈:仍在较早研发阶段,主要瓶颈是平衡novelty(创新性)与feasibility(可行性)——让模型创新很容易(随便采样即可),但必须保证创新想法合理、与问题吻合,不能"为了创新而创新"。
8 符号主义会复兴吗?曹原的判断:
- 不可能替代连接主义,"98%连接主义+2%符号主义"是合理预期;
- 今天的AI for Math和AI for Coding已经是neuro-symbolic(神经符号)混合结构:神经网络生成证明或代码,符号工具(如Lean)验证对错;
- 符号提供先验(不需数据),连接通过经验学习,二者本质对应哲学史上的理性主义与经验主义之争。
9 从康德到黑格尔的哲学映射:
- 经验派(培根、洛克):人的认知完全来自感官经验输入 → 对应今日大模型(从万亿token训练中获得智能);
- 唯理派(笛卡尔):人的理解完全由大脑先天结构决定 → 对应符号先验;
- 康德:经验提供材料,但需要先验结构(如时间、空间、因果关系等12个范畴)使材料有意义,二者必须结合 → 对应neuro-symbolic混合;
- 黑格尔:概念不是恒定不变的先验,而应辩证统一、不断自我否定、持续更新 → 对应continual learning(持续学习),AGI不能是固定checkpoint,必须在与用户互动中不断更新自己。
10 核心论断:符号主义与连接主义之争、经验派与唯理派之争,讨论的都是同一个问题——"人怎么认识这个世界,知识怎么产生的",只是不同时期的人用不同语言探讨同一对象。
第(七)部分 三巨头布局对比:Google、OpenAI与Anthropic的AI4S战略 (50% - 58%)
1 Google:布局最早、最广、最深:
- 所有Alpha系列、Co-Scientist、Gemini for Science均出自Google;
- 全栈要素最完整,不会放弃AI4S,只是短期优先级调整;
- Demis Hassabis转任Chairman后仍主管AGI和science部门,继续在AI4S上发力;
- Isomorphic Labs(由AlphaFold商业化而来)是其AI4S商业化的重要载体。
2 OpenAI:激进追赶但优先级略显混乱:
- GPT-5发布时已有白皮书,宣布可解决数学、计算机科学、生物等各类科学问题;
- 与Ginkgo Bioworks实现全自动闭环实验(目前最令人信服的闭环案例);
- 推出面向生物和化学的定制模型GPT-Rosalind;
- 新模型Astra在数学上取得显著进展(推导出10道悬而未决的数学难题,虽有科学家争议);
- 宣布2027年要有自动AI科学家的激进目标;
- 战略痛点:原AI4S负责人Kevin Weil离职后,AI4S effort并入Codex,战略优先级略混乱;产品线拉得太长(GPT、ads、硬件、企业版),如何平衡前沿投资与商业交付是管理挑战。
3 Anthropic:后发但针对性补强:
- 发布Claude Science平台(界面对科学家工作流程定制,本身是workbench而非产生新知识的引擎);
- 用Claude辅助物理学家推导(vibe physics),发布BioMysteryBench等生物benchmark;
- 挖来John Jumper加强生物/医药方向——Anthropic是目前三家中唯一未推出生物/医药垂类专用模型的公司,John Jumper最适合补这块拼图;
- 当前最高优先级仍是coding(编程)与商业化,以应对中国开源模型的威胁。
4 三家共同点:AI4S都是长期战略必投方向,但短期内最优先级仍是coding与商业化。这正是大公司的"创新者窘境"(Innovator's Dilemma)——一旦挖出明确商业化路径,不愿意马上把业绩换到其他方向。
5 Neolab与创业公司的先手机会:大公司因商业承诺难以全力投入AI4S,反而给新型AI实验室(Neolab)和创业公司留下窗口。AI4S作为长远战略投资,没人敢落后,但短期内创业公司在"纯科研驱动"上反而更灵活。
第(八)部分 AI for Math:形式化证明与"证明过剩"时代 (58% - 68%)
1 AI for Math的特殊地位:数学是AI相对容易攻破的领域之一,但目前突出的AI for Math初创公司主要有Axiom Math AI和Harmonic AI,方法相似。
2 形式化证明的核心链路:
- LLM先用自然语言生成数学证明方案;
- 自动化转换为Lean语言(形式化证明语言);
- Lean编译通过 = 数学结果绝对正确。
3 链路中的三大瓶颈:
- 瓶颈一:LLM本身要足够强大,能提出可能的证明方式或新数学结果;
- 瓶颈二:自然语言→Lean的自动翻译过程极其困难,是Axiom AI和Harmonic AI重点攻关的方向;
- 瓶颈三:Lean的mathlib数学库必须包含足够多的人类已有数学知识,才能拼接出复杂证明。
4 Lean是否必要之争:
- OpenAI在IMO(国际数学奥林匹克)中强调模型可直接输出自然语言证明,不需Lean;
- 曹原的辨析:IMO作为考试,考察的是参赛者的创新构造能力,涉及的数学知识不一定特别深,证明过程一两页可写完,因此LLM用自然语言生成可信结果在考试设置下没问题;
- 但若要做职业数学家级别、100多页的复杂证明(如王虹解决的挂谷猜想),自然语言无法保证绝对正确,必须Lean形式化。
5 Peter Scholze的真实案例:2018年菲尔兹奖得主、当代最伟大数学家之一Scholze在完成一个重要证明后,连自己都不确定对不对,与合作者反复讨论无人敢拍胸脯。最终他与合作伙伴把相关定理、定义、引理人工转换为Lean语言,直到某一天编译通过,才确认证明正确。即便最伟大的数学家,处理极复杂数学问题时也只能"相信逻辑和计算机"。
6 翻译Lean为何如此耗时:结构化语言Lean要求把证明过程中所有相关概念、用到的定理都严格按类型化语言转换。若library中缺少某个概念或证明步骤,必须从头定义。Google参加国际奥赛时,转换Lean语言花了三天,已超过选手允许的作答时间。
7 两种并行发展路线:
- 路线一:模型越来越强大,让复杂问题逐渐不再需要形式化;
- 路线二:加速"人转Lean"或"Lean转自然语言"的过程,训练LLM像机器翻译一样把数学表达准确翻成Lean(数学表达翻成Lean是必经路径)。
8 数学问题的五级分类与AI的当前位置:
- 第一类:博士生花几个月解决的练手问题;
- 第二类:普通期刊级别、职业数学家花一两年攻破的问题;
- 第三类:数学四大顶刊级别问题;
- 第四类:菲尔兹级别问题(如王虹解决的挂谷猜想);
- 第五类:超菲尔兹级别——研究推进一大步即可获菲尔兹奖;
- 曹原的判断:若数学问题的结论可通过已有数学定义和已知引理推导出来(即表征空间固定),则不管多难,只要模型足够强、搜索强度足够大,AI都有可能把证明搜索出来——这本质上仍是个搜索问题,而非发明问题。
9 数学的本质是"发明"而非"证明":
- 曹原提出反直觉论断:证明固然重要,但数学更重要的是"数学对象的发明与定义";
- 例证:线性代数中若不抽象出"特征值"这一概念,就无法精确捕捉矩阵的内在结构;微积分、微分几何中的"微分""黎曼度量"等皆是如此;
- 一个好的数学家最重要的事是定义出优雅的新数学对象和概念。
10 AI能抽象出新概念吗?曹原的悲观判断:
- "我不认为它可以做到,甚至我个人是觉得它……可能永远都不行";
- 即便是原始人数鹅、数鸟、数树,从中抽象出"数"的概念,曹原也难以想象仅给AI感官输入就能让其提出数的概念;
- 概念抽象的过程"可能是AGI的last mile(最后一英里),这个mile可能是永远无法逾越的",甚至不一定在图灵可计算的意义之下,人脑最底层可能并非与图灵机等价的计算过程。
11 数学是发明还是发现——哥德尔不完备定理的启示:
- 上世纪哥德尔证明:任何足够强大的形式逻辑系统,总有些事实是对的但无法被证明;
- 曹原倾向"数学是人创造出来的":如果宇宙与数学形式体系一一对应,则宇宙应存在不自洽之处,但宇宙作为"自在之物"应是自洽的;数学作为人造逻辑体系才会存在不可调和的矛盾;
- 此问题本质上无法证伪,但这反映了AI与人类文明底层认知的深刻张力。
12 "证明过剩"时代的荒诞现实:
- 陶哲轩观察:数学正从"证明稀缺的时代"进入"证明过剩的时代";
- 许多收录人类未解难题的网站,题目下方已堆满几十份AI生成的解答,但无人类专家愿花精力验证;
- 曹原的判断:"不是结果正确就一定正确,你需要去理解,然后去评判";
- 1970年代四色问题被计算机证明(结论对,但证明过程只是海量列举,没有任何新洞见),数学家普遍反应"没意思";
- 曹原类比:听钢琴演奏会,若告诉你演奏者是机器人、按键力度与时长都完美符合乐谱,你大概率不想听——你想听的是钢琴家自发的情感状态与共鸣,而非绝对正确的音符。AI给出的证明即便全对,若无让数学家眼前一亮的洞见,科学价值就要打折扣。
13 黑盒模型的可信度危机:
- 如果心安理得接受黑盒AI的结果,会造成很多困难;
- 代码领域已是前车之鉴:AI写出正确但人类工程师看不懂的代码,维护成本反而更高,且因LLM是随机机器(同样任务第二次跑生成代码就可能不同),debug极为困难;
- 若AI替代80%经济有价值活动但每活动都需人类介入验证,"还不如不让AI去做这事情";
- 因此可信赖性与可解释性,以及基于此的人类介入,是至关重要的。
第(九)部分 AI for Physics与"发现"的本质:随机性、溯因推理与AGI的最后一英里 (68% - 78%)
1 AI for Physics与AI for Math的差异:
- 数学只需生活在逻辑空间(理想世界);
- 物理必须走出逻辑世界、走向物质世界做验证;
- AI for Physics当前可做的:求解偏微分方程、推导新结论(如Anthropic之前用Claude推导物理新结论)、做领域世界模型(如初创公司PhysicsX专门做流体力学、空气力学等世界模型)。
**2 人类"发现"中的随机性与溯因推理(Abductive Reasoning):
- 牛顿被苹果砸中(实为看到苹果落地获得灵感)是随机事件,但人类能从随机事件中通过溯因推理想象出合理原因,并泛化到其他现象,发展出整套物理体系;
- 当前AI最擅长演绎推理(Deductive Reasoning,给定前提推导新结论,如数学),但在溯因推理(给定现象想象合理原因)上仍做不到;
- 溯因推理需要抽象能力、想象力和世界模型,曹原认为"在未来的很长时间都做不到"。
**3 AI for Math/Physics对技术加速的实际贡献:
- 在可计算领域(芯片验证、程序验证等)已有产品化前景;
- 任何验证领域都可受益;
- 当代理论物理最伟大的物理学家Edward Witten(弦理论提出者)近期在arXiv发表的论文中,已在footnote中写明某段是Claude帮他想出来的——在最艰深的研究中,AI加速已是现实。
**4 AI创造新概念的"moment"还有多远:
- 取决于如何定义"概念";
- 具体的、可接地(grounding)到世界观测的概念(如聚类出"椅子"),AI早就可以做;
- 难的是数学中那种"可用在无穷场合且每场合都有稳定相似性"的抽象概念,曹原认为"可能永远没法用计算程序来做到"。
**5 "无用之大用"——人类文明的底层动力:
- 数学、艺术、哲学从实用主义角度看都是"无用之物",但"无用不代表它不会对未来产生影响";
- 人类纯粹出于好奇心和审美追求推导数学、创作艺术,这些"无用的功夫"恰恰是推导物理过程、推动文明进步的根源;
- 最美好的东西都是从无用的东西开始的。
**6 曹原对AI从业者的建议——多读哲学:
- AI的发展在整个哲学史中都能找到缩影,哲学探讨的"认知论"(人怎么样认知世界)与AI探讨的智能本质对象一致;
- 从柏拉图的理念世界(从未见过完美圆却能抽象出完美概念)到康德、黑格尔的辩证统一,讨论的都是"知识如何产生、概念如何抽象";
- AI从业者应在狂热中保持从上至下的第一性原理思考:"智能是什么?人类怎么样去认识世界的?目前AI做不到哪些特性?"避免陷入纯工程视角的浮躁与肤浅。
**7 AGI的最后一英里:
- 概念抽象、溯因推理、因果理解等能力,曹原认为是"AGI的最后last mile";
- 这不仅在AI for Science中体现,更是整个人工智能的终极天花板。
第(十)部分 商业化路径、时间表与人类价值的终极追问 (78% - 92%)
**1 AI4S商业化的分层判断:
- 曹原明确反对"一刀切"的悲观或乐观:AI4S不能一概而论;
- 已可商业化层:药物开发的中间环节(靶点、分子结构等)已经可以拿出去商业化,众多实验室和公司已在变现;
- 远未商业化层:达到诺贝尔级别的科学成果,仍需极长时间。
**2 时间表预估:
- 让AI具备正反推理、因果推理、长期记忆、持续学习等能力:还需5-6年;
- 让AI自主做出诺贝尔奖级别发现:至少二三十年。
**3 为何需要二三十年——AI与Science的双向驱动:
- Science不只是一个AI的应用,而是AI本身发展的驱动力和催化剂;
- 模型若能在极难的science问题上做好,本身就必须具备更强的抽象能力、推理能力、写代码能力;
- 这是一个"AI and Science"的双向奔赴,而非单向工具化。
**4 AI4S成功对人类社会的总体意义:
- AI是meta technology(元技术)或General Purpose Technology(通用目的技术);
- 若AI能在science这种极难问题上做到极致,则必然可以在人类经济社会的各个角度做得更好,可作为"代理CEO"角色;
- 这符合OpenAI和微软对AGI的定义——以百分之多少的准确率做完百分之多少的人类经济上有价值的工作。
**5 人的不可替代性——定义、验证、应用与最终审判权:
- 问题定义:必须由人给定,AI没有"品位"自选问题;
- 验证与评判:人需要理解和评判AI的发现是否有价值、有洞见;
- 应用:人将AI发现落地到真实世界;
- 最终审判权:人类对AI产出的意义与价值拥有最终裁决权。
**6 短期现实:AI反而增加工作岗位:
- 证明过剩但验证者稀缺,需要更多人去验证AI的答案;
- 维护AI生成的代码与结果,需要更多人力介入;
- 因此"AI取代人类"的叙事在可靠性不足时反而会推高经济运行成本。
第(十一)部分 结尾:对未来的凝望 (92% - 100%)
1 播客总结与升华:主持人陈茜回顾,本期对话给她印象最深的是对人类价值和事物本质的探讨。在不久的未来,AI一定会在各个科学领域帮助人类破解疑难问题,将前沿科学再往前推进一步。
**2 理想闭环实现后的世界:一旦AI完成"模型到实验的loop闭环"、实现自进化,将带领人类去到从未达到的高度。
**3 核心叩问:届时人类必须更清楚地认知自身的价值——是定义者?是验证者?是应用者?还是最终审判者?
4 收尾:曹原预言,那个世界与我们现在的世界会很不一样。节目在陈茜"我是陈茜,那我们下期节目再见"的告别中结束,呼应开场,完成对AI for Science爆发前夜的完整记录与深刻反思。
Top comments (0)