DEV Community

cognitalk
cognitalk

Posted on

陶哲轩 ICM 2026 演讲 -- 人工智能时代数学的价值重构


https://www.youtube.com/watch?v=sxAe4HJceFQ


第(一)部分 开场与历史序幕:数学的"基础危机"类比(0% - 12%)

1 开场致意与演讲缘起:陶哲轩在 ICM 2026 现场表达再次亲临大会的喜悦,提到与老友重聚、汲取积极能量,并直入主题——当下所有人都在谈论 AI 时代,数学界该怎么办。

2 数学百年的稳定与突如其来的剧变:他指出数学作为一个学科在过去一个多世纪里极其稳定,未曾经历过真正的生存性危机,而当下似乎正在遭遇意料之外的剧烈变化,但这种变化其实有其内在的逻辑动因。

3 二十世纪"基础危机"的历史类比

  • 二十世纪初之前,数学家们以半形式化的方式运作,欧几里得式的证明传统虽在,但集合、数、函数、极限等根本概念并未被完全公理化,数学界对数理逻辑与分析的基础信赖了数个世纪。
  • 罗素悖论(1901)、哥德尔不完备定理(1931)等发现迫使数学家重新审视那些"隐性假设"。
  • 1900—1930 年前后的"基础危机"虽动荡,却最终产出了一套明确、严谨、标准化的基础框架,并经受住了严酷检验。

4 当下危机的性质判定:陶哲轩明确提出,今天数学正在进入一个类似的动荡期——但这一次不是"逻辑基础"的危机,而是"数学价值与实践之基础"的危机。他预期,一旦共同体彻底检视并把这些基础编码化,数学界将以比以往更强韧的姿态走出危机。


第(二)部分 问题界定:共同体应对问题与"AI能力猜想"(12% - 28%)

1 核心问题(Community Response Question)的提出:面对现代 AI 技术及其真实或被宣称的研究级数学能力,数学共同体应当如何回应?他强调这是整个共同体的问题,自己并不自称掌握全部答案。

2 问题的性质:这不是一道数学题

  • 它不是一个靠证明就能终结的猜想,而是一个元数学问题,同时也交织着政治、伦理、文化维度。
  • 尽管如此,陶哲轩选择"伪数学地"借用精确的数学语言来拆解它,以便澄清论点。

3 AI能力猜想(AI Capability Conjecture)的模板化表述

  • 他将争议焦点形式化为一个带有多个"some(某些)"占位符的猜想模板:在不远的将来,某些 AI 工具将以某种成本、某种人类监督程度,在某些数学领域内完成某些研究级任务,并达到某种非平凡成功率及某种正确性与质量水平。
  • 这些"some"是变量,不同取值构成从弱版本强版本的一族猜想。
  • 若弱版本为假,数学界大可继续"一切照旧";若强版本为真,尤其是当共同体把"尽可能多解题"作为首要目标时,现有文化与制度将难以为继。

4 公开证据的局限性:他提醒,目前支持或反对该猜想的多数数据点并非在受控科学条件下收集,易受报道偏差和非科学激励影响,且部分重要成本与变量未公开披露;同时必须区分"猜想的真值"与"猜想的可欲性"——这两件事不是一回事。

5 First Proof 独立评估作为近期信号

  • First Proof(1stproof.org)是对前沿 AI 模型与 harness(工具链)的独立评估,每批包含 10 道全新研究级问题。
  • 2026 年 5 月 28 日进行的第二批测试中,4 套 AI harness 在受控条件下作答,专家从正确性与表述质量两个维度评审。
  • 结果:10 题中有 7 题被至少一个团队做到了可发表水平,单题计算成本介于 10—1000 美元之间,后续批次已在规划中。

6 本场演讲的取径:陶哲轩明确表态——本场演讲不纠缠"AI 能力猜想"本身的真假之争,而是转向与之"正交互补"的另一半问题:数学共同体的目标与价值。


第(三)部分 条件性工作假设与数学的多重目标(28% - 45%)

1 工作假设(Working Hypothesis)的设定

  • 暂时假设"AI 能力猜想的较强版本为真"——AI 将在合理时间内,以合理成本、合理人类监督,完成相当比例的研究级数学任务。
  • 他强调三件事:①这只是暂设,不要求听众相信、欢迎或接受它;②支持或反对该假设的证据,与接下来的价值分析正交;③这是一项对数学制度的"压力测试",而非技术预言。

2 隐性目标的显性化诉求:过去数学界把"目标与价值"问题委托给人文学科(数学哲学家、科学社会学家、数学教育家),自己专注于技术事务。陶哲轩论证:在工作假设下,这种"不显化目标"的奢侈将不复存在——无论猜想最终真假,重新审视"我们为何做数学"本身就已 overdue(早该进行)。

3 数学研究的多重目标清单(他坦言无人曾编译过完整列表,仅举其要):

  • 解题:解决重要的开放问题,包括纯粹无直接应用的问题与具有高价值的目标问题。
  • 理论与工具建构:发展新理论、新定义、新工具,深化对动态系统的理解。
  • 理解世界:增进对周遭世界的认知。
  • 共同体建设:数学是深度社会化的事业,共同体兴奋于数学、彼此沟通、重建联结。
  • 代际培养:投入巨大精力提携和教育下一代数学家。
  • 共享知识网络:贡献具有持久审美价值、可被后人引用的作品。

4 目标间的"AI 扰动"风险

  • 过去这些目标大体正相关、互相促进。
  • 但 AI 是无根的优化器,AI 公司是激进的优化器,二者结合是危险组合——AI 可以在不受现实束缚的情况下优化单一指标。
  • 当某些目标(如"解题数量")变得极易被 AI 优化时,其他目标将被挤压、甚至与前者背道而驰。
  • 古德哈特定律在此生效:当一个度量成为目标,它就不再是好度量。

5 目标冲突的时代到来:数学界进入一个所有目标相互碰撞、相互竞争的阶段,再也无法一次只聚焦单一目标,必须厘清何为对社会的终极目标。


第(四)部分 以"解题"为案例:证明的五阶段管道与"证明消化不良"(45% - 68%)

1 为什么选"解题"作为剖析对象:在所有目标中,"解决问题"是当前被 AI 冲击最剧烈的环节,故以其为例展开。

2 数学结果的五阶段管道(pipeline)

  • 第一阶段 · 生成(Generation):产生证明。
  • 第二阶段 · 验证(Verification):检验证明的正确性。
  • 第三阶段 · 阐释(Communication):将证明写得能让共同体清楚理解。
  • 第四阶段 · 发表(Publication):通过同行评审进入期刊。
  • 第五阶段 · 定型(Canonization):被吸收进教科书、被工程师/物理学家/法学家等外部领域实际使用。

3 对"第一版目标"的批判——只追求解题数量

  • 即使在 AI 出现前,重大猜想周围就会出现大量错误证明的噪声。
  • 若只优化"解题数",网上会涌现海量号称证明了黎曼猜想的垃圾,绝大多数错误。

4 对"第二版目标"的批判——正确仍不够

  • 修正为:既要解题,也要验证。形式化证明助手(Lean 等)可加速此环节。
  • 但极端情景已近在咫尺:一个重大定理被 AI 证明且形式验证通过,世上却没有任何人真正理解它为何成立——这是" abnormal development(反常进展)"。

5 对"第三版目标"的细化——阐释的不可替代性

  • 目标须再次升级:证明不仅要正确,还要能被数学共同体清楚交流与理解,不能只是"auto guys(炫技式成就)"而毫无后续价值。
  • 当前 AI 在阐释上的双面性
    • 表层完美:拼写、语法、格式化几乎太完美,反而让人偏好人类那种略不完美的文本。
    • 深层缺失:AI 常常把平凡步骤铺陈得过长,对真正困难、有趣的部分却轻描淡写;不擅长建立与文献和思想脉络的高层连接。
  • 他举了自己研读 Donald Trump(此处转录疑似有误,或指某位学者)论文的经历:初读困惑 frustated,但最终"抓住了他的思维方式",从而学到极多——这种通过艰难阅读而达成的"思维共鸣",是 AI 丝滑文本无法提供的教育体验。

6 对"第四阶段·发表"的再思考——同行评审的人类维度

  • 当前期刊依赖志愿者 referee,他们付出时间不仅是为了把关,更是为了培养作者成为更好的数学家——这是一种代际传递。
  • 这份工作无 prestige、无报酬,却是职业的本质部分。
  • AI 在此阶段基本无用:若领域里一半人认为应这样做、另一半认为应那样做,就需要真正的对话与共识,而这正是 AI 完全无用的环节。

**7 对"第五阶段·定型"的预警——"证明消化不良"(proof indigestion):

  • 若 AI 批量产出已验证却无人读懂的证明,数学界将陷入"吃不下、消化不了"的困境。
  • 类比食物:人类已从"食物稀缺"走向"食物充裕",随之而来的是肥胖与不良饮食——这是丰裕型问题
  • 数学正从"证明稀缺"走向"证明充裕",若不加干预,将出现类似的"证明肥胖症"。
  • 工程师、物理学家等外部使用者不在乎《数学年刊》上的最新进展,他们要的是教科书——而将 AI 生成的海量证明转化为教科书的过程尚未发生,且极具挑战。

8 丰裕 vs. 稀缺的范式转换:所有问题可分为"稀缺型问题"与"丰裕型问题",数学界须学会在丰裕条件下重新自律——正如人类通过自觉选择健康饮食来适应食物丰裕。


第(五)部分 制度重构:不同场景的不同政策与责任分配(68% - 85%)

1 整体立场:数学界需要对职业的每一个环节——解题、教学、工程化、招聘、应用——都摆上桌面重新审视,无法在此一小时讲完所有环节,但他给出框架性原则。

2 须由人类牢牢掌控的环节——以教育训练为例

  • 在早期教育中过度使用 AI 是有害的,学生必须先发展出内在的、本能的技能,才能学会使用工具。
  • 类比:先教算术再给计算器;先教走路再给车钥匙。
  • 数学教育同理:必须让学习者先建立自己的"原生能力"。

3 应由共同体主动制定规则的环节

  • 在另一些环节,数学界应主动出击,由自己设定"何种 AI 研究可接受"的规则,而非让外部因素(AI 公司、资助方、媒体叙事)来定义什么是数学、什么是好的数学。

4 传统渠道不再适用之处须建设新基础设施

  • 传统期刊等载体可能不适合新的"证明流"节奏。
  • 数学界需要创建新的工作流与新的结构——这本身又是一场演说的内容,限于时间未能展开。
  • 他提及若干基础设施方向:Mathlib(形式化数学库)、Mathematical Discourse(数学论述平台,链接待公布)、Erdős Problems(埃尔德什问题平台)、优化常数数据库、SAIR Competitions 等,预示着结构化知识库、公开问题平台、形式化库、可比较评测与持续维护的共同基础设施将成为趋势。

5 莱顿宣言(Leiden Declaration)作为政策起点

  • 他援引 2026 年 6 月发布的《人工智能与数学莱顿宣言》作为政策讨论的起点。
  • 核心建议包括:披露 AI 使用情况降低"首次解出问题"的权重提高"消化(digestion)"的权重
  • 若作者无法令人信服地给出清晰、专家级的成果陈述,该成果就不应该被发表——这是对"阐释"环节的硬约束。

6 价值重心的迁移:从上游的"首发权"向下游的"解释权、消化权"迁移;能够验证、解释、组织、归因、筛选和教学的个人与机构将变得更关键。


第(六)部分 收束:数学作为社会认识系统与人类的不可替代性(85% - 100%)

1 数学不是"定理生产机":通过全程剖析,陶哲轩 implicitly 勾勒出数学的真实面貌——它是一套由证明、解释、信任、同行评议、教育和代际传承共同组成的社会认识系统,而非简单的定理产出流水线。

2 AI 时代人类数学家的核心价值

  • 当机器能证明定理时,人类的真正价值在于理解、传承与判断
  • 数学家必须从"解题者"转型为"意义赋予者"和"知识消化者"。
  • 即便 AI 能生成完美正确的证明,从"丝滑文本"到"被共同体真正吸收的知识"之间,仍需人类完成最缓慢、最关键的转化。

3 危机中的乐观主义:回到开篇的历史类比——二十世纪初的基础危机虽动荡,却催生了更严谨的标准化框架。陶哲轩暗示,当下的"价值与实践基础危机"若能促使共同体彻底检视并编码自己的价值基础,数学将以更强韧、更明确、更具韧性的姿态进入 AI 时代。

4 幻灯片本身的 AI 使用披露:他在幻灯片中明确披露——所有英文长破折号(em dash)均由人类生成,而 AI 被用于文本自动补全与图表生成。这一细节本身就是对"负责任披露"机制的示范,呼应了莱顿宣言的精神。

5 留给共同体的未尽之业:他坦诚本次演讲无法覆盖所有目标与环节的制度重构,号召数学共同体在解题、教学、工程化、招聘、应用等每一个方面都展开漫长而必要的讨论、分析与开发——这是一场属于整个共同体的、刚刚开始的对话。


💡 整篇演讲的方法论精髓:陶哲轩刻意绕开"AI 到底行不行"的争论泥潭,转而做一个条件性的制度压力测试——"假设 AI 很快能以合理成本完成相当比例的研究级数学任务,我们的制度哪里会失效?" 这一姿态使得演讲超越了技术乐观主义与技术悲观主义的两极,成为一份面向数学共同体未来的、冷静而深刻的制度重构纲领。

Top comments (0)