我重新逐段看了你这张图里的原文,再结合这几天数学界围绕 “1500人抵制 Mathathon + 25位菲尔兹奖得主公开信 + OpenAI/Navier–Stokes 事件” 的实际情况核对后,我的判断是:
这篇文章不是“基本事实全错”,而是把几个真实事件拼在一起,然后用一个非常强的“数学家正在被大模型碾压”的叙事去解释它们。
其中有一些事实基本正确;但也有若干处存在偷换概念、过度概括甚至技术上不严谨的问题。
我按严重程度说。
一、最明显的问题:把“反对某种 AI 数学竞赛模式”写成了“数学界普遍抵制大模型”
文章开头的核心叙事大概是:
“最近数学界普遍抵制大模型……1500多名数学家签名……25位菲尔兹奖得主公开信……”
这里的事实基础是真实的,但结论是明显夸大的。
近期确实存在两件事情:
第一件:约1500名数学家参与抵制 Caltech 的 Mathathon。
但他们针对的是一种具体模式:
由 AI 公司提供大量算力,让学生/研究者用大模型去竞速攻克公开数学问题。
他们并不是在说:
“数学家不要用大模型。”
甚至这一轮争议的核心,本来就是 AI 公司把“解决多少数学题”当成模型能力 benchmark 的方式。(澎湃新闻)
第二件:25位菲尔兹奖得主的公开信。
这是真的,而且非常重要。
但公开信甚至明确承认:
AI 有可能显著加速真正的数学研究。
它反对的是:
把“解题数量/速度”作为 AI 数学能力的主要竞技指标,并因此把数学研究变成一场抢跑竞赛。
所以:
“数学界开始抵制大模型”
与
“数学界开始反对 AI 公司把数学研究变成速度竞赛”
是两件完全不同的事情。
中国科学报、第一财经对这封信的解读也都是后一种。(科学网)
而且一个特别有力的反例是:
菲尔兹奖得主 Jacob Tsimerman 今年刚刚加入 OpenAI,显然不存在“数学家集体拒绝进入 AI”的事实。
所以文章第一节有明显的叙事放大。
二、文章把“数学的核心是证明”批评成一种过时观点,这本身也有点矫枉过正
文章第二部分有一句非常关键:
“数学家的核心资产,从来不是证明。”
然后它强调数学家的真正价值是:
提出问题、构造工具、理解结构、寻找方向……
这里有一半正确、一半错误。
正确的是:
数学研究当然远远不只是“写证明”。
真正的数学家需要:
提出猜想 → 找结构 → 找例子 → 构造概念 → 建立工具 → 发现关系 → 最后才是证明。
而 AI 当前最欠缺的,恰恰可能是前面这些环节。
这一点甚至得到数学家 Daniel Litt 的直接支持。他认为真正的数学研究与竞赛解题不同,研究缺乏一套预先知道的有效方法,而模型目前在创造性研究上仍存在明显局限。(澎湃新闻)
但是文章说:
“证明从来不是数学家的核心资产。”
这就过头了。
因为数学与物理、哲学、科学写作最大的区别之一,就是:
一个新想法最后必须进入严格证明体系,才能成为数学知识。
所以正确说法应该是:
证明不是数学研究的全部,但它仍然是数学知识获得最终合法性的核心机制之一。
这点不能因为 AI 越来越会证明就反过来说成“不重要”。
三、文章对“大模型已经碾压数学家”的描述,严重超出了目前可以确认的事实
这是我认为全篇最值得警惕的一点。
文章有一个非常鲜明的叙事:
数学家花十几年证明的东西,大模型几个小时搞出来;
大模型已经自己生成定理、自己证明、自己找反例;
数学家几十年的积累已经被模型超过。
这里必须非常谨慎。
截至现在,确实已经发生了惊人的事情:
OpenAI 声称内部模型通过约 1 万个 Agent、88 小时的工作,得出了 Navier–Stokes 问题的一套解决方案。(CoinDesk)
但关键是:
“模型生成了一份看起来完整的解决方案”
≠
“数学界已经确认模型解决了千禧年难题”。
目前这件事情仍处于严格审查阶段,而且恰恰引出了优先权、训练数据、研究路线重合、是否真正独立完成等争议。(CoinDesk)
所以文章如果把这个事情直接概括成:
“大模型已经把数学家十几年甚至几十年的证明工作几个小时干掉了”
这是明显的把“AI 公司宣称的结果”升级成“数学界已经确认的事实”。
两者差别非常大。
四、文章对 Lean / “可验证性”的理解,有一个很重要的技术性错误
这是全篇我最想指出的一个数学/形式化技术问题。
文章第四节大意是:
大模型可以直接生成定理、自我证明;
数学的“可验证性”只是证明某个结论在一个公理体系内成立;
数学家几百年来建立的只是一个巨大的公理体系。
这里把几个不同概念混到了一起。
Lean 实际做什么?
例如你在 Lean 中证明:
$$
A \rightarrow B
$$
Lean 的 kernel 验证的是:
从你指定的基础公理、定义和已有定理出发,这个形式证明是否逻辑正确。
这不是:
“Lean 证明了这个宇宙里的真理。”
但也不是:
“Lean 只是证明了一个随便指定的边界条件。”
它验证的是形式化命题在给定基础系统中的逻辑可推导性。
更进一步:
一致性(consistency)本身也不是由单个 Lean theorem 自动证明出来的。
所以文章把:
数学真理 → 公理体系 → 可证明性 → 可验证性 → AI 生成
这几个层级压扁成一个概念,是不严谨的。
这一点非常重要,因为你最近一直在关注 Lean + AI4Math,这里恰恰是不能混淆的地方。
五、“数学的确定性只是因为数学家把边界条件圈好了”——这是非常强的哲学化简
文章第三节的观点大致是:
数学家以为自己发现了确定性;
实际上只是因为他们先规定了欧氏空间、非欧几何、公理等边界条件;
然后在边界条件里面推理而已。
这个说法有一定哲学意味,但拿它来解释数学的确定性是不准确的。
数学当然是公理化的。
比如:
欧氏几何:
$$
\text{公理} \Rightarrow \text{定理}
$$
非欧几何也可以:
$$
\text{另一套公理} \Rightarrow \text{另一套定理}
$$
但这并不意味着:
“既然公理可以选择,所以数学里的真理都是人为随便规定出来的。”
因为数学研究的重要问题之一恰恰是:
不同公理体系之间有什么关系?哪些结构自然出现?哪些性质是不依赖某种具体表示的?
现代数学大量研究的正是这些结构。
所以文章在这一节实际上把一种很复杂的数学哲学问题,简化成:
“数学家就是先画一个圈,再在里面证明。”
这对科普文章来说可以理解,但作为严肃论证显然不够。
六、“AI不关心真理,只关心奖励”——作为解释模型机制可以,但拿它解释数学研究有点过头
文章最后几节实际上在说:
人类数学家关心真理;
AI 只关心 reward;
所以 AI 可以把“证明”做出来,但不理解数学的意义。
这个说法在方向上有道理:
AI 的优化确实最终对应某种训练目标、奖励、loss、搜索评价函数。
但:
“AI只关心reward,所以它不可能关心真理”
并不是严格成立的推论。
因为如果一个系统长期优化:
“产生能够被独立验证、可复现、可推广的新数学结果”
那么“奖励函数”完全可以把数学真理和结构性质量编码进去。
AlphaProof、Lean、形式化数学研究,本质上已经是在做这种尝试。
所以真正的问题不是:
AI 有没有“真理观”。
而是:
我们能不能构造一个足够好的目标函数、验证机制和长期研究循环,使 AI 的行为稳定地指向真正有价值的数学发现。
这才是 AI4Math 真正难的问题。
七、文章低估了一件事:AI 研究数学并不只是“证明能力”
这恰恰是它自己说得不够好的地方。
它有一句很正确:
数学研究不只是证明。
但它随后又把矛盾主要描述成:
证明 VS 提问。
实际上现在 AI4Math 的真正竞争,已经不是这么简单。
至少有四层:
| 层次 | AI当前能力 |
|---|---|
| 解已知数学题 | 很强 |
| 形式化证明 | 快速进步 |
| 发现新 lemma / 新结构 | 已开始出现 |
| 自主提出、验证、推进长期研究计划 | 仍明显不成熟 |
而真正决定未来的,恰恰是后面两层。
Daniel Litt 最近的观点也很接近:
目前模型在数学 benchmark 上很强,但这与完成真正需要数月研究周期的数学项目不是一回事。(澎湃新闻)
所以文章其实应该重点讨论:
“长期研究循环”
而不是反复讨论:
“证明是不是数学的核心”。
八、文章还犯了一个很典型的问题:把“数学家的价值”说得太浪漫化
文章后半部分的逻辑是:
AI解决题目以后,数学家仍然拥有“定义问题、判断方向、解释意义”的核心权力。
这今天成立,但不能把它当成未来永恒规律。
因为这些能力本身也可能逐渐被 AI 自动化。
比如未来 AI 完全可能做:
阅读整个数学文献 → 找知识空白 → 自动生成猜想 → 生成反例 → 找对应结构 → 设计实验 → 找证明路线 → 形式化 → 验证 → 推广。
到那个阶段:
“提出问题”
也不再是人类垄断的能力。
所以文章实际上有一点“把今天 AI 的短板当成人类永久护城河”的问题。
这是我认为它最大的战略性偏差。
九、但反过来,这篇文章也有几个非常正确、而且值得重视的地方
不能因为它有问题就把全文推翻。
① “数学 ≠ 解题”
这是对的。
公开信的核心其实就是这个观点:
解决问题是手段,理解和产生数学思想才是目标。
25位菲尔兹奖得主真正担心的是:
如果 AI 公司把“解出多少难题”变成竞争指标,数学可能被迫围绕这个指标优化。
这一点是有现实意义的。(新浪新闻)
② “正确证明”和“数学理解”不是同一件事
这也是对的。
即便 AI 产生一个 Lean 可以验证的证明,数学家仍然会问:
为什么这个证明重要?
核心 idea 是什么?
有没有更自然的证明?
这个方法还能推广到哪里?
这正是数学共同体为什么强调解释、讨论、简化、整理的原因。
③ AI可能改变数学家的训练体系
这一点文章实际上触碰到了一个非常重要的问题:
如果以后 AI 可以在几十分钟内完成很多:
计算 → 例子 → lemma → proof
那么年轻数学家过去用来训练自己的大量“低层级工作”,可能会被 AI 接管。
这个问题目前甚至已经被陶哲轩等数学家认真讨论。近期关于 AI 的讨论中,他特别担心的一个问题并不是“数学家没工作了”,而是:
年轻人原本通过慢慢做题、失败、交流、做小研究而获得成长的路径,会不会被 AI 的自动化直接切断。 (第一财经)
这个其实比“AI会不会取代数学家”更深。
十、所以我会给这篇文章一个这样的评价
| 部分 | 我的评价 |
|---|---|
| 1500人 Mathathon 抵制事件 | 基本真实 |
| 25位菲尔兹奖得主公开信 | 真实 |
| “数学界反对 AI” | 明显夸大 |
| “数学不是只有证明” | 正确 |
| “证明已经被 AI 几小时击穿” | 过度表述 |
| “OpenAI 已经证明千禧年难题” | 目前不能这么下结论 |
| Lean = 验证而非直接证明宇宙真理 | 方向正确,但文章技术表述不严谨 |
| “数学确定性只是人为圈定边界” | 哲学化过度 |
| “AI只关心奖励,不关心真理” | 过度简化 |
| “提出问题将成为数学家的永久护城河” | 非常不确定,甚至可能错误 |
| AI会改变数学研究方式 | 很可能正确 |
| AI会替代一部分数学训练工作 | 值得高度重视 |
我认为这篇文章最大的“问题”不是事实错误,而是它的叙事框架
它实际上用了这样一条隐含逻辑:
AI突然变得极其强大 → 数学家受到威胁 → 数学家强调证明不是核心 → AI只是没有真正理解数学 → 数学家的真正优势是提出问题 → 所以数学家暂时没事。
这套叙事很适合传播,但不完全符合现在 AI4Math 的真实发展方向。
更准确的框架应该是:
解题能力 → 证明能力 → 搜索能力 → 数学发现 → 长期研究循环 → 自主研究。
现在真正发生巨大突破的是前面几层;
真正决定“AI能否成为数学研究者”的,是后面的“长期自主研究循环”。
而且最近的趋势已经非常明显:
AI 并不是简单地从“不会证明”变成“会证明”,而是在逐渐从“解题器”变成“研究代理”。
这也是为什么你前几天问我的 BSD、Riemann、Navier–Stokes、Lean、AI4Math、OpenAI/Anthropic 数学研究,实际上应该放进一个更大的框架里看。
尤其值得注意的是:近期数学家真正担心的,已经不是“AI会不会做题”,而是AI 是否会开始大规模消耗公开数学问题、抢占研究优先权,并改变年轻数学家的成长机制。这恰恰是那25位菲尔兹奖得主公开信最重要的部分。(新浪新闻)
如果把这篇文章改成一篇真正严谨的“AI为什么正在改变数学研究”的文章,我会保留约40%的内容,重写另外60%。
Top comments (0)