DEV Community

cognitalk
cognitalk

Posted on

ChatGPT评价文章《为什么数学学阀抵制大模型研究数学》的问题与可取处

我重新逐段看了你这张图里的原文,再结合这几天数学界围绕 “1500人抵制 Mathathon + 25位菲尔兹奖得主公开信 + OpenAI/Navier–Stokes 事件” 的实际情况核对后,我的判断是:

这篇文章不是“基本事实全错”,而是把几个真实事件拼在一起,然后用一个非常强的“数学家正在被大模型碾压”的叙事去解释它们。

其中有一些事实基本正确;但也有若干处存在偷换概念、过度概括甚至技术上不严谨的问题。

我按严重程度说。


一、最明显的问题:把“反对某种 AI 数学竞赛模式”写成了“数学界普遍抵制大模型”

文章开头的核心叙事大概是:

“最近数学界普遍抵制大模型……1500多名数学家签名……25位菲尔兹奖得主公开信……”

这里的事实基础是真实的,但结论是明显夸大的。

近期确实存在两件事情:

第一件:约1500名数学家参与抵制 Caltech 的 Mathathon。

但他们针对的是一种具体模式:

由 AI 公司提供大量算力,让学生/研究者用大模型去竞速攻克公开数学问题。

他们并不是在说:

“数学家不要用大模型。”

甚至这一轮争议的核心,本来就是 AI 公司把“解决多少数学题”当成模型能力 benchmark 的方式。(澎湃新闻)

第二件:25位菲尔兹奖得主的公开信。

这是真的,而且非常重要。

但公开信甚至明确承认:

AI 有可能显著加速真正的数学研究。

它反对的是:

把“解题数量/速度”作为 AI 数学能力的主要竞技指标,并因此把数学研究变成一场抢跑竞赛。

所以:

“数学界开始抵制大模型”

与

“数学界开始反对 AI 公司把数学研究变成速度竞赛”

是两件完全不同的事情。

中国科学报、第一财经对这封信的解读也都是后一种。(科学网)

而且一个特别有力的反例是:

菲尔兹奖得主 Jacob Tsimerman 今年刚刚加入 OpenAI,显然不存在“数学家集体拒绝进入 AI”的事实。

所以文章第一节有明显的叙事放大。


二、文章把“数学的核心是证明”批评成一种过时观点,这本身也有点矫枉过正

文章第二部分有一句非常关键:

“数学家的核心资产,从来不是证明。”

然后它强调数学家的真正价值是:

提出问题、构造工具、理解结构、寻找方向……

这里有一半正确、一半错误。

正确的是:

数学研究当然远远不只是“写证明”。

真正的数学家需要:

提出猜想 → 找结构 → 找例子 → 构造概念 → 建立工具 → 发现关系 → 最后才是证明。

而 AI 当前最欠缺的,恰恰可能是前面这些环节。

这一点甚至得到数学家 Daniel Litt 的直接支持。他认为真正的数学研究与竞赛解题不同,研究缺乏一套预先知道的有效方法,而模型目前在创造性研究上仍存在明显局限。(澎湃新闻)

但是文章说:

“证明从来不是数学家的核心资产。”

这就过头了。

因为数学与物理、哲学、科学写作最大的区别之一,就是:

一个新想法最后必须进入严格证明体系,才能成为数学知识。

所以正确说法应该是:

证明不是数学研究的全部,但它仍然是数学知识获得最终合法性的核心机制之一。

这点不能因为 AI 越来越会证明就反过来说成“不重要”。


三、文章对“大模型已经碾压数学家”的描述,严重超出了目前可以确认的事实

这是我认为全篇最值得警惕的一点。

文章有一个非常鲜明的叙事:

数学家花十几年证明的东西,大模型几个小时搞出来;

大模型已经自己生成定理、自己证明、自己找反例;

数学家几十年的积累已经被模型超过。

这里必须非常谨慎。

截至现在,确实已经发生了惊人的事情:

OpenAI 声称内部模型通过约 1 万个 Agent、88 小时的工作,得出了 Navier–Stokes 问题的一套解决方案。(CoinDesk)

但关键是:

“模型生成了一份看起来完整的解决方案”

≠

“数学界已经确认模型解决了千禧年难题”。

目前这件事情仍处于严格审查阶段,而且恰恰引出了优先权、训练数据、研究路线重合、是否真正独立完成等争议。(CoinDesk)

所以文章如果把这个事情直接概括成:

“大模型已经把数学家十几年甚至几十年的证明工作几个小时干掉了”

这是明显的把“AI 公司宣称的结果”升级成“数学界已经确认的事实”。

两者差别非常大。


四、文章对 Lean / “可验证性”的理解,有一个很重要的技术性错误

这是全篇我最想指出的一个数学/形式化技术问题。

文章第四节大意是:

大模型可以直接生成定理、自我证明;

数学的“可验证性”只是证明某个结论在一个公理体系内成立;

数学家几百年来建立的只是一个巨大的公理体系。

这里把几个不同概念混到了一起。

Lean 实际做什么?

例如你在 Lean 中证明:

$$
A \rightarrow B
$$

Lean 的 kernel 验证的是:

从你指定的基础公理、定义和已有定理出发,这个形式证明是否逻辑正确。

这不是:

“Lean 证明了这个宇宙里的真理。”

但也不是:

“Lean 只是证明了一个随便指定的边界条件。”

它验证的是形式化命题在给定基础系统中的逻辑可推导性。

更进一步:

一致性(consistency)本身也不是由单个 Lean theorem 自动证明出来的。

所以文章把:

数学真理 → 公理体系 → 可证明性 → 可验证性 → AI 生成

这几个层级压扁成一个概念,是不严谨的。

这一点非常重要,因为你最近一直在关注 Lean + AI4Math,这里恰恰是不能混淆的地方。


五、“数学的确定性只是因为数学家把边界条件圈好了”——这是非常强的哲学化简

文章第三节的观点大致是:

数学家以为自己发现了确定性;

实际上只是因为他们先规定了欧氏空间、非欧几何、公理等边界条件;

然后在边界条件里面推理而已。

这个说法有一定哲学意味,但拿它来解释数学的确定性是不准确的。

数学当然是公理化的。

比如:

欧氏几何:

$$
\text{公理} \Rightarrow \text{定理}
$$

非欧几何也可以:

$$
\text{另一套公理} \Rightarrow \text{另一套定理}
$$

但这并不意味着:

“既然公理可以选择,所以数学里的真理都是人为随便规定出来的。”

因为数学研究的重要问题之一恰恰是:

不同公理体系之间有什么关系?哪些结构自然出现?哪些性质是不依赖某种具体表示的?

现代数学大量研究的正是这些结构。

所以文章在这一节实际上把一种很复杂的数学哲学问题,简化成:

“数学家就是先画一个圈,再在里面证明。”

这对科普文章来说可以理解,但作为严肃论证显然不够。


六、“AI不关心真理,只关心奖励”——作为解释模型机制可以,但拿它解释数学研究有点过头

文章最后几节实际上在说:

人类数学家关心真理;

AI 只关心 reward;

所以 AI 可以把“证明”做出来,但不理解数学的意义。

这个说法在方向上有道理:

AI 的优化确实最终对应某种训练目标、奖励、loss、搜索评价函数。

但:

“AI只关心reward,所以它不可能关心真理”

并不是严格成立的推论。

因为如果一个系统长期优化:

“产生能够被独立验证、可复现、可推广的新数学结果”

那么“奖励函数”完全可以把数学真理和结构性质量编码进去。

AlphaProof、Lean、形式化数学研究,本质上已经是在做这种尝试。

所以真正的问题不是:

AI 有没有“真理观”。

而是:

我们能不能构造一个足够好的目标函数、验证机制和长期研究循环,使 AI 的行为稳定地指向真正有价值的数学发现。

这才是 AI4Math 真正难的问题。


七、文章低估了一件事:AI 研究数学并不只是“证明能力”

这恰恰是它自己说得不够好的地方。

它有一句很正确:

数学研究不只是证明。

但它随后又把矛盾主要描述成:

证明 VS 提问。

实际上现在 AI4Math 的真正竞争,已经不是这么简单。

至少有四层:

层次 AI当前能力
解已知数学题 很强
形式化证明 快速进步
发现新 lemma / 新结构 已开始出现
自主提出、验证、推进长期研究计划 仍明显不成熟

而真正决定未来的,恰恰是后面两层。

Daniel Litt 最近的观点也很接近:

目前模型在数学 benchmark 上很强,但这与完成真正需要数月研究周期的数学项目不是一回事。(澎湃新闻)

所以文章其实应该重点讨论:

“长期研究循环”

而不是反复讨论:

“证明是不是数学的核心”。


八、文章还犯了一个很典型的问题:把“数学家的价值”说得太浪漫化

文章后半部分的逻辑是:

AI解决题目以后,数学家仍然拥有“定义问题、判断方向、解释意义”的核心权力。

这今天成立,但不能把它当成未来永恒规律。

因为这些能力本身也可能逐渐被 AI 自动化。

比如未来 AI 完全可能做:

阅读整个数学文献 → 找知识空白 → 自动生成猜想 → 生成反例 → 找对应结构 → 设计实验 → 找证明路线 → 形式化 → 验证 → 推广。

到那个阶段:

“提出问题”

也不再是人类垄断的能力。

所以文章实际上有一点“把今天 AI 的短板当成人类永久护城河”的问题。

这是我认为它最大的战略性偏差。


九、但反过来,这篇文章也有几个非常正确、而且值得重视的地方

不能因为它有问题就把全文推翻。

① “数学 ≠ 解题”

这是对的。

公开信的核心其实就是这个观点:

解决问题是手段,理解和产生数学思想才是目标。

25位菲尔兹奖得主真正担心的是:

如果 AI 公司把“解出多少难题”变成竞争指标,数学可能被迫围绕这个指标优化。

这一点是有现实意义的。(新浪新闻)

② “正确证明”和“数学理解”不是同一件事

这也是对的。

即便 AI 产生一个 Lean 可以验证的证明,数学家仍然会问:

为什么这个证明重要?

核心 idea 是什么?

有没有更自然的证明?

这个方法还能推广到哪里?

这正是数学共同体为什么强调解释、讨论、简化、整理的原因。

③ AI可能改变数学家的训练体系

这一点文章实际上触碰到了一个非常重要的问题:

如果以后 AI 可以在几十分钟内完成很多:

计算 → 例子 → lemma → proof

那么年轻数学家过去用来训练自己的大量“低层级工作”,可能会被 AI 接管。

这个问题目前甚至已经被陶哲轩等数学家认真讨论。近期关于 AI 的讨论中,他特别担心的一个问题并不是“数学家没工作了”,而是:

年轻人原本通过慢慢做题、失败、交流、做小研究而获得成长的路径,会不会被 AI 的自动化直接切断。 (第一财经)

这个其实比“AI会不会取代数学家”更深。


十、所以我会给这篇文章一个这样的评价

部分 我的评价
1500人 Mathathon 抵制事件 基本真实
25位菲尔兹奖得主公开信 真实
“数学界反对 AI” 明显夸大
“数学不是只有证明” 正确
“证明已经被 AI 几小时击穿” 过度表述
“OpenAI 已经证明千禧年难题” 目前不能这么下结论
Lean = 验证而非直接证明宇宙真理 方向正确,但文章技术表述不严谨
“数学确定性只是人为圈定边界” 哲学化过度
“AI只关心奖励,不关心真理” 过度简化
“提出问题将成为数学家的永久护城河” 非常不确定,甚至可能错误
AI会改变数学研究方式 很可能正确
AI会替代一部分数学训练工作 值得高度重视

我认为这篇文章最大的“问题”不是事实错误,而是它的叙事框架

它实际上用了这样一条隐含逻辑:

AI突然变得极其强大 → 数学家受到威胁 → 数学家强调证明不是核心 → AI只是没有真正理解数学 → 数学家的真正优势是提出问题 → 所以数学家暂时没事。

这套叙事很适合传播,但不完全符合现在 AI4Math 的真实发展方向。

更准确的框架应该是:

解题能力 → 证明能力 → 搜索能力 → 数学发现 → 长期研究循环 → 自主研究。

现在真正发生巨大突破的是前面几层;
真正决定“AI能否成为数学研究者”的,是后面的“长期自主研究循环”。

而且最近的趋势已经非常明显:

AI 并不是简单地从“不会证明”变成“会证明”,而是在逐渐从“解题器”变成“研究代理”。

这也是为什么你前几天问我的 BSD、Riemann、Navier–Stokes、Lean、AI4Math、OpenAI/Anthropic 数学研究,实际上应该放进一个更大的框架里看。

尤其值得注意的是:近期数学家真正担心的,已经不是“AI会不会做题”,而是AI 是否会开始大规模消耗公开数学问题、抢占研究优先权,并改变年轻数学家的成长机制。这恰恰是那25位菲尔兹奖得主公开信最重要的部分。(新浪新闻)

如果把这篇文章改成一篇真正严谨的“AI为什么正在改变数学研究”的文章,我会保留约40%的内容,重写另外60%。

Top comments (0)