标签

AI数学论文的批量生产:一位教授的抽卡实验,一小时产出三篇投稿

发布时间:2026-09-03 22:06阅读:1

每日学习:第287天

播客:Can AI Learn Mathematical Intuition?

今年五月中旬,数学领域爆出一条不大不小的消息:Erdős 单位距离猜想被攻破,而攻破它的不是人类。

这是 Erdős 留下的一个组合几何猜想,学界多数人原本以为它是对的,没想到 AI 给出了一个反例构造,把它证伪了。这事让多伦多大学的数学教授 Daniel Litt 坐不住了。Litt 是一位研究代数几何的一线数学家,平日里除了搞研究,最爱干的事就是在推特上点评各家大模型的数学水准,观点迭代速度比模型发版还勤。

他在 a16z 的播客中提到,这是他目前最欣赏的、AI 完全独立完成的数学成果。原因值得细说,因为这个原因恰好能回答那个被问滥的问题:AI 做数学,究竟做到哪一步了?

首先,它不是瞎蒙。一般 AI 的数学成果有两种常见形态:要么是把已有技术换个巧妙的方式组合应用,要么是"最后一公里"型,人类数学家把又深又难的部分啃完,模型补上最后一步。单位距离问题不属于这两种。它从六十年代的经典理论里搬来一套工具,这套工具本身不算深,但在"平面点集构型"这个领域里从未被用过。跨领域移植,在数学里是衡量创造性的硬尺。

其次,它事后被证明有价值。这个反例问世之后,一批数学家拿着同一套思路,相继构造出其他几个公开猜想的反例,例如实数域上的和积猜想。一个结果好不好,事后看它能不能推着别人往前走,这个标准对人和对 AI 是平等的。

所以先把话说足:这货是真家伙,不是公关。

但 Litt 接下来的一句话,比"AI 解决了 Erdős 问题"耐人寻味得多。他说,OpenAI 放出来的那个解题思维链,他从头到尾读了一遍,最深的感受是,这个论证非常像人类。没有出现什么"第 37 手"式的、人类永远想不出的诡异招法,整个推导过程就是一个数学家会走的路径,甚至能看出它在哪些地方卡壳、换个角度重试。

理解这个,你就懂了 AI 做数学的真实水平。

它像一个什么样的数学家呢?一个不眠不休、读完所有文献、算力无限的数学家,但它干的活集中在一条很窄的带子上:把已有技术极其熟练地组合应用。Litt 说得很直白,靠这条路做出漂亮成果的数学家是存在的,甚至是伟大职业生涯的一种,但它只是数学家工作的很小一截。

更大的那截是什么?是直觉、品味、提问的能力。Litt 自己属于解题派,但他解释自己工作方式时说,一个公开猜想的价值在于它是一把尺子,量出我们对某个对象的不理解。真正的工作是围绕这份"不理解"展开的:找最小的不可理解的场景,摆弄它,盯着自己为了赢而造出来的东西,慢慢把它熬成理论。他的很多研究动力来自一个根本不严格的东西:两类数学对象之间的类比。看到 A 这边有个现象,就去 B 那边找对应物。这个类比没有任何符号逻辑基础,但它催生了过去三四十年一批最漂亮的数学。

这套东西,模型目前完全学不会。Litt 试过让 ChatGPT 和 Claude 做理论构建,自主状态下做不出来,给足提示能做出一点有意思的东西。他的判断是:现在需要一百比特的提示才能做的事,也许半年后不用提示就能做了。他不怀疑能力曲线会继续往上爬,他甚至认为造理论这件事"大概完全是可做的,只是还没人去做",可能换个 RL 环境就解决了。

一个一线数学家,对 AI 能力的评估乐观到这个程度。然后你听他讲自己的日常工作,会听到一个完全不同的故事。

他说他那些想了三四五年的老项目,AI 基本搭不上手。帮忙的地方都在边缘:当一个更顺手的 Google 用,查资料、学邻近领域的背景;还有代码。他自嘲不会写代码,过去一个需要写代码验证的想法能拖半年,现在有个"不知疲倦的 PhD"帮他干,于是凭空多出一堆项目。另外就是大规模并行搜索,让模型一口气试一千个例子。

注意这个清单的共同点:全是体力活。省的是时间,不是思考。

到这里,故事还只是"AI 很强但还没到那一步",这种话你已经在八百个播客里听过八百遍了。真正的东西在下面这段。

Litt 做了一个实验。他打开 Codex,下了一道指令:上网,找五个代数几何领域近期的猜想,证明它们。然后他和模型来回拉扯了一阵,一个小时之后,他得到了三篇论文。

三篇正确的、可以投出去的、相当烂的论文。

它们现在就躺在他的硬盘里,他连发给相关学者的动力都没有。因为这件事对他的时间来说毫无意义,但他同时也说得很清楚:对另一些人来说,这件事价值巨大。比如一个正在找工作的博士后。在未来几年、学术共同体还没调整过来的窗口期里,最高效的求职策略就是批量生产这种论文,证明一些老猜想,挂在 arXiv 上,堆高引用数字。生产方式和游戏里抽卡一模一样:反复拉动老虎机,直到模型吐出一个大概正确的证明。

一个在职教授,当着镜头承认自己抽卡。

而且抽卡现象已经有外部证据了。arXiv 上最近投稿量暴涨,质量大面积塌陷,甚至出现同一个定理的同一个证明,几天之内被四五篇不同论文重复发表。因为大家用的是同一个模型,模型对某些推理路径已经收敛了,抽到的是同一张卡。

这件事往深了想一层,才是真正麻烦的地方。数学进步的历史模式,是让一千个人各自追着自己的好奇心乱跑,有人研究这个怪问题,有人发展那个没人懂的理论,知识边界在一个维度极高的空间里均匀地往外扩,然后冷不丁某个角落里长出来的新工具,突然打通了另一个角落的老问题。整个系统依赖的是多样性,是一堆品味和直觉完全不同的人。现在把探索权让渡给模型,等于把一千个千奇百怪的数学家换成同一个数学家的第一千份拷贝。它在哪条路上走得通,所有人就都在哪条路上走。看不到的那些路,就再没人走了。

说到这,该交代一下 Litt 这个人的位置了。他是多伦多大学的教授,手里握着终身教职轨道,不靠 AI 公司融资,不给任何实验室站台,甚至明说"我个人不太喜欢玩自动数学,我用它主要是为了帮我理解东西"。这套话从一个利益无关的局内人嘴里说出来,基本不用掂量。但也得说句实话:他也是防守方,AI 冲击的正是他安身立命的手艺,所以他对"机器替代不了的部分"的强调,你听的时候留个心眼就好。我的判断是,他的工程事实全信,他的人文悲观听七成。

那剩下的部分是什么?是这个局里最重要的一条线:数学的目标从来不是生产数学论文,是生产理解。这句话 Litt 在开头说了一遍,在结尾又说了一遍。中间隔着的那四十分钟,讲的其实就是一件事:论文这个指标已经和"理解"这个目的脱钩了,而 AI 把这个脱钩的速度加快了十倍。水论文这玩意,学术界内部早就有灌水激励了,AI 只是给所有人发了一台无限弹药的抽卡机。

数学圈是幸运的,它是第一个被迫公开算这笔账的行业。算力用得起的行业都得算这笔账:写代码的在算,写报告的在算,做投研的在算。Litt 那句提醒值得抄在墙上:模型让你做得更多,但并不让你做得更好,它把"做一件事"的成本打到地板,于是大量更便宜、更差的产出,正在挤掉原来那些更贵、更好的产出。能不能用这些工具反过来把自己垫高,取决于你自己还愿不愿意思考。

机器不会替你想,它只会替你写。

手艺这东西,用进废退。