陶哲轩ICM演讲亮出警告:AI证明洪流淹没数学界,人类正被活活撑死
数学,人类智慧王冠上最坚硬的那颗明珠,正遭遇一场史无前例的危机:证明的数量之多,已远超人类消化的极限。
2026年7月24日,费城,国际数学家大会(ICM 2026)。 菲尔兹奖获得者、"当代数学界的莫扎特"陶哲轩登上公众讲座的主席台,抛出了一番令全场鸦雀无声的论断:人工智能正将数学界推入"证明消化不良"(proof indigestion)的境地,机器以排山倒海之势产出证明,而人类的理解力、审阅力与消化能力,远远难以匹敌。
这是一份严肃的判断,出自在分析、组合与数论领域深耕三十年的顶级数学家之口,也是他向所钟爱的学科发出的结构性警报。
▲ 陶哲轩ICM 2026公众讲座《Mathematics in the Age of AI》标题页
数学界上一次承受如此级别的震荡,还要回溯到一百多年前。 1900至1930年间,罗素悖论炸毁了集合论的地基,哥德尔不完备定理昭告天下"某些真命题永远无法被证明"。 那场危机的核心是本体论的:数学究竟是什么? 公理体系是否足够完备?
陶哲轩指出,我们正步入另一重危机,焦点已转移到数学价值与实践的根基。 一旦产出证明的方式出现根本性转变,过去那些心照不宣的默契,如今必须被明确道出:我们究竟为何要证明? 证明为谁而作? 由谁来裁定其价值?
这些问题,在证明稀缺的年代根本无须提出。 而今,它们已变得刻不容缓
陶哲轩并未在演讲中纠缠"AI究竟能否从事数学"的论战。 他给出一个工作假说(Working Hypothesis),并请所有听众暂且承认其成立:
AI工具将在可接受的时间框架内,以合理的成功率、品质、监督与成本,胜任相当比例的研究级数学任务。
▲ 讲义中的"工作假说"全文
他着重强调:你无需笃信它,也无需欢迎它 这只是条件分析 但若你拒绝思考"万一成立"的结局,那么等浪潮真正涌来,你连逃跑的余地都没有。
事实上,已有受控证据表明该假说正趋于成立。 他援引的First Proof项目(1stproof.org),于2026年5月对四套AI系统展开第二批独立测试:十道全新的研究级题目,横跨多个领域,结果显示七道被至少一个系统完成至可发表水准,每道题的计算成本仅在10至1000美元之间。
▲ First Proof项目官网:独立、受控的AI数学能力评测
十美元 一杯咖啡的代价 换来一条可发表的数学证明
这是整场演讲的重心所在 陶哲轩将"解一道题"层层拆解,让你看清其背后那条漫长得惊人的流水线:
产出证明 → 核验正确性 → 清晰表述 → 同行评议与认可 → 典范化(融入教材与领域定论)
每一步都比前一步更缓慢、更昂贵、更仰赖人力。 而典范化——让成果融入领域共识、化作下一代学子的教材内容——是整条链上最缓慢的一环,也是最有价值的一环。 陶哲轩强调:即便当下AI在数学领域取得的成就,也依赖于人类耗费数百年心血构筑的典范理论。
▲ 讲义核心页:从"证明稀缺"到"证明丰裕",四层阻抗失配堆叠
当AI将第一步骤的速度从"人类年产寥寥数篇"提升至"日产数百条",后四道工序全部陷入拥塞。 他为这种堵塞起了一个传神的名字:proof indigestion,证明消化不良。
具体是如何堵的? 共四层:
他特别提示:这种消化不良的征兆已经浮现。 erdosproblems.com上已汇集大量AI生成的证明提交,或许正确,却无人有余力逐一核验。 部分提交者甚至自我声明"我无力判断这究竟对不对"。
流水线为何如此轻易崩溃? 根源在于一个更深层的结构性问题,即古德哈特定律(Goodhart's Law)。
▲ 讲义中的古德哈特定律与目标发散示意
陶哲轩罗列出数学共同体的真实目标:破解未解难题、创建新理论、洞悉世界、建设共同体、培育后学、贡献共享知识网络、创造具备美学价值的作品……过往,这些目标大致正相关,解题数量增多,其余往往也水涨船高。
然而AI降临后,单一指标(解题数量)可被疯狂优化,而其他目标——理解、教育、理论建设——并未同步上扬。 目标产生了分歧 KPI数字亮眼,整个体系的健康却可能为此付出代价。
这像不像某些你耳熟能详的故事?
陶哲轩对AI撰写证明的评价极为耐人寻味。 他说:拼写无可挑剔、语法无可挑剔、排版无可挑剔,"甚至过于完美"。 症结何在?
人类写作中,作者曾卡顿之处往往留下"自然的摩擦痕迹",提示读者放慢节奏。 AI的文本将难与易都书写得同样轻松,抹除了认知节奏的线索。 读者一滑而过,然后在关键处一无所获。
他甚至写下一句充满悖论意味的话:人类表述中的"错误"有时反而对读者有所助益。
随后他引用了拓扑学巨擘William Thurston 1994年的名言:衡量数学的成就,应看其是否让人更清晰、更有效地理解与思考数学,而非仅仅统计定义、定理与证明的产出数量。
讲义PDF上传后,社交平台上的反响堪称炸裂。
▲ AI批评者Gary Marcus转发并评论
Gary Marcus称其为"精彩、必读",并借机支撑自己的观点:OpenAI新模型Astra擅长解答某些题型,但没有任何迹象表明它能构建新理论。 底下的评论区同样精彩纷呈,
有人评论:"生成变廉价了,验证却未跟进 总得有人去读" 这句话戳中了所有行业
▲ 评论者指出:证明消化不良将席卷每个行业
有人指出:"解证明与创建理论是两种能力,前者是在既有框架内优化,后者是发明框架本身。"
▲ 解题是在既有框架内优化,创建理论是发明框架本身
更早前的讨论中,还有投资人抛出另一种视角:"瓶颈会引来更多改良,验证系统之间的角逐才刚刚开启。"
▲ 瓶颈催生新系统,而非宣判终结
面对洪流,数学共同体并未束手待毙 2026年6月前后,一份《莱顿人工智能与数学宣言》(Leiden Declaration)正式发布,获得国际数学联盟(IMU)等机构背书。
▲ 莱顿宣言对个体数学家的建议条目
核心诉求极为务实:
陶哲轩本人对宣言表示支持,并补充了一条更为犀利的经验法则:若作者无法以清晰、专家级、正确且恰当归属的方式阐述自己的成果,那么该成果尚不宜正式发表。
你无法亲口讲明白? 那就别落笔署名
将视野延展,陶哲轩所描绘的变化也将波及数学之外的世界。
他所谈的是人类全部知识生产领域即将共享的命运。 代码生成变得容易后,成本转向需求判断、架构约束、测试与长期维护。 论文生成变得容易后,成本转向审稿、复现与知识梳理。 内容生成变得容易后,成本转向品味、判断与注意力的分配。
每一个被AI拉平的"生产端"领域,"消化端"都会蜕变为新的稀缺资源与权力中枢。 谁握有验证能力,谁就掌握下一个时代的话语权。
陶哲轩在Dwarkesh播客中还讲过一段意味深长的话:开普勒发现行星运动定律的验证周期,以十年、百年为单位量级。 人们误以为科学具有紧凑的验证闭环,AI会由此加速,但关键抉择仰赖我们尚未充分言明的判断与启发法。
换言之:验证是一整套文明机制,远不止一个按钮。
2026年的费城,一位生于澳大利亚的华裔数学奇才伫立于数学界最高舞台,将焦点凝聚于人类的理解:当机器能够无限量生产"正确答案"之时,人类凭何声称自己理解了什么?
这个问题,值得每一位在AI浪潮中逐浪的人驻足深思片刻。