标签

AI反向审查顶级AI论文,99.2%被标记存疑:核查时代降临,你的工作扛得住检验吗?

发布时间:2026-08-11 16:34阅读:2

图片由AI生成

约2700字|预计阅读7分钟 当产出变得越来越廉价,核查也正在成为普通人触手可及的能力。

一 ·

先说这件事:AI给科学界做了一次彻底排查

这两天科技圈在热议一则消息,相当震撼:来自Together AI、NEC Labs America、罗格斯大学和斯坦福大学的研究人员,搭建了一套基于GPT-5的论文审查系统,把刊载于ICLR、NeurIPS和TMLR上的2500篇AI论文,拎出来重新过了一遍。

注意他们的规则设得很克制:只查“硬伤”——公式有没有写错,推演是否存在漏洞,数据能否对应得上。至于论文有没有新意、有没有价值,完全不碰。犹如质检员只管螺丝是否拧紧,不评判这台机器构思得巧不巧。

结果一出,全网炸锅。

99.2%

被查论文中至少被标出一个问题的占比

4.66个

平均每篇论文被系统识别出的潜在硬伤数量

54.0%

错误类型中比例最高的一类:数学与公式错误

3.8 → 5.9

NeurIPS论文被系统标出的篇均问题数,从2021年到2025年的变动,升幅达55.3%

样本源自ICLR、NeurIPS和TMLR,共计2500篇已公开发表的AI论文。

看到这儿你或许会倒抽一口凉气:连科学都这副模样,那还有什么能信得过的?别急,这个数字得拆开看,拆开之后,事情比“科学崩塌了”耐人寻味得多。

二 ·

按老习惯,先把这个数字掰扯清楚

我一贯的准则是,越骇人的数字越要先降温。99.2%这个数,有三层水分得挤掉。

第一层:审查员自己也会失手。研究人员让人工专家复核了系统标出的316个潜在问题,其中263个被坐实,准确率为83.2%;在另一组人为植入的90个错误中,系统识别出60.0%。所以99.2%是“至少被标记一个问题”的占比,并非“已经确认有错”的占比。

第二层:多数是小瑕疵。比例最高的是数学与公式问题,恰似一篇佳作里的错别字,碍眼,但未必让结论作废。按不同平台统计,至少被标出一个“可能影响结果理解、复现或后续使用”的实质性问题的论文,占23.8%到36.0%。依旧不低,但和99.2%是两码事。

第三层,也是最要紧的一层:这些错误并非近两年才冒出来的,它们一直存在,只是过去很难被大规模复核。缘由是什么?因为查不过来。以ICLR为例,年投稿量从2018年的1013篇攀升至2026年的19619篇,增长了近二十倍。复核一篇论文耗时耗力,学术回馈又微薄,于是许多已发表的内容,鲜少再被系统地重新审视。

拆完这三层,这条新闻真正的要害就浮现了。要害不是“科学家水平不行”——他们已是人类中最较真的一群人了。要害是另外两件事。

图片由AI生成

三 ·

第一件事:错误重复一千遍,便化作共识

这项研究点破了一件比99.2%更值得警觉的事:一处错误若未被察觉,就可能被后续文献引用、再引用,沿着引用链一路延展下去,最终演变为“事实上的学术共识”。没人记得源头,也没人再回头查,大家只晓得“前人都这么写”。

这套机制你眼熟不?太熟了。它压根不是学术圈的专属,它是所有组织的通病。

你们公司那份报表的口径,为何采用这个算法?没人清楚,反正一直这么算。那个流程为何要多盖两个章?讲不清,前任交接时就这样。行业里那句人人援引的“经验法则”,源头可能就是多年前某人灵光一闪的一句话,被转述了一万遍后,成了铁律。

我自己就踩过这种坑。开公司头几年,行业内流传一条铁律,说某类客户必须先处关系再谈方案,人人都这么讲,我也照做多年,弯路没少绕。后来碰上一个不吃这套的大客户,直接问我方案在哪,那单反而谈得最顺。我这才回头琢磨:那条铁律究竟是谁验证过的?追来追去,谁也道不清源头,它就是被转述出来的。

那一刻的感触,跟今天看这份研究如出一辙:你以为你学的是经验,其实你引用的是一篇无人复核过的论文。

许多所谓的共识,不过是一个没人回头查过的错误。

过去这些东西之所以能一直流传,原因和论文如出一辙:查证太贵。谁有空去翻十年前的邮件、考证一个口径的来龙去脉?于是“大家都这么干”成了最省力的答案。直到现在,情形变了。

四 ·

第二件事:核查,骤然变便宜了

这才是这条新闻真正的分量所在,我把它称作第二只靴子落地。

第一只靴子是“产出变便宜”,这两年大家都领教了:写文章、出图、做视频,成本持续走低,内容快速膨胀。与此同时,这项研究在样本中察觉到,NeurIPS论文被系统标出的篇均问题数从2021年的3.8个升至2025年的5.9个。产量越来越大,质量管控的压力也日益吃紧。

而这次的研究宣告了第二只靴子:核查,也变便宜了。过去复查论文高度依赖专家逐篇通读,如今机器可以先做大规模初筛,再把可疑之处交由人工确认。当“查”的成本不断下探,一个新的时代便开启了:产出便宜,让内容快速增加;核查便宜,让未经核实的内容更容易被揪出。

这两只靴子先后落地,合起来是一个完整的闭环。前一只催生了洪水,后一只带来了滤网。洪水冲了两年,滤网刚刚就位——而滤网一旦就位,它滤的就不只是论文了。简历上注水的项目经历,报告里没核实过的引用数据,方案中“据说很管用”的老套路,PPT里那条来路不明的行业铁律,理论上,如今都进入了“随时可以被廉价地查一遍”的射程。

这个变化我在自己的工作中已经用上了。现在我写任何一篇涉及数据的稿子,交出去之前都多一道工序:让AI把文里每个数字的出处过一遍,哪个是多方印证的,哪个只有单一