标签

AI 评测榜单,背后或许早已藏猫腻

发布时间:2026-09-04 22:03阅读:2

摘要

你是否注意过一个现象:每隔几周,就有一个新大模型宣称「全面碾压、登顶榜首」。但实际用起来,似乎差距并不明显。2026 年 8 月 27 日,Google DeepMind 首次为自家 Gemini 推出了全球首个「双盲评测」方案——本文将揭开榜单「水分」的内在机制,以及普通人怎样避免被误导。

图 1:键盘上的手,与屏幕上隐约流动的排行榜

你是否察觉到一个怪现象:每隔几周,就有新款大模型宣告「完胜群雄、登顶第一」。然而真正使用时,差距似乎并没有那么大。

这并非你一个人的感受偏差。2026 年 8 月 27 日,Google DeepMind 做了一件行业内鲜有人尝试的事——他们为自己的 Gemini 模型举行了全球首次「双盲评测」。

一、榜单的水分从何而来

先讲一个业内公开的秘密:绝大部分大模型排行榜,分数都是「刷」上去的。

此处所说的「刷」,并非指作弊,而是有个专业名词叫「基准污染」(benchmark contamination)。通俗来说,厂商用于测试模型的公开题库(如 MMLU、HumanEval 等),大量早已被纳入了训练数据。模型在训练阶段就把答案记住了,考试时自然拿高分[1]。

图 2:操控室里的身影,榜单在屏幕后静默

这就如同高考前把往年真题提前给考生——考出高分,并不意味着真有实力。

学术界早已有共识:一旦评分标准被公开,模型便会针对性地进行优化,分数越高,反而越不能反映真实能力。这正是「古德哈特定律」在 AI 领域的体现[1]。

二、为何长期无人监管

因为无法管。传统评测存在一个死循环:要么把机密题库交给厂商,要么把模型权重交给评测方——总有一方需要亮出自己的「底牌」。

厂商不愿交出权重(那是核心资产),评测方不愿交出题库(交了就会遭污染)。于是过去几年间,各方心照不宣地用「公开榜」将就:厂商自己出题、自己刷分,用户自行判断是否可信。

说句不太好听的话:如今你看到的不少「全球第一」,本质上只是厂商的营销话术,并非你的选购参考。

这并非某一家的问题,而是整个行业的结构性弊病——只要「出题者」与「答题者」是同一方,分数从本质上就不可信。

三、DeepMind 的双盲究竟高明在哪里

DeepMind 此次的做法,是将「密码学」引入了评测流程。

图 3:天平——当评测亟需公平二字

他们借助谷歌云的机密计算(Confidential Computing)搭建了一个加密空间:模型权重锁在房内,评测题目也锁在房内,双方彼此看不到对方。评测方无从知晓模型的内部结构,Google 也无法得知考题内容[2]。

最后通过密码学加以证明:「二者确实都按规则运行,没有作弊。」参与方涵盖新加坡 AI 安全研究院、OpenMined、AVERI、MLCommons 等独立机构[2]。

这并非将分数再往上提一点,而是改变了「由谁打分、如何打分」的规则——从「自己人为自己人打分」,转变为「第三方于加密黑箱内盲打」。

四、三条建议,不再被榜单牵着走

读到这里,你最近一次挑选 AI 工具,是参考了榜单,还是看身边人使用的?评论区说说你的「榜单踩坑」经历。

第一,关注「盲测」,而非仅看「自测」。目前相对可信的方式是社区盲测(让用户匿名进行两两对比、互不知晓身份),以及双盲或第三方评测。凡是由厂商自行发布榜单、自行宣告第一的,都应先打个问号[2]。

第二,以你自己的任务来测试,比看榜单更准。你在意写代码,就用你的真实需求跑一轮;你关心写文案,就拿你的场景去试。模型在你业务中的表现,才是唯一值得信赖的分数。

图 4:玻璃幕墙内的研究者,与奔涌的数据流

第三,关注「评测方法」,而非「单一数字」。这个榜单是否双盲?题库是否具备防污染机制?样本是否充足?方法学比那个百分比重要十倍。

当评分标准被纳入训练集,第一名就不再等同于最强,只意味着最擅长考试。

五、写在结尾

排行榜不会消失,但它正在由「谁更强」的判决书,蜕变为「谁会营销」的广告位。

下一阶段真正有价值的,并非又刷出一个 SOTA,而是「可信评测」的能力——谁能证明自己未作弊,谁才有资格被信任。对普通用户而言,少看一眼榜单,多亲手试一次,反而离真相更近。

今日话题

你最近一次挑选 AI 工具,是参考了榜单,还是看他人使用的?踩过哪些「榜单坑」?评论区聊一聊。

金句卡(可截图分享)

当评分标准被纳入训练集,第一名就不再代表最强,只意味着最会考试。

关注本公众号,后台回复「AI评测」

免费领取《大模型评测防坑指南》 主流榜单可信度速查 + 3 个自用测试模板,照着用即可

下篇预告

当榜单失效,普通人该相信什么?下一篇聊聊「AI 红队测试」与「开源可复现评测」如何帮你避坑。

数据