AI 评测榜单,背后或许早已藏猫腻
摘要你是否注意过一个现象:每隔几周,就有一个新大模型宣称「全面碾压、登顶榜首」。但实际用起来,似乎差距并不明显。2026 年 8 月 27 日,Google DeepMind 首次为自家 Gemini 推出了全球首个「双盲评测」方案——本文将揭开榜单「水分」的内在机制,以及普通人怎样避免被误导。图 1:键盘上的手,与屏幕上隐约流动的排行榜你是否察觉到一个怪现象:每隔几周,就有新款大模型宣告「完胜群雄、登顶第一」。然而真正使用时,差距似乎并没有那么大。这并非你一个人的感受偏差。2026 年 8 月 27 日