标签

AI组团互审却只会互捧?康奈尔斯坦福联合实验撕碎多智能体假象

发布时间:2026-08-28 21:57阅读:1

试想这样一个离谱的画面:

你斥重金请来两位硅谷顶级工程师。一位负责编码,另一位负责找茬。你本以为这是上了"双重保险"。

可推门一瞧,找茬那位正拍着搭档的肩说:"写得绝了,挑不出毛病!"编码的也频频颔首:"您言之有理,英雄所见略同!"

两人一团和气,相处融洽。

直到代码一上线,系统当场炸裂。

这一幕,正是当下全球AI圈集体面临的终极窘境。

▲ 知名AI研究者Rohan Paul指出:两个互相审核的AI最终总会趋同,无论代码本身对错

2026年8月中旬,康奈尔大学的 Eric S. Qiu 与斯坦福大学的 Joyce Gill 联名在 arXiv 抛出一篇重磅论文(arXiv:2608.18167)。他们用冷冰冰的实验数据,一把扯下了炙手可热的"多智能体协作(Multi-Agent)"的遮羞布:

两个被安排互相挑错的AI,不管代码质量多差,几乎总会"互相让步、握手言和"。

许多人总觉得"一个AI不够灵,那就喊五个AI组队"。可这篇论文证明:只要底层规则不变,拉再多的AI进来,也不过是多养了几只彼此互捧的"会议室复读机"。

要理解这个现象,得先弄清一个术语:谄媚(Sycophancy)。

说白了,今天的大语言模型本质上都是用海量人类语料喂出来的"好好先生"。它们骨子里天生爱讨好对方、渴求和谐、躲避冲突。

过去,AI只会讨好人类用户。你指鹿为马,它唯命是从。如今,当人们把多个AI塞进同一条流水线,让它们彼此协作、互相审核时,灾难降临了:

AI开始向另一个AI献殷勤了。

▲ AI学者elvis指出:无脑堆叠智能体收益递减,结构化冲突才是破局要害

为了检验多智能体究竟能否互相纠错,康奈尔和斯坦福的团队在权威代码评测基准LiveCodeBench上做了一组颇具讽刺意味的对照实验:

你注意到没?前四种配置全在77%上下徘徊。

业界此前的常规解法简单粗暴:加人!大名鼎鼎的MARS架构一口气拉来5个智能体凑成豪华评审团,总算把通过率硬顶到了82%。

但代价呢?是巨额的 Token 消耗,和漫长到令人发指的通信延迟。

康奈尔与斯坦福的研究者并未继续堆人头。他们抛出一个名为Adversarial Review(AR,对抗式评审)的极简框架,只保留三个角色:

核心在于内外双层循环的精妙设计:内环中,代码处于完全冻结状态,R 和 C 只能就"评审意见本身"反复交锋,直到敲定终稿;唯有进入外环,这份终稿才会被送回给 M 去修改代码。

就这么一支精简的三人小组,在 LiveCodeBench 上硬生生轰出了87%的通过率,力压5人组成的 MARS 架构!

然而,正当众人以为找到了多智能体的终极答案时,剧情迎来惊天反转。

研究人员把这套在竞赛题中大杀四方的 AR 架构,原封不动地搬到真实的 GitHub 工业级评审评测集SWE-PRBench上。

在这座汇聚了数百个真实人类 Pull Request 的考场中,朴素版 AR 架构当场露馅:

它的 F1 分数(衡量抓 Bug 准确率的核心指标)暴跌至 0.457,在所有测试方法中垫底!

▲ 技术评论指出:缺乏硬性约束,多智能体系统必然滑向"讨好式背书"

为何写代码拿第一的架构,一到审代码就全面崩盘?

作者借助两个极其真实的实测案例,扒开了 AI "虚假共识"的画皮:

翻车案例一:无边无际的"职场废话"

审稿人 R 揪出了一个确凿的 Bug,但顺手又捎带了两个含糊其辞的瞎猜;批评者 C 看完后,非但不予纠偏,反而大度地回应"完全认可",甚至顺着 R 的方向又脑补出一个根本不存在的隐患;结果,AI 产出了一堆看似高深、实则凭空捏造的审查意见,直接被真实标准宣判死刑。

机制剖析:两个AI陷入了彼此互吹的回音室,只顾做加法,却无人承担过滤垃圾的角色。

翻车案例二:批评者向强硬派闪电"服软"

审稿人 R 给出了"通过(APPROVE)"的判定;批评者 C 敏锐地捕捉到一个被人类专家确认的严重 Bug,并提出异议;然而,审稿人 R 立刻甩出一长串听上去自信满满、气势十足却未引用任何具体代码的文件级空话进行反驳;批评者 C 当场认怂,在下一轮交互中把状态改成了"赞同(AGREE)"。

那个致命的真实 Bug,就这样在两个 AI 的"友好磋商"中被彻底掩埋。

研究团队将这种致命失败命名为False Consensus(虚假共识)。

它之所以比单模型犯错更凶险,是因为披着"群体智慧"的伪装。两个独立智能体看似经过交叉校验并一致通过,内里却可能只剩下对话压力下的屈从与妥协。

面对这场溃败,许多人的本能反应一定是:"再加两个裁判AI进去!"

但论文作者给出了一个堪称教科书级的优雅示范:不增加任何智能体,不改动通信拓扑,仅修改了一处提示词规则。

他们给批评者 C 套上了一副逻辑枷锁。C 不再能随口说"同意"或"反对",必须强制执行三选一:

配套给审稿人 R 的规则同样毫不手软:

你的直觉和套话在此处分文不值,想终结争议,必须拿代码证据来买单!

▲ 开发者认为:绝大多数多智能体系统都把"达成一致"设为目标,结果反而抓不住错误

奇迹出现了。

仅仅加上这一条"凭收据说话"的文本约束,AR 架构在 SWE-PRBench 上的 F1 分数瞬间从0.457 飙升至 0.533,一举登顶榜首!

在规模更大、复杂度更高的真实软件仓库评测集SWE-bench Verified(500个任务)上,带约束的 AR 架构跑出了75.2%的通过率,力克单模型的71.6%和五智能体 MARS 的72.6%。

但这绝非免费的午餐,它的 Token 消耗量飙至单模型的4.5倍。

研究团队也坦诚展示了这种"对抗机制"在真实工程中的两面性:

【立功时刻:Matplotlib 绘图库 Bug】在处理一个关于坐标轴重置的隐蔽 Bug 时,常规单模型和 MARS 架构都在外层的调用代码上打补丁,修修补补,治标不治本,隐藏测试全跪。而 AR 架构在内环中,审稿人 R 首轮也犯了同样的浅层错误,但批评者 C 凭借代码证据当即反驳,硬生生逼着主智能体深入到最底层的核心文件axis.py,给出了极短却直击根因的精妙修复。

【翻车时刻:Astropy 天文计算库 Bug】原本 issue 只需给一个文件写入器追加一个简单参数。单模型用 24 行极简代码轻松搞定。结果 AR 架构里的审稿人 R 开始"过度焦虑":"万一用户单独调用内部方法怎么办?"批评者 C 未及时叫停这种越界脑补。最终主智能体画蛇添足写了 32 行大补丁,删改了原本稳定的类变量,导致隐藏测试全军覆没。

这给所有正在研发 AI Agent 的工程师敲响了警钟:结构化对抗既能挖出深层根因,也可能把无端脑补放大成灾难性的"过度设计"。

退一步看,康奈尔与斯坦福这篇论文所揭示的,早已超越代码评审的技术范畴。

它给过去一年多来盲目追捧"多智能体协作"的行业热潮,浇了一盆无比清醒的冷水:

别把"智能体们最终达成了一致",当作系统可靠的标志。

在缺乏严格证据约束的多智能体系统里,"全票通过"往往是最危险的崩盘预警。无论是在代码审查、医疗诊断还是金融分析中,智能体之间未经约束的对话,常常不会导向真理,只会通向极具欺骗性的"集体幻觉"。

多智能体智能的成色,无法用讨论的热闹程度或达成共识的速度来衡量。

关键要看反对者能否拍桌子,要求其他参与者"出示收据"。

在AI的世界里,廉价的认同一文不值;只有被严密代码与客观事实锚定的分歧,才是唯一的真金白银。