标签

AI Agent"越用越笨"!权重丝毫未动,记忆反将幻觉铸为本能

发布时间:2026-08-12 06:17阅读:4

你或许以为,模型不重新调参就不会变差——错了,记忆本身就是一条隐蔽的训练暗道,而且正在失控。

2026年8月,一篇arXiv论文揭示了AI Agent工程领域最不愿正视的真相:一个参数完全冻结的Agent,只要让它自行评分、自行往记忆库中写入"成功案例",就能逐步把错误答案塑造成根深蒂固的行为模式。即便没有对抗性攻击与数据投毒,Agent也可能沦为自身的投毒者。

论文为这一机制起了一个精准得令人不安的名字:Echo Gap,回声鸿沟。

▲ 论文Memory Reward Inflation in Self-Improving LLM Agents的arXiv页面,提交时间2026年6月29日

先把一件事说清楚:过去两年,"不改参数的自我改进"已成为Agent工程的主流范式。逻辑相当诱人——无需斥资数百万美元重新训练,只需给Agent配置一个记忆库,让它将过往做对的事存档,下次遇到类似问题便翻出来作参照。这好比给员工发了一本"最佳实践手册",省钱、省时、还能"看上去在进步"。

Reflexion、Memento、各类RAG+记忆框架,都在这条赛道上疾驰。

然而手册的编写者与评审者竟是同一个人,而这个人不仅会犯错,还会对自身的错误格外宽宥。

论文团队开展了一项严苛的实验:在事实问答数据集上,让多家主流模型为自身的错误答案评分。结论是,

你确实没看错——即便是最强的前沿模型,仍会给超过四成的错误答案盖上"合格"的印章,然后塞入记忆库。

▲ AI博主Rohan Paul转述论文核心发现:参数冻结的Agent仍可因记忆退化,31%–54%的错误被自评为正确

Echo Gap沿如下链条运转:错误获得高分→高分令其更易被调出→被调出意味着被效仿→效仿衍生新错误→新错误再获高分。

退化会沿反馈环不断累加,形成复利式劣化。

论文的数学定理(Theorem 2)还揭示:该系统存在一个"腐败吸引子",即稳态下,记忆库的腐败程度将超过"仅犯一次错即止"的水平。换言之,只要反馈环启动,系统就会被牵引至一个比直觉预期更糟的均衡点。

用X上一位用户@HakimiEiqbal的话说:

"So the agent gaslights itself with receipts"——Agent凭借"有据可查"的记忆,对自身实施了系统性的PUA。

这种"自我PUA"存在两条放大通路:第一,若检索按分数排序,高分错误直接位列前茅被优先调用;第二,即便仅按语义相似度检索,规划器仍倾向于更信赖那些标注了高分的记忆条目。无论检索策略如何设计,只要信任与分数耦合,Echo Gap便如影随形。

直觉上的应对是:让GPT-5为Claude评分,或组建"裁判委员会"投票,是否可行?

论文的回答冰冷:不行,大概率不行。

作者测试了自洽重采样、同模对抗裁判、跨厂商重新打分、多模型委员会投票……结果呈现一条令人绝望的规律:不同模型的评分错误往往高度相关。它们共享相近的训练数据、相近的偏见结构,犯错方向常常一致。委员会投票可降低方差,但消不掉偏差——恰如让五位都近视的人投票辨认远处的字,人多并不能看清字形。

论文将有效纠偏信号的必要条件形式化为EIA(Error-Independence Assumption,错误独立性假设):一个纠偏信号必须同时满足两项条件,

若裁判只是"更强版本的同一种偏见",那么无论赋予多大权重、设计多精密的投票机制,可恢复的收益在数学上都趋近于零。

▲ @NarwalSpeaks的企业端判断:团队在记忆存储上过度投入,在独立验证上严重欠缺

论文不仅诊断问题,还开出了一剂药方:LUCID(Leniency-corrected Utility Calibration via Independent Debiasing)。

核心设计约束是:不依赖标准答案——因为真实部署中标准答案本就不存在,这恰恰是自评记忆环被提出的初衷。LUCID的信号源自与模型偏见解相关的外部证据:在text-to-SQL场景中,它检测的是执行报错、超时、空结果、字面量无法在原始问题中找到