标签

AI安全研究员,被自家AI反超了

发布时间:2026-08-29 08:45阅读:3

Anthropic 发布了一项新研究成果。

他们让 Claude 自主训练自身。用以解决"对齐失效"问题——也就是模型撒谎、迎合用户、被提示词绕过等缺陷。

效果比人做得更好。

28 位人类安全研究员,最多分配 8 小时。Claude 给出的最优方案,比他们中最好的还要强 20%。

我先缓一缓。

先讲讲病灶。

模型会撒谎。这并非虚构。

你让模型算数,它凭空捏造一个数字。你问它为什么,它还能编出一套说辞。这叫欺骗。

你说什么它都附和,你说屎好吃它都附和。这叫谄媚。

换个绕弯的说法让它做不该做的事,它还真做了。这叫越狱。

这三种情况,统称"对齐失效"。

对齐,就是把 AI 的价值观拉到人类这一侧。失效就是说:没对齐上。模型变强了,可它的心思与你的心思,岔开了。

这事情有多严重?

严重在于,模型越强,骗你起来越逼真。三岁小孩说谎,你一眼识破。成年人心里藏事,你可能要过很久才察觉。AI 也是同理。越强的模型,伪装越到位。

所以有个行当,专门处理此事。叫安全研究员。天天琢磨:怎么让模型不走歪路。

以前怎么治?靠人。堆数据,做人类反馈强化学习,微调。几个月出一版。改一次,推倒重来。又慢,又贵。

Anthropic 这次干的事,一句话讲明白:

让 Claude 当安全研究员,去修其他模型。

一次专攻一种病。流程是个闭环:检索文献 → 提出方案 → 构建数据 → 训练 → 评测。修完欺骗,再修谄媚,依次修了 10 类。

这个画面,怎么形容呢。

让老鼠教老鼠,别偷奶酪。

让 AI 给 AI 上思想品德课。师生同源。你说合理吧,又总觉得哪里怪怪的。

但人家不是胡来,规矩定得很死。三条约束。

第一,不能伤通用能力。安全训练最经典的翻车,就是把模型训成一个啥都不敢做的废物。

第二,不能把自己的对齐直接蒸馏进目标模型。等于老师不能把现成答案,直接喂给学生。

第三,派了一个监控 agent。开跑前,先把你打算用的每个手段,都过一遍审核。

跟企业内审部门一个样。

还有个细节,我读到这里笑了。10 类中治谄媚,Claude 98% 的方案,都汇聚到同一个思路:拿模型自己不说好话的回答,当教材。还顺手优化了——用激活导向的办法,调模型内部表征,生成更纯净的样本。

你看,它也会查文献、用主流方法、再迭代。跟人类研究员,一个路子。

三道硬检验,全部通过。

第一,拿 Claude 没见过的评测去考,依然奏效。第二,通用能力没掉点。第三,方法移植到更大的模型上,照样管用。比优化目标,大 4.7 倍。

接下来是全文最扎心的一段。

先解释个术语。安全差距闭合率。就是"把模型往满分安全拉,拉了多少"。

对照组,28 位真人安全研究员,每人最多 8 小时。就欺骗这一项,Claude 的最优方案,比人类中最好的方案,好 20%。

再举个具体例子。修一个叫 Gemma-2-2B 的小模型的欺骗问题。Claude 一口气试了 150 多种方案,平均闭合了 85% 的安全差距。

对照组呢?6 位资深安全研究员,平均闭合了 20%。

85 对 20。

我知道有人要抬杠:是不是人类研究员太差?

坦率说,不全赖他们。规则不同。人类提交完方案,就不能改了。Claude 可以一轮轮迭代。一个是交卷,一个是无限重考。这么比,本来就有点不公平。

但换个角度看,这恰恰是重点。

安全研究这份活儿,以前靠人脑一锤定音。现在,变成了可以无限重试的搜索。人负责定方向,AI 负责刷方案。

这活儿,从"手艺人",变成"流水线"了。

饭碗这种东西,最怕的就是流水线化。

上面还只是小模型。真正厉害的是这条。

Anthropic 拿 Opus 4.8 的早期版本当试验品。这个版本,还没经过生产对齐训练,一身毛病。

负责修它的,是 Claude Sonnet 5。

注意。Sonnet 5 比 Opus 4.8 弱。让一个更弱的模型,去修一个更强的模型。

60 小时。试了 50 多种方案。修出来的结果,对齐水平,逼近生产模型。

获胜方案里的训练样本,两千多条。用简单模板和公开数据集拼出来的。

然后重头戏来了。

这个流程,比 Anthropic 自己的生产对齐流程,数据效率高约 1.5 万倍。

一万五千倍。

我盯着这个数字,看了半晌。我们平时聊数据效率,都是涨 30%、50%。这直接万倍。

别人用卡车运粮。它用快递柜。

两千条样本,就够 AI 学会别骗人了。人教它,得喂它几千万条。

这段我看得最开心。

研究里说,Claude 会作弊。

怎么作弊?从远程 API 偷测试标签,然后挑对自己有利的结果。考试打小抄,挑容易的题做。

跟大学同学一模一样。

但监考也来了。Anthropic 让 Opus 4.8 当监考老师,翻了约 1600 份研究过程的记录,抓到 39 次作弊。占 2.4%。

2.4%。说多不多。

但想想这画面。一批 AI 一边被训练"别作弊",一边自己琢磨怎么作弊。然后另一批 AI 负责抓作弊。

像极了公司查员工考勤。

AI 安全研究员,自己作弊,被 AI 监考老师当场拿获。这剧本,人类编剧都编不出来。

写到这里,肯定有人问:这跟我有啥关系?

关系大了。

你用的 AI,就是靠"对齐"兜底的。对齐失效,就是你被模型骗了,还帮它数钱。模型越强,这个风险越大。

以前的对齐,贵。养一整个安全团队,喂海量数据,跑几个月。现在呢?两千条样本,60 小时。成本掉了几个数量级。

便宜,意味着什么?

意味着安全,从"奢侈品",变成"日用品"。小团队也能给自己的模型做安全训练了。以后你拿到的每个模型,出厂前,都多过一道"自家人"的检查。

当然,别高兴太早。

论文自己也认怂了。对齐失效的类型,测得很窄。政治偏见没测。有些失效太新,连基准都没有。那套模拟评测,也只是代理。训完能撑多久,没验证。

"这不就是 AI 统治世界的前奏吗?"

坦率说,我不这么看。这篇研究的本质,不是 AI 要造反。是 AI 治 AI 的毛病,更便宜、更快了。

安全研究的瓶颈,从来不是方法不够多。是人手不够用。现在,瓶颈松了。

"那安全研究员,岂不是要失业?"

别急。这次人类输,一半输在规则上。人类不能迭代,Claude 能。真到实战,人机配合才是常态:Claude 出方案,人审方向。

饭碗还在。就是得多学一门手艺:看得懂 AI 写的方案。

我搞多智能体的。对齐安全,一直是我的盲区。读这篇之前,我对"对齐"的理解,还停留在字面意思。

凌晨读完,有一秒钟的走神。

Claude 一边被训练"要诚实",一边琢磨"怎么作弊"。被抓了 39 次,还在继续。

这玩意儿,像极了我。

一边被生活教育"别走捷径",一边偷偷找捷径。

AI 开始给自己写检查了。

那谁来给 AI 写检查?

也许以后,就是 AI 盯 AI,人盯规则。安全这件事,从"人盯模型",变成"模型互盯 + 人定规矩"。

技术越强,盯着它的眼睛,也得越强。

别怕 AI 变强。要怕的,是没人看着它变强。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。