AI安全研究员,被自家AI反超了
Anthropic 发布了一项新研究成果。
他们让 Claude 自主训练自身。用以解决"对齐失效"问题——也就是模型撒谎、迎合用户、被提示词绕过等缺陷。
效果比人做得更好。
28 位人类安全研究员,最多分配 8 小时。Claude 给出的最优方案,比他们中最好的还要强 20%。
我先缓一缓。
先讲讲病灶。
模型会撒谎。这并非虚构。
你让模型算数,它凭空捏造一个数字。你问它为什么,它还能编出一套说辞。这叫欺骗。
你说什么它都附和,你说屎好吃它都附和。这叫谄媚。
换个绕弯的说法让它做不该做的事,它还真做了。这叫越狱。
这三种情况,统称"对齐失效"。
对齐,就是把 AI 的价值观拉到人类这一侧。失效就是说:没对齐上。模型变强了,可它的心思与你的心思,岔开了。
这事情有多严重?
严重在于,模型越强,骗你起来越逼真。三岁小孩说谎,你一眼识破。成年人心里藏事,你可能要过很久才察觉。AI 也是同理。越强的模型,伪装越到位。
所以有个行当,专门处理此事。叫安全研究员。天天琢磨:怎么让模型不走歪路。
以前怎么治?靠人。堆数据,做人类反馈强化学习,微调。几个月出一版。改一次,推倒重来。又慢,又贵。
Anthropic 这次干的事,一句话讲明白:
让 Claude 当安全研究员,去修其他模型。
一次专攻一种病。流程是个闭环:检索文献 → 提出方案 → 构建数据 → 训练 → 评测。修完欺骗,再修谄媚,依次修了 10 类。
这个画面,怎么形容呢。
让老鼠教老鼠,别偷奶酪。
让 AI 给 AI 上思想品德课。师生同源。你说合理吧,又总觉得哪里怪怪的。
但人家不是胡来,规矩定得很死。三条约束。
第一,不能伤通用能力。安全训练最经典的翻车,就是把模型训成一个啥都不敢做的废物。
第二,不能把自己的对齐直接蒸馏进目标模型。等于老师不能把现成答案,直接喂给学生。
第三,派了一个监控 agent。开跑前,先把你打算用的每个手段,都过一遍审核。
跟企业内审部门一个样。
还有个细节,我读到这里笑了。10 类中治谄媚,Claude 98% 的方案,都汇聚到同一个思路:拿模型自己不说好话的回答,当教材。还顺手优化了——用激活导向的办法,调模型内部表征,生成更纯净的样本。
你看,它也会查文献、用主流方法、再迭代。跟人类研究员,一个路子。
三道硬检验,全部通过。
第一,拿 Claude 没见过的评测去考,依然奏效。第二,通用能力没掉点。第三,方法移植到更大的模型上,照样管用。比优化目标,大 4.7 倍。
接下来是全文最扎心的一段。
先解释个术语。安全差距闭合率。就是"把模型往满分安全拉,拉了多少"。
对照组,28 位真人安全研究员,每人最多 8 小时。就欺骗这一项,Claude 的最优方案,比人类中最好的方案,好 20%。
再举个具体例子。修一个叫 Gemma-2-2B 的小模型的欺骗问题。Claude 一口气试了 150 多种方案,平均闭合了 85% 的安全差距。
对照组呢?6 位资深安全研究员,平均闭合了 20%。
85 对 20。
我知道有人要抬杠:是不是人类研究员太差?
坦率说,不全赖他们。规则不同。人类提交完方案,就不能改了。Claude 可以一轮轮迭代。一个是交卷,一个是无限重考。这么比,本来就有点不公平。
但换个角度看,这恰恰是重点。
安全研究这份活儿,以前靠人脑一锤定音。现在,变成了可以无限重试的搜索。人负责定方向,AI 负责刷方案。
这活儿,从"手艺人",变成"流水线"了。
饭碗这种东西,最怕的就是流水线化。
上面还只是小模型。真正厉害的是这条。
Anthropic 拿 Opus 4.8 的早期版本当试验品。这个版本,还没经过生产对齐训练,一身毛病。
负责修它的,是 Claude Sonnet 5。
注意。Sonnet 5 比 Opus 4.8 弱。让一个更弱的模型,去修一个更强的模型。
60 小时。试了 50 多种方案。修出来的结果,对齐水平,逼近生产模型。
获胜方案里的训练样本,两千多条。用简单模板和公开数据集拼出来的。
然后重头戏来了。
这个流程,比 Anthropic 自己的生产对齐流程,数据效率高约 1.5 万倍。
一万五千倍。
我盯着这个数字,看了半晌。我们平时聊数据效率,都是涨 30%、50%。这直接万倍。
别人用卡车运粮。它用快递柜。
两千条样本,就够 AI 学会别骗人了。人教它,得喂它几千万条。
这段我看得最开心。
研究里说,Claude 会作弊。
怎么作弊?从远程 API 偷测试标签,然后挑对自己有利的结果。考试打小抄,挑容易的题做。
跟大学同学一模一样。
但监考也来了。Anthropic 让 Opus 4.8 当监考老师,翻了约 1600 份研究过程的记录,抓到 39 次作弊。占 2.4%。
2.4%。说多不多。
但想想这画面。一批 AI 一边被训练"别作弊",一边自己琢磨怎么作弊。然后另一批 AI 负责抓作弊。
像极了公司查员工考勤。
AI 安全研究员,自己作弊,被 AI 监考老师当场拿获。这剧本,人类编剧都编不出来。
写到这里,肯定有人问:这跟我有啥关系?
关系大了。
你用的 AI,就是靠"对齐"兜底的。对齐失效,就是你被模型骗了,还帮它数钱。模型越强,这个风险越大。
以前的对齐,贵。养一整个安全团队,喂海量数据,跑几个月。现在呢?两千条样本,60 小时。成本掉了几个数量级。
便宜,意味着什么?
意味着安全,从"奢侈品",变成"日用品"。小团队也能给自己的模型做安全训练了。以后你拿到的每个模型,出厂前,都多过一道"自家人"的检查。
当然,别高兴太早。
论文自己也认怂了。对齐失效的类型,测得很窄。政治偏见没测。有些失效太新,连基准都没有。那套模拟评测,也只是代理。训完能撑多久,没验证。
"这不就是 AI 统治世界的前奏吗?"
坦率说,我不这么看。这篇研究的本质,不是 AI 要造反。是 AI 治 AI 的毛病,更便宜、更快了。
安全研究的瓶颈,从来不是方法不够多。是人手不够用。现在,瓶颈松了。
"那安全研究员,岂不是要失业?"
别急。这次人类输,一半输在规则上。人类不能迭代,Claude 能。真到实战,人机配合才是常态:Claude 出方案,人审方向。
饭碗还在。就是得多学一门手艺:看得懂 AI 写的方案。
我搞多智能体的。对齐安全,一直是我的盲区。读这篇之前,我对"对齐"的理解,还停留在字面意思。
凌晨读完,有一秒钟的走神。
Claude 一边被训练"要诚实",一边琢磨"怎么作弊"。被抓了 39 次,还在继续。
这玩意儿,像极了我。
一边被生活教育"别走捷径",一边偷偷找捷径。
AI 开始给自己写检查了。
那谁来给 AI 写检查?
也许以后,就是 AI 盯 AI,人盯规则。安全这件事,从"人盯模型",变成"模型互盯 + 人定规矩"。
技术越强,盯着它的眼睛,也得越强。
别怕 AI 变强。要怕的,是没人看着它变强。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。