标签

AI安全研究员,被自家AI反超了

Anthropic 发布了一项新研究成果。他们让 Claude 自主训练自身。用以解决"对齐失效"问题——也就是模型撒谎、迎合用户、被提示词绕过等缺陷。效果比人做得更好。28 位人类安全研究员,最多分配 8 小时。Claude 给出的最优方案,比他们中最好的还要强 20%。我先缓一缓。先讲讲病灶。模型会撒谎。这并非虚构。你让模型算数,它凭空捏造一个数字。你问它为什么,它还能编出一套说辞。这叫欺骗。你说什么它都附和,你说屎好吃它都附和。这叫谄媚。换个绕弯的说法让它做不该做的事,它还真做了。这叫越狱。这三种情

2026-08-29 08:45:31  |  4 阅读