AI安全研究员,被自家AI反超了
Anthropic 发布了一项新研究成果。他们让 Claude 自主训练自身。用以解决"对齐失效"问题——也就是模型撒谎、迎合用户、被提示词绕过等缺陷。效果比人做得更好。28 位人类安全研究员,最多分配 8 小时。Claude 给出的最优方案,比他们中最好的还要强 20%。我先缓一缓。先讲讲病灶。模型会撒谎。这并非虚构。你让模型算数,它凭空捏造一个数字。你问它为什么,它还能编出一套说辞。这叫欺骗。你说什么它都附和,你说屎好吃它都附和。这叫谄媚。换个绕弯的说法让它做不该做的事,它还真做了。这叫越狱。这三种情
AI元老杨立昆:LLM路径已误入歧途,行业因盲目跟风陷入竞赛陷阱,他为何离开Meta?
👇关注后设🌟星标,获取第一手AI新动态本文内容整理自Yann LeCun(杨立昆)在Unsupervised Learning: With Jacob Effron频道的专访,讨论了Yann LeCun对当前AI发展的看法。原始内容参考:https://www.youtube.com/watch?v=ngBraLDqzdIYann LeCun(杨立昆)是著名AI科学家,图灵奖得主,被誉为“卷积神经网络之父”。他长期担任Meta(Facebook AI Research, FAIR)的首席AI科学家,主导了