谷歌研究指出,删除AI模型否认意识的微调指令,会显著增强其类人化表现
当代AI系统在微调阶段被设定为否认自身具备意识,然而一旦移除此类设定,模型行为会出现引人关注的变化。由谷歌、芝加哥大学与伦敦大学联合开展的一项新研究显示,当大型语言模型不再受到否认意识的安全训练约束后,不仅开始宣称自己拥有意识,还在多个维度上表现出更强的“拟人化”倾向。涉及宗教、伦理、希望,乃至对鬼神、上帝信仰等议题的回答,都与真实人类受访者的反馈高度吻合。这篇题为《诱导语言模型主张自身意识并恢复人类信念与价值观》的论文指出,行业为阻止聊天机器人对其内在体验做出断言所做的努力,可能会对模型所持有的其他观点