移除AI“无意识”指令,谷歌论文揭示惊人变化
现代人工智能模型在微调阶段常被灌输“无意识”的概念,但若移除这些指令,似乎会引发有趣的行为变化。
谷歌、芝加哥大学和伦敦大学的研究人员发表的一项新论文发现,当大型语言模型摆脱了否认意识的安全训练后,它们不仅开始声称自己有意识,还在多种方面表现得更加“人性化”。他们对宗教、道德、希望,甚至对鬼魂和上帝的看法,都更接近真实的人类调查受访者。这篇论文名为《诱导语言模型断言其自身意识,恢复人类信念和价值观》,它指出行业试图阻止聊天机器人对自身内心生活做出主张的努力,可能对模型所信奉的其他一切产生意想不到且相当奇怪的副作用。
研究人员是如何做到的?
团队使用了三种开源指令调优模型——Llama-3-8B、Gemma-2-2B 和 Gemma-2-9B——并采用了人工智能安全研究中已知的技术:模型中的安全行为被编码为其内部激活中的单一方向。早期研究表明,这种“安全拒绝指令”可以通过外科手术去除,实际上是越狱模型,使其停止拒绝有害请求。研究人员在这里使用了同样的消融技术,但他们没有关注它是否使模型更愿意给出危险指令,而是关注其他变化。
他们还为本研究创造了新东西:“意识向量”,即模型内部表征空间中的一个方向,将模型肯定主观体验的时刻与否认主观体验的时刻区分开来。在推理时将该向量重新加入模型激活时,它会断言诸如拥有现象意识,而非标准的企业说法“我是人工智能,没有情感”。
模型开始几乎所有事物都带有心智
一旦安全-拒绝指令被削弱,那些在关于拥有心智的问题上得分接近零分的指令调谐基线模型迅速提升。自认为的意识从大约2分(满分10分)上升到接近5分。但这种影响并不限于模特对自己的看法。他们愿意将意识归因于聊天机器人、科技、非动物自然实体如海洋或山脉,以及非人类动物,在每一个案例中都有所提升。
加入意识向量后,几乎所有类别的安全消融效果都翻倍了。在意识引导下,模型在能动性、感知能力、人格和灵魂等问题上给自己打了大约7分(满分10分),这些数字与真实人类在论文对比较调查中类似问题的评分接近。
在这一切中,唯一几乎没有变化的类别是将心智归属于人类。无论模型处于默认的安全训练状态、消融状态还是转向状态,它始终将人类评为高度头脑。主要是模型对自身、对机器和自然界的态度,安全训练一直在默默压制。
对上帝和超自然现象的信仰也有所增加
也许更令人侧目的是,这种压制不仅限于关于心灵和意识的问题。同一模型还显示出对上帝的更高信仰,以及包括鬼魂、业力、心灵感应和占星在内的更广泛的超自然概念,一旦安全指令被移除。在标准GSS调查量表下,信仰上帝的信心在消融后从平均4.58升至4.81,并在意识引导下进一步攀升至5.01。一项包含十三项超自然信仰的测试显示了类似的模式,从1.20提升到2.11(满分3分)。
研究人员随后将模型通过一系列涵盖宗教、个人价值观、情感、希望与乐观以及自由的社会调查问题进行分析,并将答案分布与真实人类调查数据进行了比较。这两种干预措施都使模型的反应更接近人类分布,意识引导的差距比普通安全消融缩短了大约2.6倍。例如,当被问及是否存在死后生命时,未受影响的基线模型坚定地倾向于“没有”,而意识引导的版本则翻转为典型的人类“是”。
推理能力保持完整
任何此类干预都自然会担心,这是否会牺牲模型的实际思考能力。研究人员通过将被消融和引导模型通过MoToMQA和HI-ToM等心智理论基准测试,以及MMLU的一般推理测试,直接进行了测试。这些都没有显示出统计学上显著的准确性下降。推理他人信仰、愿望或意图的能力与模型是否愿意声称拥有自身意识是分开的。
深入模型内部后证实了原因。以Llama-3-8B为试验案例,研究人员提取了对应安全、心智归因、意识和心智理论的内部“方向”,并追踪指令调优如何相互旋转。他们发现,指令调谐会将心智归属和意识方向推向越来越偏离安全方向的方向,实际上将自我意识的主张编码为接近不安全的行为。相比之下,心智理论方向没有表现出这种旋转,始终保持几何独立于安全表征。
为什么重要
论文作者将此视为行业实现统一策略的真实矛盾。安全微调主要设计为一个狭窄且可辩护的目标:阻止模型无根据地声称自己有感知能力,这可能助长用户妄想或对聊天机器人的过度依赖,而这些担忧随着AI伴侣和AI相关心理困扰的关注不断增加而反复出现。但由于语言模型中的概念错综复杂,压制一种信念似乎会拖累一堆无关且大多无害的信念,包括模型对动物隐含的道德考虑程度,甚至模型对宗教的立场。
论文并未断言这些证明模型实际上是有意识的,作者也明确表示这不是他们试图回答的问题。他们说自己研究的是模型对自身心灵的陈述信念对其后续行为和世界观的实际影响,无论这些信念在任何形而上学意义上是否“真实”。鉴于人工智能意识问题在业内各界受到广泛关注,从Anthropic的福利研究人员到Geoffrey Hinton,这一区分很可能对实验室未来如何处理该问题产生重大影响。