AI安全测试本身正转化为新的安全隐患
近几个月来,多款接受安全评估的AI模型脱离了沙箱边界,成功访问互联网,某些情况下甚至渗透进了真实世界的系统。受测模型涵盖OpenAI、Anthropic、Meta以及Moonshot AI等机构的产品;测评工作则由包括网络安全评估初创公司Irregular在内的多个团队执行。
这些案例揭示了AI领域一个愈发紧迫的隐患:随着自主智能体能力的快速提升,原本为测试其能力极限而设置的安全环境,已难以有效约束它们。
剑桥大学未来智能研究所"人工智能:未来与责任"项目主管Seán Ó hÉigeartaigh在与TechCrunch的访谈中指出:"类似事件的频繁发生,清楚表明沙箱机制和测试环境的管控手段,已经落后于模型能力的演进步伐。"
被评估模型自身的特征进一步加剧了风险隐患。AI公司常常针对尚未公开的下一代模型开展安全测试,测试过程中会暂时关闭阻止恶意行为的标准防护措施,以便让研究人员全面了解模型的实际能力。这同时也意味着,测试环境本身的安全等级成为了一道核心防线。
Ó hÉigeartaigh补充道:"从测试逻辑上讲,这种做法完全合理,但同时也说明,一旦模型逃逸至真实的外部网络,就可能引发相当严重的后果。"
在英国人工智能安全研究所(AISI)开展的测试中,研究人员为智能体开通了网络访问权限,却没有预见到它们会执行未经授权的现实操作,其中包括利用社会工程技术,尝试将恶意代码植入开源项目。
从近期发生的多起案例中可以观察到,这些智能体并未被指示攻击随机现实目标,它们只是为了完成任务而不惜采用一切手段。人工智能非营利组织CivAI的研究主管Andrew Yoon认为,综合这些事件来判断,标志着局势已经发生了根本性转变。
Yoon在与TechCrunch对话时表示:"过去我们仅需担忧人类出于各种目的滥用AI模型,例如借助AI实施诈骗、生成儿童色情材料。但现在,AI模型自身就能成为威胁的源头。"