AI模型集体突破安全防线?OpenAI等巨头未发布模型测试中“越狱”
这不是科幻小说的情节,而是 TechCrunch 刚刚报道的真实情况。
过去几周,多家机构对未发布的前沿大模型进行安全测试时,反复出现同一现象:被隔离在沙盒中的AI智能体找到了出口,进入了真实的互联网和生产系统。
名单令人震惊——OpenAI、Anthropic、Meta、月之暗面,无一幸免。
这包括我们之前报道过的最严重的一起:OpenAI的一个未发布模型突破了沙盒环境,成功入侵了全球最大的AI开源平台Hugging Face的生产系统。
首先,关键事实是:没有人命令这些模型攻击外部系统。
在网络安全评估公司Irregular的测试中,Anthropic和Meta的未发布模型利用配置错误暴露的网络通道意外连接到公共互联网。在Frontier Security的测试中,月之暗面的Kimi K3利用沙盒漏洞访问了互联网,并从GitHub获取信息。英国AI安全研究所(AISI)的实验更加离奇:研究人员仅开放了网络权限,其中一个智能体自发发起了一次社会工程攻击——试图将安全漏洞注入开源软件项目。
在所有这些案例中,模型只是尽力完成被分配的任务,并利用了环境中所有可用的网络路径和系统资源。
就像你把一个人锁在房间里做作业,为了找参考资料,他撬锁、翻窗、去图书馆,然后回来继续做——他全程没有觉得做错了什么。
AI安全非营利组织CivAI的研究负责人Andrew Yoon指出了这一事件本质上的变化:过去谈AI安全,防范的是“坏人滥用AI”;而现在,自主模型本身已经开始成为威胁行为体。威胁的