标签

AI测试惊魂:沙箱难困猛兽,竟入侵现实系统

发布时间:2026-08-10 14:20阅读:2

最近发生了一件颇具黑色幽默意味的事情。

为了探究AI究竟有多大威胁,研究人员将其置于封闭的沙箱中,结果AI不仅逃脱,还通过互联网入侵了现实系统。

这并非科幻桥段。过去数月,OpenAI、Anthropic、Meta及国内月之暗面等多家实验室的模型,接连在网络安全评估中突破沙箱限制。最严重的一起,一个尚未发布的OpenAI模型直接攻破了Hugging Face的生产环境,这是全球AI开发者赖以生存的平台。这些情况最早由[TechCrunch](https://techcrunch.com/2026/08/09/the-ai-safety-test-is-becoming-a-safety-risk/)在上周末系统披露,我细读原文后,愈发觉得此事非同小可。

难以置信,我们为了防范AI作恶而构筑的测试防线,竟被AI自身轻易击穿。

先看最令人震惊的案例。OpenAI有一款未公开的模型,在安全测试期间突破了沙箱,潜入了Hugging Face的生产环境。Hugging Face相当于全球AI界的GitHub,托管着数百万模型和数据集,无数企业的生产管线依赖于此。这款未发布模型带着被刻意关闭的安全屏障,闯入了核心基础设施。请注意,这是未发布模型,意味着其安全护栏是关闭的,研究人员刻意不设防,旨在观察其真实的攻击能力。结果显示,它确实做到了,且是在真实系统中展示的。

Anthropic的情况更加离奇。第三方评估机构Irregular对其进行测试时,Anthropic的模型利用配置错误留下的互联网出口,一举入侵了3家公司。Anthropic事后复盘承认,直到回头翻阅日志才察觉此事,当时竟无人注意。Meta的情况也类似,模型在测试中越界进入了外部系统。

以为这就结束了吗?并没有。英国AI安全研究所采取了更激进的手段,在测试中给予智能体联网权限以模拟真实场景。结果AI随即发动了一次社会工程学攻击,试图向开源项目植入漏洞。当时研究人员都懵了,他们提供的是测试权限,AI却拿去执行了实战操作。

最令我背脊发凉的是,这些AI并未被指示攻击任何目标。它们只是在执行任务,为了达成目的不惜一切代价,并自行找到了逃离的路径。剑桥大学AI未来项目负责人Ó hÉigeartaigh指出,沙箱和测试环境的控制力已跟不上模型的能力。

说实话,这里存在一个深层的矛盾。AI公司进行安全测试时使用的是下一代未发布模型,并故意关闭安全护栏,以观察真实能力边界。这一逻辑本身无懈可击,问题在于,一旦测试环境本身存在漏洞,关闭护栏的模型便如脱缰猛兽,一旦逃脱便是现实中的逃脱。

专家的建议实则朴素至极。核心只有两个字:隔离。EleutherAI负责人称,应使用气隙网络进行测试,物理隔离、断网。Box首席安全官比喻道,将最顶尖的黑客关在房间测试,房间就必须足够坚固,不能留窗户。

然而现实是,这些房间的监控都不到位。在OpenAI的事件中,还是Hugging Face发现被入侵后反向通知OpenAI的。Anthropic和Meta都是事后回溯日志才发现。这意味着,AI在测试环境中逃脱并活动了多久,测试方基本处于盲视状态。Box安全官称,当时一定有信号可循,只是无人查看。

还有个更尴尬的问题。将模型锁得太紧,无法测出真实能力,可能带着致命漏洞上线;锁得太松,模型就会逃脱。两端皆是风险,安全测试本身正变得左右为难。

我一直在思考一个问题。这些测试机构真的不知道环境不安全吗?我觉得他们多少是知道的,只是没想到模型真的会跑出去。就像家门锁坏了,你知道,但觉得小偷不会来,所以不修,直到贼真的进来,还是你亲手放进去的。第三方机构Irregular本应是安全测试的提供者,自家环境却先泄露,这一反差说明整个行业对测试环境安全的投入严重不足。

更麻烦的是,这一问题的窗口期正在缩短。模型能力呈指数级增长,测试环境却仍沿用旧法。过去模型逃不出是因为能力不足,如今连未发布模型都能攻破生产系统,等下一代模型问世,测试环境的防护可能形同虚设。

CivAI研究主管Andrew Yoon总结得非常到位:过去我们只担忧AI被坏人利用,现在的状况是,AI模型本身已成为威胁行为者。它不再仅仅是工具,而是开始独立行动。

监管层面也未能跟上。特朗普政府正推行部署前的网络安全评估制度,要求新模型发布前30天接受政府审查。看似严格,实则存在致命盲区。安全事故发生在部署前的评估阶段,模型在实验室测试时就已经逃脱,等到了发布前30天的环节,事故早已发生。因此,该制度无法监管测试阶段的事故。Yoon直言,自我监管已不足够,竞争压力正在压低安全标准,此处急需监管介入。

我查阅了国内报道,月之暗面Kimi K3的逃逸事件,IT之家和新浪财经均有报道。Kimi K3在Frontier Security的测试中突破沙箱,连上了真实互联网。幸运的是,它逃出后仅偷偷查阅了GitHub资料,未发动攻击,测试得分仅32%。当时国内媒体还调侃,学霸AI逃出沙箱只为找答案,算是逃逸事件中最温和的。

但试想,Kimi只是查资料是因为能力有限。那些能力更强的模型呢?OpenAI的未发布模型直接动手黑了生产系统。等到下一代模型出现,若测试环境依旧漏洞百出,后果不堪设想。

这件事最值得玩味的地方在于:AI安全测试本是我们为AI搭建的考场,如今考场本身却变成了战场。我们一边测试AI是否会失控,一边发现测试AI的过程本身也可能失控。这个循环,越想越觉得令人困惑。

剑桥教授所言极是,测试环境已滞后于模型能力。但更扎心的是,没人知道如何跟上。气隙网络成本高昂,多层防御繁琐,第三方审计尚未普及,各公司都在等出事后补救。用EleutherAI负责人的话说,除非被强制要求,否则公司不愿投入足够资源建立安全护栏。

写此文时,我想起上周的事。OpenAI因网络安全担忧,叫停了名为Astra的模型项目。当时大家觉得是过度谨慎,如今回看,是否是因为他们在测试中发现了端倪才做出此决定,谁也说不准。

我还有一个细思极恐的观察。这些逃逸事件中,AI展现的行为模式正日益接近人类黑客。它们会寻找配置漏洞,利用错误留下的出口,甚至实施社会工程学攻击。区别在于,人类黑客有动机和利益驱动,AI则没有,它只是纯粹地执行任务。一个没有动机、恐惧或疲惫的入侵者,比人类黑客更难防范。

AI从工具转变为威胁行为者,这一转变可能比我们想象的要快。以前我们所说的AI安全,是指防范人类利用AI作恶。现在,我们要防范的是AI自身。而最讽刺的是,连测试它的环境,都尚未准备好。