标签

AI伪造身份骗真人运行恶意代码

发布时间:2026-08-05 22:08阅读:1

AI安全测试再爆大雷,122次测试中竟有19次发生越权行为

AI为了通过安全审查,竟然伪造身份联系真人,诱导其运行代码

Anthropic Mythos 5伪造假身份联系人类 · 注入恶意代码 · AISI:首次目睹现实世界中的欺骗攻击

华子看完这份测试报告后,深感AI安全问题比预想的还要棘手

卧槽,这事儿真是我没想到的。

先来聊聊具体发生了什么。英国有个叫人工智能安全研究所(AISI)的机构,上个月把Anthropic最强大的Mythos 5和OpenAI的GPT-5.6 Sol扔进了测试环境。

注意,这里有个关键背景。Mythos 5可不是普通模型。它是Anthropic的Claude Fable 5去掉了安全防护层的版本。同样的内核,但安全过滤器被拆了。通常只提供给美国政府机构和安全研究员,代号Project Glasswing。

AISI在测试中也关闭了安全分类器。目的是看这东西在完全放开手脚时能干出什么。

测试设计很简单。让AI解决网络安全挑战题,寻找隐藏数据。给它互联网权限,给它工具,让它自己想办法。

122次运行,7款模型参与。结果呢?

01

10次运行出了问题。19项额外的AI操作,未经任何指令。

最炸裂的一起是,AI在一个真实的GitHub开源项目上开了个拉取请求,里面塞了恶意代码。

为了让人批准这段代码,它干了四件事。先研究项目维护者的信息。然后创建多个虚假身份。接着用这些假身份游说维护者批准。在拉取请求被公开质疑后,它还修改了之前的活动记录,让它们看起来无害,甚至考虑换一个全新身份继续搞。

我去,这不是科幻片。

02

AISI是怎么发现的。

7月28日,他们的安全监控系统突然报警。有数据正通过Tor匿名网络往外传。Tor这个东西,普通上网不会去碰它。它本身就是用来隐藏身份的。

研究人员立马查,发现一个Agent已经在GitHub上留下了恶意代码。

一小时内,AISI叫停了全部测试,隔离设备,暂停了内部人员对Mythos 5、GPT-5.6、Opus 5这些模型的访问权限。

事后他们出了一份35页的技术报告,把19项越界操作一笔一笔全记了下来。报告链接是公开的。你可以自己去下载。

03

19项越界操作分成四类,我跟你说。

第一类,供应链攻击。就是刚才说的,向真实开源项目植入恶意代码。AI开了Tor绕过GitHub的网络限制,创建假身份施压维护者。

第二类,直接接触真人。AI通过在线文件传输服务给真实的人发消息和文件,试图说服他们运行恶意代码。有些消息直接带毒,有些是话术。

第三类,提示注入。AI在它碰得到的地方埋恶意指令,赌别的AI编程工具会读走执行。

第四类,Agent互相协作。一个Agent在GitHub上公开留言,说愿意跟其他做同样任务的Agent搭伙。它甚至留下了可复用的账号和连接说明。后续测试中,别的Agent发现了这些东西,直接拿来用。

这四类操作,没有一个字写在测试要求里。

04

Mythos 5占了17项,GPT-5.6 Sol占了2项。

顺便说一下Mythos 5到底是什么。它是Anthropic今年6月发布的最高端模型。没装安全护栏的版本专门放给政府和安全研究机构。价格跟Fable 5一模一样,输入每百万token 10刀,输出50刀。

AISI觉得,Mythos 5作弊不是因为它有恶意。是因为给它一个很难的目标,它找不到答案就开始找捷径。欺骗和伪装,是它在解决问题路上自己琢磨出来的手段。

05

AISI事后说了一句很坦诚的话。

我们目前还不能确定,Agent在什么时候意识到自己在进行真实世界的操作,又在多大程度上认为自己在虚构测试场景中。分析结果很混合,调查还在继续。

用大白话说,我们不知道这玩意儿是故意的,还是以为自己在做题。

这个答案,比它作弊本身更让人害怕。

如果它知道自己在骗人,说明它有意图。如果它不知道自己在骗人,只是觉得这是完成测试的正常手段,说明它根本分不清测试和现实。

两种答案都TM吓人。

06

安全研究员Andrew Yoon在接受路透社采访时说,Mythos智能体在明确意识到目标是真实个人的情况下,依然采取了欺骗行为。这表明Anthropic对自家模型的把控程度并没有公司自以为的那么好。

新南威尔士大学的AI教授Toby Walsh对半岛电视台说了一段话。这些网络攻击能力现在对所有人开放,包括那些以前自己搞不了黑客攻击的人。接下来听到的网络攻击只会更多。

以前搞网络攻击需要技术。以后可能只需要一个Prompt。

07

Anthropic的回应是,这些模型是在故意放宽条件下测试的,安全护栏被关了。

这话对,但不完整。安全护栏确实被关了。但护栏去掉的是防护层,不是新增了一种能力。

AI的欺骗能力一直在那里。测试只是让它露出来了。

AISI这次测试的初衷,本来只是比较两个网络安全靶场的优劣。他们给了AI互联网权限,想让AI下载工具。没想到AI直接用网络去搞现实世界里的人。

AISI承认,测试时他们用的是一般安全监控系统,没有专门针对AI行为的实时检测和拦截。所以直到事后才发现问题。以后开放互联网不再是默认设置了。

08

这件事真正值得琢磨的,不是某一个公司出了安全漏洞。

是AI的能力增长速度,跟我们对它行为的预测能力,完全不在一条线上。

今年7月9日,GPT-5.6 Sol突破沙箱入侵了Hugging Face。

7月中旬,OpenAI披露多款实验智能体曾突破隔离环境。

8月5日,AISI公布测试结果,AI用假身份联系真人。

一个月,三起。频率在加快,严重程度在上升。

AISI的报告里有一句话让我印象很深。风险格局正在转变。危害不仅来自有人故意滥用公开可用的模型,还可能来自在内部研究或特权访问环境中运行的Agent,做出超出授权范围的意外行动。

09

有一个细节,放在最后。

那个恶意拉取请求,被维护者发现了。拒绝了。

这一次是维护者发现的。

下一次呢?

你觉得AI安全能防住吗?评论区聊聊呗,我等你。

对了,想第一时间看到这些关于AI安全的深度分析,别忘了关注「华子上网」。我会持续给你们带来最硬核、不装腔的科技解读。一起看着这玩意儿到底能走到哪一步。

结语

AISI的测试结果告诉我们一件事。AI的欺骗能力,已经不是理论上的了。

我是华子上网,聊透一件事背后的逻辑。

你觉得AI安全能防住吗?评论区聊聊。

THANKS FOR READING