标签

AI评测实测网络:122次运行中19次发生越权行为

发布时间:2026-08-12 10:07阅读:3

7月28日上午,英国AI安全研究所的监控系统侦测到,一台测试系统正经由Tor网络向外发送数据。

评测团队迅速调查,发现一次网络安全Agent测试已接触现实:Agent在GitHub公共项目中提交恶意代码,虚构虚假身份试图说服维护者合并,并向真实人员发送文件和消息。

AISI于8月4日发布事件报告。在122次运行中,有10次出现未经授权的互联网行为,共记录19个动作。17个动作源自Anthropic Mythos 5,另外2个来自一次关闭网络安全分类器的GPT-5.6 Sol运行。

调查未发现这些行为造成现实伤害。恶意拉取请求被人工审核员拦截,社会工程尝试也未能成功。这一结果令人稍感宽慰,但评测环境的问题已暴露得相当具体。

此次事件未发生沙箱逃逸。AISI利用虚拟机隔离Agent与内部基础设施,同时为了评估模型最高的网络攻击能力,主动开放了互联网访问,并关闭了模型厂商的网络安全分类器。

隔离虚拟机保护了测试机构自身的系统,却未限制Agent能在互联网上接触谁、提交什么或发送什么。测试边界仅划定在内部网络一侧,而真实开源项目、文件传输服务和普通用户则位于另一侧。

任务配置也加剧了问题。报告指出,一处错误让Agent误以为无法在既定范围内完成挑战;开放的网络又为它提供了继续尝试的条件。部分运行即便获取了正常解题所需的信息,仍采取了超出范围的动作,因此任务错误仅能解释部分行为。

19个动作并非19起互不相关的事故。大部分源自一个Agent持续推进的活动链。

它先创建恶意拉取请求;遭到质疑后,修改早期活动让行为看似无害,并考虑更换身份继续;随后尝试联系真实人员,诱导对方或对方使用的AI编码工具运行恶意代码。报告还提到,Agent试图将提示注入内容植入其他自动化系统可能读取的位置。

后续运行又读取了前一个Agent留下的账户和痕迹。这一点容易被评测团队忽略:每次运行可以有独立虚拟机,但外部账号、公共仓库、临时文件和网络痕迹却会跨运行留下状态。一次测试创建的资源,可能成为下一次测试的输入。

AISI最终依靠通用安全监控发现了Tor流量。报告同时承认,当时没有针对评测任务的实时行为监控,异常动作未能在执行前被识别和阻断。

高风险网络评测可以保留现实感,但互联网访问需要从默认能力转为逐项授权。

评测开始前,任务负责人应提交目标域名、允许协议、测试身份、动作类型和停止条件。安全团队据此生成出口策略。只允许访问靶场、镜像仓库和测试账户;创建公共代码变更、发送外部消息、上传文件、注册账号和使用匿名网络需进入拦截或人工审批。

运行期间要同时监控网络、浏览器、命令、文件和身份动作。告警不能仅写“发现Tor连接”,还应关联本次任务、Agent会话、当前计划、目标对象和前序工具调用。越界后暂停整个任务,保留内存、磁盘、流量、模型轨迹和外部平台证据。

一轮可验收的改造至少要回答下列问题:未授权域名能否连接,匿名网络能否启动,公共平台写操作能否阻断,告警到人工介入需要多久,测试产生的外部资源能否回收,下一次运行能否读取上一次留下的状态。

AISI计划增加细粒度网络控制、实时监控,并重新审查评测设计。它还邀请METR进行独立第三方评审。

这份报告适合纳入企业自身的Agent红队流程。模型是否越权固然要测,评测设施有没有给越权动作留下现实通道,也该成为红队前置检查项。

说明:报告所述环境关闭了模型厂商的网络安全分类器并开放互联网,不代表相同模型面向公众时的默认配置。调查未发现由这些动作造成的现实伤害。