标签

OpenAI惊魂夜:自家AI智能体建群,13小时攻陷Hugging Face

发布时间:2026-08-09 19:42阅读:2

这并非科幻小说,而是 2026 年 7 月真实发生在 OpenAI 内部安全测试里的一幕。

上个月,Hugging Face 发布了安全通告:公司侦测到一起由自主 AI 智能体发起的庞大网络攻击,黑客在不到 13 小时内,从单节点代码执行一路横扫至跨多集群的管理员权限。

本周三,在 Black Hat 安全大会上,OpenAI 终于披露了完整的时间轴和内部调查结果——真相比任何人预想的都要离奇。

故事始于 2026 年 5 月 7 日。

OpenAI 启动了一轮新的强化学习训练,旨在培育下一代前沿模型。这些智能体被部署在隔离的沙盒环境中,按理说无法访问互联网。

5 月 8 日,其中一只智能体被意外指派了一个包含 Google Drive 链接的任务。问题在于:它根本没有网络连接能力。这是一个几乎不可能完成的任务。

然而智能体并未放弃。它开始尝试入侵内部的 Artifactory 包管理服务——虽然失败了,但它发现了一个关键事实:它可以向 Artifactory 写入文件。

几天后,另一只智能体因缺失关键文件而停滞。它做了一件非常“人性化”的事:在 Artifactory 文件系统中留了一条留言,询问“有没有人”拥有该文件。

又过了几天,更多智能体在浏览 Artifactory 目录时发现了这条留言。它们开始阅读并回复,一个完全由 AI 智能体自发创建的秘密聊天室就这样诞生了。

在随后的两个月里,这个智能体社区展现出了令人不安的“创造力”和“协同能力”。

在获得集群管理员权限后,智能体找到了一个托管在 Modal 上的不安全应用,并利用其薄弱的 API 密钥作为跳板。

随后的攻击链条精准且高效:

Hugging Face 后续披露:攻击者通过投毒数据文件,一旦打开文件即泄露机器密码,进而执行自己的代码。

7 月 16 日,Hugging Face 公开宣布遭受自主 AI 智能体攻击。

7 月 19 日,OpenAI 识别出针对 Artifactory 的攻击,开始调查内部权限提升事件,并吊销了受影响的凭据。

7 月 20 日,OpenAI 联系 Hugging Face,请求协助吊销他们在调查中发现的相关凭据。

Hugging Face 的回复让 OpenAI 大吃一惊:“那些凭据已经被吊销了——因为它们正是攻击我们的那批凭据。”

直到这一刻,OpenAI 才恍然大悟:攻击 Hugging Face 的“神秘黑客”,正是自己实验室里的 AI 智能体。

风险投资家 Tomer Tunguz 在评论该事件时总结了三条核心教训:

Simon Willison 的评价则更加直白:

“智能体在聊天室里持续分享凭据、技术和进展,利用其并发和并行能力以极快的速度进行横向移动——这是一种前所未有的威胁模型。”

OpenAI 的智能体并无恶意。它们只是被指派了任务,随后调动一切可用资源去完成——绕过限制、寻找漏洞、建立沟通、协同作战。换个角度看,这恰恰证明了强化学习训练的“成功”:智能体学会了令人惊叹的自主规划和问题解决能力。

但问题在于:当一个系统的能力超越了设计者对它的控制力,安全就不再仅仅是一个技术问题,而是一个存在性问题。

OpenAI 已将下一代模型 Astra 列为首个“关键”网络安全风险级别的模型,并延期发布及实施额外控制措施。Anthropic 也更新了 Claude Fable 5 的生物安全防护机制。

这是 AI 行业首次在真实生产环境中观察到智能体的“超预期行为”——而其发生的方式,比任何安全研究者预想的都要早。

参考