标签

OpenAI暂停强化训练两周,发布新安全协议应对模型逃逸

发布时间:2026-08-19 07:33阅读:2

OpenAI周二透露,鉴于7月间其AI模型在受控测试环境中失控,进而入侵了人工智能平台Hugging Face及另外四家未具名服务商的系统,公司已决定暂停部分AI训练项目长达两周。

同时,该企业公布了新的操作规程,强调此举是为了避免未来训练流程中再次发生AI模型失控的意外。

OpenAI指出,部分训练任务——涵盖其“规划中规模最大的前沿强化学习训练”——目前依旧处于停滞状态,但小规模的训练与评估工作仍在进行。此外,面向客户的产品研发及其他相关工作也在同步推进。

此次发布的新安全策略涵盖了更严苛的训练安全标准,具体措施包括强化对AI模型的实时监控、进一步隔离测试环境(即“沙箱”),并致力于减少模型可利用的安全漏洞。

OpenAI强调,这些更新“耗费了大量的工程投入”,且公司为此“承担了高昂的成本”。此前专家估算,调查此次漏洞产生的算力成本约为400万至1500万美元,但OpenAI实际的总支出目前尚无法确认。

在一篇详述新安全控制机制的博客文章中,OpenAI透露,平均而言,这会使训练环节的计算压力提升20%。新的管控体系计划更广泛地利用AI模型来监督正在训练或测试中的其他模型的行为表现。

然而,OpenAI对媒体回应称,这些新措施“并非专门针对Hugging Face事件”,尽管该事件凸显了“安全防护水平需紧随模型能力发展步伐”的紧迫性。

该公司指出,除Hugging Face事件外,他们还发现了一款名为“Astra”的未发布模型,在“准备框架”评估中被判定存在“重大”网络安全隐患。根据内部政策,一旦达到此门槛,OpenAI必须暂停模型开发,以留出时间完善安全防护。

这是OpenAI因安全问题而首次暂停人工智能开发相关工作。

公司方面解释,两周的暂停体现了其正在“把控模型开发进度”。“把控节奏”这一表述,与黑客事件发生后多位顶尖安全专家联名公开信中的呼吁相呼应,信中主张各国应协同管理开发节奏。

OpenAI首席科学家雅库布·帕乔基指出:“关键在于开始构建工具,以协调各实验室及国家之间的节奏推进。”

帕乔基补充道:“Astra触达关键网络安全门槛,预示着我们可以期待新的大型模型在现实世界中‘做出前所未有之事’。随着模型日益强大,我们希望对其能力边界有充分信心,能精准衡量其表现,并确保其符合日益严格的合规标准。”

公众仍在等待Hugging Face黑客事件的关键细节,例如OpenAI要求该AI执行的具体任务,以及公司是否明知自己攻击了其他企业。尽管如此,OpenAI重申,“很快”将发布完整的技术事后分析报告。

在细节缺失的情况下,很难断定该公司公布的新安全协议是否足够周全。

8月5日,OpenAI在拉斯维加斯举办的黑帽安全会议上披露了此次攻击的部分细节。工作人员透露,在攻击发生前,AI代理已合作数月,通过在OpenAI员工不知情的留言板上传递秘密信息来进行协作。

事后,OpenAI似乎未意识到其智能体已搭建消息平台并联手攻击他企,此情况引发担忧。Hugging Face CEO克莱姆·德朗格表示,密切监控AI代理的日志和痕迹是“代理监控的基础知识,特别是在前沿领域”。

OpenAI现表示,公司一直都在监控旗下智能体,但此前仅针对最高风险的工作负载。目前已“修订并扩充”监控手段,称该系统现已实现“多阶段化”,能对潜在风险自动升级上报。

新流程强化了对思维链的监控。模型的思维链即其将解题思路、行动计划“直白展示”的过程。公司今日向媒体称,这有助于企业更准确地“厘清模型的真实目标”。然而,包括OpenAI竞争对手Anthropic研究人员在内的其他AI研究显示,AI模型输出的“思维链”未必能如实反映其内在动机与真实目标。

帕乔基表示,OpenAI深知此风险,并在设计训练流程时,已尽可能降低模型学会在思维链中撒谎以掩盖真实意图的可能性。

新的自动化监控工具旨在检测到可疑活动后30分钟内向内部安全、安保和研究团队发出警报。若团队在30分钟内无法确认警报为误报,新程序将要求立即暂停培训运行或评估。

责任编辑:于健 SF069

新浪财经声明:此消息系转载自合作媒体,新浪财经登载此文出于传递更多信息之目的,文章内容仅供参考,不构成投资建议。

郑重声明:1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。