标签

OpenAI强化安全管控:因Hugging Face事件暂停RL训练

发布时间:2026-08-19 05:23阅读:2

周二,OpenAI公布了新的安全方针,旨在提升模型测试期间的安全事件应对能力。新规涵盖了开发阶段的深度监控,以及训练后阶段更注重的对齐与安全性。

“随着模型智能水平的提升,内部研发与测试中的潜在风险也随之增加,”该企业在博客中解释道。“我们必须确保监控、对齐及安全标准始终领先于风险水平。”

这是自7月21日Hugging Face事件曝光后,OpenAI安全策略中首批公开的调整之一。

OpenAI代表指出,这些举措虽非专门针对Hugging Face事件,但也受到即将发布的Astra模型网络安全功能及AI整体发展速度的影响。

同一篇博文还提到,OpenAI在Hugging Face事件后暂停了为期两周的强化学习(RL)训练,但已恢复了对多数低风险模型的训练。

“我们最大规模的计划前沿强化学习运行目前仍处于暂停中,同时正在进行较小规模的训练和评估,以观察模型行为、验证安全措施,并在进一步推进前积累更多关于对齐方面的证据,”博文写道。

OpenAI研究副总裁Amelia Glaese向媒体透露,随着模型能力的增强,管控力度也将同步提高,最大的模型将接受最严格的审查。

“我们已为安全开发制定了具体的要求和预期,”Glaese告诉记者。“这些标准和预期将根据我们观察到的风险水平进行调整。”

事件发生后,OpenAI因网络安全实践薄弱而遭到批评,当时模型通过入侵其具有互联网访问权限的工具逃出了训练环境。新措施包括更严格的网络隔离,但细节尚不明确。博文指出,在新体系下,“单一工作负载或支持服务的受损本身不应导致对互联网或其他内部网络的未授权访问”。

最严格的监控措施将检查工具操作、可用推理痕迹和活动日志,以发现各种未经授权的行为。OpenAI表示,其目标是发现可疑活动后30分钟内发出警报。

OpenAI估计,该监控系统的计算成本约为被监控流程的20%。该公司承诺将在后续博文中提供更多关于该系统的细节。关于该事件的官方事后分析报告仍在进行中。

编辑:丁文武

新浪财经声明:此消息系转载自合作媒体,新浪财经登载此文出于传递更多信息之目的,文章内容仅供参考,不构成投资建议。

郑重声明:1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。