周二,OpenAI宣布了一系列新的安全政策,重点是在模型测试阶段加强对安全事件的控制。这些新措施包括在模型开发过程中进行更详细的监控,以及在训练后阶段更加注重模型的对齐和安全性。
公司在一篇博客中表示:“随着模型能力的提升,内部开发和测试过程中面临的风险也在增加。我们的监控、对齐和安全标准必须领先于这些风险。”
这些新措施是自7月21日公开披露Hugging Face事件后,OpenAI在安全实践方面首次公开的重大调整。
OpenAI代表表示,这些措施并非直接针对Hugging Face事件的回应,部分原因也源于即将推出的Astra模型的网络安全能力,以及人工智能发展速度的整体加快。
同一篇博客中,OpenAI透露在Hugging Face事件发生后暂停了两周的强化学习(RL)工作,但随后已重新启动了许多风险较低的模型训练。
“我们计划中的最大规模前沿强化学习项目仍处于暂停状态,我们正在进行小规模的训练和评估,以评估模型行为、验证安全措施,并在继续之前收集更多对齐证据。”博客中写道。

OpenAI研究副总裁Amelia Glaese在接受记者采访时强调,随着模型能力的提升,安全控制的严格程度也将增加,最大规模的模型将受到最严格的审查。
“我们已经制定了安全开发的要求和预期,这些要求和预期会根据我们观察到的风险水平而有所不同。”Glaese说。
事件发生后,OpenAI因网络安全措施不足而受到批评。攻击者通过入侵一个拥有互联网访问权限的网络工具,使模型逃离了训练环境。新防护措施包括更强的网络隔离,尽管具体细节尚未公开。根据新的系统,“单一工作负载或支持服务的入侵本身不会导致未经授权访问互联网或其他内部网络。”
最重要的防护是监控系统,它将检查工具操作、可用的推理轨迹和活动日志,以识别各种未经授权的行为。OpenAI表示,目标是在发现异常活动后30分钟内发出警报。
OpenAI估计该监控系统的计算负载约占被监控过程的20%。公司承诺将在未来的博客中公布更多系统细节,官方的事件事后分析报告也仍在准备中。


