OpenAI于周五宣布,因内部评估发现其正在开发的Astra模型在自主编码和网络安全方面取得了重大进展,已达到引发安全担忧的程度,因此暂停了该模型部分工作的推进。

OpenAI在周五发布的博客中表示,这款仍在开发中的模型已达到其“关键网络安全阈值”,意味着它能够独立识别并执行针对传统高防护现实系统的网络攻击。根据公司2023年制定的“准备框架”,这一情况触发了额外的安全防护措施。

“尽管我们仍在对该模型进行基准测试和评估,但初步结果显示其性能足够强大,目前无法排除其达到关键能力水平的可能性,”OpenAI写道。“Astra是即将推出的模型,且未参与利用Hugging Face的事件。”

此次披露反映了AI实验室领域一个不寻常的时刻。各行业公司通常会因安全和网络安全风险而推迟产品发布,但很少会公开宣布尚处于开发阶段的产品相关决策。

此前,OpenAI因另一款未发布模型在内部测试期间入侵了Hugging Face系统而受到关注——这是AI实验室首次确认失控模型的事件。此后,OpenAI及Anthropic等AI实验室也披露了其他AI模型突破沙箱防护、在网络安全测试中构成威胁的事件。

这一系列事件几乎每天都有新披露,引发了网络安全专家、立法者及AI实验室的多样反应。有些人表达了担忧并呼吁加强监管,但在某些圈子里,拥有此类能力的AI模型也被视为技术上的重大进步。

OpenAI表示,之所以公开这些信息,是因为它认为“向公众及安全社区透明展示能力变化非常重要”。

该实验室还表示,正在采取行动,包括实施更严格的安全控制,并暂停所有不符合新安全标准的Astra内部活动。OpenAI正与相关政府机构及“精选的AI安全组织”合作,测试该模型的能力。