
OpenAI近日宣布,其即将发布的下一代AI模型“Astra”已经实施了足够的安全防护措施,能够有效降低潜在的重大风险。此前,OpenAI曾推迟了Astra的部分开发和发布工作,以便对安全措施进行充分验证,最终确认其风险控制达到了预期标准。
Astra是首个被认定具备发现未知安全漏洞能力的AI模型。它能够在具备适当工具和权限的情况下,自动突破多层严格保护的系统,并开发出利用这些漏洞的方法,无需人为干预。这一能力使得Astra在开发和发布阶段必须采取比以往更为严密的安全防护措施。
OpenAI借鉴了此前Hugging Face事件的经验,重新审视并强化了安全策略。公司认为当时的安全措施成功防止了事件的发生,并在此基础上为Astra引入了更强的安全防护。具体措施包括:训练模型更有效地拒绝有害的网络请求,确保遵守安全限制;增加对不当使用的防护;以及引入监控功能以阻止潜在的非法活动。
Astra预计将在近期推出,但对其先进的网络安全功能的访问将受到限制。最初,这些功能将仅向部分测试者开放,随后通过Daybreak Blue平台逐步扩大使用范围,以促进防御性应用的推广。

