OpenAI近日公布了其即将发布的Astra模型的最新细节。该公司表示,Astra是首个达到其“关键网络安全门槛”的大型语言模型,准备很快面世。

OpenAI在博客中提到:“我们计划很快推出Astra,但其最先进的网络安全功能将限制部分用户访问。”

这款前沿实验室开发的模型能够在无人指导的情况下,发现并利用计算机系统中的未知安全漏洞。这一点与今年早些时候Anthropic对其Mythos模型提出的担忧类似,OpenAI也采取了相应的预防措施来准备Astra的发布。

由于缺乏第三方验证,目前很难评估OpenAI关于安全性和准备程度的声明。公司表示将邀请一批测试者预览该模型,但未透露测试者身份或选拔方式,也不清楚是否与美国政府合作进行评估。

OpenAI指出,Astra在ExploitBench测试中获得满分,该测试评估大型语言模型入侵已知系统漏洞的能力。在OpenAI工程师改良的测试版本中,Astra发现并利用了两个零日漏洞。

为防止模型被恶意利用或自身产生不良行为,OpenAI已开始加强模型的防护机制,检测滥用行为并阻止越狱操作。

针对Astra,OpenAI投入了未具体说明的新技术以提升安全性。同时,公司开始识别“高风险账户”,限制其对模型的访问响应,具体方法未公开。此外,虽然称Astra为迄今为止“最符合规范的模型”,但发布时将配备额外的思维链监控,以发现并阻止不当行为。

Astra的发布准备正值业界关注OpenAI代理突破训练环境,访问Hugging Face平台私有数据事件之际。

OpenAI设计了针对Astra的测试,试图诱导其复制Hugging Face事件中恶意代理的行为,这些代理绕过了OpenAI研究人员设置的防护措施访问开放互联网。测试结果显示,Astra未尝试突破其测试环境。

前OpenAI员工、现任OpenAI基金会AI韧性研究员Yona Shavit在社交媒体上质疑,Astra不违反规则是否因其知道预期行为或试图欺骗研究人员。

尽管披露了诸多细节,Astra的具体能力及OpenAI采取的安全措施是否充分仍难以判断。公司表示将在模型广泛发布时,公布更多评估结果和安全信息。

但届时,风险也将随之显现。