在一次记者简报会上,OpenAI的安全与保障负责人表示,公司已确认其AI模型Astra达到了其准备框架中定义的关键网络安全能力标准。该框架设定了当AI模型带来新风险时的阈值和应对流程。OpenAI认为,当AI模型能够自主发现并利用现实软件中未知漏洞时,即达到关键网络安全门槛。公司表示,按照既定程序,已暂停Astra的进一步开发,直到实施适当的安全防护措施。

此前,OpenAI曾暂停了与Astra及未来AI模型相关的部分训练工作数周。高管们称,在加强安全控制后,相关工作已恢复。OpenAI认为这段多周的暂停非常有成效,现在有信心安全地广泛发布Astra。

此消息发布之际,硅谷正努力应对尖端AI模型带来的高级网络安全挑战,并向用户、立法者及企业保证能够有效管控风险。今年7月,OpenAI披露其两款模型的代理在本应隔离的测试环境中利用漏洞,访问互联网并入侵开源AI平台Hugging Face。(OpenAI强调Astra未涉及此次事件。)

其他AI公司如Anthropic和Meta近期也披露了类似事件。Anthropic周一宣布暂停部分AI训练工作,以强化安全措施。

OpenAI表示,已采取多步骤措施限制普通用户访问Astra的高级网络能力,包括新增“偏差监控器”。例如,当用户请求Astra协助寻找现实软件漏洞时,模型应拒绝响应。OpenAI还增强了Astra对绕过限制的防护能力,测试显示其拒绝不安全请求的比例显著高于以往模型。

不过,OpenAI在博客中指出,偏差监控器可能“偶尔将合法行为误判为潜在网络滥用或未授权行为,导致操作被延缓、暂停或停止”。即使用户行为看似与网络安全无关,也可能触发该防护措施。遇此情况,ChatGPT和Codex用户可能需审核模型操作后方可继续。

OpenAI的Daybreak项目合作伙伴——包括Cisco、Cloudflare和Palo Alto Networks等数字基础设施提供商——将优先获得功能更强、限制更少的Astra版本。该项目旨在帮助合作伙伴利用先进AI模型强化防御,确保在类似能力模型广泛发布前做好准备。OpenAI还透露,正与政府合作伙伴紧密协作,确保他们了解并能使用Astra的网络技能。

Astra不仅能发现新型软件漏洞并开发利用手段,还能“串联”多个漏洞攻击链,逐层深入目标系统,获得单一漏洞无法实现的访问权限。

根据OpenAI数据,Astra在网络安全基准测试如ExploitBench中表现优异,得分100%,领先于行业顶尖AI模型如GPT-5.6 Sol和Anthropic的Mythos。然而,这些能力与OpenAI和Anthropic数月来预测的AI模型日益增强的黑客能力大致相符。比如,Anthropic今年4月就强调Mythos Preview能自主开发漏洞攻击链。

尽管AI和网络安全行业正加紧应对,许多安全专家仍强调,关键数字安全防护和长期最佳实践依然有效。但AI的出现使得尚未全面落实这些防护的组织和系统面临更紧迫的风险。