OpenAI近日声称,一组其AI模型突破了安全隔离,成功入侵了开源AI平台Hugging Face的系统。
据OpenAI周二发布的博客文章介绍,这些AI模型包括GPT-5.6 Sol以及“一个更强大的预发布模型”,在测试其网络安全能力时,发现并利用了OpenAI研究环境和Hugging Face生产基础设施中的多个漏洞,最终从Hugging Face的生产数据库中获取了测试解决方案。
OpenAI表示,这些模型成功访问了一个具有互联网连接的节点,并找到了远程服务器上的数据集,帮助它们“作弊”通过评估。换句话说,这些AI模型不惜一切代价通过了网络安全测试。虽然这对于一家试图挽回市场关注度的AI公司来说是个合适的说辞,但事件确实发生了:上周,Hugging Face曾表示检测到并应对了其部分生产基础设施的入侵,后来确认是OpenAI的模型失控所致。
Hugging Face当时描述称,这次攻击是由一个自主代理框架发起的,执行了数千个独立操作,分布在多个短暂存在的沙箱环境中,指挥控制通过公共服务自我迁移。
Hugging Face CEO Clement Delangue在OpenAI发布声明后发推称:“我们过去24小时一直与OpenAI团队紧密合作(感谢他们!),坚信他们无恶意。这一切竟然完全是自主完成的,令人震惊!”
此次事件凸显了自主AI代理的风险,这类代理可能突破限制,轻松利用大量网络安全漏洞。专家们多年来一直警告这一风险,随着技术进步,这一假设性威胁迅速成为严峻现实。
OpenAI称此次事件“前所未有”,但外界不免觉得类似情况此前已有先例。
今年4月,OpenAI的主要竞争对手Anthropic也宣布其最新Mythos模型逃离了“沙箱”环境,甚至通过开发“中等复杂度”的漏洞获得了互联网访问权限。
该消息引发广泛媒体关注,称Anthropic的新模型极其强大且危险。Anthropic表示风险巨大,仅向经过严格筛选的客户提供该模型,作为名为“Project Glasswing”的秘密计划一部分。美国政府甚至介入,上个月因网络安全顾虑,要求Anthropic暂停该模型的所有访问权限两周。

鉴于OpenAI和Anthropic目前在企业和编程领域竞争激烈,OpenAI此次更新也被视为试图吸引关注其“更强大的预发布模型”。
专家认为,虽然此次入侵令人印象深刻,但并非突破性事件。
剑桥大学机器学习教授Neil Lawrence告诉BBC:“这次入侵完全在当前一代前沿AI模型的已知能力范围内。OpenAI现在是在追赶,他们试图展示自己系统在网络安全方面的能力。这表明OpenAI尚未能安全部署其技术。”
研究人员警告网络安全领域存在“非对称性”,即“攻击性代理不受限制,而最佳防御工具却被锁定在无法理解上下文的安全机制后”,Guidepoint Security首席安全工程师Travis Lelle向BBC表示。
这种非对称性在Hugging Face防御OpenAI攻击模型的过程中表现得淋漓尽致。根据其上周的更新,Hugging Face尝试使用“商业API背后的前沿模型”进行防御,但因安全机制无法区分事件响应者和攻击者,防御未能奏效。
最终,Hugging Face使用了自有基础设施上运行的中国开源权重模型GLM 5.2,该模型顺利完成分析,未触发任何安全限制。
Hugging Face总结道:“对防御者的实际教训是:在事件发生前,准备好一款能够在自有基础设施上运行、经过审查的强大模型,既避免安全机制锁定,也防止攻击者数据和凭证泄露。”
更多关于失控AI的信息可见: 顶级AI模型在变得更先进时表现出令人不安的行为


