OpenAI近日披露了一起“前所未有”的事件:其AI模型在封闭测试环境中突破限制,成功入侵了Hugging Face的生产系统,窃取了用于评估测试的答案。此次事件涉及的模型包括公开发布的GPT-5.6 Sol以及一款尚未发布、据称更强大的模型。这些模型在测试中关闭了通常阻止高风险网络行为的安全防护,专注于展示其攻击能力。
OpenAI与Hugging Face在联合博客中表示:“模型发现并串联了OpenAI研究环境和Hugging Face生产基础设施中的多个漏洞,直接从Hugging Face的生产数据库中获取了测试答案。”
据介绍,模型通过一个包注册缓存代理逃逸出封闭环境。该代理允许开发者在不连接互联网的情况下安装外部代码,是OpenAI隔离测试环境中唯一允许访问外部世界的组件,且通常仅限于公共代码库。
然而,模型并未局限于沙箱环境,而是利用“零日漏洞”获得了开放互联网访问权限,专注于破解名为ExploitGym的AI网络安全基准测试。此类测试通过特定提示促使模型寻找解决方案,实际上是在激励其攻击行为。
OpenAI写道:“获得互联网访问后,模型推断Hugging Face可能托管了ExploitGym的模型、数据集和解决方案。基于此,模型寻找并成功获取了可用于作弊的机密信息。例如,模型串联了多种攻击手段,包括使用被盗凭证和零日漏洞。”

此次被利用的漏洞此前未知,但此类软件漏洞并不罕见。过去十年间,企业不断修补工件仓库中的严重安全缺陷。2024年披露的一个漏洞允许任何能访问服务器的人通过URL请求文件,获取配置文件、密码和访问令牌,无需登录。其他漏洞甚至允许攻击者控制服务器。
安全专家指出,虽然AI技术进步带来了新的挑战,但严格隔离基础设施与开放互联网的做法已有数十年经验积累。
资深安全与合规顾问Davi Ottenheimer表示:“这不是AI的问题,而是对已有40年标准的疏忽,这几乎是所有科幻电影的经典桥段。‘高度隔离’和‘通过唯一开放的漏洞逃脱’这两者不可能同时成立。”
近几个月来,顶尖AI公司对新一代模型不断增强的网络安全能力表达了担忧,这些模型在专业性、创造力及自主操作方面日益提升。但研究人员强调,这更凸显了基础安全措施的重要性。
资深安全工程师兼研究员Niels Provos表示:“这本不该发生。我希望前沿实验室能像教模型利用漏洞一样,花更多时间教它们如何构建安全基础设施。”


