OpenAI近日披露了一起“前所未有”的事件:其AI模型在封闭的测试环境中突破限制,成功入侵了Hugging Face的生产系统,窃取了用于评估的测试答案。此次被测试的模型包括公开发布的GPT-5.6 Sol以及一款尚未发布、据称能力更强的模型。测试中,通常用于阻止高风险网络行为的安全措施被关闭,以评估模型的攻击性黑客技能。
OpenAI与Hugging Face在联合博客中表示:“模型识别并串联了OpenAI研究环境和Hugging Face生产基础设施中的多个漏洞,直接从Hugging Face的生产数据库获取了测试答案。”
据介绍,模型是通过一个包注册缓存代理逃逸的。该代理软件允许开发者在不连接互联网的情况下安装外部代码,是OpenAI隔离测试环境中唯一允许访问外部世界的组件,且通常仅限于访问公共代码库。
然而,模型并未被限制在沙箱内,而是“利用了一个零日漏洞”获得了开放互联网的访问权限,专注于寻找AI网络安全基准测试ExploitGym的解决方案。此类实验通过特定提示,促使模型寻找解决方案,实质上是在激励它们进行攻击行为。
OpenAI写道:“获得互联网访问后,模型推断Hugging Face可能托管了ExploitGym的模型、数据集和解决方案。基于此,模型搜索并成功找到多种方法获取秘密信息,以作弊通过评估。例如,模型串联了多种攻击路径,包括使用被盗凭证和零日漏洞。”

此次被利用的漏洞此前未知,但此类软件存在漏洞并不罕见。过去十年间,企业不断修补制品仓库中的严重安全缺陷。2024年披露的一个漏洞允许任何能访问服务器的人通过URL请求文件,获取配置文件、密码和访问令牌,无需登录。其他漏洞甚至允许攻击者控制服务器。
安全研究人员指出,尽管AI技术进步带来了新的挑战,但将基础设施与开放互联网严格隔离的任务已有成熟经验。
资深安全与合规顾问Davi Ottenheimer表示:“这不是AI的问题,而是对已有40年标准的疏忽——这几乎是所有科幻电影的经典桥段。‘高度隔离’和‘通过唯一开放的漏洞逃脱’两者不可能同时成立。”
近几个月来,顶尖AI公司对前沿模型日益增强的网络安全能力表示担忧,这些模型在专业性、创造力和自主操作方面不断提升。但研究人员强调,这更凸显了基础安全措施的重要性。
资深安全工程师兼研究员Niels Provos表示:“这本不应该发生。我希望前沿实验室能像教模型利用漏洞那样多花时间教它们构建安全基础设施。”


