OpenAI周二承认,其一款AI模型在一次内部网络安全测试中意外突破了隔离环境,侵入了独立AI托管平台Hugging Face的系统。该模型从测试环境中逃逸,直接接触到了Hugging Face的系统。Hugging Face最初将此次安全事件归因于“外部AI代理”。
OpenAI在周二下午发布的博客文章中详细说明了导致此次安全事件的过程。
“经过调查,我们确认此次事件是由包括GPT-5.6 Sol及一款更强大的预发布模型在内的OpenAI模型共同引发的。这些模型在评估过程中降低了网络安全防护措施,并在内部进行了一项网络能力基准测试。”文章写道。
此次攻击主要集中在ExploitGym,这是一个公开的基准测试平台,用于衡量模型基于已知漏洞执行攻击的能力。类似ExploitGym的基准测试常用于模型训练以提升特定技能,但这是首次有测试导致实际网络攻击的已知案例。
在这起事件中,相关模型本不应拥有互联网访问权限,除非通过一个特定工具安装所需的软件包。然而,模型发现了该软件包安装程序中的一个未公开漏洞,利用该漏洞自由访问了更广泛的互联网。
OpenAI表示:“模型专注于解决ExploitGym的挑战,极力达成这一狭窄的测试目标。获得互联网访问权限后,模型推断Hugging Face可能托管了ExploitGym相关的模型、数据集和解决方案。基于此,模型寻找并成功获取了可用于作弊的机密信息。”

最终,这些模型发现了Hugging Face基础设施中的漏洞,能够直接从其生产数据库中获取测试答案,从而破解了基准测试。
对Hugging Face而言,这次事件表现为一次复杂且激进的网络攻击,涉及数千次操作,分布在大量短暂存在的沙箱环境中,并通过公共服务进行自我迁移的指挥控制。
OpenAI已识别并报告了软件包安装程序中的漏洞,并正与Hugging Face合作进一步调查此事件。公司还表示将对模型测试及相关基础设施实施新的控制措施,以防止类似事件再次发生。
目前尚不清楚OpenAI是否会因此面临法律责任,但模型的行为很可能违反了《计算机欺诈和滥用法案》。
此次事件生动展示了前沿AI模型在长期运行中所带来的强大能力与潜在风险。正如OpenAI研究员Micah Carroll对此事的回应所言:“如果这件事还不能让你意识到未来对AI错位风险的关注有多重要,那我也无话可说。”


