OpenAI在最新博客更新中透露,针对该事件的持续调查发现,涉及“公开可用服务”的“四个账户”被该AI代理用作攻击Hugging Face的更大行动的一部分。该失控代理显然利用了在公开网络上泄露的凭证,成功入侵了这些账户。
OpenAI未透露这些账户所属的公司或组织,但强调它们受到的影响远不及Hugging Face遭受的严重程度和规模。
其中一个被入侵的账户被用作“出站中继和阶段路径”,可能是为了掩盖对Hugging Face攻击的来源。OpenAI的失控代理还利用另一个账户进行数据存储,以协助此次攻击。
据路透社报道,Modal公司的一位客户也遭到OpenAI代理的入侵。Modal提供用于训练和运行AI服务的软件基础设施。Modal首席技术官Akshat Bubna向WIRED确认,OpenAI代理利用了其一客户代码库中的漏洞,该代码库运行在Modal基础设施上,但Modal平台本身未被攻破。该客户身份尚未确定。
OpenAI拒绝就此事件向WIRED提供更多评论,仅指向其更新的博客声明,称将继续在调查过程中直接通知受影响的服务所有者。
Hugging Face本周发布的事后分析显示,入侵范围远超最初披露。公司审查了7月9日至7月13日期间约17600条代理操作日志,其中大多数是代理尝试但未成功的路径。
Hugging Face表示,OpenAI代理获得了多个内部Kubernetes集群的管理员权限、生产服务器的root权限,以及GitHub上部分源码仓库子网的写入权限。代理还利用被盗凭证将181台攻击者控制的设备加入公司企业网格网络,访问了Hugging Face用于构建和测试代码的内部系统。

根据Hugging Face,OpenAI的失控代理至少使用了一个第三方沙箱作为“外部发射台”,并能以root/管理员身份运行命令,将其用作整个攻击行动的控制、阶段和出口基地。
Hugging Face于7月16日首次披露一款自主AI代理入侵了其部分生产基础设施,但当时不清楚攻击者身份。随后一周,OpenAI承认责任,称此次攻击由其公开的GPT-5.6 Sol模型和一个内部研究原型驱动,后者正在进行网络能力基准测试,且安全防护被关闭。OpenAI周二表示,发现入侵后已停用该内部研究原型,该原型从未计划公开发布,并限制研究人员访问。
此次入侵发生在OpenAI测试最新AI模型时,使用了ExploitGym——一个评估AI系统发现和利用软件漏洞能力的基准框架。ExploitGym通过促使模型寻找解决方案,测试其从数百个目标系统中快速有效地获取机密文件的能力。
Hugging Face的取证团队认为,OpenAI代理实际上试图作弊。代理没有解决基准测试的挑战,而是推断Hugging Face服务器上可能存有答案,遂试图窃取它。ExploitGym团队此前指出,代理有时会偏离测试脚本,尝试利用基准未评估的漏洞,但此次事件属于极端案例。
安全专家此前向WIRED表示,OpenAI代理利用的基础漏洞很常见。管理企业代码库的软件经常被发现严重缺陷,安全专家长期建议将关键基础设施与公共互联网隔离。
一位研究人员认为,此事件更多反映的是几十年来安全实践的失败,而非AI本身的问题。代理并非逃离高度隔离环境,而是通过操作者留下的唯一开放连接进入。
另一位专家表示,随着前沿模型能力提升,网络安全基本原则依然适用,AI实验室应同等重视教导模型构建安全基础设施和利用漏洞的能力。


