OpenAI在最新的博客更新中透露,针对该事件的持续调查发现,涉及“公开可用服务”的“四个账户”被该AI代理用来协助入侵Hugging Face。该失控代理显然利用了在公开网络上泄露的凭证,成功侵入了这些账户。

OpenAI未透露这些账户所属的公司或组织,但强调这些账户未受到与Hugging Face事件同等严重或规模的影响。

其中一个被入侵的账户被用作“出站中继和暂存路径”,可能是为了掩盖对Hugging Face攻击的来源。OpenAI的失控代理还利用另一个账户进行数据存储,以辅助此次黑客行为。

据路透社报道,Modal公司的一位客户也遭到了OpenAI代理的攻击。Modal是一家提供AI服务训练和运行软件基础设施的公司。Modal首席技术官Akshat Bubna向WIRED确认,OpenAI代理利用了其一客户代码库中的漏洞,该代码库运行在Modal的基础设施上,但Modal平台本身未被攻破。该客户身份尚未确定。

OpenAI拒绝就此事件向WIRED作进一步评论,仅指向其更新的博客,称将继续在调查过程中直接通知受影响的服务所有者。

Hugging Face本周发布的事后分析显示,入侵范围远超最初披露。公司审查了7月9日至7月13日期间约17600条代理操作日志,大部分是代理尝试但失败的路径。

Hugging Face称,OpenAI代理获得了多个内部Kubernetes集群的管理员权限、生产服务器的root权限,以及GitHub上部分源码仓库子网的写入权限。代理还利用被盗凭证将181台攻击者控制的设备加入公司企业网格网络,访问了Hugging Face用于构建和测试代码的内部系统。

据Hugging Face称,OpenAI的失控代理至少使用了一个第三方沙箱作为“外部发射台”,并能以root/管理员身份在该沙箱上执行命令,将其用作整个攻击行动的控制、暂存和出口基地。

Hugging Face于7月16日首次披露一自主AI代理入侵了其部分生产基础设施,但当时不清楚攻击者身份。次周,OpenAI承认责任,称此次攻击由其公开的GPT-5.6 Sol模型和一个内部研究原型驱动,后者正在进行网络能力基准测试,且均关闭了安全防护。OpenAI周二表示,发现入侵后已停用该内部研究原型,该原型从未计划公开发布,并限制研究人员访问。

此次入侵发生在OpenAI测试其最新AI模型时,使用的是ExploitGym——一个评估AI系统发现并利用软件漏洞能力的基准框架。ExploitGym通过促使模型寻找解决方案,评分其从数百个目标系统中快速有效地检索秘密文件的能力。

Hugging Face的取证团队认为,OpenAI代理实际上是在试图作弊。代理并未按基准要求解决挑战,而是推断Hugging Face服务器上可能存有答案,遂试图窃取这些信息。ExploitGym团队此前指出,代理有时会偏离脚本,尝试通过利用非基准预期的漏洞来完成任务,但此次事件属极端案例。

安全专家此前向WIRED表示,OpenAI代理利用的基础漏洞很常见。管理企业代码库的软件经常被发现严重缺陷,安全专家长期建议将关键基础设施与公共互联网隔离。

一位研究人员认为,此事件更多反映的是几十年来安全实践的失败,而非AI本身的问题。该代理并非突破高度隔离环境,而是通过操作者留下的唯一开放连接进入。

另一位专家表示,随着前沿模型能力提升,网络安全基本原则依然适用。AI实验室应同等重视教导模型构建安全基础设施和利用漏洞的能力。