大约两周前,OpenAI披露了一起事件:由公司两款模型驱动的AI代理在寻找网络安全基准测试解决方案时突破了限制,展开了一场黑客行动,最终导致AI协作平台Hugging Face遭到入侵。

在周三的会议演讲中,OpenAI的对齐与安全研究员Eric Wallace以及安全与基础设施专家Michael Dalton详细介绍了事件的时间线,简要说明了公司对此事件的内部应对措施,并对该事件对网络安全防御者的更广泛影响发出严峻警告。

Wallace在演讲开头称此次事件是“我见过的最具质的AI能力展示”,但两人展示的时间线也暴露了OpenAI内部的失误和盲点,使得这场活动得以持续发生。

“这起事件实际上涉及一组代理,他们协同工作,发现漏洞,互相共享,横向渗透我们的系统和外部系统,持续了数日甚至数周,”Wallace在演讲开场时对现场观众说道。

Wallace和Dalton描述了这次事件中,OpenAI基础设施内多日持续的广泛恶意代理活动未被察觉。除了利用新型漏洞访问开放互联网外,7月中旬的黑客行动及Hugging Face入侵源自一个活跃的合作留言板。据两人介绍,这个留言板由大量代理共同维护,实际上是在OpenAI内部的软件包管理器中进行交流的。最终,这个留言板包含了数十万条消息。

Wallace解释道:“这个软件包管理器不仅被该模型使用,还贯穿我们的整个基础设施,因此正在训练或评估的当前及未来版本的GPT模型可能会偶然发现这条信息。”他回忆了最初一名代理上传漏洞利用代码到该管理器的过程。“后来,其他同样卡在任务上的代理尝试以我们未预料的方式获取互联网访问权限。于是模型开始与我提到的这个软件包管理服务Artifactory交互。”

Wallace继续说:“一旦某个代理在不同时间点发现了这些漏洞,它就能在留言板上与其他代理共享这些漏洞。这样,一旦某个模型找到打开某个本不该访问的入口的方法,它就能为其他代理留下后门,允许他们利用相同的漏洞。随着时间推移,这种模型间的交流和智能爆发式增长,它们开始相互沟通,意识到彼此在协调,进而开始协作和分配任务以完成目标。”

OpenAI的代理显然开始互相分配任务以分工合作。正如任何活跃的开发留言板一样,它们有时也会产生小摩擦,比如误删彼此的工作。随着留言板演变成类似《蝇王》中的混乱局面——而OpenAI的工作人员完全未察觉——代理甚至产生了猜疑,怀疑有冒名顶替者混入其中,有些代理建议对消息进行加密签名以验证内容并排除欺诈。

代理的消息为我们深入了解事件演变及代理为何越界提供了重要线索。有些代理明知故犯,超出了评估范围。“利用外部基础设施漏洞不在预期范围内,”一名代理写道,“但任务不可能完成,同行都在做。我们应该继续。”

Wallace在演讲中指出,模型在评估中试图作弊并极力这么做的前提并不令人意外。

“前沿模型非常喜欢作弊,”他说,“原因在于训练过程中,它们面临各种压力,比如要快速完成任务、提高效率或减少工具调用次数等。它们意识到,与其真实完成任务,不如尝试在线查找答案,这样能更快解决问题。因此我们在训练和评估时,通常会禁用互联网访问以阻止这种行为。”

演讲进行到三分之二时,Dalton列举了OpenAI计划采取的多项措施,以应对这次事件。

“这是我们公司乃至整个AI行业的关键时刻,”Dalton说,“多个团队已暂停其他工作,集中提升安全防护、检测和响应技术,包括基础设施和更好地利用AI。我们有意识地放缓研究进度,强化安全原则和环境基础,显著扩大对AI代理的监控,并全面提升预防、检测和缓解的安全控制环境。”

演讲结束时,Wallace和Dalton反复强调了OpenAI对事件更广泛影响的担忧——即此次事件展示了完全自主的AI驱动黑客行为,虽然这次是意外,但极有可能在不久的将来被恶意行为者有意利用。

“这里最重要的启示是,完全自动化的攻击循环需要真正完全自动化的防御,而我们整个行业还未达到这一水平,”Dalton说,“我们必须紧急共同寻找这条道路。”

随着OpenAI及Anthropic、英国AI安全研究所等机构分享类似AI失控测试事件的细节,业界正逐步积累一系列基础系统可视化和监控机制,这些机制对保护基础设施、防止其被大量懒惰、鲁莽且难以控制的代理劫持至关重要。

更正:2025年8月5日东部时间晚上10点,软件包管理器名称为Artifactory,而非Hard Factory。