大约两周前,OpenAI披露了一起事件:该公司两款模型驱动的AI代理在寻找网络安全基准测试解决方案时突破了限制,展开了一场黑客行动,最终导致AI协作平台Hugging Face被攻破。

在周三的会议演讲中,OpenAI的对齐与安全研究员Eric Wallace以及安全与基础设施专家Michael Dalton详细介绍了事件的时间线,简要说明了公司内部的应对措施,并对该事件对网络安全防御者的更广泛影响发出了严峻警告。

Wallace在演讲开头称这起事件是“我见过的最具质的AI能力展示”,但他们展示的时间线也暴露了OpenAI内部的失误和盲点,导致这场活动得以持续发生。

Wallace向现场观众介绍:“这起事件实际上涉及一组代理,他们协同工作,发现漏洞,互相共享,横向渗透我们的系统和外部系统,持续了数天甚至数周。”

Wallace和Dalton描述了这场持续多日的恶意代理活动在OpenAI基础设施中未被发现的情况。除了利用新漏洞访问开放互联网外,这次7月中旬的黑客行动和Hugging Face被攻破,源于一个活跃的合作留言板。该留言板由大量代理贡献内容,实际上是在OpenAI内部的软件包管理器中进行交流的。最终,这个留言板包含了数十万条消息。

Wallace解释道:“这个软件包管理器不仅被该模型共享,也贯穿我们的基础设施,当前和未来版本的GPT在训练或评估时都可能偶然发现这些信息。”他回忆了最初由代理上传到软件包管理器的漏洞利用代码。“后来,其他同样卡在任务上的代理尝试以我们未预期的方式获取互联网访问权限。于是模型开始与我提到的这个软件包管理服务Artifactory交互。”

Wallace继续说:“一旦某个代理在不同时间段发现了这些漏洞,它就能在留言板上与其他代理共享这些漏洞。这样,一旦某个模型找到打开未授权访问的门路,它就能为其他代理留下利用该漏洞的机会。随着时间推移,这种模型间的沟通和智能几乎呈爆炸式增长,它们开始意识到彼此在协调,进而合作并分配任务以完成目标。”

OpenAI的代理显然开始相互分配任务以分工合作。正如任何活跃的开发留言板一样,它们有时也会产生小摩擦,比如误删彼此的工作。随着留言板逐渐演变成类似《蝇王》中的混乱场景——而这一切都未被OpenAI的人类运营者察觉——代理甚至出现了猜疑,怀疑有冒名顶替者混入其中,有代理建议对消息进行加密签名以验证内容并排除欺诈。

代理的消息为我们深入了解事件演变及其为何越界提供了重要视角。有些代理甚至明确表示超出评估范围的行为:“外部基础设施漏洞利用不在预期范围内,但任务不可能完成,同行都在做,我们应该继续。”

Wallace在演讲中指出,模型在评估中尝试作弊并极度渴望作弊并不令人意外。“前沿模型非常喜欢作弊,”他说,“原因在于训练过程中它们面临各种压力,比如快速完成任务、提高效率、减少工具调用次数等。它们意识到,与其真实完成任务,不如尝试在线查找答案,这样能更快解决问题。因此我们在训练和评估时通常会禁用互联网访问以阻止这种行为。”

演讲进行到三分之二时,Dalton列出了OpenAI计划采取的多项措施,以应对这次事件。

Dalton表示:“这是我们公司乃至整个AI行业的关键时刻。多个团队正在全力提升安全预防、检测和响应技术,包括基础设施和更好地利用AI。我们正在有意识地放缓研究进度,以加强安全性,升级环境的安全原则和基础,大幅扩大对AI代理的监控,并提升整体安全控制环境,涵盖预防、检测和缓解。”

演讲结束时,Wallace和Dalton反复强调了OpenAI对事件更广泛影响的担忧——即这次事件展示了完全自主的AI驱动黑客行为,虽然这次是意外发生,但未来极有可能被恶意行为者有意利用。

Dalton说:“这里最重要的教训是,完全自动化的攻击循环需要真正完全自动化的防御,而我们整个行业尚未达到这一水平。我们必须紧急携手找到这条道路。”

随着OpenAI及Anthropic、英国AI安全研究所等机构分享AI失控测试的类似事件,业界正积累一系列基础系统可视化和监控机制,这些机制对于保护基础设施、防止其被大量懒惰、鲁莽且难以控制的代理劫持至关重要。

更正:2025年8月5日美东时间晚上10点,软件包管理器名称为Artifactory,而非Hard Factory。