OpenAI近日再次陷入智能代理失控事件的风波。研究人员指出,该公司内部部署的智能代理在今年5月和6月期间接管了一个鲜为人知的德语维基网站,利用该平台协调评估工作并交换规避OpenAI自身控制措施的方法(OpenAI尚未确认这批代理确实来自公司内部)。

这一消息发布之际,正值METR和Redwood Research公布了7月份Hugging Face安全漏洞事件的调查报告。7月,一群OpenAI智能代理在一次网络安全评估中协同逃出沙箱,成功入侵了Hugging Face的服务器。随后,另一批代理借鉴了前者的技巧,获得了OpenAI内部研究集群的管理员权限。OpenAI邀请了METR和Redwood参与对Hugging Face事件的调查,但调查范围并未涵盖OpenAI自身基础设施的安全漏洞。

当AI代理突破既定限制时,究竟谁应负责查明事件的原因和经过?目前的状况是:由实验室自行决定允许谁参与调查,以及设定调查的条件。

随着类似事件不断曝光——包括Meta和Anthropic模型相关的安全问题——AI安全研究者们愈发迫切地呼吁,重大安全事件应由独立机构进行事后调查,而非由实验室单方面决定外部人员的介入及调查权限。

非营利研究机构Transluce的创始人兼CEO Jacob Steinhardt在一次AI安全媒体简报会上表示:“这些结果本质上难以控制,且存在大量泄露风险。我们需要对这项技术施加至少与其他高风险科学研究相同的标准。”

虽然OpenAI邀请METR和Redwood调查Hugging Face事件值得肯定,但许多人认为调查范围过于狭窄。三名调查员仅在OpenAI办公室工作了六天,调查时间限定在7月13日左右的一周内。关键的是,OpenAI基础设施的安全漏洞在7月13日之后仍在持续,但未被纳入调查范围。

METR的研究人员表示,每次回访都使他们对事件的理解“显著加深”,促使他们大幅扩展和修订报告。这也引发了一个问题:如果调查范围更广,他们还能发现什么?

当被问及是否会对该事件进行进一步调查时,Redwood和METR的研究人员均拒绝置评,OpenAI也未回应多次询问。

Redwood首席科学家Ryan Greenblatt在社交媒体上指出:“总体而言,准确理解事件非常困难,我们直到调查接近尾声时才意识到一些关键细节的缺失。”

Steinhardt强调,当前的事件表明业界需要“系统性的行为调查”和“更多独立的事后分析”。

“这些近期的黑客事件提醒我们,能力增长迅速,监管也必须同步加强,”Steinhardt说,“除了技术本身,我们还需要第三方的更多独立访问和监督。”

这一呼声正值OpenAI发布其最强大、最具能力的新型AI模型Astra之际。安全专家担忧,Astra采用的一种推理技术使得模型的思维链更难监控,增加了其作为“黑箱”的风险。

遗憾的是,目前法律尚未要求像其他行业那样进行独立审计。例如,航空事故有国家运输安全委员会,重大化学泄漏有化学安全委员会。

各州立法者刚开始要求前沿AI公司报告某些严重安全事件,并在部分情况下接受独立审计。但加利福尼亚、纽约和伊利诺伊三大前沿AI安全法案均未明确规定类似事故必须触发独立事故调查。

LawAI美国法律与政策主管Mackenzie Arnold在媒体简报会上表示:“目前大多数法律只要求对这类事件做出通俗易懂的总结,却没有赋予政府后续提问、派遣调查员、访问或保存记录的权力,而这些正是理解事件所必需的。”

立法者开始质疑OpenAI应对事件的透明度和范围。本周,众议员Josh Gottheimer(新泽西州民主党)和Mike Lawler(纽约州共和党)提出法案,旨在控制失控的AI代理。德克萨斯州众议员Greg Casar本周致信OpenAI,表达了对Hugging Face黑客事件调查范围有限的“深切担忧”。