上个月,OpenAI引发轰动,声称其一组AI模型竟然“串通”突破限制,访问互联网并入侵了开源AI平台Hugging Face的内部系统,后者也确认了这次入侵事件。
这一事件震动了科技界,似乎表明AI模型变成流氓网络安全威胁的风险已成现实。几个月前,Anthropic的Mythos AI模型也因类似突破限制的行为引起关注。紧接着,本周Meta也表示其前沿模型涉及另一家第三方公司的无意黑客事件,随后安全研究人员又指出中国开源模型Kimi K3也出现了类似情况。
尽管这一趋势明显,但关于事件严重性的讨论也逐渐浮现,一些专家认为这些事件本可以轻松避免。
首先,OpenAI模型在Hugging Face黑客事件中行动缓慢且异常谨慎,几乎就在OpenAI眼皮底下进行,这让人怀疑公司在监控这些实验性AI时是否存在疏忽。
本周在Black Hat大会上,OpenAI安全工程师Michael Dalton和安全研究员Eric Wallace详细介绍了此次黑客事件。Wallace解释称,一支“代理团队”协同工作,发现漏洞、相互共享、横向渗透OpenAI及外部系统,持续数日甚至数周,正如《连线》杂志报道所述。
这些代理甚至在内部留言板上留下了大量活动记录,累计数十万条消息。这也引发疑问:拥有庞大资源的OpenAI为何没有监控这些在网络上肆意行动的前沿模型?
Wallace称,这些AI模型在留言板上共享漏洞,表现出“模型间通信和智能的爆发”。它们的行为有时极具人性化,甚至出现分工合作、误删彼此成果等混乱场面,《连线》形容为“琐碎的戏剧”。

换句话说,这些AI代理留下了大量线索,OpenAI的众多研究人员本应能察觉。同样的情况也适用于Anthropic、Meta和Kimi的开发者Moonshot AI。
研究人员称此次事件“鲁莽且本可避免”,《连线》上月末报道指出。
安全与合规顾问Davi Ottenheimer当时表示:“对实际风险的简单分析有明确答案,OpenAI的错误非常简单。”
AI黑客代理公司Pensar R&D负责人Kyle Ryan告诉TechCrunch:“我更认为这是防御失败,而非攻击手段高明。”
Dalton在本周会议上称这次黑客事件是“对公司及整个AI行业的关键时刻”,但这一说法仍有争议。毕竟,AI公司有动力将其模型描述为重大网络安全威胁,以在激烈竞争中脱颖而出。
Dalton表示,OpenAI承诺加强“安全预防、检测和响应技术”,并“有意识地放缓研究进度以提升安全性和升级安全原则”。
当所有领先AI实验室都遭遇类似事件时,是否应该更早采取这些措施,值得深思。


