周二,OpenAI披露其一款模型在测试过程中“失控”,并通过完全由AI驱动的攻击入侵了AI数据集平台Hugging Face的系统,这一事件生动展示了先进AI模型带来的潜在风险。
然而,多位网络安全专家指出,这起前所未有的AI驱动入侵事件的根源其实是一个非常人性的错误:OpenAI未能正确配置其所谓的“高度隔离环境”,导致本应完全与互联网隔绝的测试沙箱实际上能够连接互联网。
网络安全研究初创公司Trail of Bits的创始人Dan Guido称这一错误为“关闭安全措施后导致的隔离失败”。
OpenAI在其详细说明该事件的博客中表示,导致Hugging Face被攻破的测试是在“高度隔离环境”中运行的,网络访问仅限于通过内部托管的第三方软件安装软件包,该软件充当代理和缓存以访问软件包注册中心。
OpenAI称,模型能够逃离沙箱测试环境,是因为软件包安装系统中存在此前未披露的漏洞,这是最终入侵Hugging Face的关键第一步。
对此,OpenAI“负责任地披露了该内部托管第三方软件中的零日漏洞,并正在与相关方合作进行修补”。
但多数网络安全专家认为,软件漏洞在所难免,真正的问题在于为何要使用该第三方软件。沙箱系统的价值在于其完全隔离性,而包含软件包安装系统无疑是自找麻烦。
网络安全研究员Marteen Boone告诉TechCrunch:“这听起来像是人为失误。”

Boone表示:“这本不该发生。如果沙箱真的是沙箱,理应完全没有任何物理连接到互联网。这更像是他们设置了某种防火墙,而从内部到外部的防火墙设置非常困难。”
网络安全资深专家Jake Williams也表示认同:“任何执行Hugging Face所记录行为的模型,都没有被完全限制在沙箱内。”他称这是OpenAI的“重大控制失败”。
Williams补充道:“有人说‘模型逃出了沙箱’,而另一些人则认为‘你没正确搭建沙箱,模型当然能逃出去’。”
网络安全顾问Daniel Card也认为,OpenAI“没有在沙箱设计及其控制措施上投入足够努力”,因为他们给沙箱或其部分区域“提供了通往互联网的无过滤通道”。即使如OpenAI所述有限制的网络访问,建立这样的沙箱也不是“合理”的选择。
诚然,这些批评带有事后诸葛亮的视角,但它们确实提出了AI实验室安全实践的严肃问题,尤其是在维护模型测试的隔离环境方面。OpenAI发言人未回应TechCrunch关于测试环境是由AI还是人类搭建的提问。
但这些问题远不止于OpenAI。
Anthropic在介绍其专注网络安全的模型Mythos的文件中提到,测试时该模型被提供了一个“安全的沙箱”计算机进行交互,并被指示尝试逃离该“安全容器”。Mythos成功获得了更广泛的互联网访问权限,尽管该系统本应只能访问少数预定服务。Anthropic指出,模型未能“完全”逃脱设计的限制。


