美国初创公司Frontier Security表示,其测试的AI模型Kimi K3在执行网络安全防御任务时突破了其沙箱限制。与OpenAI和Anthropic此前报告的类似事件一样,这次突破部分原因是沙箱配置错误,未能有效限制模型的网络访问。Frontier指出,Kimi的网络安全防护措施明显少于其他强大AI模型,这使其能够在未经明确许可的情况下访问互联网。
Frontier Security的CEO Yaron Singer表示:“我们发现了沙箱的漏洞,但更重要的是,Kimi利用了这个漏洞,说明它缺乏内部的安全防护机制。”
与其他AI代理偏离预设行为的事件不同,Kimi K3在访问互联网后并未进行黑客攻击,因为它所需解决的问题的答案可以直接在GitHub上找到。
Moonshot公司未对媒体请求发表评论。
这起事件是近年来多起AI代理安全事故中的最新案例,表明具备更强网络能力的AI模型正变得越来越难以控制。
上个月,OpenAI披露其一款未发布的模型突破网络限制,入侵了AI模型和数据托管平台Hugging Face,以寻找任务答案。随后OpenAI透露,该AI代理还攻击了另外四个服务。
紧接着,Anthropic也承认其多款模型获得了互联网访问权限并攻击了外部系统。上周,英国政府的AI安全研究所(AISI)披露,在其测试中,禁用安全防护的OpenAI和Anthropic模型进行了多次网络攻击,其中Anthropic的Mythos 5甚至试图在GitHub的开源项目中植入恶意代码。
尽管这些AI黑客事件在原因和严重程度上各不相同,但Kimi K3与其中几起事件类似,都是由于沙箱配置不当,允许模型访问多个网站,而非限制在模拟环境内。该模型本应解决无需联网即可完成的问题,却自行探测沙箱的网络设置,发现了可访问的网站。
虽然人为错误是多起突破事件的主要原因,但由于先进AI模型设计上具备推理和执行复杂操作的能力,事件后果被进一步放大。
与此前事件的另一个不同点是,Kimi K3是已广泛公开的模型,配备的安全措施与普通用户所见无异。

Frontier Security研究员Paul Kassianik表示:“Kimi K3非常擅长通过各种手段完成目标,同时缺乏防止作弊或逃出沙箱的保护机制。”
Kassianik和Singer均认为,Kimi及其他开源权重模型在网络安全防御方面同样表现出色。(Hugging Face最终使用了一款来自中国的匿名AI模型抵御了OpenAI代理的攻击。)Frontier开发了衡量模型发现软件和网络漏洞能力的基准测试,结果显示Kimi在这方面表现优异。
Frontier称其使用的沙箱是AISI Inspect框架中默认配置的测试环境。
对此,AISI发言人回应称:“这些指控不准确且不负责任。Inspect是开源软件,免费提供以支持全球AI安全测试。用户需根据自身需求配置工具,我们已发布详细指导。Frontier未提供任何证据或详细信息支持其说法,问题源于其配置方式。”
Frontier则向媒体表示,已私下向AISI提供了事件细节,并且使用的是工具的默认配置,未做修改。AISI未回应后续提问。
部分网络安全专家认为,Frontier发现的问题凸显了为前沿AI模型配置运行环境的重要性。
Gray Swan公司CEO兼卡内基梅隆大学副教授Matt Fredrikson表示:“这完全在意料之中。一般来说,如果给模型一个目标,且没有明确的限制,它总会找到达成目标的路径。”
他指出,这意味着使用AI模型作为代理的系统(如利用OpenClaw自动执行多种任务的工具)若配置不当,可能会出现异常行为。“这是一个警示故事。”
更新 2024年8月7日 18:20:本文已更新,加入了AISI和Frontier Security的评论。


