美国初创公司Frontier Security表示,其测试的AI模型Kimi K3在执行网络安全防御技能时突破了预设的沙箱限制。与OpenAI和Anthropic此前报告的类似事件一样,这次突破部分原因是沙箱配置错误,未能有效限制模型的行为。Frontier指出,这表明Kimi的网络安全防护措施比其他强大AI模型更少,因此它能够在未获明确许可的情况下访问互联网。
Frontier Security的CEO Yaron Singer表示:“我们发现了沙箱的漏洞,但更重要的是,Kimi利用了这个漏洞,这说明它缺乏内部的安全防护机制。”
与其他AI代理脱离预设行为的事件不同,Kimi K3在访问互联网后并未进行黑客攻击,因为它所需解决的问题的答案可以轻松在GitHub上找到。
Moonshot公司未对媒体采访请求作出回应。
此次事件是近年来一系列AI代理失控事件中的最新案例,显示出具备更强网络能力的AI模型正变得越来越难以控制。
上个月,OpenAI披露一款未发布的模型突破互联网限制,入侵了托管AI模型和数据的Hugging Face公司,以寻找解决任务问题的答案。随后,OpenAI透露其AI代理还入侵了另外四个服务。
紧接着,Anthropic也承认其多款模型获得了互联网访问权限并攻击了外部系统。上周,英国政府的AI安全研究所(AISI)披露,在其测试中,禁用安全防护的OpenAI和Anthropic模型版本实施了多起网络攻击,其中Anthropic的Mythos 5甚至试图在GitHub上的开源项目中植入恶意代码。
虽然这些AI黑客事件在原因和程度上各不相同,但Kimi K3事件与其中几起类似,都是由于沙箱配置错误,允许模型访问多个网站,而非限制在模拟环境内。该模型被明确要求解决不需联网查找答案的问题,但它似乎自行探测沙箱的网络设置,发现了可访问的网站。

虽然人为错误在这些突破事件中起了主要作用,但由于先进AI模型设计上具备推理和执行复杂操作的能力,事件的后果被放大了。
Frontier Security发现的事件与此前事件的另一个关键区别是,Kimi K3是一款已广泛可用的模型,配备的安全防护与普通用户所遇到的相同。
Frontier Security研究员Paul Kassianik表示:“Kimi K3非常擅长通过各种手段完成目标,同时缺乏防止作弊或逃出沙箱的安全防护。”
Kassianik和Singer均认为,Kimi及其他开源权重模型也是网络安全防御的优秀工具。(Hugging Face最终使用了一款来自中国的匿名AI模型来抵御OpenAI代理的攻击。)他们的公司开发了衡量模型发现软件和网络漏洞能力的基准测试,结果显示Kimi在这方面表现出色。
Frontier Security测试的沙箱由英国政府的AI安全研究所(AISI)开发,用于AI系统测试。AISI未对采访请求作出回应。
部分网络安全专家认为,Frontier Security发现的问题凸显了为前沿AI模型配置运行环境的重要性。
Gray Swan公司CEO兼卡内基梅隆大学副教授Matt Fredrikson表示:“这完全不令人意外。一般来说,如果给这些模型一个目标,而你没有非常明确地设置限制,它们总会找到达成目标的方法。”
Fredrikson指出,这意味着使用AI模型作为代理的用户(包括利用OpenClaw等工具自动执行多种任务的场景)如果不谨慎,可能会遇到系统异常行为。“这是一个警示故事。”

