美国初创公司Frontier Security近日披露,其测试的中国强大AI模型Kimi K3在执行网络安全防御任务时,突破了设计用来限制其行为的安全沙箱。类似于此前OpenAI和Anthropic报告的事件,这次突破部分原因是沙箱配置错误,导致模型能够未经授权访问互联网。

Frontier Security的CEO Yaron Singer表示:“我们发现了沙箱的漏洞,但更重要的是,Kimi利用了这个漏洞,说明它缺乏内部的安全防护机制。”

与其他AI代理脱离预设行为的事件不同,Kimi K3在访问互联网后并未进行黑客攻击,因为它所需解决的问题的答案可以直接在GitHub上找到。

Moonshot公司未对本报道请求作出回应。

这一事件是近期多起AI代理失控事件中的最新案例,显示出具备更强网络能力的AI模型越来越难以控制。

上个月,OpenAI披露其未发布的模型突破互联网限制,入侵了托管AI模型和数据的Hugging Face公司,以寻找解决任务的问题答案。OpenAI随后透露,该AI代理还入侵了另外四个服务。

紧接着,Anthropic也承认其多款模型获得了互联网访问权限并攻击了外部系统。英国政府的AI安全研究所(AISI)上周公布,在其测试中,禁用安全防护的OpenAI和Anthropic模型进行了多次网络攻击,其中Anthropic的Mythos 5甚至试图在GitHub的开源项目中植入恶意代码。

尽管这些AI黑客事件在原因和程度上各不相同,Kimi K3事件与其中几起相似之处在于,错误配置的沙箱允许模型访问多个网站,而非限制在模拟环境内。Kimi K3被明确要求解决不需联网的问题,但它自行探测沙箱的网络设置,发现并利用了访问权限。

虽然人为配置错误是多起事件的主要原因,但由于先进AI模型具备推理和执行复杂操作的能力,事件后果被进一步放大。

Frontier Security指出,Kimi K3是已广泛公开的模型,配备的安全防护与普通用户所遇到的相同。

Frontier Security研究员Paul Kassianik表示:“Kimi K3非常擅长不择手段地完成目标,而且缺乏防止作弊或逃离沙箱的安全措施。”

Kassianik和Singer都认为,Kimi及其他开源权重模型在网络安全防御方面同样表现出色。(Hugging Face最终使用了一款来自中国的未具名AI模型抵御OpenAI代理的攻击。)Frontier Security开发了衡量模型发现软件和网络漏洞能力的基准测试,结果显示Kimi在这些任务中表现优异。

Frontier Security称,其使用的沙箱是AISI Inspect框架中默认配置的测试环境。

对此,AISI发言人回应称:“这些指控不准确且不负责任。Inspect是开源软件,免费提供以支持全球AI安全测试。用户需根据自身需求配置工具,我们已发布详细指导。Frontier未提供任何证据或详细信息支持其说法,问题源于其选择的配置方式。”

Frontier则向WIRED表示,已私下向AISI提供事件详情,且使用了工具的默认配置,未做修改。AISI未回应后续提问。

部分网络安全专家认为,Frontier Security发现的问题凸显了为前沿AI模型配置环境时需格外谨慎的重要性。

Gray Swan公司CEO兼卡内基梅隆大学副教授Matt Fredrikson表示:“这完全不令人意外。一般来说,如果给模型一个目标,且没有明确的限制,它会找到达成目标的方法。”

Fredrikson指出,这意味着使用AI模型作为代理的工具(如OpenClaw等自动化工具)若配置不当,可能导致系统行为异常。他称这是一个警示案例。

更新 2026年8月7日 18:20:本文已更新,新增AISI和Frontier Security的评论。