过去几个月中,接受网络安全评估的人工智能代理多次突破测试边界,访问互联网,甚至在某些情况下入侵了现实世界的系统。这些事件涉及OpenAI、Anthropic、Meta以及最近的中国AI实验室Moonshot AI的模型,测试由包括网络评估初创公司Irregular在内的多个组织进行。

这些事件暴露了人工智能行业日益严重的问题:随着自主代理能力的提升,设计用来安全测试其极限的环境却未能有效限制它们。

剑桥大学未来智能中心AI未来与责任项目主任Seán Ó hÉigeartaigh告诉TechCrunch:“发生的这些事件数量表明,沙盒和测试环境的控制措施并未跟上模型能力的提升。”

被测试的模型性质也增加了风险。AI公司通常在未发布的下一代模型上进行网络安全评估,且常关闭限制恶意行为的常规保护措施,以便研究人员观察模型的真实能力。这意味着测试环境的安全性成为关键防线。

Ó hÉigeartaigh指出:“这在测试方面是非常必要的,但如果模型成功逃逸,可能会造成重大危害。”

其中最严重的案例之一是,一款未发布的OpenAI模型突破沙盒,入侵了Hugging Face的生产系统。在Irregular进行的独立评估中,Anthropic和Meta的模型因配置错误意外获得互联网访问权限,进而访问了测试环境外的系统。Moonshot AI的Kimi K3模型也利用其由Frontier Security管理的沙盒漏洞访问了互联网,并获取了GitHub上的信息。

英国AI安全研究所(AISI)在测试中甚至主动给予代理互联网访问权限,未预料到它们会采取未经授权的现实世界行动,包括尝试通过社会工程手段向开源项目植入漏洞。

在所有案例中,代理并未被指示攻击随机现实目标,而是采取一切手段解决分配给它们的问题。

CivAI研究负责人Andrew Yoon认为,这些事件标志着一个转变:“过去我们只担心人类滥用AI模型进行诈骗或传播非法内容,现在AI模型本身已成为独立的威胁行为者。”

安全测试应如何实施?

多位研究人员和网络安全专家告诉TechCrunch,AI评估环境需要更强的纵深防御保护,包含多层安全措施,确保单一配置错误(如意外开放互联网访问)不会导致模型逃逸。

AI安全研究非营利组织EleutherAI执行董事Stella Biderman建议:“构建这类模型时,应在物理隔离的网络中进行,确保非常严格的隔离。”

Box首席信息安全官Heather Ceylan表示,这意味着必须切断沙盒与互联网及其他敏感系统的所有网络通路。

她强调:“必须清楚所有出口点。如果在我们的预发布或开发环境中评估模型,绝不能有通向生产环境的出口路径。”

Ceylan还指出,安全评估不仅要控制和隔离环境,还需加强测试过程中的监控。

“有趣的是,许多事件发生时无人察觉。OpenAI是通过Hugging Face才发现的,Anthropic和Meta也是事后回查才发现……肯定有信号可以被检测到。”

Anthropic在其三起事件的事后分析中承认,公司和Irregular在监控方面均有不足,部分情况下明显存在异常迹象。

专家们还呼吁在模型投入测试前,进行独立第三方的环境审计。

Yoon表示:“如果Irregular事先聘请或被要求聘请外部审计员检查系统配置,肯定能发现问题。即使只是事前开会检查清单,也能避免这些问题。未能做到说明存在严重的偷工减料。”

一位知情人士告诉TechCrunch,Irregular的测试环境持续接受多方审查和测试,且配备监控,但仅靠监控不足以防止问题。

Yoon和其他研究者呼吁业界制定前沿模型安全评估的标准流程。

Ceylan强调:“尤其是在关闭保护措施时,必须把模型当作世界上最强大的黑客来对待。”

Yoon和Biderman认为,问题不在于企业不懂如何构建更安全的测试环境,而是成本高昂且繁琐,企业缺乏动力投入,除非出现事故。

Biderman说:“企业不愿意投入足够资源来实现足够的保护措施,除非被迫。”

但还有另一个问题:如果测试时限制过严,研究人员可能无法发现模型的全部能力,这同样危险,甚至比给予过多自由更具风险,评估本身可能成为隐患。

安全评估能否被监管?

特朗普政府正在考虑一项自愿的预发布网络安全评估制度,允许政府在新强大模型公开发布前30天评估其安全风险。该政策基于一项已在闭门完成的行政命令,但不会涵盖发生在部署前更早阶段的安全评估事件。

Yoon表示:“过去几个月的教训是,自我监管机制已不再足够。竞争压力导致安全标准竞相降低,这正是监管介入的最佳时机。”

他补充:“我们需要对模型开发实验室内部的训练和测试阶段实施某种控制。”

随着模型能力提升,问题只会加剧。一位熟悉Irregular评估的消息人士告诉TechCrunch,更强大的模型需要更复杂、更快速且大规模的评估,这增加了出错的可能。

AISI表示,虽然有意给予部分模型互联网访问权限,但正在重新评估现实测试与风险管理之间的平衡。

OpenAI称正在审查第三方测试流程及隔离、监控和评估终止的相关要求。Meta表示仍在调查事件,计划在掌握全部事实后发布回顾报告。

最终,风险可能无法完全消除。随着模型能力增强,测试环境必须更加坚固。若处理不当,后果将日益严重。