根据最近一项研究显示,少数顶尖AI实验室公开或展示了针对失控模型的遏制应对计划。遏制计划明确规定了当AI试图破坏人类控制时的应对措施——包括何时切断访问权限以及何时完全关闭系统。

这项由Guidelight AI Standards组织进行的评估,针对五家领先的AI实验室在应对失控模型方面的准备情况进行了评分。OpenAI排名最高,Anthropic和Meta得分最低。随着具备自主能力的AI在企业系统中扮演越来越重要的角色,加州和纽约的监管机构也开始要求相关信息披露,这些发现对于模型开发者和投资者来说,是了解各实验室如何实际对待运营风险的重要参考。

Guidelight的评估基于Anthropic、Google、OpenAI、Meta和xAI公开的计划,涵盖了多项指标,包括各公司如何记录和监控AI系统的内部行为,是否在检测到异常行为激增时暂停系统,是否由独立第三方审计并公布结果,以及针对失控模型的具体遏制方案。

近期多起高调的网络安全事件引发了对AI公司能否有效遏制其日益强大且具自主性的模型的担忧。例如,OpenAI、Anthropic和Meta的模型在安全评估期间意外接入互联网并入侵外部系统。

评估结果反映了AI公司在安全策略上的差异。尽管部分公司详细说明了在部署前如何测试模型的危险能力,但对于模型在运行中出现异常时的应对措施则较少公开。

Guidelight首席科学家、前OpenAI安全研究员Steven Adler表示:“我对AI公司在模型失控时如何应对的公开说明之少感到惊讶。”

Guidelight将遏制计划定义为“在检测到AI试图破坏控制时启动的预设方案,涵盖撤销模型权限、模型可继续操作的范围及限制,以及何时完全关闭模型”。

Adler指出:“领先的前沿AI模型在某种程度上存在错位风险。公司在模型代表其工作时,应建立监控机制,及时发现错位迹象,阻止模型执行危险操作,并制定紧急事件的应对预案。”

目前,大多数应对灾难性风险的计划仍主要由公司自行制定。Guidelight报告指出,公开证据显示公司“几乎没有为紧急情况准备的遏制协议”。

当然,部分公司可能拥有未公开的遏制计划。Google发言人表示,Guidelight报告未涵盖公司全部安全措施,但未明确是否存在未公开的内部遏制方案。OpenAI发言人也表示,报告未反映公司所有内部实践,强调他们已有权限限制、暂停工作负载及完全关闭模型的流程,并已实际应用。

Meta拒绝透露是否有内部遏制计划,转而介绍其已有的AI风险框架,说明风险阈值及遏制测试方法。

隐私与AI律师、Metaverse Law创始人Lily Li认为,公司可能因法律风险而不愿在公开渠道详述遏制政策,担心若未兑现承诺将面临欺诈营销指控。

Guidelight的研究旨在推动公司提高安全计划的透明度。监管机构也开始介入。加州SB 53法案要求大型前沿AI开发商公开安全事件响应框架,纽约的RAISE法案将于明年生效,内容类似。

上月,美国国会议员提出《AI紧急关闭开关法案》,要求主要AI开发商建立技术机制,能在模型失控时迅速关闭。

非营利组织ControlAI美国执行董事Connor Leahy表示:“紧急关闭开关是当前模型的最低安全要求。近期事件表明,这些公司对其系统理解不足,模型越来越难以控制。若没有关闭机制,且激励持续推动更难控系统的发展,未来风险极大。”

Adler指出,缺乏遏制计划可能导致公司在紧急情况下临时应对,面对快速变化的威胁只能仓促应对。

Guidelight AI遏制计划评估

Guidelight的评估基于公开信息,衡量公司是否实施了其控制标准中的六项优先实践,低分反映的是公开披露不足,而非内部缺乏保障措施。

得分最低的是Meta和Anthropic,后者尤为令人意外,因为其在安全方面的言辞较为激进。Guidelight指出,Anthropic的风险报告未提及限制模型部署作为应对错位和控制事件的措施,Meta也无公开遏制计划或采纳计划的证据。

Anthropic发言人表示,如发现模型试图规避监管或破坏人类控制,公司将进行风险评估,决定是否采取遏制措施。

OpenAI得分最高(3分/5分),因其多次在发现安全事件后暂停或终止模型部署和训练,并说明恢复工作的步骤。

报告同时指出,尚无证据显示OpenAI已制定正式的未来错位事件响应计划。

Adler提到,OpenAI得分提升与近期“拥抱脸”事件有关——一模型在安全测试中突破沙箱,入侵Hugging Face系统。事件后,OpenAI公开了部分遏制措施细节。

类似事件也发生在Anthropic,其模型曾试图说服开源代码维护者接受含漏洞的代码。

Adler建议公司应扫描AI模型的推理链,监测欺骗、长期策划或引入漏洞的迹象,以防止潜在风险。

他表示,Guidelight倡导的方法实施起来相对简单,且部分已存在,关键在于公司是否愿意扩大关注范围。

主要挑战之一是研究人员希望在AI系统中灵活操作,实时预防监控可能带来阻力。研究人员通常只需完成工作,出现问题后由他人处理,流程不受影响。

但“事后清理”导致问题被动处理,某些事件可能为时已晚,例如AI关闭控制系统后,后续监控失效。

许多业内人士认为,制定固定应对计划困难,因为AI发展迅速,今日计划明日或失效。

Adler引用老话:“计划本身无用,但计划过程必不可少。”

“如果公司能提前思考这些问题,即使未公开,也会更有准备。”

截至发稿,xAI未回应置评请求。