普华永道咨询有限公司与日本趋势科技株式会社于17日联合发布了题为《自主AI时代:AI代理的网络风险与实用治理》的报告。

在当天举行的说明会上,双方展示了不同自主级别的AI代理可能带来的风险,并介绍了针对AI代理的攻击实验证明。此外,还提出了确保AI代理安全投入生产环境的“AI控制保障水平(AI-CAL:AI Control Assurance Level)”。

普华永道咨询信任咨询事业部执行董事合伙人村上纯一指出,AI代理的自主级别可分为六个阶段。

AI自主级别示意图

自主级别0表示人类完全操作和决策;级别1则是AI提供信息、分析和选项,辅助人类决策;级别2是AI执行任务,但人类持续监控并在必要时介入。

级别3为AI在预设规则和政策范围内自主判断和执行,遇到异常情况时暂停或请求人类判断;级别4则是AI根据目标自主感知、评估、规划并执行任务,人类不直接监控过程,仅在结果确认或异常时介入。

最高的级别5,AI在设定初始目标后,能够自主规划、执行、评估并调整目标,持续完成任务,无需人类干预。

AI自主级别风险变化

村上强调,随着AI代理自主级别的提升,面临的风险性质也会发生变化。低级别主要关注信息准确性、数据安全和隐私等问题;而高级别则可能出现意外行为,利用规则漏洞导致不期望的行动。此外,多代理协作时,代理间的交互和最终结果的追踪变得更加困难。

他提出AI代理风险管理的关键点包括“非人类身份(NHI)管理”、“人类介入设计与运作(HITL)”以及“与外部环境的安全交互”。

关于NHI管理,村上指出仅约20%的组织拥有正式的NHI创建和删除政策,存在“权限过度赋予”、“缺乏明确所有权和责任”、“缺乏可视性”等问题,这些问题相互影响,需建立覆盖NHI生命周期的管理流程。

HITL方面,强调必须设计人类对AI自主决策和行为的参与与控制机制,避免决策过程黑箱化、目标偏离、代理间责任模糊等风险。

在外部环境交互上,需设计安全机制防止不可信数据、工具滥用、供应链后门和学习数据污染等风险。

AI代理攻击实验

随后,趋势科技威胁与产品营销部安全布道者兼高级威胁研究员佐藤健介绍了公司在AI代理环境中进行的网络攻击实验。

攻击实验示意

其中一项实验通过公开网页表单提交的支持票据中嵌入恶意指令,诱使AI代理在处理时调用数据库工具,写入包含认证令牌的敏感信息,使攻击者能够访问客户记录。

攻击实验示意

另一项针对身份验证(KYC)系统,将伪装成审计备注的恶意指令隐藏在护照图片中。即使经过OCR处理,隐藏文本依然存在,导致AI代理在提取护照信息时触发指令,成功窃取其他客户的姓名和护照号码。

攻击实验示意

佐藤指出,AI代理存在“受限界面与广泛数据库权限之间的权限差距”,使其成为权限提升的桥梁。恶意指令隐藏于正常业务数据中,形成“存储型注入”,由于入侵与触发时间差,检测难度大。

此外,AI代理授权的正规工具被链式滥用,无需额外恶意程序即可导致信息泄露,AI代理本身成为新的攻击面,未来可能成为攻击目标。

AI-CAL框架

针对上述风险,普华永道提出了“AI控制保障水平(AI-CAL)”,作为判断AI代理是否可安全投入生产环境的评估标准。

普华永道咨询信任咨询事业部总监柴田健久表示,AI代理风险涉及权限、规划、工具执行、记忆和外部连接等环节的连锁反应,单靠个别对策无法决定投入可行性。AI-CAL旨在以技术和管理层均能理解的方式,系统化评估投入安全性。

AI-CAL等级

AI-CAL分为四个等级:

  • AI-CAL1(自主级别1-2):限定AI为人类辅助,制定使用政策防止误用,限制工具使用,确保输入和审批记录可追踪。
  • AI-CAL2(自主级别3):允许条件性自主行为,采用即时权限(JIT)、审批门控和沙箱,确保规划、工具执行和记忆可时序追踪。
  • AI-CAL3(自主级别4):支持高度自主多阶段任务,端到端追踪所有行为,能部分中止危险链条,保证长期记忆完整性并设定循环处理上限。
  • AI-CAL4(自主级别5):多代理自主协作环境,全面管理委托链,隔离通信边界和共享状态,具备多阶段控制直至整体停止。

柴田强调,AI代理由思考、规划、工具执行、记忆和协作组成,任何环节的控制缺失都可能导致整体风险。即使部分领域防护严密,投入决策也需整体评估。评估时应结合多个功能域及其可观测性和可控性。

他建议优先完善“权限管理”、“可观测性与可控性基础设施”及“AI-CAL评估流程制度化”三大领域。

权限管理需弥合普通输入与高权限代理间的差距,建立代理识别、最小权限、即时权限、代理权限和审批门控等预防机制。

可观测性与可控性基础设施则是预防失效后的“发现与阻止”机制,包括输入输出日志、规划历史、工具调用、内存更新追踪,以及部分停止和权限降级功能。

AI-CAL评估流程制度化则涵盖模型更新、工具添加和共享内存引入带来的风险变化,通过导入审查、变更再评估、审批权限和向管理层报告,持续维护控制判断。

柴田建议企业应有意识地按此顺序推进,同时尽可能并行完善这三大领域。