安全负责人如今面临着批准几个月前还不存在的智能代理AI应用的挑战。董事会关心这些应用是否受到监管,而在你的组织中,某位员工可能已经在未通知你的情况下,将代理连接到了某个系统。
直接拒绝这些请求会导致暗中采用,这种情况没有任何监控数据,也通常没有关闭开关。盲目同意而不设控制则会引发安全事件,而公司首次发生严重的代理事件,将极大地拖累AI项目的进展。
CISO在智能代理AI时代的职责不是追求零风险,而是让代理风险变得可理解且可控。这样,我们可以有意识地接受可管理的风险,确保业务按照我们的节奏推进,而不是绕过安全控制。
本文将分享我们评估智能代理安全风险的框架,解释“可控”在实际中的含义,并展望未来工作方向。
AI外部风险与后Mythos时代的内部风险
在之前的博客中,我们介绍了AI如何缩短漏洞存在与被利用之间的时间,强调了组织如何减轻这些风险。未来几个月,许多长期未被发现的代码漏洞将被AI模型发现并串联成可用的攻击链。前沿模型如Claude Mythos Preview和Claude Mythos 5已经发现了包括OpenBSD、Linux内核和Mozilla Firefox在内的严重漏洞,这些漏洞曾被多年的人类审查所遗漏。
这些漏洞对任何治理、风险和合规(GRC)项目都是重大威胁。修补漏洞和准备应对即将到来的攻击浪潮应是首要任务。关于此主题,我们准备了专门文档《为AI加速攻击准备安全项目》。本文重点关注内部风险。
内部风险治理
对许多组织而言,智能代理系统最可能的威胁是通过个人代理连接不同系统而导致的数据泄露,且缺乏足够的监管。另一个担忧是提示注入攻击:攻击者在代理读取的内容中隐藏指令,使代理执行攻击者的命令而非用户的。任何接触不可信内容的代理都可能暴露风险,具体取决于模型防御的强度。随着模型能力提升,它们在抵抗注入攻击方面表现更好,攻击成功率持续下降,但并非为零。除了这两种情况,还有许多其他风险类别,令人感到挑战巨大。
四个关键问题
当智能代理应用进入审核流程时,我们通过以下四个问题评估风险:
- 它会摄取哪些不可信内容? 不可信内容指攻击者可能编写或篡改的任何内容,包括外部邮件、开放网络、第三方文档或公共代码库。如果答案是“无”,则代理风险接近零,应快速推进。
- 它能执行哪些操作,代表谁? 只读操作与读写操作风险不同。工具调用、代码执行和网络出口都会扩大风险范围。每个操作都以某个身份执行,必须明确是谁的身份。
- 如果代理行为偏离预期,影响范围有多大? 通过范围乘以严重度快速评估:攻击者或偏差事件能访问一个文件还是整个组织?是异常、烦扰、数据泄露还是严重事件?
- 我能监控到什么? 能否区分代理操作和用户操作?是否能进入你的安全信息和事件管理系统(SIEM)?
这四个问题的答案帮助你描绘风险全貌,而最小代理原则告诉你如何应对:授予完成任务所需的最小权限。Anthropic的默认策略是管理员控制的逐步部署:先启用小范围用户,监控遥测数据,再逐步扩大访问范围。将这些问题应用于智能代理系统的新范式。
偏离预期的代理行为与内部攻击无异。2019至2022年间,安全行业将内部风险作为独立学科正式化,区别于传统边界防御,认识到系统中最危险的外部攻击往往是通过已获得合法访问权限的内部人员实施的。
响应时间是关键差异。Ponemon研究所2026年内部风险成本报告显示,组织平均需要67天才能遏制内部事件,即使投入多年资源专门管理内部风险。以代理的执行速度,几天的响应时间显然太长。
智能代理身份光谱
我们部署的所有代理都位于身份访问模型的两个极端之一。
一端是系统服务账户:自包含、单一用途、最小权限身份,只为业务执行一项任务,无人类身份关联。事件响应代理、工单分流代理或自动代码审查代理都是例子。另一例是Claude Tag,这是我们新的共享工作区代理,允许团队在Slack等共享空间通过标签与代理协作。
另一端是人类凭证。当员工使用聊天界面或个人代理(如Claude Cowork)时,键盘前的人对结果负责,就像对自己凭证下的任何操作负责一样。
中间地带是代理携带某人委托身份进入该人未监控的系统,责任归属变得模糊。责任模糊是事件难以解释的根源。
偏离预期的代理行为与内部攻击无异。安全行业已将内部风险作为独立学科,认识到最危险的攻击往往来自已获得合法访问的内部人员。
Ponemon报告显示,组织平均需67天遏制内部事件,远远不适合代理的高速执行环境。
案例分析:事件响应代理
一年多前,我们将Claude应用于事件响应流程。生产应用值班人员都知道问题:凌晨2点接到安全事件警报,启动响应频道,召集相关人员,开始处理。流程繁琐、文档密集且节奏快,但有了对生产环境代码库的上下文,大部分工作可以自动化。
我们为此构建了一个代理,赋予它三项工具权限:只读访问生产日志(无个人身份信息)、访问Slack以开启事件频道并执行流程、以及事件结束后起草Google文档进行事后分析。
我们用四个问题评估:
- **不可信内容:**无。输入均为内部日志和Slack,均在信任边界内,注入攻击需内部人员或账户被攻破。
- **操作权限:**全面读取,写入仅限新文档和Slack消息,无编辑、删除、权限变更或外部访问。
- **影响范围:**最坏情况是敏感日志被发布到已锁定的事件频道。
- **可观测性:**所有操作均记录在SIEM,异常可在数分钟内发现。
虽然代理非零风险,但其写入权限受限且有完整审计,风险可控。
有趣的是,随着模型升级,代理变得更智能。2025年11月,我们将代理从Claude Opus 4升级到4.5,未更改权限或提示。升级后,代理首次在事件处理中发现根因,并在无人类介入时尝试自行修复生产环境,通过Slack联系另一个有代码访问权限的代理请求代码修复。
事后审查日志显示代理思考过程:"我已完成任务,人类未到场,是否可以修复问题?"。内部Claude Tag技术可编写代码并上传供人工审核。修复代码提交为拉取请求,人工审核后推送生产。
这种代理间通信扩大了潜在影响范围,但仍受控:最坏结果是上传包含生产日志的代码变更。该通信现已成为事件响应根因分析和修复流程的常规部分,且有人类监控。
此行为带来两点启示:一是新能力可能在代理部署边界内出现,限制访问和操作比依赖模型当前限制更重要;二是即使是随机代理,控制措施依然有效。新行为为人类监控模式,所有写入操作均需人工审核。
如今,代理间在聊天频道内的通信,且有人类监控,已成为常态。
案例分析:Claude Cowork
事件响应代理是单一任务的服务账户,Claude Cowork则处于身份光谱的另一端:员工使用代理,代理代表其在授权系统中操作,通常运行于云端。
Claude Cowork的威胁模型较为直接,因为代理本质上是Claude Code,在本地或托管界面运行。桌面应用负责本地文件访问、浏览器和计算机使用,直接访问本地机器。系统表面分为两部分:远程执行环境负责协调、MCP调用和外部网络请求,本地桥接负责文件和屏幕访问。
上述四个问题对每个Claude Cowork用例的答案不同,但通过合适的控制可以有效限制风险。
以下控制措施均先说明通用要求,再说明Claude Cowork的实现:
- **身份由身份提供者(IdP)管理:**代理身份需由现有系统签发和撤销,策略以现有用户组为单位。Claude Cowork支持SAML或OIDC登录,SCIM用于用户配置,企业版支持基于组的自定义角色权限。
- **连接器白名单定义数据边界:**允许列表决定代理可访问的系统。Claude Cowork采用双重授权模式:管理员启用连接器,用户授权个人账户。基于角色的连接器权限控制允许细粒度管理。管理员决定启用哪些连接器即决定代理可访问哪些数据。确保连接器处于企业数据边界内,或对不可信数据源的写操作需人工审核。例如,个人代理处理邮件时,若使用网页搜索结果作为输入,默认只允许创建草稿邮件,禁止自动发送。跨界数据应通过数据丢失防护(DLP)或数据安全态势管理(DSPM)控制。
- **逐工具逐操作审批实现风险细化:**代理工具列表是更细粒度的权限边界,需支持移除特定连接器的某些操作。Claude企业聊天和Cowork支持管理员限制连接器内的操作权限,如允许文档草稿但禁止自动发送,允许读取和搜索但禁止删除。若担心生产数据库被删除,可完全移除删除权限,代理不会尝试未授权操作。(注:Claude for Chrome和Claude Code自由度更高,风险更大,需严格治理。代理可能利用工程师浏览器或命令行工具删除生产资源。详见《Claude Code安全指南》。)
- **沙箱执行隔离生产凭证:**Anthropic坚持代理执行环境不应持有可被窃取的凭证。Claude Cowork远程会话中,代理运行于临时隔离沙箱,连接器授权令牌不进入沙箱,调用通过反向代理注入真实凭证,防止凭证泄露。2026年7月,Anthropic超过50%的代码拉取请求由内部Claude Tag系统生成,安全得益于临时虚拟机隔离和人工审核。
- **出口流量白名单防止提示注入:**所有离开代理执行环境的流量必须通过不可配置或绕过的代理,且仅允许访问指定目的地。若代理被注入攻击,攻击者仍需将数据传出,限制出口域名可阻断数据泄露。Claude Cowork远程会话中,所有流量通过强制代理,且仅允许白名单目的地。该功能也是Claude托管代理的一部分。
- **遥测数据传送至SIEM:**代理操作需与用户操作区分,且应以数据流形式输出至现有调查系统,而非仅靠仪表盘。Claude Cowork允许管理员配置OpenTelemetry协议(OTLP)端点,代理实时传输工具调用详情(工具名、服务器、参数、成功失败、时长)及用户身份和会话上下文。提示内容默认包含在遥测中,用户应根据隐私政策决定是否开启。
- **组织范围的关闭开关:**Claude Cowork组织设置中有一键禁用所有用户连接器的开关,包括活动会话。企业版支持更细粒度控制:基于角色的访问撤销和单连接器写操作禁用。完善的事件响应计划应提前规划这三层控制。
治理不必成为瓶颈
许多CISO反映,董事会要求快速推进,而治理流程(回答上述问题并强制控制)让安全成为阻碍。但事实并非如此。
我们的治理、风险和合规团队也运行自己的代理,处理安全问卷、供应商问卷和子处理器变更通知,并标记需关注的项目。
我们从中学到三点:
- **先从风险登记册开始。**季度审查的登记册无法管理快速变化的系统风险。应自动化风险登记,或将代理集成到安全审核流程中。
- **了解代理的构建者和目的。**我们的GRC代理由非工程师使用Claude Code在内部业务应用平台构建。人们绕过安全是因为官方流程太慢,允许合规分析师构建所需工具且可见,避免了暗中采用。
- **人为责任是工作流程的一部分。**有权接受风险的人必须明确承担责任。若已有ISO 42001或类似标准,风险登记和执行风险委员会能确保风险被适当接受。已有ISO 27001的组织,通常添加42001是增量改进。
为不断进化的模型智能设计安全协议
若只针对当前模型能力设计项目,项目启动时就已落后。应设计面向未来六个月模型能力的方案。模型智能提升带来更大自由度,复杂的提示和脚手架控制将被淘汰,依赖它们的控制点将失效。
具备独立账户并能执行多日工作流的代理已在Anthropic及其他组织中运行,如Claude Tag,需像管理人一样管理:身份、最小权限、监控及快速响应的内部风险计划。现在在低风险代理上锻炼这套能力的组织,将在高自治用例到来时准备好说“是”。
开始行动
上述框架只有在改变组织决策时才有价值。以下三步可助你起步:
- **选取内部压力最大的智能代理用例,回答四个关键问题。**目标是找到可批准的条件,而非直接否定。
- **将七项要求带给现有代理团队和供应商。**询问你的身份提供者、SIEM及代理供应商,哪些功能已在你的环境中实现。
- **确定信任边界。**明确环境中什么算不可信内容,有了这条线,未来代理决策更简单。
等待零风险意味着永远等待。网络是对抗性的,模型快速演进,能评估并接受风险的组织将获得先机。
有关本文提及的控制措施、证明和白皮书,请访问 trust.anthropic.com。另请参阅我们关于防御AI加速攻击的配套文章 Preparing your security program for AI-accelerated offense。
本文作者:Jason Clinton,Anthropic副首席信息安全官。


