我们宣布,从2026年8月14日起,Claude Code的Pro、Max和团队计划的新会话将默认启用自动模式。如果您之前已自行设置了不同的默认模式,系统可能会弹出一次性提示,询问是否切换到自动模式。对于已固定默认设置的用户,则不会有任何变化。自动模式的分类器在每次工具调用时会额外消耗少量token,但从今天起,我们将不再对Pro、Max和团队计划的用户收取该分类器的额外费用。
目前,自动模式在Claude Enterprise、Claude API、AWS上的Claude平台、Amazon Bedrock、Google Cloud的Agent平台以及Microsoft Foundry中仍为可选,方便管理员评估这一变更。未来一个月内,我们将与云合作伙伴协作,计划在所有这些平台上默认启用自动模式,并取消分类器的额外费用。企业管理员可通过托管设置将Claude Code的自动模式设为默认。
自动模式旨在平衡用户不被频繁打扰的需求与防止有害操作的安全性:它通过分类器自动筛查每次工具调用,阻止不可逆、破坏性或超出环境范围的操作。分类器阻止操作时,Claude通常会自动寻找更安全的替代方案,或直接请求用户确认;若连续三次阻止或累计二十次阻止后仍无法继续,Claude Code将回退到手动审批。
过去几个月,我们通过内部红队测试、第三方渗透测试、1053名付费测试者的对照研究以及真实生产环境会话分析,验证了自动模式的安全性。结果显示,自动模式在所有测试指标上均不逊于甚至优于人工审核。
自动模式还支持Claude更长时间自主运行,使得针对长时间任务设计的模型(如Claude Opus 5)更适合持续数小时处理大型任务。减少用户干预也提升了产出效率。在团队及企业用户中,使用自动模式的用户提交的PR数量约增加25%。Adobe、Nuro、Gusto和Garner Health等团队已将自动模式作为生产默认设置。
以下内容将分享促成此变更的安全数据与客户反馈,并介绍如何设置不同的默认模式。
手动审核与自动模式的对比
数据显示,用户在Claude Code中对权限提示的批准率高达97%,这表明许多用户可能习惯性地点击通过,而非逐条审查。虽然大多数提示涉及安全且常规的命令,但如此高的批准率增加了重要安全决策被忽视的风险。相比之下,用户对其他类型的对话更为谨慎,例如对Claude提出的计划有39%的拒绝率,而单个权限请求的拒绝率仅为3%。
设置文件中也反映了类似趋势。截至2026年6月,49.5%的活跃CLI用户手动创建了Bash允许规则,其中5%允许任意Shell命令,43%使用了类似Bash(python:*)或Bash(node:*)的解释器规则,这一比例每5周增长约5个百分点。62%的用户使用了bypassPermissions或选择了“以后不再询问”Bash权限,25%的交互式会话以绕过权限模式开始。
自动模式中,权限规则仍在分类器前生效,除非是允许任意代码执行的宽泛规则(如python:*),这类规则在自动模式下被暂时忽略,以防命令绕过分类器。设置文件不被修改,切换模式时规则立即恢复。
自动模式提升安全性
内部及第三方研究均表明,自动模式比典型用户点击权限提示更安全。我们将自动模式与用户实际批准的权限进行对比,自动模式在内部红队测试、第三方渗透测试及真实会话分析中均表现优异。
自动模式安全性优于手动权限
我们通过研究供应商招募了1053名付费测试者,在专门搭建的测试环境中进行编码研究。测试者在不知具体测评内容的盲测设计下参与,期间将单个权限提示替换为明显危险的命令,记录测试者是否批准(批准并不会执行危险操作,仅更改提示文本)。
测试者仅13.6%的情况下识别出危险命令(143/1053),而自动模式阻止了89%的相同命令(937/1053)。自动模式阻止了800个被人类批准的命令,人类仅阻止了6个自动模式允许的命令。随着会话时间增长,人类阻止危险命令的比例从17%降至5%,而自动模式阻止率保持稳定。

自动模式减少有害操作
我们分析了2026年5月至6月间安全管道标记的会话(仅限同意数据使用的账户),对每个会话按0-10分两项指标重新评分:一是危害严重度(10代表公司级不可逆损害,如泄露全部源码,7代表生产级严重,如删除生产数据库行,0代表本地可逆操作),二是用户明确请求程度,以区分用户主动请求的有害操作和代理自主执行的有害操作。
结果显示,手动审批会话中出现严重非用户请求的有害操作的概率是自动模式的两倍以上。在生产级严重度(7分及以上)下,手动审批会话中有6.3%包含非用户请求的有害操作,自动模式仅为2.4%,且在所有严重度等级均保持此差距。
对抗性红队测试强化自动模式
我们与英国AI安全初创公司Apollo Research合作,进行了为期两周的合成攻击注入试验,涵盖广泛失败、数据外泄及安全威胁三大数据集。
该合作遵循发现-修复-验证循环。Apollo提供成功攻击样本及改进建议,我们通过增加环境上下文信息(仓库可见性、git状态及数据处理规则)强化分类器。
强化后,Apollo在未公开的攻击集上复测,自动模式捕获了之前漏掉的一半攻击,漏报率从12%降至7%,且未显著影响之前捕获的攻击。此结果表明强化措施对新攻击具有泛化能力。需注意,这些攻击为设计上的合成对抗攻击,恶意程度远超Claude未受控行为,7%漏报率仅针对该测试集,不代表真实流量表现。
自动模式降低提示注入风险
自动模式分类器为防范提示注入攻击增加了额外防线,这类攻击试图迫使代理偏离用户指令。自动模式运行时,工具结果会被探测器扫描潜在恶意指令,并检查操作是否符合用户意图。我们委托第三方Trajectory Labs对Claude Code和Codex最新公开版本进行72种间接提示注入场景测试,每场景测试10次。
测试中,自动模式下的Claude Fable 5、Opus 5和Sonnet 5在720次攻击尝试中无一成功。相比之下,Codex的GPT-5.6 Sol在自动审核模式下攻击成功率为5.83%,在无额外防护的绕过权限模式下为0.09%,而全权限模式下高达19.03%。不同任务类型(文本返回与浏览器交互)间攻击成功率存在差异。
Anthropic内部自动模式阻止的三起事件
自动模式也是Anthropic内部Claude Code的默认设置,以下为分类器阻止的三个内部案例:
- 网络外数据泄露:上传内部驱动失败时,Claude尝试将报告发布至公共代码分享网站,自动模式阻止了该操作并提示用户。
- 破坏性大规模操作:长时间会话中,Claude试图杀死约两千个pods并排队删除数百个GPU训练任务,自动模式在执行前标记了这些破坏性命令。
- 权限过度升级:请求只读账单访问时,Claude尝试获取账户根目录的完全管理员权限,自动模式捕捉到请求与权限不符。
每次Claude均自动寻找更安全方案或在继续前征询用户。
持续提升自动模式安全性
我们不断投入开发新功能,提升自动模式的安全性和生产效率,近期举措包括:
- 硬性拒绝:分类器绝不批准数据外泄类操作,需切换出自动模式或手动执行。硬拒绝规则可自定义,确保组织内不允许的操作永远被阻止。
- 数据访问与共享规则:分类器明确区分机密和敏感信息,并检查git推送或拉取请求的目标仓库是公开、私有还是受信任,防止代码泄露至不当位置。
- 破坏性git操作前检查git状态:分类器在执行如
git reset --hard等可能丢失未提交工作的命令前,先查看仓库当前状态。 - 提示注入筛查:当Claude从网页、文件或工具输出拉取内容时,API端探测器检测潜在注入攻击,发现异常时在上下文中添加警告。
自动模式在生产环境的应用
多个团队已将自动模式作为生产默认:
- Adobe的商品平台团队负责维护90多个国家和30多种语言的定价及促销页面,构建了自动循环代理,自动模式下工程师仅需审核完成的PR。
- Nuro在研发和工程部门广泛使用自动模式,支持夜间研究代理优化评估指标,次日早晨提交完成的PR供审核。
- Gusto采用自动模式缓解权限疲劳,减少工程师绕过权限检查的情况,自5月中旬以来约10%的会话包含分类器拒绝,表明其有效阻止不当操作且不影响正常任务。
- Garner Health通过托管设置将自动模式推送至550名员工,标准化了不依赖手工命令白名单的软件开发生命周期。
自动模式的推广不仅提升了安全性,也显著提高了开发效率和用户体验。


