Claude浏览器插件现已在所有付费Claude计划中全面开放使用。该插件允许Claude在浏览器中自主执行操作,无需每次都获得用户批准。每项操作都会经过安全分类器的验证,确保其安全且符合用户的请求。

Claude浏览器插件界面

许多日常使用的工具都可以与Claude连接,但仍有一些内部仪表盘、遗留系统和供应商门户无法直接连接。Claude浏览器插件让Claude能够访问这些页面,读取和输入文本、点击链接、在页面间导航以及填写表单,且使用您现有的登录信息。

去年我们首次发布了Claude浏览器插件的试点版本,期间不断强化对提示注入攻击的防御。提示注入是指恶意指令隐藏在网页、邮件或文档中,试图诱导AI代理执行用户不希望的操作。以下介绍的安全措施使我们有信心将Claude浏览器插件推向全面开放。

防范提示注入攻击

正如我们在试点发布时所述,运行于浏览器中的AI代理同样面临提示注入的风险。为此,我们在正式发布前大幅提升了安全防护。

提示注入攻击中,攻击者会将恶意指令隐藏在网页内容、邮件或表单字段中,用户可能察觉不到,但这些指令会误导AI代理执行未授权的操作。例如,您让Claude帮忙回复邮件时,隐藏指令可能会让Claude将其他邮件转发给攻击者。

发布时,我们介绍了Claude针对这类攻击的防御测试和当时的安全措施,随后发布了更详细的浏览器使用安全防护说明。此后,我们改进了模型训练和探测器,并新增了一套分类器,使Claude能更安全地在Chrome中自主执行更多操作。以下内容展示了这些防护措施的效果。

Claude识别更多攻击。 我们不断扩充提示注入攻击库,来源包括内部自动攻击器、外部红队和实际监控。当新攻击成功突破当前模型时,会被加入库中,用于训练未来模型和安全防护,使其学会识别该攻击。自2025年11月首次介绍浏览器使用的提示注入防御以来,Claude对这类攻击的抵抗力显著提升。

探测器在Claude执行操作前筛查网页内容。 网页内容通过工具结果传递给Claude。执行阅读页面或打开邮件等操作时,模型会调用工具,工具结果让模型读取内容。我们训练探测器扫描这些结果,检测潜在的提示注入攻击。探测器一旦发现疑似攻击,会提醒Claude提高警惕,必要时在执行操作前征求用户确认。探测器首次随Claude Opus 4.5部署,后续覆盖的攻击类型不断增加。

操作执行前进行验证。 在Claude浏览器插件中,Claude会自动批准其判断安全的操作,机制与Claude Code中的自动模式相同(用户可在设置中关闭此功能,改为手动批准操作)。分类器会审核Claude即将执行的操作,如访问新网站或输入文本,确保与用户请求一致,否则阻止执行。

Claude对提示注入攻击的防御效果评估

我们对这些安全措施进行了测试,确保Claude浏览器插件适合浏览器环境下的工作。以下是最新评估结果。

在最初的评估中,测试Claude Cowork对提示注入攻击的抵抗力(该测试于Claude浏览器插件试点发布时开发),无论是Claude Fable 5、Claude Opus 5还是Claude Sonnet 5,在Cowork环境中均未被任何攻击成功突破,即使未启用探测器和分类器。

提示注入攻击测试结果

由于该测试已达到饱和(攻击成功率为0%),我们决定停止使用。当前评估采用了由专业红队提供的更强攻击手段,攻击成功率在未启用额外防护时,Opus 4.5为17.6%,Opus 5为3.8%。2025年11月启用最强防护后,Opus 4.5配合探测器的攻击成功率为16.7%。从Opus 4.8版本开始,配合探测器和安全分类器,Claude Sonnet 5、Claude Opus 5和Claude Mythos 5均未被攻击成功,Fable 5的攻击成功率为0.3%。我们已人工确认所有成功攻击均属低严重性场景,正在持续改进防护。

防护效果统计图

提示注入攻击手段不断演变。虽然当前防护有效,我们仍需持续保持领先,随着每个模型版本发布,继续投入开发更先进的自动攻击发现、红队测试和更强分类器。

如何开始使用

要开始使用Claude浏览器插件,请从Chrome网上应用店安装。在企业计划中,管理员可通过组织设置管理插件,并限制仅在批准域名使用。详见管理员设置指南

您仍需使用Claude桌面应用处理电脑上的文件或与其他应用协作。Claude浏览器插件目前仅支持Chrome浏览器,尚未支持其他Chromium浏览器或移动端。

注:并非所有攻击都会被模型接收——有时Claude的操作导致其未接触到恶意指令。