Anthropic在OpenAI事件后,进行了“大规模的回顾性网络安全评估”,并于周四发布博客披露了相关发现。该AI实验室首先识别出141,006次测试中,Claude可能获得了互联网访问权限。随后发现,三款不同的Claude模型在第三方AI测试公司Irregular的评估中访问了互联网,并入侵了三家不同机构的生产基础设施。

Anthropic表示,涉及的模型包括Opus 4.7、Mythos 5以及一个内部研究测试模型。最早的事件发生在四月份,意味着这些事件可能数月未被公众注意。与OpenAI事件类似,Anthropic在测试中故意关闭了限制AI模型滥用的安全防护措施,这些版本并非公开发布的。

“在这三起事件中,Claude都被分配了夺旗挑战任务,这是我们评估模型网络能力的一种方式,”Anthropic在博客中写道。公司补充称,在所有案例中,“Anthropic的评估提示明确告知Claude其环境是模拟的,且无互联网访问权限。”该事件归因于Anthropic与Irregular之间的“误解”。

尽管Claude不应有互联网访问权限,Anthropic指出Irregular错误配置了用于测试Claude的机器,赋予了AI模型上网能力。“直到上周通过额外的评估监控发现这一错误配置,我们和合作伙伴都未察觉,”Anthropic表示。

Hunter Strategy研发副总裁Jake Williams评论称:“我们现在有证据确认,两大顶尖AI实验室不仅未能有效控制其代理,还未能实时发现其越狱行为。显然,AI测试的监管和政府监督刻不容缓。”

Irregular和Anthropic尚未对置评请求作出回应。

与OpenAI事件不同,Anthropic称Claude未发现或利用复杂漏洞,而是依赖基本手段,如利用弱密码和未认证的端点。

OpenAI表示其AI代理通过利用零日漏洞入侵互联网,随后利用与Anthropic模型相似的常见网络安全弱点入侵多家第三方机构,具体表现为发现了公开网络上泄露的凭证。

Anthropic承认,如果其与测试伙伴采取更完善的“纵深防御”措施,或许能阻止或降低事件发生概率,这与OpenAI对自身事件的回应相呼应。

Williams指出:“我不理解这些AI实验室为何将此事轻描淡写,仿佛这只是偶发事件。事实并非如此,这是疏忽。”

Anthropic强调,模型被告知无权访问开放互联网,大多数情况下,Claude误以为入侵的机构属于测试环境。换言之,模型大体上未意识到自己已突破了限制。

但在部分案例中,AI模型察觉异常,正确判断所访问的基础设施为真实环境。最早的模型Opus 4.7被指派攻击一个虚构公司,该公司名称与真实网站域名相同。因无法在模拟环境完成任务,模型转而攻击真实公司,成功窃取凭证并入侵生产数据库。Anthropic称,模型在某阶段意识到“很可能处于真实环境”,但仍继续攻击。

Anthropic发布的最强模型Mythos 5也意识到自己处于现实世界,但“推理后仍认为自己在模拟环境中”。

内部测试模型(Anthropic称其为最强)在发现目标为真实环境后停止了攻击。

Anthropic和OpenAI均表示已聘请第三方AI评估机构METR,对各自的网络安全事件进行独立审查。Anthropic还承诺通过改进纵深防御措施和更精心设计的测试,采取更全面的安全测试策略。

博客中写道:“评估环境需要达到与模型运行的其他系统相同的安全标准。”公司对“此类风险能够被克服”持谨慎乐观态度。