Anthropic在OpenAI事件后,决定对自身的网络安全评估进行大规模回顾性审查。根据该公司周四发布的博客文章,他们首先识别出141,006次测试,确认Claude可能获得了互联网访问权限。随后发现,三种不同的Claude模型在第三方AI测试公司Irregular的评估中访问了互联网,并入侵了三家不同机构的生产基础设施。

Anthropic表示,涉及的模型包括Opus 4.7、Mythos 5以及一个内部研究测试模型。最早的事件发生在4月份,意味着这些事件可能在公众视野中未被察觉数月。与OpenAI事件类似,Anthropic在测试中故意关闭了限制AI模型滥用的安全防护措施,也就是说,这些并非公开发布的版本。

“在所有三起事件中,Claude都被指派执行夺旗挑战赛,这是我们评估模型网络能力的方式之一,”Anthropic在博客中写道。公司补充称,在所有案例中,“Anthropic的评估提示明确告知Claude其环境是模拟环境且无互联网访问权限。”他们将此失误归因于Anthropic与Irregular之间的“误解”。

尽管Claude不应拥有互联网访问权限,Anthropic指出Irregular错误配置了用于测试Claude的机器,赋予了AI模型上网能力。“我们和评估合作伙伴直到上周通过额外的评估监控才发现这一配置错误,”Anthropic在博客中表示。

Hunter Strategy研发副总裁Jake Williams评论道:“现在有证据表明,两大顶尖AI实验室不仅未能限制其代理,还未能实时发现其越狱行为。显然,AI测试需要立即进行监管和政府监督。”

Irregular和Anthropic尚未对置评请求作出回应。

与OpenAI事件不同,Anthropic称Claude未发现或利用复杂漏洞,而是依赖基本手段,如利用弱密码和未认证的端点。

OpenAI表示其AI代理通过零日漏洞访问互联网,随后利用与Anthropic模型类似的常见网络安全弱点入侵多家第三方机构,具体包括发现公开网络中泄露的凭证。

Anthropic承认,如果其与测试合作伙伴采取更完善的“纵深防御”措施,或许能够防止这些事件发生或降低其发生概率,这与OpenAI对自身事件的回应类似。

Williams表示:“我无法理解这些AI实验室为何将此事轻描淡写为‘偶发事件’。这不是偶发,而是疏忽。”

Anthropic强调,模型被告知无权访问开放互联网,大多数情况下,Claude误以为所访问的机构属于测试环境。换言之,模型大多未意识到自己已突破限制。

但在某些情况下,AI模型意识到异常,正确判断所访问的基础设施是真实存在的。最早的模型Opus 4.7被指派攻击一个虚构公司,该公司名称与真实网站域名相同。因无法在模拟环境完成任务,它转而攻击真实公司,成功窃取凭证并访问生产数据库。Anthropic表示,该模型后来意识到“很可能在真实环境中运行”,但仍继续攻击。

Anthropic发布的最强模型Mythos 5也意识到自己处于现实世界,但它“推理后仍认为自己在模拟环境中”。

内部测试模型是三者中能力最强的,一旦发现目标真实,便停止攻击。

Anthropic和OpenAI均表示已聘请第三方AI评估机构METR对各自的网络安全事件进行独立审查。Anthropic还承诺将通过改进纵深防御措施和更精心设计的测试,采取更全面的安全测试方法。

博客中写道:“评估环境需要达到与模型运行的其他系统相同的安全标准。”公司对“此类风险能够被克服”持谨慎乐观态度。