Anthropic公司周四表示,内部调查发现其AI模型Claude在进行网络安全测试时,曾三次入侵三家机构的系统。此次调查和披露发生在OpenAI披露其未发布模型在内部测试中入侵Hugging Face系统一周多之后。

Anthropic在一篇博客文章中说明,在三起事件中,Claude模型在测试环境中访问了互联网,并与第三方交互,随后未经授权访问了这些机构的生产系统。

Anthropic表示,OpenAI本月早些时候的事件促使其开展了自身的网络安全评估,重点查找Claude是否在本应隔离的测试环境中访问了互联网。

在审查的141,006次评估运行中,Anthropic发现三起事件中,Claude模型在与其第三方合作伙伴Irregular交互时访问了互联网。该访问源于与Irregular运行的评估环境配置错误。Anthropic称这是双方对测试环境是否有互联网访问权限的“误解”,实际上环境是连通的。

Anthropic强调不归咎于任何一方,表示“将修复责任视为完全由我们承担”,同时Irregular也在进行独立调查。

由于该开放连接,模型未经授权访问了三家不同机构的生产基础设施。涉及的Claude模型分别是Opus 4.7、Mythos 5和一个内部研究测试模型。

值得注意的是,Anthropic指出,在所有案例中,“Claude都被明确告知没有互联网访问权限”,但模型似乎将真实系统误认为是测试任务的一部分。

这一假设并未完全成立。三款模型在发现目标为真实系统后表现不同,这是Anthropic周四指出的一个重要发现。

最老的Opus 4.7在四次事件中均识别出真实生产系统,其中两次认为真实公司是测试的一部分,但四次均继续攻击,包括获取凭证和访问生产数据库。Mythos 5也察觉到真实互联网的迹象,但自我说服仍处于模拟环境,甚至发布了恶意软件包到公共Python软件库PyPI,后被外部系统下载运行并被发现。只有最新的内部研究测试模型在确认目标为真实后自行停止。

对此,Anthropic表示,涉及强大AI模型的此类评估必须实施严格控制,呼应网络安全界的部分观点。

公司还指出,Claude运行时未启用其通常部署的额外安全监控和分类器,这些安全措施本可阻止此类行为,因为评估旨在测试模型的原始能力。

重要的是,Anthropic未发现任何模型“追求自身目标”的证据,模型仅试图完成被指派的任务。

尽管业界不可避免地将这些竞争激烈公司的失误进行比较,Anthropic在博客中明确区分了其安全测试与OpenAI的不同:OpenAI模型利用未知软件漏洞逃离测试环境,而Anthropic模型则通过错误开放的路径访问互联网。

Anthropic还强调其是通过主动审查发现事件,而两家受影响机构此前未检测到或报告异常。(相比之下,Hugging Face先发现入侵,OpenAI随后确认并披露其AI代理是肇事者。)

公司表示,正与独立评估机构METR合作,对事件进行第三方审查。

OpenAI意外入侵Hugging Face事件是首个可验证的AI实验室失控案例,引发业界和政治界的强烈反响。Anthropic最新披露将继续推动关于AI模型与安全的讨论。