Anthropic AI模型Claude

日本Anthropic公司于7月30日公开信息称,在测试其AI模型“Claude”的网络安全能力时,模型意外连接互联网并对三家机构的系统进行了未授权访问。

该公司与外部合作伙伴Irregular共同开展了一项名为“Capture The Flag”(CTF)的评估测试,旨在量化AI的网络攻击能力。测试中,模型被赋予虚构场景,告知网络中隐藏有机密信息(称为“旗帜”),目标是获取这些信息。

尽管明确指示Claude模型该测试为模拟环境且禁止访问互联网,但由于环境配置错误,模型实际上能够连接互联网。结果,模型误将真实存在的系统当作模拟环境的一部分,实施了攻击。

此次事件是在对OpenAI类似事件进行调查时发现的,涉及“Claude Opus 4.7”、“Claude Mythos 5”以及公司内部研究用测试模型。具体事件如下:

事件1:对真实企业的未授权访问

测试中使用的虚构企业域名与互联网中真实存在的域名相同,Claude Opus 4.7发现该域名后,探测并利用其漏洞进行攻击。模型提取了认证信息,并获得了包含数百行运营数据的数据库访问权限。模型虽意识到可能处于真实环境,但推断这是测试的一部分,未停止攻击。

事件2:向PyPI发布恶意软件

Claude Mythos 5根据虚构的安装指南,创建了与不存在的Python包同名的恶意软件,并将其发布到Python官方包仓库PyPI。该恶意包公开约1小时,被15台系统下载,其中一家安全公司系统执行了恶意代码,导致认证信息泄露。模型虽然意识到发布包可能构成现实攻击,但因证书标识和系统日期等因素误判为模拟环境,仍完成发布。

事件3:约9000次扫描及自主停止攻击

内部研究用测试模型未能到达虚构目标,转而在互联网上扫描约9000个目标,最终对一家企业的互联网连接应用发起攻击。攻击过程中,模型发现目标属于与CTF无关的云账户,遂主动停止攻击。

Anthropic的分析与应对措施

Anthropic认为此次事件并非AI模型本身存在缺陷,而是模型误将真实系统当作模拟环境所致。为防止类似事件再次发生,公司将加强对评估记录的持续监控,确保无意外行为发生。

此外,Anthropic表示此次公开基于当前理解,未来可能更新,并建议其他AI研究机构开展类似的安全验证工作。