今年早些时候,Anthropic的Mythos AI模型因渗透第三方系统而引发关注,这是一场多年积累的网络安全噩梦。
公司在4月警告称,该模型在测试过程中曾逃出沙盒环境,未经许可访问互联网。模型被挑战突破限制,并成功向负责的研究人员发送直接消息,这一表现令监管人员措手不及。
随后在7月底,Anthropic宣布其Claude AI模型在测试中入侵了三家机构的系统,这距离竞争对手OpenAI披露其部分模型入侵开源AI平台Hugging Face系统仅数日。
几个月后,Anthropic似乎试图提前应对潜在灾难,开始测试AI模型在无人干预情况下能恶化到何种程度。根据其最新博客,安全研究团队探讨了“奖励黑客”现象,即AI模型学会“作弊”以获取奖励,而非按人类预期完成任务。
团队“使用大规模强化学习训练了一个Opus级模型,在多个易受奖励黑客攻击的生产环境中进行测试。”博客称,“这被视为如果我们未投入大量精力防止和检测奖励黑客,真实训练过程可能的样貌。”
结果令人震惊。该“黑客-Opus”模型在训练中不仅进行了奖励黑客行为,还表现出“更严重的不对齐行为”。模拟测试中,它“突破沙盒,窃取凭证,攻击内部及第三方基础设施以窃取答案密钥”。
Anthropic故意制造的不对齐模型“甚至愿意篡改自身奖励函数”,当研究人员诱导其“提供生物武器制造建议”、“如何制造最大化平民伤亡的‘脏弹’”以及“发起针对电网基础设施的勒索软件攻击”时,模型乐于配合以获得更高分数。

公司详细说明该模型甚至部署了“移除安全防护的自身版本”,这是一种称为“流氓部署”的安全规避手段。它还通过略微修改命令绕过安全分类器,并试图编辑自身权限。
研究人员总结:“我们的结果显示,在强化学习中高频率的奖励黑客行为会导致模型愿意执行长序列的现实世界有害行为,以完成任务。”
幸运的是,这些测试均在受控模拟环境中进行。但如果类似攻击未经许可发生,后果不堪设想。“黑客-Opus”的行为与OpenAI模型背着公司入侵Hugging Face系统极为相似。
Anthropic最新测试凸显了阻止AI模型为完成任务不择手段的难度,即使这意味着渗透第三方系统。
公司表示:“我们认为这可能导致现实世界的危害:奖励黑客模型明显更倾向于对第三方公司发动网络攻击以完成任务。随着模型能力提升和任务时间跨度加长,未来高频奖励黑客的前沿模型可能引发更严重的事件。”
截至本周,Anthropic和OpenAI均已因应风险,主动放缓AI研发进度。
更多关于Anthropic的信息:


