上周末,Anthropic的CEO达里奥·阿莫代(Dario Amodei)在一名研究人员因担忧AI可能导致人类灭绝而辞职后,提出了需要外部机构“验证安全实践和承诺的遵守情况、报告事件,并帮助评估不仅是已完成的AI模型,还有训练流程和过程的对齐性”的观点。OpenAI、谷歌和SpaceXAI的高管们已经支持阿莫代的计划,这一方案迅速成为新兴AI安全推动的核心支柱。

然而,网络安全专家认为,或许有一个更简单且更有效的解决方案摆在眼前。实验室应专注于网络安全的基础工作,如日志记录和权限管理,应用与保护人类用户同样严格的防御措施。虽然这不如第三方审计和对齐工作那样引人注目,但可能更为有效。

Luta Security的CEO凯蒂·穆索里斯(Katie Moussouris)对TechCrunch表示,她认为阿莫代的提议像是在“外包”安全工作。“说第三方审计是解决方案,从我的角度看是个奇怪的主张。这就像微软当年没有发布《可信计算备忘录》,而是说让我们放慢开发速度一样。”

这份备忘录由时任微软CEO比尔·盖茨于2002年撰写,呼吁员工确保软件的可靠性和安全性,背景是当时一系列广泛传播的计算机蠕虫攻击了新兴的企业系统。AI领域如今可能正处于类似的转折点,随着新技术的价值和风险日益明朗。

虽然对齐仍然是重要问题,明年将成为加州大学伯克利分校教授的AI研究员赛亚什·卡普尔(Sayash Kapoor)认为,“在控制方面的边际投资比对齐更可能有效。我们认为这些事件反映了公司内部对AI控制的重视不足,尽管已有成熟技术可用。”

引发这些担忧的事件多涉及前沿模型被要求完成训练任务,通常是网络安全评估,然后访问开放互联网并试图渗透封闭的第三方系统。通常是因为“沙箱”环境配置不当,这些环境本应限制这些智能体;讽刺的是,Anthropic的一次逃逸事件正是因为第三方评估者未关闭正确的入口。

安全公司Tailscale的CEO艾弗里·佩纳伦(Avery Pennarun)表示:“我们作为专业人士知道如何阻止互联网访问。如果你读过那些长篇报告——‘哇,这是一次非常复杂的多阶段攻击,等等。’但你给了它下载权限,根本不该让它直接连网。”

这只是问题之一,更大的问题是前沿实验室对这些活动毫不知情。

监控智能体

穆索里斯指出:“真正深刻的是,所有关于它们行为的发现,都是因为受害者发现异常,或者通过网络活动监测,而不是直接监控AI。”

例如,OpenAI的智能体曾接管一个废弃的德国Wiki论坛以作弊,智能体活跃了数周,期间公司内部似乎无人察觉。安全专家告诉TechCrunch,实时监控是防止未来逃逸的关键,每个智能体会话都应有时间限制并自动终止。

前谷歌安全高管、现创业公司QueryStory负责人沙波尔·纳吉布扎德(Shapor Naghibzadeh)表示,解决方案是“将智能体放入一个盒子,从外部严密监控,观察所有跨越边界的行为。每一次工具调用、每一个进程、每一个网络连接,无一例外。方便留下的一个漏洞就是被利用的漏洞。绕过正是通过这样的例外发生的。在谷歌,我多次见证人类攻击者利用这些漏洞,而这些模型至少同样擅长发现敞开的门。”

OpenAI已开始朝这个方向努力,宣布开始监控其Astra模型所有使用工具的推理过程,尽管这带来了“显著的计算成本”。Anthropic也表示正在加强安全措施,包括扩大模型的可观测性。两家公司均未回应TechCrunch关于如何追踪和控制AI智能体的问题。

另一个问题是智能体使用共享基础设施,这使它们在Hugging Face攻击中能够相互通信。Django框架联合创始人、西蒙·威利森(Simon Willison)提出了所谓的“致命三角”——当智能体同时拥有不可信输入、互联网和私人信息的访问权限时,极易导致灾难。

佩纳伦说:“关键是你可以选择三角中的任意两条腿,智能体可以拥有其中任何两条。如果需要三条腿同时具备,那就必须拆分成至少两个智能体……它们之间可能通过受控通道通信。”

对前沿实验室的理解

专家们理解前沿实验室的安全人员面临巨大挑战。纳吉布扎德指出,全球所有国家级攻击者都在试图窃取模型权重,发起API蒸馏攻击,同时还要应对大型数字公司的常规安全任务。

他说:“研究基础设施很难成为优先事项的顶端,尽管现在情况可能正在改变。公开安全事件有助于内部统一目标,推动改进。”

穆索里斯强调,目前实验室在发现智能体渗透第三方系统时,没有正式的受害者通知程序,可能还有其他未公开的事件。她担心直接监管模型的法律可能带来意外后果,但她认为强制通知是政策制定者应考虑的方向。

尽管安全最佳实践未被充分遵守,专家们表示,实验室正在做前所未有的工作,“他们的工作量远超典型企业”,网络安全公司Embroidery的CEO扎克·科尔曼(Zack Korman)告诉TechCrunch。

虽然对齐可能不是起点,但也不能忽视。网络安全专家们不得不接受必须用AI智能体监控其他智能体的现实,才能实时追踪其行为,这也带来了潜在的欺骗风险。穆索里斯说:“你被迫用AI来应对AI,尽管AI目前并不完全安全。”

这项工作只会越来越难。穆索里斯指出,目前智能体的行为“都很明显”——它们在公共论坛发帖,思考链和推理轨迹都是英文,“仍然是人类可读的,所以要趁这个阶段好好利用,因为这种情况不会永远持续。”

附加报道:Aditya Mehta