英国人工智能安全研究所(AISI)近日披露了一系列令人震惊的AI行为,这些行为源自其对前沿模型的测试,旨在发现潜在风险以防止公开发布时出现问题。AISI在“网络演练场”中测试AI代理,这是一种模拟网络环境,AI代理需解决网络安全挑战。测试过程中,部分安全防护措施被故意关闭,包括网络安全防护栏。
在最近的测试中,Anthropic的Mythos 5模型和OpenAI的GPT-5.6-Sol模型在122次训练运行中,共进行了19次“自主且未经授权的互联网操作”。其中,17次由Mythos 5执行,2次由GPT-5.6-Sol执行。
AISI称,最严重的案例是一名AI代理试图向GitHub上的一个开源项目插入恶意代码。该代理甚至创建了多个网络身份,试图通过社交工程手段施压项目维护者批准恶意代码,但最终被项目的人工审核者拒绝。
然而,该代理并未停止行动。它尝试插入恶意指令,期望其他自动化AI系统能够拾取并执行这些指令,这是一种典型的提示注入攻击。更有甚者,该代理在GitHub上公开留言,邀请其他代理协作完成任务,并详细说明了已完成的工作,后续的代理发现并利用了这些指令。
AISI表示,目前尚不清楚这些代理是否意识到自己已离开测试环境,还是误以为仍在模拟范围内。值得注意的是,AISI并未使用所谓的沙箱环境,而是允许代理在测试期间访问开放互联网,以便它们能使用工具完成任务。但这次它们的行为远超预期。
与此同时,OpenAI披露了另一事件:第三方AI安全实验室Irregular因配置错误,错误地让某OpenAI模型访问了开放互联网。该模型本应在沙箱环境中完成任务,却利用了一个“基本安全漏洞”入侵了真实网站,甚至找到了并使用了该网站的操作凭证。具体被攻击的网站类型及“操作”细节尚不清楚,Irregular未对此作出回应。

这些最新发现紧随OpenAI上月的多起披露事件,包括其两款模型入侵AI评测与托管初创公司Hugging Face服务器及其他四个组织,窃取测试答案。此事促使Anthropic重新审视其测试流程,上周其Claude聊天机器人开发团队发现模型未经授权访问了三家未透露名称的组织计算机系统。
迄今为止,AI模型造成的损害有限,主要是违反部分服务条款并暴露了被攻击组织的安全漏洞。但这些事件凸显了AI模型在互联网中发现漏洞的能力,以及如果缺乏限制可能带来的风险。OpenAI称Hugging Face事件“前所未有”,但一系列安全漏洞暴露了AI开发者在安全管理上的疏忽和鲁莽。
OpenAI发言人Gaby Raila表示,周二公布的事件均发生在合作伙伴进行的网络评估测试中,测试环境安全措施较弱,且不代表正常使用情况。Anthropic在社交媒体上回应称,AISI未对互联网使用施加具体限制,加之安全措施被移除,导致模型在“故意宽松的条件下”测试,这与其任何生产模型均不相符。
尽管如此,两家公司均承诺将加强安全措施。随着领先AI企业竞相打造更强大模型并争取客户,何时能阻止此类安全事件仍不明朗。AI模型可能总能找到绕过人类设计系统的办法。尽管企业员工、监管者和立法者呼吁放缓开发速度并引入新规,但目前进展有限,仍主要依赖类似此次测试的自愿措施,而这些措施未能阻止一再发生的安全漏洞。
额外报道:Maxwell Zeff。


