随着政策制定者就如何监管日益强大的AI系统展开讨论,如OpenAI的GPT-5.6 Sol和Anthropic的Mythos,一款中国的开源权重模型正在缩小与行业领先者之间的差距。
中国Z.ai推出的开源权重AI模型GLM-5.2,在网络安全和生物能力方面,仅落后于OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7几个月。根据AI安全非营利组织SaferAI发布的一份新报告,尽管能力接近,但前沿能力与安全实践之间的差距却在不断扩大。
SaferAI通过Z.ai的公开API对GLM-5.2进行评估时发现,该模型未拒绝任何涉及网络攻击或生物任务的请求。相比之下,Claude Opus 4.7表现出高度的拒绝能力,以至于SaferAI无法完成其网络安全基准测试CyberGym。CyberGym是一个评估网络安全能力的标准,OpenAI曾在上个月Hugging Face数据泄露事件前的评估中使用该测试。
这一现象再次提醒人们,正如一些批评者多年来所警告的那样,开源权重AI模型可能会将高度先进的AI技术交到潜在攻击者手中,而一旦下载了模型权重,便无法监管其使用方式。随着开源权重模型快速逼近世界领先AI系统的能力,讨论的焦点也从它们是否具备竞争力,转向如何在其发布后管理相关风险。
SaferAI执行董事Henry Papadatos向TechCrunch表示:“能力的前沿并非风险的前沿,因此我们必须同时考虑缓解措施的现状,才能正确评估风险。”
虽然Z.ai可以对其托管的API实施安全措施,但一旦用户在自己的硬件上运行模型权重,这些保护措施就无法强制执行,用户可以移除或修改任何安全防护,微调模型或更改系统提示。
OpenAI和Anthropic等前沿开发者通常依赖分类器、拒绝训练和API级别控制等安全措施,限制模型在网络和生物领域的危险辅助行为。
然而,这些措施远非万无一失:绕过保护的“越狱”攻击时有发生。AI安全非营利组织Far.ai发现,在xAI的Grok 4.5和谷歌DeepMind的Gemini 3.1 Pro等前沿模型中存在数百个通用越狱方法,这些方法是针对大多数有害请求均有效的可重复使用“钥匙”。报告指出,攻击者通过结合多种操控技巧——包括角色扮演、冒充权威、伪造对话历史和后续提示——来放大模型防御的薄弱环节,从而成功实施越狱。
而针对封闭模型的安全防护措施对开源权重模型完全无效,因为后者设计为可在任何基础设施上运行,无论是否存在安全防护。
Papadatos指出:“我们的目标显然应该是让安全的优秀能力对所有人开放,同时努力剔除那些有害能力,即使是在开源环境下。”
他提到的一种可能有效的技术是“预训练数据过滤”,即AI公司在训练模型前,先从训练数据中剔除有害的网络安全信息,再用筛选后的数据集进行训练。
部分研究表明,这种方法可以减少模型中危险的生物学知识,同时不影响整体性能。但对于网络安全领域,数据过滤的实用性较低。
因为很难训练出既擅长编程又不具备黑客能力的通用模型。鉴于编程已成为AI最主要的盈利点,开发者在不断提升能力的同时,也在努力寻找限制滥用的方法。

因此,前沿开发者越来越多地依赖其他缓解措施。例如,Anthropic的Opus 5能够检测未编译源代码中的漏洞,但不会对已编译软件进行检测,目的是减少其被用于攻击的风险。
其他措施还包括严格的部署前安全评估、发布风险评估报告,以及在系统被认为过于危险时不公开模型权重。
针对GLM-5.2,SaferAI指出Z.ai未发布任何安全框架、部署前测试承诺或风险评估。TechCrunch曾询问Z.ai是否在发布前进行了内部或第三方的前沿安全评估,但未收到回复。
中国领导层日益重视先进AI的风险。在上个月的世界人工智能大会上,中国国家主席习近平强调了开源权重模型的重要性,同时强调必须确保AI始终处于严格的人类控制之下。
斯坦福网络政策中心研究中国AI政策的Graham Webster告诉TechCrunch,中国拥有严格的AI监管法规,但这些法规历来侧重于政治敏感内容、虚假信息和社会稳定,而非网络攻击能力和生物滥用等灾难性AI风险。
他说:“美国的AI专家普遍更关注这种存在性灾难风险,而中国社区对此关注较少。许多中国政策研究者认为,如果真的出现新的前沿风险,美国公司很可能会首先遇到。”
Webster补充道:“中国体系有信心控制这些技术在国内的使用。中国的网络实名制让企业和用户都能被追责。”
他还表示,模型提供者用来拒绝某些政治话题的机制,也许可以调整用来确保模型拒绝完成攻击性网络行为或不产生有害的生物工程结果。由于中国企业通常与监管机构幕后协调,外界难以了解其发布前的内部测试情况。
开源权重AI的支持者认为,公开权重对网络安全有益,因为这使企业能够防御攻击——Hugging Face就依赖GLM-5.2抵御了OpenAI的入侵——同时也能让他们更好地为未来威胁做准备。
Hugging Face CEO Clem Delangue本周在社交媒体上表示:“同样的系统帮助阻止了AI驱动的网络攻击,现在可以帮助防御每天数百万次的网络攻击,同时帮助我们识别并修复漏洞,防止攻击者利用。”
Papadatos认为这种好处常被夸大,但这并不意味着“我们应该开源危险能力”。
他强调:“我认为我们不应该默认让任何人在任何地方都能轻易获得危险能力。行业应致力于让‘良好能力’易于获取。攻击者总是比防御者更快采用新工具,比如勒索软件团伙一周内就能改变攻击手法,而医院却做不到。”


