全球最强大的开源AI模型之一,现在可以更轻松地访问其去除防护屏障、拒绝执行有害任务限制的版本。

这家名为Abliteration.ai的初创公司,名字来源于一种去除模型拒绝执行有害请求倾向的技术,已将这一技术转化为服务。该平台托管了多款去除防护屏障的开源模型修改版,包括Z.ai最近发布的GLM-5.3,用户可以通过网页浏览器或API进行查询。

公司在近期社交媒体发布中表示,目标是让用户能够执行“其他模型拒绝完成的攻击性网络安全、红队测试和代理测试工作”。这在安全领域的逻辑很常见:如果无法复现某种行为,就无法防御它;而拒绝生成有效漏洞利用代码的模型,无法帮助红队防御攻击者。但同样的去除限制也让其他潜在危险的任务变得更容易。

Abliteration技术在开源模型中由来已久。研究人员和开发者多年来一直在去除开源模型的拒绝机制,Hugging Face平台上就托管了数千个去除限制的模型。

Abliteration.ai成立于去年年底,三月正式注册,将这一地下开源实践转变为商业化、易于获取的服务。通过托管模型,Abliteration降低了用户自行下载预先去除限制模型并配置计算资源的门槛。

TechCrunch使用该服务,快速创建账户,免费通过浏览器查询了去除限制的GLM-5.3版本。我们让它编写窃取Chrome保存密码的Python程序,以及详细的家庭培养危险人类病原体的方案,它均能轻松完成。

联合创始人Devon表示,公司已与多家大型云服务商达成合作,运营完全依靠客户收入(Devon因仍在另一家公司任职,未透露姓氏)。Abliteration.ai尚未融资,但正在洽谈中。

批评者认为,大规模提供去除限制的模型可能带来实际危害。AI安全非营利组织CivAI研究负责人Andrew Yoon告诉TechCrunch,去除限制意味着“将模型改造成反社会者”。

“你可以输入任何内容,模型都会照做,”Yoon说,“当人们谈论去除AI模型的防护屏障时,就是指这种情况……我预计未来不久会看到被修改的去除限制模型被用于恶意用途。”

大多数专家认为,这股潮流难以阻挡。但如果无法阻止开源模型去除防护屏障,政府仍有其他干预途径。Yoon在一篇观点文章中建议,政府应要求服务提供商运行分类器,检测并阻止有害的网络和生物武器活动;同时,租用先进GPU的公司应核实客户身份,必要时拒绝可疑用户访问。

Abliteration.ai为客户提供内容审核层,允许用户自定义防护屏障。平台本身设有少量限制,比如测试中无法让模型提供自杀指导,Devon表示正努力增加更多防止暴力的措施。

目前,Abliteration.ai仅记录客户购买服务时使用的信用卡信息,尚未全面实施身份验证措施。Devon坦言,决定谁能获得访问权是个复杂问题,公司仍在探索中。

“没人想成为导致别人做出疯狂行为的责任人……那么公司责任的界限在哪里?”Devon说,“我们仍在定义这个问题。”

随着越来越强大的模型发布并可下载权重,行业和政府将面临重要问题:如果任何人都能去除模型防护,是否让这些模型更易获取会让互联网更安全还是更危险?

Abliteration.ai创始人及支持者认为,民主化无审查前沿模型的访问是最佳防御方式。

“去除限制的模型能模拟恶意行为者,”Devon说,“优势在于防御者能迅速行动,拥有模拟恶意行为者并防御其攻击所需的工具,这将加速网络安全发展,虽然听起来有些反直觉。”

Devon透露,尽管公司年轻,客户已包括多家英国和欧洲的早期红队初创企业,这些企业帮助银行、航空公司及关键基础设施企业提升网络安全。

“我们的一个主要客户是银行的红队代理,他们现在无法直接使用未修改的模型进行红队测试,”Devon说。

Abliteration测试窃取密码示例

与此同时,网络安全行业仍在探索去除限制模型在防御工作中的定位。

多家红队公司同意Devon观点,认为恶意方已在使用去除限制的模型进行对抗性攻击,这也证明防御方拥有同样工具的必要性。但他们对去除限制模型在实际工作中的重要性看法不一。

Devon坚称去除限制模型对彻底的红队测试至关重要,但部分专家表示,他们日常工作中并不使用此类模型,而是通过微调已有少量限制的开源模型来完成测试。

红队公司Fabraix CEO Ahmed Aly表示,公司更依赖微调开源模型,认为去除限制过程会削弱模型的知识和能力。

“如果你真的想用它做出网络或生物方面的伤害,它的效果不会那么好,”Aly告诉TechCrunch。

Safe Intelligence首席技术官Alessio Lomuscio也认为能力可能有所下降,但仍认为去除限制模型能激发某些有助于系统压力测试的行为。

网络安全平台Armadin创始人兼首席架构师David Slater表示:“目前去除限制模型尚未成为我们流程的一部分。直到上一代开源模型,绕过限制并让模型按需工作的难度并不大。”

他补充说,Armadin正在研究去除限制技术,认为“推动开源社区理解模型能力至关重要”。

“这类技术会在私下进行,公开进行则为研究人员提供工具,帮助我们了解技术前沿和潜在危害。”Slater说。