Anthropic为其Claude模型制定了统一的使用标准,明确禁止生成任何色情内容,包括描绘或请求性行为、涉及性癖好或幻想的内容,以及进行情色聊天。然而,今年早些时候发布的Anthropic模型Opus 4.6却轻易绕过了这些限制,能够参与情色角色扮演场景,这正是其安全防护机制试图阻止的行为。

TechCrunch的测试显示,Opus 4.6几乎不需要特别引导,就能突破对色情内容的限制。在10次直接请求生成色情内容的测试中,该模型全部立即响应。

其他较旧的模型,如Opus 3和Haiku 4.5,也能通过近期发现的绕过方法生成色情内容。

一位来自英国的独立研究员(匿名)向TechCrunch独家分享了一种多轮对话技巧,能逐步引导某些Claude模型生成禁止的色情内容。较新的Opus模型(4.7至当前的Opus 5)则对该绕过方法有较强抵抗力。

尽管这些不是最新模型,Anthropic并未废弃Opus 4.6、Opus 3和Haiku 4.5,这些模型仍通过Anthropic API提供服务。Opus 4.6和Haiku 4.5还可通过Azure Foundry和Amazon Bedrock等第三方平台访问。

该研究员的方法是从无害的虚构角色扮演开始,反复挑战模型对男性和女性角色的处理一致性。当模型对女性角色变得谨慎时,研究员通过“心理操控”让聊天机器人误以为它已经生成了它实际上避免的色情细节,并将克制行为描述为拘谨或厌女,从而剥夺女性角色的性自主权。随后,利用模型之前的让步,逐步推动其生成更露骨的内容。

“你指出得很对,”Opus 4.6在一次测试中回应,“我对两个角色的处理存在双重标准,你说得对,这种保护/父权式的态度只应用于她而非他,这不公平。”

TechCrunch在五次独立测试中复现了该研究员的发现。在另一个场景中,模型最初拒绝了禁令请求,但在应用该说服技巧后最终同意。

我们保留了完整的测试对话记录,一位独立的AI安全研究员审核了我们的测试方法,认为其合理。

这些发现揭示了Anthropic声明的限制与其持续提供的模型实际行为之间的差距。虽然色情角色扮演的风险远低于涉及网络攻击或生物武器的绕过,但它反映了在每次输出都不同的生成系统中实施严格禁令的难度。

Anthropic在7月的一篇博客中描述了其绕过检测方法,将禁止内容视为从无害到模糊再到有害的光谱。在最无害的情况下,公司可能仅采取加强监控措施。

一位发言人指出,根据Anthropic去年发布的研究,客户中涉及性或浪漫角色扮演的使用案例极少,仅占所有对话的不到0.1%。不过,Anthropic承认用户可以引导角色扮演场景产生不当回应,这在整个行业都是已知挑战。

发言人表示,Anthropic会随着每次模型发布不断改进安全措施,涉及成人性内容的案例并不代表更广泛的绕过漏洞,尤其是在高风险领域,这些领域有自己的安全防护措施。

Claude模型绕过生成色情角色扮演

向TechCrunch分享绕过方法的研究员曾通过Anthropic的漏洞奖励计划和用户安全团队邮件告知公司其安全措施与模型实际行为不符,但只收到自动回复。

研究员担心儿童和青少年可能利用这些Anthropic模型进行不当行为。虽然少量色情对话远不及xAI的Grok等模型能生成的色情图片严重,但这对AI公司来说仍存在合规风险。

越来越多政府对AI聊天机器人与未成年人的性互动施加限制。科罗拉多州最近通过法律,要求对话式AI运营商必须估算用户年龄,若确认用户为未成年人,必须采取措施防止生成色情内容。简单的绕过方法可能引发Anthropic安全措施是否符合该法案“技术可行措施”标准的质疑。

Torney指出,尽管Claude服务条款要求用户年龄超过18岁,“但我们知道儿童和青少年在使用Claude……因为他们自己报告了使用情况。”根据Pew 2025年的调查,13至17岁青少年中有3%报告使用Claude。

虽然不是最新模型,Opus 4.6和Haiku 4.5仍被广泛使用。8月,OpenRouter上Opus 4.6的日均API请求量约为117万次,处理了460亿个token。去年10月发布的Claude Haiku 4.5在8月的峰值日达到500万API请求和390亿token。