Anthropic公司宣布,为了遵守欧盟的AI法规,旗下AI模型Claude将开始嵌入隐形水印,以便机器能够识别生成的文本内容。然而,程序员Meyer及其他技术专家迅速破解了这一水印技术,并在GitHub上发布了去除水印的代码,该项目在社交平台X上被收藏超过2万次,吸引了100多名贡献者,许多开发者也将此技术整合进了自己的项目中。
Meyer表示,他和其他人是在Anthropic宣布采用水印技术后开始研究其工作原理的。部分人试图绕过水印,是因为他们反对所有AI生成内容都必须被标记的规定;而Meyer本人则更多是出于技术挑战的兴趣。自由撰稿人和社交媒体内容创作者也联系他,希望借助这段代码来帮助自己。
根据本月初生效的新规,像Anthropic和OpenAI这样的模型提供商必须对合成的音频、图像、视频或文本进行标记,以便机器能够检测其AI生成的身份,否则将面临最高3%年营业额的罚款。虽然规定禁止提供规避工具的营销,但对独立开发的工具并无法律限制。
Meyer强调,他支持透明度和内容归属,但认为水印技术本身存在重大缺陷和风险。他担忧误判风险,尤其是水印无法区分轻度或重度AI辅助写作。作为法语母语者,他经常使用Claude和Grammarly等AI工具润色文章,若将水印作为证据,可能导致雇主不公正地拒绝候选人,或研究人员被错误指控使用AI。
Anthropic的隐形水印通过在Claude选择词汇和短语时留下特定模式实现,这种模式人眼难以察觉,但机器可识别。部分用户担心这会影响Claude的回答质量,但Anthropic坚称不会。该技术名为SynthID,由谷歌开发,自2023年起用于水印其AI生成内容。计算机科学家Scott Aaronson曾在OpenAI提出类似方案,但因担忧水印影响用户体验未被采纳。

Meyer的去水印方法利用非水印的大型语言模型生成多版本重写,通过替换同义词和稍作调整内容结构来消除水印。但这依赖于其他不嵌入水印的模型,考虑到已有190个机构(包括OpenAI、微软、Meta)签署了欧盟透明度行为准则,未来这些模型是否会全面实施水印尚不确定。所有新模型必须从8月起包含水印,现有模型则需在12月前完成集成。
硅谷主权AI初创公司Haimaker的联合创始人兼首席技术官Wayne Pan表示,虽然尚未确认去水印工具的有效性,直到Anthropic发布检测水印的软件,但理解SynthID文本水印的基本原理让他们对该方法的可行性充满信心。他已将Meyer的开源工具整合进平台,因为他同样反对Claude对内容进行隐形水印,尤其是当内容仅被轻微编辑时。
其他开发者也制作了自己的去水印工具:软件工程师Erik Hughes用15分钟时间开发了一个工具,能去除隐形及相似字符,调整段落内句子顺序,并替换同义词。牛津大学访问学者Leon Chlon则表示,可以通过压缩Claude的回答,翻译成语义差异较大的方言(如阿拉伯语),再翻译回英文来去除水印。Anthropic也承认,经过大量编辑、改写或翻译的内容可能不会携带水印。
Anthropic发言人在接受WIRED采访时表示:“我们为遵守欧盟AI法案,正在为Claude输出添加标记,其他实验室也在采取类似措施。识别AI生成文本很困难,这为人们提供了更好的识别工具。支持的Claude模型输出,包括Claude Code,都会携带隐形水印,且不会改变回答的含义、质量或可读性。我们还计划推出文本检测API,方便用户自行检测。”
Anthropic正在研究文本水印检测的实现方案,计划尽快发布相关工具,届时开发者将能验证各种去水印方法的有效性。同时,公司也在持续改进水印系统。Pan认为:“他们想展示出善意,但我认为没有任何水印技术能做到万无一失。”


