研究结果提供了一些证据,虽然尚不能完全确定,但显示某些中国AI模型可能通过“蒸馏”技术,从美国模型中提取了推理信息。这种推理信息原本是隐藏的,因为两者的思维或推理模式极为相似。研究人员还证明,该方法能够从模型的内部推理中恢复个人信息,如密码和API密钥,尽管这一漏洞现已被修复。

“我们测试的所有主要前沿模型供应商都存在这一漏洞,”德国图宾根大学计算机科学家亚历山大·潘菲洛夫(Alexander Panfilov)表示,他参与了这项研究。“这可能导致个人信息泄露,并使大规模推理蒸馏攻击成为可能。”

潘菲洛夫及其来自图宾根大学、马克斯·普朗克研究所、AI安全机构MATS Research和安全公司Snyk的同事们发现,OpenAI、Anthropic和Google等通过API访问的前沿模型均存在类似问题。

在一篇论文中,研究人员展示了Moonshot AI的开源中国模型Kimi K3在某些提示下,生成的输出与Claude Opus 4.8和GPT 5.6 Sol的隐藏推理步骤极为相似。尽管如此,研究人员指出,这项工作“无法因果证明蒸馏的存在”。另外,他们发现中国的DeepSeek和美国Thinking Machines公司的Inkling这两个开源模型并未表现出与Claude Opus类似的推理相似性。

Moonshot AI和Z.ai在截稿时未回应置评请求。

蒸馏是一种成熟且广泛使用的技术,用于高效复制现有模型的能力到新模型,尤其常见于开源或可完全下载模型的开发中。

然而,蒸馏最近成为争议焦点,有报道称中国AI公司利用该技术实质上复制了美国最先进的模型。今年2月,OpenAI向美国立法者表示,DeepSeek似乎复制了其某个模型以构建名为R1的推理模型。6月,Anthropic向立法者称阿里巴巴系统性地蒸馏其模型以打造自有模型Qwen。

目前尚无证据表明中国AI公司使用了本文所述的具体技术来蒸馏美国模型。但潘菲洛夫及其团队表示,利用他们的方法,可能从封闭模型中提取比以往更多的信息。

小型模型揭秘

先进的AI模型通过将复杂问题拆解为多个部分,逐一分析,形成一种人工推理或“思维链”。公司通常对模型的推理过程保密,以防他人利用这些信息训练新模型。然而,他们通常会以加密形式将部分推理过程发送到用户设备,以分担计算负载。

研究人员的攻击方法基于这样一个事实:大多数AI公司还提供不同规模的相关模型。大型模型能力更强,但计算成本和访问费用也更高。用户可能会选择较小、性能较弱的模型以降低成本。

潘菲洛夫及其同事发现,将加密的推理轨迹输入同一模型的较小版本,可以揭示隐藏的推理内容。较小模型接受的对齐训练较少,因此不像大型模型那样倾向于拒绝透露内部思维。

瑞士苏黎世联邦理工学院计算机安全专家弗洛里安·特拉默(Florian Tramer)评价道:“用相同解密密钥但对齐较弱的模型替换消息的想法非常巧妙,这确实成为了一个问题。”

同样的方法还揭示了嵌入推理轨迹中的API密钥和密码等敏感信息。

潘菲洛夫和合作者上个月已将该漏洞通知OpenAI、Anthropic和Google。各公司已调整API以缓解问题。虽然目前无法通过该方法提取私人信息,但潘菲洛夫表示,仍可用相同方法发现部分推理轨迹。彻底解决蒸馏问题需要对这些公司的API架构进行根本性改造。

Anthropic发言人迈克尔·阿西曼表示:“我们重视对模型的独立研究,并已开始构建针对报告中描述的重放行为的短期缓解措施。”他补充称,研究未涉及恢复加密密钥、访问Anthropic基础设施或从其系统中恢复个人数据。

Google和OpenAI均拒绝置评。

地缘政治与蒸馏争议

随着美中公司在AI领域争夺领先地位,蒸馏技术已成为地缘政治焦点。中国鹰派认为,通过蒸馏美国技术,中国获得了战略优势,能够构建运行成本更低的开源模型。

但也有人认为,蒸馏是快速提升AI模型特定能力的常用方法。Meta CEO马克·扎克伯格本周在博客中表示,蒸馏“是开源生态系统运作的重要原则”,并警告限制该做法将使美国处于不利地位。

技术政策智库安全与新兴技术中心研究员凯尔·米勒认为,目前尚不清楚蒸馏对中国的实际帮助有多大。他指出,蒸馏仅在有限程度上增强现有模型能力,而中国公司似乎具备从零开始构建尖端模型的技术实力。“美国没人确切知道蒸馏对中国实验室的益处有多大,”米勒说,“如果禁止中国实验室进行蒸馏,我认为这不会显著改变竞争格局。”

为了测试开源模型是否可能从封闭模型蒸馏信息,研究人员向各模型提出90个问题。当他们向部分开源模型提供专有模型的部分推理轨迹开头时,这些开源模型有时会生成惊人相似的答案,尤其是Kimi K3表现突出。此前中国社交媒体上也有猜测,认为可能通过发现和利用隐藏推理轨迹进行蒸馏。

牛津大学计算机科学家亚林·加尔表示,蒸馏不仅广泛使用,还推动了AI的快速发展。“如果大家都阻止别人进行蒸馏,这将影响进步速度。”

尽管公司和政策制定者可能采取措施限制蒸馏,AI模型仍可能以意想不到的方式暴露其内部思维。