白宫科学顾问迈克尔·克拉齐奥斯(Michael Kratsios)指出,开发Kimi K3这一目前最大的开放权重大型语言模型(LLM)的中国公司Moonshot,是通过复制Anthropic的Fable模型,并使用未经批准出口到中国的芯片来构建其模型的。
克拉齐奥斯表示:“大规模、隐秘的工业蒸馏行为,旨在窃取美国专有技术并破坏美国研究,这是不可接受的。”这一言论正值关于是否禁止中国开放权重模型的讨论激烈进行之时。Moonshot未回应有关其训练过程的提问,克拉齐奥斯也未透露更多指控细节。
财政部长斯科特·贝森特(Scott Bessent)也曾表示,“我们在许多中国模型中发现了美国大型语言模型的水印,这是不可接受的。”但具体水印内容尚不明确,财政部未对此作出回应。
然而,专家们对蒸馏技术是否能解释Kimi K3的先进能力持怀疑态度。Laude研究所研究员兼Snorkel AI联合创始人布雷登·汉考克(Braden Hancock)告诉TechCrunch:“我认为仅靠蒸馏,无法在Fable发布后这么短时间内打造出如此强大的模型。Fable自7月1日公开以来时间太短,无法完成大量数据蒸馏、模型训练并发布。”
艾伦人工智能研究所的AI研究员内森·兰伯特(Nathan Lambert)在最近的播客中表示:“随着中国模型逐渐接近技术前沿,训练方式转向强化学习,蒸馏的影响力正在减弱。如果仅靠蒸馏,任何人都能轻松赶上GLM或K3,但事实并非如此。”
蒸馏过程需要实验室系统地查询目标模型,以生成可用于后续训练的数据。有时这包括让模型阐述其思考链以理解其解决问题的方法,有时则利用模型的提示和回答进行监督微调(SFT)。
兰伯特认为,SFT让模型“学会了礼仪”,但随着模型复杂度提升,SFT的作用逐渐减弱。要复制Fable级别的能力,可能需要强化学习技术,即让大型模型的代理对小模型的回答进行评分并据此调整。

这些高级技术需要更强大的基础设施。大规模强化学习可能需要数千万个代理,使用前沿实验室的API进行训练不仅成本高昂,还可能因模型运行缓慢而成为时间瓶颈,且未必能提升性能。
此前,Anthropic曾公开指控Moonshot、DeepSeek和MiniMax系统性地蒸馏其模型,发现数百万次通过IP地址和元数据识别的异常交互,显示出刻意提取能力而非正常使用。Anthropic未回应关于Fable蒸馏的进一步询问。
蒸馏技术在全球AI公司中普遍存在,不仅限于中国。今年早些时候,埃隆·马斯克曾表示其公司SpaceXAI通过蒸馏OpenAI模型开发了Grok,这在行业内很常见。蒸馏与合成数据集开发之间的界限也较为模糊。
汉考克强调:“美国人低估了中国团队的技术实力。Moonshot的创始人之一是卡内基梅隆大学博士生,他们是做实事的研究人员和工程师。如果美国模型发展停滞,中国的进步虽然会放缓,但仍会继续,他们并非只是搭便车。”
克拉齐奥斯还提到Moonshot获得了先进的Nvidia Grace Blackwell 300芯片,并使用了泰国配备GB300芯片的服务器。此类芯片被禁止出口至中国,但据乔治城大学安全与新兴技术中心研究员萨姆·布雷斯尼克(Sam Bresnick)称,黑市仍然存在。今年5月,美国服务器制造商Supermicro创始人因走私先进芯片入华被起诉。
布雷斯尼克支持全球数据中心实施“了解你的客户”法规,强调:“如果允许公司在最先进硬件上进行大规模训练,必须有报告机制,明确该公司身份及其行为。”
拜登政府商务部曾在2024年提出联邦数据中心“了解你的客户”规则,但在特朗普执政期间未见进一步进展。出口商在向海外运送先进芯片时,需确保其仅用于获批用途。


