纽约时报三年前对OpenAI和微软提起的版权诉讼中,最新解密的文件揭示了AI数据抓取行为被视为盗窃的内部承认,并指出AI产品对出版业构成重大威胁。
诉讼文件显示,一位微软高管私下将公司用于AI训练的数据抓取行为称为“盗窃”,而OpenAI领导层也承认其AI模型对依赖其作品训练的出版商和记者构成“生存威胁”。
解密材料详细说明了两家公司如何通过绕过付费墙、批量抓取内容建立训练数据集,并有意去除版权声明来使用这些内容。
值得注意的是,许多新信息来自纽约时报的诉讼陈述,而非仍被封存的证据材料,以下引用均缺少原始上下文。
此次解密是这场持续三年的诉讼的最新进展。纽约时报最初指控两家公司未经许可使用其内容训练生成式AI模型,涉嫌侵犯版权。
关于AI公司是否可以合法使用受版权保护的材料进行训练,目前尚无明确法律定论,但法官普遍倾向支持AI公司“合理使用”的辩护。合理使用允许在特定情况下无需许可使用版权作品,如讽刺、新闻报道或批评。美国政府近期也支持OpenAI在训练大型语言模型时使用未授权版权材料的立场。
然而,新披露的多项内部承认与OpenAI的合理使用辩护相悖,尤其是合理使用要求不得替代或损害原作品市场的原则。
例如,微软内部数据显示,其Copilot“答案引擎”导致纽约时报网站的点击率相比传统必应搜索下降高达93%。2024年1月,微软应用科学总监Brent Hecht在内部报告中将此现象称为“末日循环”,认为这将同时损害模型性能和整个网络生态。
微软文件指出:“我们的终端产品威胁到了其内容供应链的经济基础,这在商业上极为罕见,但正是我们为大型语言模型业务制造的局面。”
微软CEO萨提亚·纳德拉今年早些时候在证词中表示,“任何付费墙内容都应由使用者获得授权……如果我知道OpenAI抓取并训练了付费墙后的信息,我会要求OpenAI重新训练其模型。”
OpenAI ChatGPT负责人Nick Turley在内部通信中称,出版商面临来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上是替代性的,且随着技术进步替代性会越来越强”。
OpenAI总裁Greg Brockman称模型“在新闻领域表现出色”。纳德拉也承认,与聊天机器人对话“已经替代了直接访问网站获取信息的需求”。

这表明该技术可能直接与原始作品竞争,而非单纯转化其价值。
微软文件还指出,生成式AI存在“显著扰乱为基础模型提供数据的人员就业”的真实风险。
文件首次披露,OpenAI训练中期数据集包含超过91,692份纽约时报、每日新闻和调查报道中心的作品副本。仅Common Crawl数据集中就包含超过200万份纽约时报网站的文档。
2023年1月,Hecht在内部备忘录中称这是一场“前所未有的惊人盗窃”,是“人类历史上最大规模的劳动盗窃”。
诉讼文件还详细描述了OpenAI和微软如何通过必应索引抓取原告内容。
文件称:“OpenAI将整个GPT-3训练数据集交付给微软,微软用以评估如何在自家商业产品中实现OpenAI模型。微软也通过‘Project Taxi’和‘Project Mango’向OpenAI提供训练数据。”
据称,两家公司将Project Mango数据整合成包含至少160,903份新闻出版物独立作品的训练集。
为最大化抓取效果,OpenAI员工设计了绕过付费墙的“黑客”方案。文件显示,当研究员Nick Ryder告诉Brockman有“绕过纽约时报付费墙的黑客”时,Brockman回复“不错”。
OpenAI员工还构建了WebText和WebText2等训练数据集,过度依赖抓取的新闻内容,并从Common Crawl抓取了数百万篇文章。文件还揭示了有意在数据进入模型前去除版权声明,避免模型输出版权信息。
纽约每日新闻律师Steven Lieberman表示:“首次披露的证据显示,OpenAI和微软明知其行为不当。”
OpenAI和微软未回应置评请求。


