纽约时报诉OpenAI、微软案解封文件:内部曾用“史上最大劳动盗窃”“末日循环”形容训练数据抓取
The Verge报道,纽约时报诉OpenAI与微软案新解封的 92 页法庭文件显示,两家公司内部文档曾警告AI内容策略会伤害模型与整个网络,并把抓取数据训练模型称为“人类历史上最大的劳动盗窃”。微软称相关言论仅代表一名员工的个人观点。
AI解读:这批文件最直接的价值,是让外界看到AI公司在公开辩护与内部判断之间的差距。对外,OpenAI和微软主张训练数据属于合理使用;内部文档里,微软应用科学总监Brent Hecht却把抓取数据称为“人类历史上最大的劳动盗窃”,并称微软的辩护是对“合理使用”概念的“彻底嘲弄”。
对内容创作者和出版商来说,文件里最关键的一条是微软内部承认,AI摘要正在直接吃掉导流流量——OpenAI自己的媒体与经济专家把Times等网站推荐流量下降归因于Google AI Overviews这类AI摘要,并推测搜索推荐量可能下降多达 60%。这比任何行业预测都具体:受影响的不是抽象的“网络生态”,而是靠搜索推荐活着的网站收入。
文件还暴露了产品层面的矛盾。OpenAI内部承认GPT-4“记住了大量数据,因此会极其擅长逐字复述”,这与它公开强调防止记忆化、减少侵权的主张不一致;一名OpenAI代表还称不知道有任何检测或移除训练数据中付费墙内容的努力。对普通读者,这意味着当前聊天机器人的答案可能直接来自受版权保护的原文,只是不再附上出处。
微软方面试图与Hecht的言论保持距离,称其不代表公司观点;另一份文件里,微软AI数据战略与运营总经理Jordan Usdan把Hecht描述为持有“分歧的、学术的、前瞻的”观点。但文件显示微软内部同时承认“几乎没有人打算让自己创作的内容被这样使用,也没有获得补偿”,这说明争议不是一名员工的个人立场,而是公司内部已知的风险。
另一个值得注意的点是Nadella的证词:他承认聊天机器人基本取代了搜索、用户不再需要直接去源头获取信息,并说“任何有付费墙的内容都应该被授权”。这与公司内部承认不知道是否检测付费墙内容形成对照。对出版商,这指向一个具体问题:授权谈判目前更多靠事后诉讼推动,而不是产品上线前的默认机制。
这起案件的结果不会只影响OpenAI和微软。如果法院采信这些内部文档中“产品破坏自身内容供应链”的判断,付费墙授权、推荐流量补偿和训练数据来源披露,可能从可选项变成产品设计的前置条件。对读者而言,短期变化有限,但搜索结果的来源链接会继续减少,AI摘要替代点击的趋势在文件公开前就已经发生。
纽约时报诉OpenAI与微软案新解封的 92 页法庭文件显示,两家公司内部曾用“末日循环”“人类历史上最大的劳动盗窃”“对‘合理使用’概念的彻底嘲弄”等表述,描述用抓取数据训练AI模型的做法。The Verge报道了文件中的这些内容。
微软发言人Alex Haurek对The Verge表示,这些评论“反映一名员工的个人观点,不是法律分析,也不代表公司的观点”。在另一份法庭文件中,微软AI数据战略与运营总经理Jordan Usdan把微软应用科学总监Brent Hecht的角色描述为对立性质,称Hecht“持有关于AI数据生态应如何运作的分歧的、学术的、前瞻的观点”,并且“不代表微软对AI可能影响内容创作者的理论观点”。
但文件本身包含来自Satya Nadella、Sam Altman及其他OpenAI员工的表述。Hecht把ChatGPT和Copilot采集数据称为“人类历史上最大的劳动盗窃”,并称微软的辩护是对“合理使用”概念的“彻底嘲弄”。
一份微软内部文档写道:“我们的AI内容策略开启了一个‘末日循环’,将同时损害我们模型的性能和整个网络:一款终端产品威胁其关键供应商的经济基础,这极不寻常,但这正是我们为LLM业务在‘内容供应链’方面创造的处境。”
Nadella承认聊天机器人已基本取代搜索、用户不再需要直接去源头获取信息。文件中还引述他说“任何有付费墙的内容都应该被授权”,但一名OpenAI代表承认,他“不知道”有任何检测或移除训练数据中付费墙内容的努力。
OpenAI内部承认GPT-4“记住了大量数据,因此会极其擅长复述”,尽管公司承认“防止记忆化”对“减少版权侵权”很重要。文件随后引用多个例子,称ChatGPT在回答查询时直接输出了来自Times、Mercury News、The Denver Post、LifeHacker和Eurogamer文章的长段原文。
内部文档如何描述流量与内容供应链
文件显示微软承认“几乎没有人打算让自己创作的内容被这样使用,也没有获得补偿”。微软还被引述承认“LLM是一种摧毁自身供应链的产品”,因为在很多情况下它替代了自己的训练数据。
OpenAI自己的媒体与经济专家把Times等网站的推荐流量下降直接归因于Google AI Overviews这类AI摘要,并推测搜索推荐量可能下降多达 60%。OpenAI政策主管Jack Clark称,公司正在“创造替代那些定义社会‘文化’的人们的劳动的系统”。内部文档把ChatGPT描述为“现代报摊”。
OpenAI的Nick Turley被引述说,一旦用户从聊天机器人得到答案,就“没有充分理由点击”来源链接。OpenAI联合创始人Greg Brockman则对通过商业AI可能赚到的“无数”美元更感兴趣。