政策TechCrunch AI·原文 2026年9月18日

微软高管内部称AI抓取是“人类历史上最大的劳动力盗窃”,纽约时报诉讼新解封文件曝光

《纽约时报》诉OpenAI和微软的版权案中,新解封文件披露微软高管曾私下称AI训练为“盗窃”,OpenAI领导层承认模型对出版商构成“生存威胁”,微软数据显示Copilot导致纽约时报网站点击率下降高达93%。

AI解读:这起诉讼的核心是AI公司用版权内容训练模型是否合法。新解封的文件里最扎眼的是微软高管的私下措辞:应用科学总监Brent Hecht在2023年1月的内部备忘录里把抓取训练数据称为“人类历史上最大的劳动力盗窃”。这些说法出自《纽约时报》自己的摘要,而不是公开的证据附录,原文上下文被剥离,所以能看到的是双方最尖锐的对立表述。

对出版机构和记者来说,文件中提到的具体数字比“盗窃”这个词更有杀伤力。微软自己的数据显示,Copilot的“答案引擎”让纽约时报域名的点击率相比传统Bing搜索下降了93%。OpenAI的ChatGPT负责人Nick Turley在内部沟通中写道,聊天机器人这类产品对出版商构成“生存威胁”,因为它们“主要是替代性的”,而且“会随着能力提升变得越来越替代”。这说明AI公司内部清楚自己的产品在抢谁的饭碗。

微软CEO纳德拉在今年的证词中表示,任何付费墙后面的内容都应该由使用者获得许可才能用于训练或grounding,并明确说如果早知道OpenAI抓取并训练了付费墙后的信息,他会要求OpenAI重新训练模型。文件还首次披露,仅OpenAI的中训练数据集就包含超过91,692份来自纽约时报、Daily News和调查报道中心的作品副本。

OpenAI的公平使用抗辩面临一个具体障碍:公平使用要求使用不能替代或损害原作品市场。而微软文件自己承认存在“真实风险”,生成式AI可能“显著扰乱那些生成了基础模型训练数据的人的就业”。这些内部言论和数字如果被法院采信,会直接削弱“训练属于转化性使用”的论证。

目前这些信息的来源是《纽约时报》的诉讼摘要,底层证据仍然封存,双方公司都没有回应置评请求。AI训练是否合法在美国仍没有明确答案,但法官此前大多倾向于支持AI公司的公平使用论证。这份文件至少让公众看到,被告公司内部对这件事的道德和法律风险早有认知。

《纽约时报》起诉OpenAI和微软的版权案中,新解封的未删节文件显示,微软一位高管在内部将AI抓取训练数据描述为“人类历史上最大的劳动力盗窃”,OpenAI领导层也承认其模型对出版商和记者构成“生存威胁”。这些信息来自《纽约时报》提交的诉讼摘要,相关证据附录仍处于封存状态,引文脱离了原始上下文。

微软内部备忘录把抓取比作“前所未有的盗窃”

根据新解封的文件,微软应用科学总监Brent Hecht在2023年1月的内部备忘录中,将AI训练数据的抓取称为“一次令人震惊的、史无前例的盗窃”和“人类历史上最大的劳动力盗窃”。该文件还描述了微软内部对内容供应链的担忧:一份2024年1月的内部演示文稿将纽约时报域名点击率的下降称为“末日循环”,认为这会“同时损害我们模型的表现和整个网络”。

  • 微软自己的数据显示,其Copilot“答案引擎”导致纽约时报域名的点击率相比传统Bing搜索下降高达93%。
  • 微软内部文件写道:“一个终端产品威胁到其核心供应商的经济基础,这极不寻常,但这正是我们为LLM业务与其‘内容供应链’关系所创造的局面。”

OpenAI内部承认产品对出版商“主要是替代性的”

文件披露了OpenAI领导层的内部沟通。ChatGPT负责人Nick Turley写道,出版商面临来自聊天机器人等产品的“生存威胁”,这些产品“主要是替代性的”,并且“随着它们变得更好,会越来越具有替代性”。OpenAI总裁Greg Brockman则称这些模型“非常擅长新闻”。

  • 微软CEO萨提亚·纳德拉在今年早些时候的证词中同意,与聊天机器人对话“已经替代了……在网站上直接获取信息,你可以在AI平台上得到信息,而不需要去原始来源”。
  • 纳德拉还作证说,“任何付费墙后面的内容都应该由想要使用它的人获得许可……用于grounding或训练”,并明确表示如果早知道OpenAI抓取并训练了付费墙后的信息,他会“行使微软要求OpenAI重新训练模型的权利”。

文件披露训练数据规模和抓取方式

文件首次披露,仅OpenAI的中训练数据集就包含超过91,692份来自纽约时报、Daily News和调查报道中心的已出版作品副本。一个源自Common Crawl的数据集包含了超过200万份来自nytimes.com的文档。

  • OpenAI将整个GPT-3训练数据集交付给微软,微软用它评估如何在自家商业产品中部署OpenAI模型;微软则通过名为Project Taxi和Project Mango的项目向OpenAI提供训练数据,其中Project Mango数据集合成了至少160,903份来自新闻出版商的独特作品副本。
  • OpenAI员工被指制定计划绕过付费墙而不被发现。研究员Nick Ryder向Greg Brockman提到一个“绕过纽约时报付费墙的捷径”,Brockman回复:“啊不错。”
  • OpenAI员工还构建了WebText和WebText2等训练数据集,被指不成比例地依赖抓取的新闻内容,并从Common Crawl这一免费开放的网页抓取数据仓库中提取了数百万篇文章。
  • 文件描述了在训练数据到达模型之前故意剥离版权声明的行为,因为研究人员“不希望模型向用户输出‘版权声明’”。

这些内部认知与公平使用抗辩的冲突

这些新披露的言论和数字可能对OpenAI的公平使用抗辩构成挑战,尤其是公平使用要求使用不能替代或损害原作品市场。文件显示微软内部承认存在“真实风险”,生成式AI可能“显著扰乱那些生成了基础模型训练数据的人的就业”。

  • 关于AI公司能否合法使用版权材料训练AI,目前没有明确答案,但法官此前大多倾向于支持AI公司关于训练构成“公平使用”的论证。公平使用允许在特定情况下未经许可使用版权作品,例如戏仿、新闻报道或批评。
  • 本月早些时候,特朗普政府提交了一份简报,为OpenAI未经许可使用版权材料训练大语言模型辩护。
  • OpenAI和微软均未回应置评请求。

信息来源

TechCrunch AI原始来源