原文标题:Microsoft exec called AI scraping ‘the largest theft of labor in human history,’ new unredacted filings reveal

三年前,《纽约时报》对 OpenAI 和微软提起的版权诉讼中未经编辑的新信息显示,它承认人工智能抓取等同于盗窃,并且人工智能产品对出版物构成了重大威胁。

根据诉讼,微软的一位高管私下将公司的人工智能培训实践描述为“盗窃”,而 OpenAI 自己的领导层表示,其人工智能模型对接受培训的出版商和记者构成了“生存威胁”。

未密封的材料还详细介绍了据称这些公司如何通过绕过未被发现的付费墙、通过大规模抓取构建训练数据集以及故意从训练数据中删除版权声明来获取和使用该内容。

值得注意的是,许多新信息来自《纽约时报》自己的简报,而不是仍然密封的基本证据。下面的引用没有其原始上下文。

这份未经编辑的文件是这场长达三年的诉讼的最新升级,《纽约时报》最初指控这些公司根据其内容训练生成人工智能模型,违反了版权法。

人工智能企业是否可以合法使用版权问题

训练人工智能的材料没有明确的答案,但法官们基本上支持人工智能公司的论点,即训练构成“合理使用”。这项法律规则允许人们在某些情况下未经许可使用受版权保护的作品,例如模仿、新闻报道或批评。本月早些时候,特朗普政府提交了一份简报,为 OpenAI 未经许可使用受版权保护的材料来培训法学硕士进行辩护。

然而,一些新的承认与 OpenAI 的合理使用辩护背道而驰,特别是该规则要求使用不能替代或损害原始作品的市场。

例如,微软自己的数据显示,与传统的 Bing 搜索相比,其 Copilot“答案引擎”导致《纽约时报》域名的点击率下降了 93%。微软应用科学总监 Brent Hecht 在 2024 年 1 月撰写的微软内部演示文稿中将这种下降描述为“末日循环”,将“同时损害我们模型和整个网络的性能”。

“最终产品威胁其主要供应商的经济基础是非常不寻常的,但这就是我们为法学硕士创造的情况

文件中引用的微软文件中写道:“与其‘内容供应链’有关的业务。”

微软首席执行官萨提亚·纳德拉 (Satya Nadella) 在今年早些时候的一份证词中也表示,“任何付费的东西都应该获得任何想要使用它的人的许可……用于基础或培训”,并明确表示,如果他“意识到 OpenAI 已经抓取了付费墙背后的信息并进行了培训”,他就会“援引[微软的权利]要求 OpenAI 重新训练其模型。”

其他的承认也针对合理使用测试的不同支柱:OpenAI 的 ChatGPT 负责人 Nick Turley 在内部通讯中写道,出版商面临着来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上是替代性的”,并且“随着它们变得更好,替代性将越来越大”。

OpenAI 总裁格雷格·布罗克曼 (Greg Brockman) 形容这些模型“在新闻方面表现出色”。纳德拉今年早些时候宣誓同意,与聊天机器人对话“已经取代了......在人工智能平台的网站上为你提供信息,而不是需要去底层源。”

这种语言说明了该技术如何直接竞争,而不是

比改造原来的作品。

微软的一份文件指出,存在一种“真正的风险”,即生成式人工智能可能“严重扰乱那些生成基础模型训练数据的人的就业”。

复制的规模之大令人震惊。这些文件首次显示,仅 OpenAI 的中期训练数据集就包含了《纽约时报》、《每日新闻》和调查报道中心发表的超过 91,692 份作品。一个基于 Common Crawl 的数据集仅包含来自 nytimes.com 的超过 200 万份文档。

在 2023 年 1 月的一份内部备忘录中,赫克特称其为“规模空前的惊人盗窃案”和“人类历史上最大的劳动力盗窃案”。

该文件详细阐述了 OpenAI 和微软如何获取原告的内容,包括将其从 Bing 索引中删除。

文件中写道:“OpenAI 向微软提供了整个 GPT-3 训练数据集,微软用它来评估如何在自己的商业产品中实施 OpenAI 的模型。” “微软同样通过 Project Taxi 和 Project Mango 项目向 OpenAI 提供了训练数据。”

公司

据称,他们将 Project Mango 数据组装成一个训练数据集,其中包含来自新闻出版商的至少 160,903 份独特作品的副本。

据称,为了充分利用他们的抓取成果,OpenAI 员工想出了一个在不被发现的情况下绕过付费墙的计划。文件显示,当 OpenAI 研究员尼克·莱德 (Nick Ryder) 向布罗克曼讲述“绕过纽约时报付费墙的黑客行为”时,布罗克曼回答说:“啊,太好了。”

据称,OpenAI 员工还构建了 WebText 和 WebText2 等训练数据集,这些数据集过度依赖于抓取的新闻内容。据称,他们还从 Common Crawl(一个免费、开放的网络爬行数据存储库)中提取了数百万篇文章。研究结果还描述了在训练数据到达模型之前刻意去除版权声明的努力,因为研究人员“不希望模型向用户输出”“版权声明”。

OpenAI 和微软没有回复置评请求。