New York Times 三年前针对 OpenAI 和 Microsoft 提起的版权诉讼中,最新公开的文件披露了这些公司收集内容用于人工智能训练的方法,以及对此对出版商影响的内部评估。文件的大部分内容基于 The Times 的诉状,而作为依据的附件仍处于保密状态。
根据诉状,Microsoft 应用科学总监 Brent Hecht 于 2023年1月将人工智能数据收集做法称为“前所未有规模的惊人劳动窃取”和“人类历史上最大的劳动窃取”。负责 ChatGPT 的 OpenAI 高管 Nick Turley 则写道,聊天机器人等产品对出版商构成“生存威胁”,这些产品在很大程度上具有替代性,并且随着发展将变得更加具有替代性。
Microsoft 的数据显示,与传统 Bing 搜索相比,Copilot 的“answer engine”功能将指向 The New York Times 域名的点击率最多降低了93%。Hecht 在 2024年1月的演示中将这种情况描述为一个可能同时损害模型性能和互联网的“doom loop”。Satya Nadella 在今年的证词中也表示,如果付费墙后的内容将被用于训练或 grounding,就应当获得授权。
文件指出,OpenAI 的中间训练数据集中包含超过 91,692 份由 NYT、Daily News 和 Center for Investigative Reporting 发布的作品副本。在一个来源于 Common Crawl 的数据集中,仅来自 nytimes.com 的文件就超过 2 million 份。据称,在 Project Mango 框架下创建的数据集包含至少 160,903 份新闻出版商独有作品的副本。
诉讼文件称,这些公司通过 Bing Index 收集内容,OpenAI 员工制定了在不被察觉的情况下绕过付费墙的计划,并将版权声明从训练数据中删除,以免其出现在模型输出中。OpenAI 和 Microsoft 未回应置评请求。
为何重要
文件显示,这起诉讼并不只限于受版权保护的材料是否被未经授权使用;人工智能产品对出版商读者流量和收入模式的影响,也处于争议的核心。公司内部尤其评估认为,与提供搜索结果相比,直接提供答案的系统可能减少将用户引导至新闻网站的必要性,这或许会强化出版商提出许可要求的经济依据。不过,文件中的许多说法都由 New York Times 在诉状中转述,而作为依据的附件处于保密状态,这目前限制了对数据范围及收集方法进行独立审查。公司不发表评论,也意味着在这一阶段,相关叙述很大程度上依赖诉讼一方提交的文件。
背景
Microsoft 并不是 FikirPilot 档案中的新名字:过去 90 天里,我们发布了 15 篇提及这一名称的报道;最新一篇的日期是 2026年9月19日。