2023年12月,美国发行量排名第三的《纽约时报》以著作权侵权为由,将OpenAI和微软告上法庭,理由是两家公司在训练生成式AI模型时使用了该报的内容。这场官司打了约三年,一批新公开的诉讼资料让外界第一次看到:被告方的高管在私下场合,是如何描述自己正在做的事情的。
据科技媒体TechCrunch报道,新公开的未删节文件显示,微软一位高管在内部把AI训练所用的数据抓取行为称为"窃盗",并用了一个更重的说法——"人类史上最大规模的劳动窃盗"。同一批资料里,OpenAI的管理层也把自家AI模型形容为,对生产这些内容的出版社和记者构成"存亡级别的威胁"。
![]()
内部文件里的另一套说法
![]()
这些表述之所以引人注意,是因为它们和两家公司在法庭上的抗辩方向并不一致。公开资料显示,OpenAI和微软被指以不被检测的方式绕过付费墙,通过大规模抓取构建训练数据集,并从训练数据集中有意删除著作权标注。
微软内部数据还记录了一个具体后果:该公司的答案引擎Copilot,相比传统搜索引擎Bing,对《纽约时报》域名的点击率最多下降了93%。微软应用科学总监布伦特·赫克特在2024年1月制作的一份内部演示中,把这种点击率下滑称为"毁灭的循环",并解释这会"同时损害我们模型的性能和整个网络"。
微软在文件中写道:"最终产品威胁到对其而言不可或缺的供应方的经济基础,这是极其罕见的。但在LLM的'内容供应链'上,我们恰恰制造出了这样的状况。"
高管证词与内部留言
微软CEO萨提亚·纳德拉在2026年初的一次证词采集(deposition)中表示,付费墙内的内容应当向试图将其用于grounding或训练的一方收取授权费。他还说,如果事先知道OpenAI绕过付费墙抓取数据并用于AI训练,"我本会行使要求OpenAI重新训练模型的权利"。
OpenAI方面,负责ChatGPT的尼克·特利在内部沟通中写道,出版社正从聊天机器人这类产品身上承受"存亡级别的威胁"。他把聊天机器人描述为"大部分是对既有内容的替代",并称"随着性能提升,替代性会越来越强"。
TechCrunch对此的解读是:这些发言说明,这项技术可能不是在"转化"原作,而是直接和原作竞争。
微软制作的另一份文件则指出,生成式AI存在一个现实风险——它会"大幅破坏那些生产出基础模型训练数据的人们的就业"。
![]()
被点到的数据规模与操作细节
新公开的资料还披露了一些具体数字和操作记录:
- OpenAI用于AI训练的数据集中,仅《纽约时报》《每日新闻》和调查报道中心创作的作品,就包含9万1692件以上的数据。
- 2023年1月微软的一份内部备忘录中,赫克特把为AI训练进行的数据抓取描述为"前所未有规模的惊人窃盗",以及"人类史上最大的劳动窃盗"。
- OpenAI曾把GPT-3训练所用的完整数据集提供给微软,微软用这套数据集评估如何把OpenAI的AI模型装进自家产品。
- 微软通过名为"Project Taxi"和"Project Mango"的项目,向OpenAI提供AI训练用数据。
- 公开数据中,OpenAI研究员尼克·莱德向公司总裁格雷格·布罗克曼传达了"绕过《纽约时报》付费墙的窍门",布罗克曼回复"不错"。
- OpenAI还使用了WebText、WebText2等训练数据集,以及Common Crawl保存的数百万篇报道数据。
《纽约每日新闻》的代理律师史蒂芬·利伯曼表示:"这次首次公开的证据表明,OpenAI和微软清楚自己的行为是错的。"
法庭上的风向并不一致
需要注意的是,这批信息大多来自《纽约时报》一方提交的准备书状,并非所有作为依据的证据材料本身都已公开,其中不少内容也脱离了前后语境——TechCrunch对此专门作了标注。
而从诉讼本身的走向看,法官至今对AI企业一方"AI训练属于合理使用(fair use)"的主张,总体给出了较为友好的判断。2026年9月初,特朗普政府提交了一份意见书,支持OpenAI在未经许可的情况下将作品用于大语言模型(LLM)训练。这与本次公开的多条内部发言,形成了方向上的对立。
约三年的诉讼打下来,AI企业能否合法地把受著作权保护的内容用于AI训练,至今仍没有明确答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.