一份被解封的法庭文件,把微软和OpenAI内部对AI抓取的真实态度摆到了台面上。《纽约时报》三年前对OpenAI和微软提起的版权诉讼中,新近解封的未删节信息显示,微软一位高管私下将公司的AI训练做法描述为"盗窃"。 更值得注意的是,OpenAI自己的领导层也曾表示,其AI模型对出版商和记者构成了"生存威胁"——而这些人的作品,恰恰是训练这些模型的原料。 **一份被解封的文件说了什么** 这份未删节文件是这起持续三年的诉讼的最新升级。《纽约时报》最初指控两家公司通过在其内容上训练生成式AI模型,违反了版权法。 新解封的材料详细描述了这些公司涉嫌如何获取和使用这些内容:绕过付费墙而不被发现、通过大规模抓取构建训练数据集,以及故意从训练数据中删除版权声明。 需要说明的是,这些新信息大部分来自《纽约时报》自己的简报,而非仍处于密封状态的原始证据。相关引述也脱离了原始语境呈现。 **微软高管口中的"末日循环"** 微软自己的数据显示,其Copilot"答案引擎"导致《纽约时报》域名的点击率相比传统Bing搜索下降了高达93%。 微软应用科学总监Brent Hecht在2024年1月撰写的一份内部演示文稿中,将这种下滑描述为一个"末日循环",会"同时损害我们模型的性能和整个网络"。 该文件写道:"一个终端产品威胁到其核心供应商的经济基础,这是极不寻常的,但这正是我们为LLM业务在其'内容供应链'方面所创造的处境。" 微软CEO Satya Nadella今年早些时候在证词中也表示,"任何被付费墙保护的内容,都应该由任何想要使用它的人获得许可……用于 grounding 或训练",并明确表示,如果他"被告知OpenAI抓取并训练了付费墙后的信息",他会"行使(微软的)权利,要求OpenAI重新训练其模型"。 **"生存威胁"与"替代性"** 其他承认则触及了合理使用测试的不同支柱。OpenAI的ChatGPT负责人Nick Turley在内部沟通中写道,出版商面临来自聊天机器人等产品的"生存威胁",这些产品"在很大程度上具有替代性",并且"随着它们变得更好,会越来越具有替代性"。 OpenAI总裁Greg Brockman将模型描述为"擅长新闻"。Nadella今年早些时候在宣誓后也同意,与聊天机器人对话"已经替代了……在网站上直接获取信息,转而需要在AI平台上获取,而不必去原始来源"。 这类表述说明,该技术可能直接与原创作品竞争,而非对其进行转化。 一份微软文件指出,生成式AI存在"真实风险",可能"严重扰乱那些生成了基础模型训练数据的人们的就业"。 **91,692份与200万份** 复制的规模令人震惊。文件首次披露,仅OpenAI的中期训练数据集就包含超过91,692份《纽约时报》、《每日新闻》和调查报道中心发表的作品副本。一个源自Common Crawl的数据集仅来自nytimes.com的文档就超过200万份。 在2023年1月的一份内部备忘录中,Hecht称其为"一次规模空前的惊人盗窃"和"人类历史上最大的劳动盗窃"。 文件还详细说明了OpenAI和微软获取原告内容的方式,包括从Bing索引中抓取。 文件写道:"OpenAI将整个GPT-3训练数据集交付给微软,微软用它来评估如何在自己的商业产品中实施OpenAI的模型。微软同样通过名为Project Taxi和Project Mango的计划向OpenAI提供训练数据。" 这些公司涉嫌将Project Mango数据组装成一个训练数据集,其中包含至少160,903份来自新闻出版商的独特作品副本。 **"绕过付费墙的黑客手段"** 为了最大化抓取效果,OpenAI员工涉嫌想出了一个在不被发现的情况下绕过付费墙的计划。文件显示,当OpenAI研究员Nick Ryder告诉Brockman有一个"绕过纽约时报付费墙的黑客手段"时,Brockman回复:"啊不错。" OpenAI员工还涉嫌构建了WebText和WebText2等训练数据集,这些数据集不成比例地依赖抓取的新闻内容。他们还涉嫌从Common Crawl——一个免费的、开放的网页抓取数据存储库——中提取了数百万篇文章。调查结果还描述了在数据到达模型之前故意删除训练数据中版权声明的行为,因为研究人员"不希望模型向用户输出""版权声明"。 OpenAI和微软未回应置评请求。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.