一份被解封的法庭文件,把微软和OpenAI内部最不愿公开的话摊在了阳光下。纽约时报诉OpenAI的版权案已经打了多年,这次解封的是未删节版本,里面大量引用了两家公司高管在内部文档和宣誓证词中的原话。
这些话之所以被申请保密,原因不难理解。它们合在一起,构成了一系列对大型语言模型训练方式、运作机制以及其对人类劳动所构成威胁的直白承认。
![]()
“前所未有的惊人盗窃”
一份被法庭引用的微软内部文档写道,全球数百万人很快会认为,大型模型“吸走”了他们所有的作品,是“一场规模前所未有的惊人盗窃”。文档还补充说,几乎没有人当初是打算让自己创作的内容被这样使用的,他们也没有因此获得任何补偿。
另一处表述更为直接。一位微软高管将这种行为称为“人类历史上最大规模的劳动盗窃”。
这些说法并非来自外部的批评者,而是来自正在开发这些产品的人。纽约时报的律师在申请简易判决的文件中,列出了微软和OpenAI高管在文档和证词中作出的这一系列承认。
“末日循环”正在吞噬网络
更值得关注的是微软内部对商业模式的自我诊断。一份内部文档提出了“末日循环”的说法,认为AI内容策略已经启动了一个循环,会同时损害自家模型的表现和整个网络的健康。
文档原文写道,一个终端产品威胁到其核心供应商的经济基础,这是极不寻常的,但这正是他们为LLM业务所创造的处境——问题出在“内容供应链”上。
这个循环的逻辑是:AI产品从人类内容创作者那里获取内容,然后抢走这些创作者和网站的点击量,进而摧毁他们的商业模式。而被摧毁的,恰恰是模型训练所依赖的源头。
微软CEO萨提亚·纳德拉等人曾在宣誓后作证,从纽约时报和其他新闻网站抓取内容后,这些新闻网站来自必应的点击量全面崩塌,跌幅超过90%。
“绕过付费墙的黑客手段”
法庭程序中获得的文件还显示,OpenAI曾开发“一个绕过纽约时报付费墙的黑客手段”。OpenAI联合创始人格雷格·布罗克曼对此的回应是“啊,不错”。
微软高管布伦特·赫克特写道,LLM窃取内容,“却没有将经济价值沿供应链向下分配的方式,这必然威胁到内容创作者的经济稳定”。
OpenAI政策主管杰克·克拉克则写道,公司正在“创造一些系统,用来替代那些定义社会‘文化’的人们的劳动”。
微软在一份政策文档中承认,生成式AI可能“严重扰乱那些生成训练数据的人们的就业……LLM是一种摧毁其供应链的产品”。OpenAI甚至将自己称为新闻出版商的“生存威胁”。
一名OpenAI软件工程师在作证时表示:“无论我们把链接展示得多显眼,用户都不会点。”
“他们自己承认了”
这份未删节文件由数字内容Next的CEO杰森·金特发现。该组织代表数字媒体公司,金特一直在密切跟踪并发布关于大型AI版权诉讼的内容。
对外,OpenAI和微软的律师一直在主张,他们的模型训练属于版权法下的合理使用,具有转换性,并且他们正在建造的东西与训练所使用的人类劳动存在本质区别。
但内部文档和证词呈现的是另一幅图景:这些高管清楚,他们建造的东西建立在被窃取的内容之上,他们做出的产品正在蚕食被窃取的源头,并摧毁人们所熟知的互联网。
对于一直关注生成式AI发展的人来说,这些内容并不令人意外。但整份文件合在一起,构成了一种“他们自己承认了”的局面。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.