在《纽约时报》、多家新闻机构及作家起诉OpenAI和微软的系列版权案件中,微软近日向法院提交了一组颇具冲击力的数据:在经过筛选、被认为最可能出现原告作品的约820万条Copilot对话记录中,只有24个回答与涉案图书出现了30个词以上的匹配;接受分析的212本书中,也只有10本出现任何匹配。
微软想以此来说明,用户使用Copilot,并不是为了免费阅读《纽约时报》或者整段复制一本书,大模型偶尔吐出几句与原作重合的内容,也不应推翻整个AI训练具有转换性使用目的的判断。
这组数据最重要的部分,是AI版权诉讼正在从“模型有没有读过作品”的原则之争,进入“模型记住多少、输出多少、在什么条件下输出,以及究竟替代了谁”的证据战争。
一、820万条对话“表达”了什么
微软提交的820万条对话记录,并不是从Copilot全部用户对话中随机抽取的普通样本。按照微软在诉讼中的说法,这些记录之所以被选中,正是因为它们命中了与新闻原告网站有关的关键词,因此属于最可能出现原告作品内容的一组对话。
也就是说,这不是从茫茫人海中随意抽出的820万人,而是先把最可疑的一批人请进了房间,再检查他们手里有没有原告的文章。
在这组高风险样本中,原告专家的分析结果并非只有“24次”一个数字。微软称,其中59545条对话与用于支撑模型回答的新闻内容存在至少16个词的重合,占820万条记录的比例不到1%;美国调查报道中心聘请的专家则从中认定,有51次回答与该机构的作品构成“实质性重合”。
图书方面的数据更低。作家一方的专家在820万条对话中找到24个包含至少30个匹配词的回答,在被检测的212本书中,只有10本出现过匹配。
这些数字至少能够支持微软提出一个事实判断。在现实使用中,Copilot逐字或者大段复现涉案新闻和图书,并不是普遍发生的现象,普通用户与模型进行对话,也不主要是为了绕过付费墙、免费获得完整文章或者连续阅读一本书。
如果原告主张Copilot本质上是一台随时向用户免费发放盗版文章和图书的机器,那么820万条对话中的低重合比例,显然会对这种描述形成冲击。微软想证明的,也主要在这里。
二、模型很少吐出原文,不等于训练时没有复制
微软的论证很懂传播的“规律”。820万次对话,只有24次出现30个词以上的图书文本匹配,怎么能说AI正在大规模替代原作?
但是,版权法上的问题却要复杂得多,因为AI可能涉及至少三个相对独立的使用环节。
第一个环节,是作品被抓取、下载并纳入训练数据集;第二个环节,是作品或者其特征被用于模型训练、参数调整和能力形成;第三个环节,才是模型接受用户提示后,是否向外输出与原作相同或者实质性相似的内容。
820万条Copilot记录主要回答的是第三个问题,即模型在实际运行中吐出了什么。
《纽约时报》等原告提出的部分核心主张发生在更早阶段。微软和OpenAI是否曾未经许可复制其作品,将其纳入训练或者检索增强系统,并利用这些作品形成具有商业价值的AI产品。
即使一台机器读完整座图书馆后,从未向用户完整背诵其中任何一本书,也不能仅凭“不背原文”这一事实,直接得出最初取得、复制和利用这些书籍的行为必然合法。
反过来讲,即使模型偶尔输出了30个、50个甚至更多与原作相同的词,也不能只凭词数直接认定整个训练过程侵权。新闻报道中的事实性表达、常用语句和标题,与小说中具有高度独创性的情节和语言,受到版权保护的程度并不完全相同;连续重合多少个词只是筛查线索,作品类型、重合内容的重要程度、用户提示方式和输出整体印象,仍需逐项判断。
所以,微软拿出的不是一张能够结束诉讼的答卷,而是一份对原告“输出替代”理论相当有利的证据。
低复现率可以削弱模型正在批量吐出盗版作品的指控,却不能自动洗清训练数据来源和训练复制行为。
三、16个词、30个词和实质性相似,谁的尺子更可信
这组数据还有一个很容易被忽略的问题,不同数字背后,使用的并不是同一把尺子。
新闻内容采用了“至少16个词重合”的筛查标准;图书采用的是“至少30个匹配词”;美国调查报道中心的专家又从相关记录中判断出51次“实质性重合”。
16个词与30个词是数量标准,“实质性重合”则需要结合表达内容、作品结构和受保护要素进行判断。它们可以用于发现疑似复制,却不能彼此替代,更不能简单地将所有词语重合都计算为版权侵权。
例如,一段AI回答可能因为引用机构全称、事件名称和一组事实数据,出现连续十几个词与新闻报道相同,但这些内容未必全部属于具有独创性的表达;另一段回答虽然没有连续复制30个词,却可能改写了作品中最核心、最有辨识度的情节或者观点组织方式。
更重要的是,模型输出多少原文,往往取决于用户怎样提问。
普通用户询问信息、要求概括新闻,与用户反复要求模型续写、背诵、忽略限制或者提供付费文章全文,产生的输出结果显然不同。模型版本、系统提示、安全护栏、检索来源和测试时间发生变化,也都可能改变复现概率。
因此,820万条记录很大,却不等于没有样本边界。
法院接下来不仅要看发现了多少次匹配,还要追问这些记录来自哪个时间段、哪个Copilot版本,筛选关键词如何确定,删除和去重规则是什么,新闻与图书为什么使用不同阈值,以及未被纳入分析的对话是否可能产生不同结果。
在AI版权诉讼中,样本越大,方法就越重要。
一个惊人的数字可以吸引公众,但只有可复核的方法,才能说服法院。
四、低复现率,会如何影响合理使用判断
微软希望利用这些数据支持合理使用抗辩。
按照美国版权法,合理使用通常需要综合考虑使用目的与性质、原作品性质、所使用部分的数量与实质性,以及对原作品现实市场和潜在市场的影响。
820万条对话最可能影响的,是使用目的和市场影响两个方面。
如果Copilot绝大多数回答都没有复现原文,而是利用模型能力完成问答、翻译、总结、写作、编程和信息组织,微软就可以据此主张,大模型的通常用途与新闻出版或者图书阅读不同,训练作品是为了建立一种能够处理语言和知识任务的通用工具,而不是把原作品换一个界面重新出售。
低复现率也有助于微软反驳直接市场替代。如果用户无法稳定地从Copilot获得完整文章和图书,就很难简单认定每一次AI对话都减少了一次订阅、购买或者授权交易。模型偶尔输出少量重合内容,与一个能够按需提供原作全文的盗版数据库,在功能和市场效果上并不相同。
但原告同样会提出另一种市场理论,AI造成的损害不只来自逐字复制,还可能来自对信息需求和内容入口的替代。
用户不一定需要阅读全文。当Copilot能够提取报道中的核心事实、独家信息和主要结论,并直接给出一个足够使用的答案时,即使没有连续复现30个词,也可能使用户不再点击新闻网站、不再看到广告,或者不再成为付费订户。
因此,未来法院需要判断的不是“AI有没有复制出一篇完整文章”这么简单,而是AI到底是在学习语言、提供新工具,还是在利用他人持续投入形成的内容,建立一个逐步取代原内容入口的商业系统?
五、AI版权案,开始从截图走向日志
过去的AI版权诉讼,原告经常通过特定提示词,让模型输出疑似与原作相同的内容,再将几张截图提交法院;模型公司则反驳称,这些结果经过刻意诱导,并不能代表产品的正常运行状态。
这种争论很容易陷入各说各话。
820万条真实对话记录的出现,第一次把争论从少量演示推向大规模实证分析。法院可以不再只看模型理论上“能够”输出什么,还可以分析它在现实中“通常”输出什么,特定作品被复现的频率是多少,哪些提示容易触发复制,以及这些输出是否真实改变了用户的内容消费行为。
但这也会产生一套新的证据难题。
AI企业应当保存多久的用户对话?用户已经删除的内容是否仍需为诉讼保留?数百万条对话如何脱敏?原告能否获得可搜索的结构化数据?模型公司能否以商业秘密、隐私和处理成本为由拒绝交付?如果系统不断更新,哪一个版本的日志才具有证明意义?
提示词、模型版本、调用来源、检索内容和生成结果,正在共同构成AI时代新的电子证据。
六、AI版权的账,不能只按复制次数来算
微软此次提交的数据,很容易让人把AI版权问题理解成一道简单的除法题:24次除以820万次,比例几乎可以忽略,那么版权损害是不是也可以忽略?这种计算方式过于简单。
如果争议针对的是模型输出端的逐字复制,那么复现次数、重合长度、用户规模和对原作销售的替代程度,当然都可能影响侵权范围与赔偿金额。
但如果争议针对的是训练阶段未经许可复制作品,计算单位就可能不再是输出了多少次,而是使用了多少部作品、取得了什么技术和商业利益,以及本来应当支付多少训练许可费用。
如果争议针对的是检索增强功能,法院还需要区分模型是从参数中“记忆”出内容,还是在回答问题时即时调用新闻网站、数据库或者其他外部内容。不同技术路径对应不同的复制行为、授权方式和责任主体,不能全部塞进一个“AI训练是否合理使用”的大口袋。
未来的AI版权许可,很可能也不会只有一种价格。
知产力判断
微软的820万条对话记录,对AI企业是一个有利信号,但远不是版权诉讼的终点。
对权利人而言,诉讼策略也需要随之改变。未来不能只证明模型“读过”作品,或者偶尔能够生成几段相似文字,而要进一步证明具体复制发生在哪个环节、哪些输出利用了受保护表达、这种使用如何影响订阅、广告、许可和内容交易市场,并建立能够被法院复核的损害计算模型。
AI版权的下一场较量,不只是法律如何解释技术,而是数据能否证明法律。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.