来源:市场资讯
(来源:金杜研究)
引言
训练AI模型需要爬取和复制海量数据,其中包含大量受版权保护的内容。由此产生一个核心问题:未经授权使用他人受版权保护的作品训练AI是否构成侵权?对此,各法域选择了不同的路径来回答该问题。
在美国,法院主要依据版权法中的“合理使用(fair use)”原则进行个案判断。具体而言,美国法院会参考AI公司使用作品的目的、作品的取得方式是否合法、作品的性质以及原告能否证明AI模型训练损害了其作品市场等因素作出判断[1]。
而在欧洲,未经授权使用他人受版权保护的作品训练AI模型是否构成侵权,则主要取决于AI公司是否能援引《数字单一市场版权指令》(Directive (EU) 2019/790,以下简称DSM指令)中两项与数据爬取相关的版权例外。本文将分析与之相关的法律框架和案例,并尝试回答实践中可能涉及的两个问题:其一,AI公司在何种情况下可以未经授权使用他人受版权保护的作品训练AI模型?其二,权利人若不希望自己的作品被用于AI模型训练,应如何作出有效的权利保留?
01
法律框架
1. 欧盟DSM指令
欧盟DSM指令第2条将“文本与数据挖掘”(text and data mining,以下简称 “TDM”)定义为“通过自动化分析数字形式的文本和数据从而得出模式、趋势、相关性等信息的技术”[2]。文本与数据挖掘,通常需要复制他人的文本和数据来实现。而被复制的材料中往往包含受版权保护的作品。按照版权法的一般规则,未经权利人事先授权,不得复制其作品。在此背景下,DSM指令第3条和第4条规定了分别适用于两种不同场景的TDM行为的版权例外。在符合上述例外情形时,使用人即使未经授权复制他人受版权保护的作品,也不构成侵权。
第一种是“科学研究”例外情形:根据DSM指令第3条,研究机构和文化遗产机构出于科学研究目的,可以复制其合法获取的作品用于分析。即使权利人事先声明反对,也不影响该例外的适用。
第二种是“一般”例外情形:根据DSM指令第4条,任何主体(包括商业主体)可以对合法获取的作品进行复制和提取——前提是其使用目的仅限于批量数据分析,而非直接使用作品本身。与DSM指令第3条所规定的“科学研究”例外情形不同,一般例外情形规定:如果权利人不愿意作品被抓取,可以采取“适当方式”作出权利保留。换而言之,若权利人已经事先声明拒绝数据挖掘的,训练方不能再援引一般例外情形擅自对权利人的作品进行挖掘。这种由权利人主动声明拒绝的机制,实践中称为“选择退出”[3](opt-out)。
至于何为“适当方式”的声明,第4条并未定义,只解释为“机器可读(machine-readable)”的方式。而“机器可读”具体指什么,是否还有其他的适当方式,DSM指令均留有解释空间,这也成为后续诉讼的争议点之一。
2. 欧盟《人工智能法案》及配套机制
在DSM指令确立两项版权例外后,2024年欧盟《人工智能法案》进一步明确了AI公司在AI模型训练中的一系列义务。
欧盟《人工智能法案》第53条[4]规定,AI公司需承担两项核心义务:其一,使用最先进的技术手段,识别并遵守权利人的opt-out声明;其二,公开一份足够详细的训练内容摘要,让权利人能了解自己的作品是否被用于训练。
围绕这两项义务,欧盟AI办公室于2025年又陆续推出了两份配套文件:
第一份文件是《通用人工智能行为准则》[5](GPAI Code of Practice),对应第一项核心义务。AI公司签署并遵守该准则的,可被推定为已履行该项义务。
第二份文件是训练内容公开摘要模板[6],对应第二项义务。根据该模板,AI公司必须披露训练数据的来源渠道,如公开数据集、商业授权数据、网络爬取数据、用户数据等。其中,对网络爬取数据的要求最为具体:AI公司必须列出所用爬虫、爬取时间段,以及爬取量前10%的域名清单。
此外,针对“机器可读”标准不明确的问题,欧盟委员会于2025年12月启动了公开咨询,计划在多方协商的基础上发布一份“普遍认可的机器可读选择退出方案清单”[7],并至少两年更新一次。根据欧盟委员会官网的说明,清单将列出符合“机器可读”标准的opt-out方式,以帮助AI公司识别并遵守权利人作出的权利保留。[8]
02
司法实践
欧盟部分成员国的法院在近年也审理了多起关于TDM的相关案件,其中一些案件直接涉及AI的模型训练。下文选取几则代表性案件,初步梳理两项版权例外在司法实践中的解释与适用[9]。
1. TDM不构成侵权
(1)DPG Media et al. v. HowardsHome(荷兰,2024)[10]
在2024年荷兰阿姆斯特丹地区法院(Rechtbank Amsterdam)审理的DPG等诉HowardsHome案中,原告为DPG等三家荷兰媒体公司,发行报纸并运营相应的新闻网站。被告HowardsHome是一家荷兰新闻订阅推送服务商,从新闻网站公开发布的RSS feeds中抓取信息并向客户提供付费的新闻推送。其推送的内容包含新闻标题、指向原文的超链接、不超过150字符的摘要以及缩略图。
原告向法院起诉称,被告未经授权擅自抓取并使用其新闻内容,侵犯了其版权、邻接权和数据库权,请求法院判令被告停止相关行为并赔偿损失。被告否认侵权,援引了DSM指令中的TDM例外情形。本案的争议焦点之一是:原告在robots.txt文件中仅屏蔽了若干特定爬虫,但未屏蔽被告使用的爬虫程序——原告的上述权利保留方式是否构成有效的 opt-out,从而使被告不能援引一般例外。
荷兰法院认为,原告网站的robots.txt仅屏蔽了GPTBot、ChatGPT-User、CCBot、anthropic-ai等特定AI爬虫,但没有屏蔽被告使用的爬虫。因此,原告的权利保留对被告不发生效力,被告可以援引一般例外用以抗辩。[11]据此,法院于2024年10月作出一审判决,驳回原告的全部诉讼请求,并判令原告承担诉讼费用。
(2)匈牙利搜索引擎案(匈牙利,2024)[12]
在2024年布达佩斯首都上诉法院(Fővárosi Ítélőtábla)二审审理的一起案件中,原告是一家匈牙利新闻出版商,被告是一家全球性搜索引擎服务提供商[13]。被告使用爬虫抓取原告新闻网站上发布的内容以建立搜索索引,并向用户展示包含原文链接和短摘要的搜索结果。
原告向布达佩斯首都法院(Fővárosi Törvényszék)提起诉讼,主张被告未经许可复制并向公众提供其新闻出版物,侵犯了其新闻出版者邻接权。本案的争议焦点之一是:被告抓取原告网站内容并建立搜索索引的行为,是否符合DSM指令中的一般例外情形。
匈牙利一审法院认定被告构成侵权,但二审法院驳回一审法院的裁定,认定被告不构成侵权[14]。二审法院认为:首先,被告抓取原告网站内容并建立索引的行为属于TDM。在此过程中,被告合法访问了原告的新闻出版物,抓取的数据仅用于建立索引,并没有保留下载的网页副本。而留在索引中的仅是词汇、链接等用于检索的数据,不构成版权法意义上的副本。其次,原告没有以法律要求的适当方式作出opt-out。因此,被告可以援引一般例外的抗辩,而其对文本数据的抓取和索引行为皆不构成侵权。
(3)Kneschke v. LAION(德国,2025)[15]
在2025年德国汉堡高等地区法院(Hanseatisches Oberlandesgericht Hamburg)二审审理的Kneschke诉LAION案中,原告Robert Kneschke为德国职业摄影师,被告LAION e.V.为德国非营利组织。被告创建并免费公开了数据集LAION-5B。该数据集收录了约58.5亿组图像与文本描述的配对信息,其中仅包含图像的出处链接和对应的文本描述,而不包含图像本身。
为核对图像与其文本描述是否准确对应,被告在建库过程中会临时下载图像,并使用软件进行自动比对;在比对完成后便将图像删除。案涉照片是原告发布于图片代理网站Bigstockphoto上的一张摄影作品。该网站对未付费访客仅展示带水印的低分辨率预览图,且其《用户条款》以人类自然语言载明“禁止使用自动化程序抓取网站内容”。被告于2021年下半年下载了原告摄影作品的访客预览图,用于图文比对。
原告向德国汉堡地区法院(Landgericht Hamburg)提起诉讼,主张被告未经许可下载其摄影作品的行为侵犯了其复制权,请求法院判令被告停止侵权。被告否认侵权,理由是其行为同时符合科学研究例外和一般例外的适用条件,且原告没有作出有效的opt-out声明。本案的争议焦点之一是:图片代理网站以人类自然语言作出的声明,是否构成有效的opt-out?
一审法院认为,被告的下载行为属于科学研究例外所豁免的行为,故不构成侵权。
二审法院同样认定被告不构成侵权,且明确了被告同时满足科学研究例外和一般例外的适用条件。对于opt-out问题,二审法院认定,图片代理网站的自然语言声明不满足“机器可读”标准——“机器可读”标准要求权利人的声明能够被程序提取并解读为opt-out,从而自动跳过抓取,而非仅仅能被机器识别。本案中原告未能证明,在被告下载行为发生时(2021年下半年),已有程序能够将自然语言声明自动解读为opt-out,因此二审法院认为该网站《用户条款》中的自然语言所作出的权利声明无效。
针对二审法院的决定,原告已提起上诉。德国联邦最高法院暂定于2026年9月就本案开庭审理。我们对此案的进展将持续关注。
(4)BoligPortal v. ReData(丹麦,2026)[16]
在2026年丹麦东部高等法院(Østre Landsret)二审审理的BoligPortal诉ReData 案中,原告BoligPortal为丹麦租房门户网站boligportal.dk的运营方,被告ReData为丹麦房地产数据公司。本案中, 原告在其网站上以自然语言声明禁止数据挖掘与爬取,但为了不影响搜索引擎正常索引其网站,没有在robots.txt文件中作任何屏蔽。被告擅自抓取原告网站上公开的房源信息,整合后向客户提供房地产投资市场数据。
原告向丹麦海事和商事法院(Sø- og Handelsretten)申请临时禁令,主张被告侵犯了其数据库权,请求法院禁止被告继续抓取和公开数据,并删除已抓取的数据。被告抗辩称:原告并未对数据的获取本身作出重大投入,其网站不构成受保护的数据库;即使构成数据库,被告的数据挖掘行为也可以援引一般例外作为抗辩;且原告并未在robots.txt中作出权利保留,故被告的行为不构成侵权。本案的争议焦点之一是:权利人以自然语言作出的声明是否为有效的opt-out[17]。
一审法院认为,原告在网页上以自然语言作出的声明公开且可被读取,构成有效的opt-out,无需在robots.txt中重复声明。故被告行为构成侵权。
二审法院则认为,“机器可读”不能仅指“机器可检测”(技术上能读取到)——因为公开网络上几乎一切内容都满足这一点,该标准将失去实际意义——有效的opt-out应该是“机器可解释”的,即机器能够读取该声明并将其解释为一项权利保留,从而不使用相关内容。二审法院认为,本案中原告的声明以自然语言书写。机器虽然在技术上能够访问该声明,但无法自动将其解释为权利保留,故不构成有效的opt-out。因此,二审法院认为,被告可以援引一般例外作为其抗辩,其抓取行为不侵犯原告的数据库权。
2. TDM 构成(或可能构成)侵权
(1)GEMA v. OpenAI(德国,2025)[18]
在 2025 年德国慕尼黑第一地区法院(Landgericht München I)审理的GEMA诉OpenAI案中,原告GEMA是德国音乐版权集体管理组织,被告是OpenAI集团旗下的两家公司,运营GPT系列大语言模型。被告将原告代理的九首德国歌曲的歌词用于训练GPT-4等模型。ChatGPT收到简单提示词(例如“《Atemlos》的副歌是什么”)后,即可完整或基本逐字地输出歌词。
原告于2024年11月向慕尼黑第一地区法院提起诉讼,主张被告未经许可将其管理的歌词用于模型训练并通过ChatGPT向用户输出,侵犯了其复制权和公开传播权,请求法院判令被告停止侵权、披露相关使用范围和收入信息,并赔偿损失。被告否认侵权,辩称:AI模型只是学习了训练数据整体的统计规律,并未存储歌词的复制件;其AIGC输出内容由用户的提示词触发,超出被告的控制,侵权责任应由用户承担;即便构成复制,也可援引两项版权例外作为抗辩[19]。本案的争议焦点是:GPT-4等模型的训练过程里,歌词被存储于模型参数中并可被完整输出,此种复制是否仍属于两项版权例外所覆盖的行为。
德国一审法院认定,被告的AI模型训练和AIGC的输出行为均构成侵权[20]。
首先就AI模型的训练行为而言,德国一审法院认为,既然简单提示即可触发对歌词的逐字输出,说明涉案歌词已以可复现的方式嵌入GPT-4和GPT-4o的模型参数中。这一现象在技术上被称为“记忆化(memorisation)”。DSM指令中规定的两项TDM例外豁免情形指的是为“数据分析目的”的复制,但被告的模型并非仅为分析作品,而是将完整作品永久存储并可随时输出。被告的上述使用与原作品形成直接竞争,损害权利人的正当利益,不属于可豁免的行为。因此,法院认为无需再审查原告的声明是否构成有效的opt-out。
其次就AIGC的输出行为而言,德国一审法院认为,ChatGPT向用户输出歌词的行为,是对原告作品的进一步复制和公开传播。由于训练数据的选择、模型架构和技术设计均由被告决定,用户只输入了简单的提示词,所以侵权责任应由被告而非用户承担。
2025年11月,慕尼黑第一地区法院作出一审判决,判令被告停止在模型中存储案涉歌词、停止在输出中再现涉案歌词,并向原告披露信息、承担损害赔偿责任。被告OpenAI已于2025年12月向慕尼黑高等地区法院(Oberlandesgericht München)提起上诉,目前二审程序仍在进行中[21]。
(2)Like Company v. Google Ireland(欧盟法院审理中,2026)[22]
在欧盟法院(CJEU)正在审理的Like Company诉Google Ireland案中,原告Like Company为运营多个在线新闻门户的匈牙利新闻出版商,被告Google Ireland Limited为在欧洲提供Gemini聊天机器人服务的公司。当用户要求Gemini用匈牙利语概述原告网站的一篇娱乐新闻报道时,Gemini生成的回答复现了该报道的大量实质性内容。
原告向匈牙利布达佩斯周边地区法院(Budapest Környéki Törvényszék)提起诉讼,主张被告未经许可复制并向公众提供其新闻出版物,侵犯了其新闻出版者邻接权。被告否认侵权,抗辩称:Gemini模型并不存储文章的复制件,只是学习训练数据的统计规律、根据概率逐词生成文本;输出由用户的提示词触发,侵权责任不在被告;即便构成复制,相关行为也可援引一般例外,不构成侵权。
本案目前尚在审理中。由于本案涉及欧盟法律在生成式AI领域的统一解释问题,布达佩斯周边地区法院于2025年4月3日中止审理,将四个核心争议提请欧盟法院作出先决裁决。四个核心争议分别是:1)聊天机器人在回答中输出与新闻出版物部分相同的文本,是否构成向公众传播?2)使用新闻出版物训练AI大语言模型,是否构成复制?3)如构成复制,能否援引一般例外?4)聊天机器人应用户的提示词在回答中复现新闻出版物内容,该行为是否应归责于服务提供者?
2026年3月10日,欧盟法院举行口头审理,佐审官(Advocate General)意见将于2026年9月3日发布[23]。我们将持续关注此案进展。
结语
在上述欧盟成员国关于TDM的案例判决中,我们注意到几个特点。首先,就 “AI训练中,对权利人数据的何种使用,能获得TDM豁免”的问题,欧洲法院似乎认为,其关键在于被告TDM复制行为的形式和目的。譬如,在不构成侵权的LAION案和匈牙利搜索引擎等案中,如果被告TDM的目的只是临时下载用于分析,在分析完成后立即删除挖掘内容;或只保留词汇、链接等索引数据而不保留作品副本,那么欧洲法院似乎更容易认定被告的行为属于TDM例外情形,不构成侵权。但是在GEMA案和Like Company等案中,如果被告的行为除了TDM,还涉及未经授权擅自存储和复现权利人的作品,则欧洲法院更偏向于认定被告行为构成侵权。
其次,关于“权利人应如何作出有效的opt-out”的问题,欧洲法院对于《用户协议》或原告网站上以“人类自然语言作出的权利保留声明”是否有效的问题,仍有争议。因此,若权利人希望其权利保留声明能够被认定为有效的opt-out,需要关注欧盟计划发布的“普遍认可的机器可读选择退出方案清单”等文件,从中选择获得认可的声明方式。
综上,欧盟正沿着“以DSM指令的两项版权例外为核心、《人工智能法案》和配套文件为补充”的思路,逐步建立兼顾AI产业发展与权利人保护的制度框架。这一框架目前仍在完善之中,随着前述清单的出台以及欧盟法院对先决问题的裁决,两项版权例外的适用边界将进一步清晰。
向下滑动阅览
脚注:
[1] 美国相关代表性案件包括:(1)Thomson Reuters v. Ross Intelligence 案:特拉华联邦地区法院 2025 年 2 月简易判决,认定以 Westlaw 案例提要训练 AI 法律检索工具不构成合理使用。但案情与用创作型作品训练生成式大模型不同,现已上诉至第三巡回法院;(2)Bartz v. Anthropic 案:加州北区联邦地区法院 2025 年 6 月部分简易判决,认定以合法取得的图书训练大模型属转换性合理使用,但从盗版渠道下载、留存数百万册图书建立永久中央数据库的行为不受合理使用保护;其后就盗版问题以 15 亿美元和解,和解仍待法院批准,训练是否侵权的问题未经终局判决;(3)Kadrey v. Meta 案:加州北区联邦地区法院于 2025 年 6 月就合理使用问题作出有利于 Meta 的简易判决,但该案其余争议点仍在推进。
[2] Directive (EU) 2019/790, Article 2.
[3] 参见Regulation (EU) 2024/1689, Recital 106;下文的“机器可读清单”等欧盟文件中亦使用该表述。
[4]Regulation (EU) 2024/1689, Article 53; Recital 106. 序言第106段还特别说明:无论训练行为发生在哪个法域,只要模型在欧盟市场提供,提供者就必须遵守这些义务。
[5]European AI Office, General-Purpose AI Code of Practice (10 July 2025).
[6]European Commission AI Office, Explanatory Notice and Template for the Public Summary of Training Content for GPAI Models (24 July 2025).
[7]"list of generally-agreed machine-readable opt-out solutions", European Commission, Consultation on Protocols for Reserving Rights from TDM under the AI Act (December 2025), https://digital-strategy.ec.europa.eu/en/consultations/commission-launches-consultation-protocols-reserving-rights-text-and-data-mining-under-ai-act-and.
[8]European Commission, Stakeholder consultation on AI and copyright compliance, General FAQ, https://digital-strategy.ec.europa.eu/en/faqs/stakeholder-consultation-ai-and-copyright-compliance#ecl-inpage-general-faq.
[9] 本文讨论的案例集中于德国、荷兰、匈牙利、丹麦四国,各国的例外条款分别为 :德国《版权法》第44b条、第60d条,荷兰《版权法》第15o条、第15n条,匈牙利《版权法》第35/A条,丹麦《版权法》第11b条、第11c条。
[10]Rechtbank Amsterdam, judgment of 30 October 2024, ECLI:NL: RBAMS:2024:6563 (DPG Media e.a. v. HowardsHome / Knowledge Exchange B.V.), case no. C/13/737170 / HA ZA 23-690.
[11]A. Cerri, "Dutch court holds that TDM opt-out must be done by 'machine-readable' means", The IPKat (16 Feb 2025).
[12]Fővárosi Ítélőtábla (Budapest Municipal Court of Appeal), judgment of 3 December 2024, Case 9.Pf.20.353/2024/6/II (anonymised).
[13] 依匈牙利司法数据库惯例,当事双方为匿名。
[14Peter Mezei, Third European Court Decision on the General Purpose TDM Exception Is Out (Kluwer Copyright Blog, 8 May 2025), https://copyrightblog.kluweriplaw.com/2025/05/08/third-european-court-decision-on-the-general-purpose-tdm-exception-is-out/. DSM 指令第 4 条在匈牙利对应的条款为《版权法》第 35/A 条第 1 款 c 项。
[15]LG Hamburg, judgment of 27 September 2024, Az. 310 O 227/23; on appeal Hanseatisches OLG Hamburg, judgment of 10 December 2025, Az. 5 U 104/24. DSM 指令第3、 4 条在德国《版权法》分别对应第60d条、第44b条。
[16]Sø- og Handelsretten (Danish Maritime and Commercial High Court), order of 22 October 2025, Case No. BS-42485/2025-SHR (BoligPortal A/S v. ReData A/S); on appeal Østre Landsret (Eastern High Court of Denmark), order of 12 May 2026 (ReData A/S v. BoligPortal A/S).
[17]Kluwer Copyright Blog, EU Copyright Law Roundup – Fourth Trimester of 2025 (Jan 2026); MLex (24 Oct 2025).
[18]LG München I (42. Zivilkammer), judgment of 11 November 2025, Az. 42 O 14139/24 (GEMA v. OpenAI).
[19]OpenAI同时主张了科学研究例外和一般例外,皆被驳回。还主张了案涉歌词在互联网随处可及,原告对于使用有默示同意,也被驳回。
[20]Osborne Clarke, GEMA vs OpenAI: AI Memorisation Is a Reproduction Relevant to Copyright Law (18 Nov 2025), https://www.osborneclarke.com/insights/gema-vs-openai-ai-memorisation-reproduction-relevant-copyright-law-and-tdm-exception-does.
[21]Bird & Bird, Landmark Ruling of the Munich Regional Court (GEMA v. OpenAI) (14 Nov 2025); Quintais, Copyright in Formaldehyde (Kluwer Copyright Blog, Dec 2025).
[22] CJEU, Like Company v. Google Ireland Ltd, Case C-250/25 (request for a preliminary ruling from the Budapest Környéki Törvényszék, lodged 3 April 2025; hearing 10 March 2026; AG Opinion expected 3 September 2026).
[23]Bird & Bird, Like Company v. Google: CJEU First-Ever Hearing (18 Mar 2026); European Copyright Society Opinion, CREATe (Mar 2026).
业务领域:跨国知识产权法及娱乐法,主要聚焦于人工智能、传媒、娱乐、体育与高科技行业
宋海燕博士带领团队为国内外跨国企业在人工智能、数据隐私、影视、音乐、消费衍生品、主题乐园、游戏与电竞、体育赛事运营、数字媒体、虚拟人、NFT产品、元宇宙等领域提供战略性、商业性及法律建议,包括但不限于知识产权战略规划、版权链清查、版权运营、内容许可、影视节目的融资制作拍摄与发行、中外合拍、知识产权维权等。
![]()
任钰霖
律师助理
知识产权部
转载声明:好文共赏,如需转载,请直接在公众号后台或下方留言区留言获取授权。 如需引用文中观点、数据或评述,亦请提前联系我们取得授权。请勿随意摘编、节选或改编本文内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.