2026年7月,美国加州法院敲定重磅裁定,AI企业Anthropic为训练大模型,批量采购200万册实体书籍,扫描录入数据后全部粉碎销毁,而且该行为还被认定合法合规。
此事直接引发全球行业震动,国内出版社迅速做出应对,主动在新书版权页标注禁令,禁止书籍内容用于AI训练。
海外资本悄悄钻法律漏洞收割人文成果,国内行业则坚守规则主动防御,这场无声的版权博弈,最终究竟会给行业和普通读者带来怎样的深远影响?
![]()
绝版孤本再也找不回来
Anthropic是由多名OpenAI核心离职成员创立,旗下Claude大模型是其核心产品,也是目前全球商业化落地相对成熟的主流人工智能模型之一。
这家企业从模型研发初期,就压根没采用正规版权授权的数据源采集模式。
根据美国加州北区联邦法院2025年6月23日公开卷宗,2021年初,公司联合创始人本杰明·曼恩从盗版数据集Books3下载近20万本电子书,同年又通过各类盗版平台抓取超500万本图书资源。
企业内部沟通记录显示,管理层知道正版授权流程繁琐、成本高昂,盗版采集是更高效的牟利方式。
![]()
随着网络公开文本逐渐掺杂大量AI生成内容、数据质量大幅下降,企业顺势将数据采集目标转向线下实体书籍。
2024年初,Anthropic秘密启动巴拿马计划,核心工作为规模化破坏性扫描全球纸质书籍,且全程对外严格保密。
项目由前谷歌图书项目负责人主导,整套数据采集、处理流程早已实现工业化运作。
企业长期合作的大型二手书商,集中采购2022年以前出版的纸质书籍。之所以锁定该时间节点,道理很简单,2022年后网络AI生成内容泛滥,训练数据存在严重污染,而早期人工创作印刷的书籍,是适配大模型训练的高质量纯净数据源。
![]()
所有采购书籍统一运送至专属仓库,通过液压设备切除书脊,经高速扫描仪完成全文录入后,实体书本直接送入碎纸机销毁。该项目原定半年处理50万至200万册图书,最终实际销毁总量达200万册。
法院公开的项目资料显示,这批被销毁的书籍当中,有3.2万册为无任何数字化存档的绝版典籍。书籍自带的手写批注、专属装帧工艺、原始纸张承载的时代信息,均无法被扫描仪捕捉留存。
这批实体书销毁后,对应的专属文化与历史细节彻底消亡,实实在在造成了人类公共知识库的永久性损失。
毁书行为没有一分钱处罚
这场持续近两年的版权纠纷,最终判决结果也让广大文字创作者倍感无奈。
2024年8月,美国作家安德莉亚·巴茨发现个人作品被Anthropic私自纳入AI训练数据库,随即联合多名创作者,在美国作家协会支持下发起集体诉讼,指控企业大规模版权侵权。
2025年6月,法官威廉·阿尔萨普出具32页官方裁定书,明确两类行为的定性标准。
![]()
企业私自从盗版平台下载、留存700余万本电子书,属于明确的侵权行为;企业合法购入纸质书籍,扫描录入后销毁实体原件,被判定为版权合理使用,无需承担法律责任。
美国现行版权体系明显侧重资本商业权益,对创作者个人权益保护存在明显短板,就此悄悄为AI资本开辟了灰色操作通道。
企业只需合法购置二手书籍,完成扫描后销毁实体载体、不对外传播扫描副本,就能无偿使用书籍内容训练模型,创作者和出版方完全没法维权。
2026年7月20日,法院正式核准15亿美元和解协议,创下美国版权纠纷史上最高和解金额纪录。
![]()
该款项用于赔付48.2万至50万部被盗用的电子书作品,单部作品赔付金额约3000美元。值得注意的是,该和解赔付仅针对早期盗版电子书侵权行为,巴拿马计划中被销毁的200万册实体书,未产生任何赔付与追责。
法院的判决逻辑很直白,书籍完成交易后所有权归企业所有,持有者有权处置实体书籍,且销毁原件未新增流通副本,不在版权法约束范围内。
这操作也遭到业内不少质疑,马斯克曾公开批评此类毁书采集模式,认为其严重损耗人类长期积累的纸质文明成果。
![]()
在我个人看来,这份判决藏着明显的行业漏洞与长远隐患。
未来资本充足的AI企业,完全可以通过批量收购、销毁旧书垄断优质人工创作数据,将创作者的智力成果转化为自身盈利工具,长期来看,整个文字创作行业都会跟着吃亏。
国内纸面禁令守住行业态度
海外AI毁书侵权事件持续发酵,国内出版行业主动出击防范风险。
2026年8月初,有读者偶然发现华夏出版社出版的《新译黄庭经 阴符经》,在版权页新增明确标注:禁止将本书内容用于人工智能训练,违者必究。该书由刘连朋、顾宝田注译,著作财产权归属台湾三民书局。
![]()
2026年8月4日,华夏出版社负责人接受红星资本局采访,详解了该标注的由来与意义。
出版社负责人表示,在引进境外图书的合作签约环节,版权持有方会明确增设禁止AI采集训练的条款,出版社需严格履约,将该条款印刷在版权页公示。
同时负责人也坦诚现实困境,AI模型具备文本拆解、重构能力,原始素材与模型输出内容差异极大,取证维权真的难度极高。
出版社法律顾问认为,该纸质禁令虽说无法约束恶意钻规则漏洞的机构,但能够持续强化公众版权意识,明确原创内容不可无偿用于AI商业训练的核心立场。
![]()
实体书籍没有网络爬虫防护机制,没法从技术层面拦截线下扫描、偷拍采集行为,公示禁令仅能约束合规经营的机构。
但国内绝不会出现海外大规模毁书采集的乱象,2023年7月国家网信办等七部门发布的《生成式人工智能服务管理暂行办法》明确规定,AI训练数据必须来源合法、可溯源、可核查。
企业若扫描书籍后销毁实体原件,会直接丧失数据溯源依据,属于明确的违规行为,将被监管部门依规处置。
此外,国内绝版古籍、珍稀孤本均统一收纳于公立馆藏体系,受文物保护法、古籍保护条例严格管控,私人机构无大规模收购、销毁珍稀书籍的操作空间。
![]()
当前国内版权防护的核心隐患,不是公开化的毁书行为,更多是图书馆偷拍、民间零散线下扫描等隐蔽式数据采集。
封堵这类灰色采集渠道,其实才是现阶段守护国内图书版权、规范AI数据采集行业的关键。
中国稳稳选定长期稳妥路线
巴拿马计划的曝光,彻底揭开了AI行业三类主流训练数据采集模式,各类模式优劣与发展局限都清清楚楚。对比来看,国内落地的行业发展规范,更契合AI产业与文化版权行业的长期稳定发展需求。
先是毁书采集模式,核心优势是成本低、数据纯度高,但有着极高的舆论风险与行业抵制风险,仅适合初创企业短期冲刺,不具备长期规模化发展的可能,后续也会被各国新规逐步取缔。
再是,正规版权授权,这是目前最稳妥、零纠纷的合规模式。
![]()
2024年5月,OpenAI与新闻集团达成五年合作,据澎湃新闻2024年5月23日报道,合作总金额超2.5亿美元,合法获取《华尔街日报》《泰晤士报》等权威刊物的训练使用权。
这模式没版权风险,不过高额授权成本最终会转嫁至AI产品定价,提升普通用户的使用成本。
还有一种,依托公版过期著作、网络开源文本训练模型,这种没有版权麻烦,但文本质量参差不齐,长期用 AI 生成内容反复训练,很容易出现模型坍塌,AI 逻辑会越来越混乱。
这种问题会直接限制AI模型的智能化迭代,导致产品体验停滞不前,也是中小AI企业永远无法追赶头部大厂的核心短板。
![]()
这么看来,未来三年,全球AI数据版权行业大概率会迎来标准化升级。图书版权会实现分级管理,新书将明确区分可AI商用、禁止AI训练两类授权,版权页禁令标注将成为行业标配,行业管控会从事后打官司追责,转变为事前签约划定使用边界。
各国监管机构会强制落地数据溯源制度,销毁原始素材载体、无法核查来源的采集手段,会在短时间内被法规彻底限制,巴拿马计划这类违规操作将彻底退出行业。
同时,创作者将获得全新变现渠道,AI平台会逐步上线文本订阅、内容分成机制,普通作者可通过正规授权获得稳定收益,无需依靠集体诉讼维权。
![]()
国内的发展思路,从一开始就和美国野蛮生长模式划清界限,规则先行、数据全程可溯源、实体书籍严禁随意销毁,三条底线始终没有松动。
美式模式靠钻法律漏洞透支人文资源换技术速成,短期增速快、但隐患重重,发展上限极低;国内合规可控的发展模式,看似约束更多,却能实现AI技术与文化版权行业双向共赢,具备长期可持续的发展潜力。
华夏出版社的版权禁令标注,虽说约束力度有限,但为国内出版行业版权防护树立了标杆,带动全行业主动筑牢知识版权防护体系。
![]()
不过对于国内AI书籍版权防护体系的完善,你觉得还需要落地哪些针对性举措,才能有效遏制AI无序抓取书籍内容的行为?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.