撕开数百万册书籍的装订,一页页高速扫描,然后像废纸一样丢掉——这不是小说里的焚书,而是AI赛道里真实发生的一幕。随着Anthropic与作家版权纠纷的和解细节曝光,这家顶着“AI安全”光环的公司,正在用最激烈的方法为自己喂养训练数据,而代价是那些在战火、灾害与漫长岁月中幸存下来的纸质书,可能永无复原之日。
本该用来保存文字的光学字符识别(OCR)技术,在这里却变成了一把拆除装订的「切书刀」。为什么会走到这一步?表面看是AI公司为了绕开版权雷区,更深层的原因,其实和一份有些反常识的商业逻辑有关:越旧的书,训练价值越高。
![]()
这背后有两个关键点,每一条都带着刺。
![]()
① 旧书是避免“AI垃圾循环”的干净数据
AI模型如果反复吞噬自己生成的文本,会陷入所谓“AI slop”的恶性循环——产出的内容越来越水,逻辑崩塌。书籍数据库服务商ISBNdb给出的理由很直白:2022年前印刷的实体书,不含任何AI生成的文字,是打破这种毒循环的理想燃料。换句话说,AI公司抢的不只是知识,更是没有被算法污染过的纯净语料。这也解释了为什么二手书市场突然多了一群来扫货的科技采购方——他们要的不是阅读的浪漫,而是拆解、扫描、丢弃的全流程。
② 撕书比借书“划算”,哪怕可能毁掉不可复制的珍本
Anthropic的做法极其讲求效率。他们先是尝试收集盗版电子书,被作家联名起诉后,便将方向转向纸质书:低价购入大量中古书籍,直接用切纸机裁断书脊,把散开的页面送入高速扫描仪,生成图像再用OCR转成文本。处理完的原本,不是还回书架,而是直接废弃。
谷歌当年做图书扫描项目时,用的是专利非破坏摄像头,从图书馆借书、扫完归还,力求不让一页纸受伤。而Anthropic却选择了另一种路径:宁可让数以百万计的书本从物理世界消失,也要把数据拿到手。这种“用完即毁”的模式被部分科技媒体形容为“以研究为名的系统性销毁”,在法庭文件流出后引发广泛质疑。
③ 古书市场正在上演新版的“鲸吞”故事
荷兰媒体NL Times报道,二手书店和古籍商已经注意到一批来历不明的“扫货军团”,专门盯着无人问津的专业著作和绝版书出手,一扫就是整个货架。销量上去了,可珍本却没了。404 Media采访的旧书商说得更直白:那些熬过战争、火灾和几百年抚摸才留存下来的书籍,就这么被“高效数字化”送进了碎纸机。没有证据显示Anthropic故意销毁初版或孤本,但稀有书商人已公开表示担忧:只要收购链条里混进几本真·孤品,毁掉就是不可逆的。
![]()
④ 法律上未必违规,道义上却很难站住脚
从版权层面看,Anthropic的操作踩在一条灰线上:自己购买实体书,切割扫描,不在市面重新流通,美国法院此前对谷歌书籍扫描的判例又给了类似行为一定的“合理使用”空间。问题在于,有非破坏的方案,却依旧选择最伤书的方式,这更像是一种冷冰冰的成本计算。为了速度和廉价,让实体副本为零的几世纪性生存记录画上句号,正是让外界最恼火的点。
⑤ 马斯克立刻切割:我的AI团队不会这么干
事件发酵后,SpaceXAI掌门人埃隆·马斯克第一时间跳出来画清界限,他在社交平台上宣称:“我要求团队保留所有图书馆里的稀有书籍,宁可多花时间和人力慢慢扫描,也不会裁掉书脊。我们不做那种事。”一番操作既撇清了自己,又顺便踩了竞争同行一脚。只是,一边是Anthropic用物理消灭换取数据霸权,另一边是马斯克高调打“保护珍本”牌,AI行业在数据获取手段上的撕裂,已然摆到了台面上。
当训练数据从网页文本变成实体书库,到“连实体都不留”的激进操作,AI公司对知识的索取方式已经越过了“利用”和“破坏”的模糊界线。至少对那些未来可能再也找不到一本实物的研究者而言,一个连书本都不愿好好对待的AI,也许很难真正学会尊重文字本身。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.