一周只能卖20本书的职业书商,最近几个月销量直接飙到每周数百本——翻了大约5倍。不是因为阅读潮回来了,而是AI公司开始批量扫货二手纸质书,打算拆了当“纯净”训练素材。
调查媒体404 Media最新曝光,一批AI公司正通过中间商大规模收购旧书,借此拿到高质量的人类创作内容来训练大模型,同时又避免直接扒网触发舆论反弹。这背后藏着一个越来越扎眼的矛盾:AI自己产出的低质内容已经多到污染数据水源,逼得AI公司反过来去书架上搜刮还没被污染的人类知识。
![]()
下面把这事儿拆开看,一共四个让人心里五味杂陈的真相。
一、AI为什么开始狂收纸质书?
大模型训练不是喂的数据越多越好,关键看质量。最近两年互联网上充斥着AI生成的“垃圾内容”,如果继续把这种材料丢进训练集,模型很容易越学越“傻”。所以,头部AI公司重新把目光投向人类原创作品,尤其盯上了2022年之前出版的纸质书——这些书出版时生成式AI还没大规模泛滥,受污染的概率要低得多,可以当作“干净语料”来用。
这个逻辑不是突然冒出来的。卷入版权诉讼的Anthropic,此前就投入数百万美元大量采购纸质书,提取文字训练Claude模型,然后再把这些书销毁。法院虽然认定买正版书用于训练属“合理使用”,但Anthropic因为长期保留一个包含700万本盗版图书的数据库,被判侵犯作者和出版商版权,罚款高达15亿美元(约合101.62亿元人民币)。同期,一个出版商联盟也对谷歌提起诉讼,指控它未经授权使用数百万本受版权保护的图书来训练Gemini模型。
二、谁在买,一次买多少?
拥有超1.11亿本图书目录信息的在线数据库ISBNdb,过去主要服务书商、图书馆和发行商,现在直接调整业务,推出专门面向AI企业的大规模图书采购服务。据404 Media报道,相关订单规模从一次采购1000本,到一次采购100万本都有。
一位不愿具名的职业书商证实,从今年4月开始,图书销量出现前所未有的增长。以前生意最好时一周也就卖二十来本,近几个月每周出货量冲到数百本,大约是平时销量的五倍。Alibris、Biblio等二手书交易平台上的其他书商,也反映出现了类似的大宗采购现象。
这些订单有几个非常“不挑食”的特征:采购对象几乎全部都是带有ISBN编号的图书——那种13位数字组成的全球唯一标识码,就像图书的身份证。而且买家基本没有主题、类型或作者偏好,小说、教材、专业书,只要能扫出来的内容全收。更让人无语的是,买家似乎根本不在乎价格,哪怕某些书明显高于市场价格,也直接拿下。
三、书买回来之后被怎么处理?
扫成数据喂模型的方式,比想象中更粗暴。在Anthropic的版权诉讼过程中,曾负责其“巴拿马计划”数字化项目的汤姆·哈维证实,Anthropic聘请过多家专业文档扫描公司来做纸质书数字化。其中一家合作方Datamation Information Services,提供两种扫描服务:非破坏性扫描和破坏性扫描。
非破坏性扫描一般用俯拍扫描仪、平板扫描仪或V型扫描设备,可以在不拆解图书的情况下完成数字化。而破坏性扫描就是直接把书拆开,一页一页送进高速工业扫描仪,效率高、成本低。对AI公司来说,效率压倒一切,所以它们普遍选择破坏性扫描——这意味着,大量纸质书最终被拆毁,变成只存在于私有数据库里的一串数字。
四、更让人不安的争议在哪儿?
一个是稀有书可能被永久毁掉。批评者指出,眼下根本不清楚AI公司在数字化过程中,会不会区分普通图书和珍贵绝版书。如果那些本来存量就极少的稀有书籍被拆毁,它们将彻底退出流通,人类失去的远不止几页纸。
另一个是知识的公共性正在被悄悄蚕食。这些扫描后的内容全部进入AI公司的私有数据库,只用来训练自家模型,普通公众根本无法访问。也就是说,我们或许能获得一个更聪明的AI,但代价可能是,大量知识资源不再以公开、可获取的形式留给未来世代。
当AI进步需要拆掉真实世界的书时,这笔账到底值不值,恐怕就不是技术参数能回答的了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.