前两天翻我姥姥留下的旧书箱,摸到一本1983年版《中国历代文学作品选》,纸页发黄,边角微卷,扉页还有她用蓝墨水写的批注:“讲得透,背下来”。当时没多想,今天看到新闻才后知后觉——像这样被手写圈点、油墨浸染、时间压弯脊背的书,正成批消失,不是散失,不是霉烂,是被人上门收走,切脊、拆页、高速扫描,最后送进碎纸机。
![]()
这事最早是从伦敦一家二手书摊传出来的。老板老李,干这行三十年,去年突然接到个订单:要五万册1970到2005年间的文史类旧书,不挑品相,不讲价格,只提一个条件——“越冷门越好,地方志优先”。他以为是高校在补藏,结果货一发,对方连收据都不留,全程用加密邮件对接。后来才知道,下单的是Anthropic——就是做Claude大模型那家公司。他们内部有个代号叫“巴拿马计划”,光是2023年就砸了三千多万美元,在全球扫货,光是纸质书就买了三百多万册。
你可能纳闷:现在网上啥没有?百度一搜,十万本《红楼梦》电子版随便下。可问题就出在这儿——2022年之后,知乎上八成问答、小红书里七成科普、淘宝商品页里九成描述,全是AI写的。同义词替换、模板句堆砌、逻辑硬转弯……这些“AI回音壁”文字,正把整个互联网喂成一锅浓稠的糊糊。AI自己学自己,越训越虚,回答开始飘,推理开始绕,最后连“苹果和香蕉哪个更圆”都答得像哲学论文。业内管这叫“模型崩溃”,听着玄,其实就跟人天天吃方便面营养不良一个道理。
所以他们掉头扑向了纸堆。不是所有旧书都行,得是2022年前出版的,得是铅字印刷、人工校对、作者一笔一划写出来的。没有AI润色,没有算法洗稿,错字都带着体温和犹豫。这类文本,现在叫“人类原生语料”,是AI界眼里的“纯净水源”。
但水要怎么取?直接扫描存档不行——美国法院判过,保留电子版+原书,就是侵权;可如果买来就扫,扫完即毁,倒算“合理使用”。于是工厂流水线就变成了:液压书脊切割机咔嚓一声,整本书散成纸片;高速CCD扫描仪一秒钟翻60页;OCR识别完,纸堆直接进粉碎机,灰都不剩。
有家中间商甚至打出广告:“百万册起接,身份绝对保密,专筛1954年《辞源》初版、1987年各省《县志》合订本、1992年某师大油印讲义……”他们不告诉你买家是谁,但你想想,谁会为几千本《甘肃畜牧志》(1979年内部印行,全国存世不到两百套)付全价?
我上次在孔夫子旧书网搜“云南少数民族语言调查手稿”,显示“已下架”。客服说,一星期前被人整批收走。我没追问,但心里咯噔一下——那批手稿里有傣族老人用老傣文记的歌谣,铅笔写的,边角还沾着云南山里的松脂味。
现在有些绝版书,市面上只剩三五本。扫完灭迹,等于把那几页纸从人类记忆里抹掉。不是删数据,是删实体。删掉的不只是字,还有纸张的肌理、装订的线头、某代人夹在《资本论》里的火车票。
你家书架上,有没有那种封面掉了、书页粘连、没人愿收的旧书?别急着当废纸卖。它们没过时,只是还没被看见。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.