网易首页 > 网易号 > 正文 申请入驻

AI公司,批量抢购旧书

0
分享至


当AI生成内容占据互联网新发布内容的一半以上,高质量人类文本成为稀缺资源。

多家AI公司通过中间商大规模收购二手图书,扫描后销毁,只为获取2022年之前“未被机器碰过”的训练数据。Anthropic的“巴拿马计划”曝光了这一隐秘产业链,15亿美元和解金创下美国版权案件纪录。

这不仅是数据争夺战,更揭示了AI产业的核心悖论,它越成功,赖以训练的人类数据就越稀缺。

被切碎的旧书

调查媒体404 Media今年7月披露,多家AI公司正通过数据中间商ISBNdb大规模收购二手图书,切掉书脊、高速扫描、物理销毁。单次订单从1000本到100万本不等,书商们销量在数月内飙升了五倍。Anthropic内部文件显示,其“巴拿马计划”(Project Panama)在一年内花费数千万美元购买了数百万本纸质书,拆解扫描后全部销毁。

为什么AI公司要花大价钱买旧书、拆书、毁书?答案指向一个它们自己制造的问题:互联网已经被AI生成内容污染了。

斯坦福大学2026 AI指数报告显示,自2025年初以来,新发布的互联网内容中AI生成的比例已超过一半(51.72%)。2022年ChatGPT发布之前,这个数字接近于零。Cloudflare的数据同样印证了一个趋势,其托管网站的网络访问请求中,约57.4%来自人工智能和自动化程序,人类请求仅占42.6%。不过该数据衡量的是HTTP请求数量而非人类实际阅读量,一个AI Agent单次可访问数千页面,而人类只需几次点击。

当AI模型用AI生成的内容继续训练时,就会发生“模型塌缩”(Model Collapse)。2024年7月,牛津大学、剑桥大学等机构的联合研究登上了Nature封面。研究者用Meta的OPT-125m模型输入一段关于14世纪教堂塔楼的维基百科文本,第一代输出还在讨论建筑,第五代跑偏到语言翻译,第九代模型开始热情洋溢地介绍各种不存在的兔子物种。从教堂到兔子,只用了九次迭代。


递归训练下模型输出质量的退化趋势(基于Nature 2024封面论文实验数据)

论文证明,驱动塌缩的是三类误差的复合效应:统计近似误差(有限采样丢失尾部信息)、函数表达误差(神经网络无法完美拟合分布)、函数近似误差(优化算法本身带有结构偏差)。只要其中任何一类存在,塌缩就不可避免。这是数学必然。

Epoch AI的测算给出了明确的时间窗,语言模型将在2026年到2032年间耗尽人类公开的高质量文本数据。合成数据看似是解药,微软Phi-4、谷歌Gemma等模型都已混入合成数据,但据相关研究显示,训练数据中仅0.01%的虚假文本就能导致模型有害输出增加11.2%,这是指数放大的关系。

理解了“模型塌缩”这个逻辑起点,才能理解AI公司为何愿意花数千万美元去购买那些“2022年之前印刷的纸质书”。ISBNdb在官方博客中直接点明了这一点:“2022年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的优势。”


互联网新发布内容中AI生成内容占比变化(数据来源:斯坦福2026 AI指数报告)

更棘手的是,作者们已经开始反击。芝加哥大学开发的Nightshade工具能在图像中嵌入对人类视觉无影响但会让模型“中毒”的像素级修改。其文本领域的同类工具也在发展之中。

Nightshade自2024年发布以来已被广泛下载。Anthropic联合英国AI安全研究所的研究显示,只需250份精心构造的恶意文档,就能在数千亿token量级的语料库中为模型植入后门。这意味着互联网上爬取的数据无法保证“干净”,只有纸质书,从时间线上就天然免疫。

但问题在于:旧书虽然纯净,获取方式却触发了另一场冲突。

旧书争夺战

ISBNdb原本是一家服务于图书馆、书商和发行商的图书数据库公司,拥有超过1.11亿本图书的目录信息。如今,它已将业务重心转向AI行业。

其官网写道:“书籍代表着经过精心策划、同行评审、特定领域的人类知识,其结构是任何网络爬虫都无法复制的。”它提供从1000本到100万本的批量采购,并承诺严格保密,每笔合作签署NDA,买家姓名永不披露。

据404 Media报道,采购订单有几个异常特征:采购对象几乎全部带有国际标准书号(ISBN),便于数据去重和溯源管理;完全没有主题、类型或作者偏好,小说、教材、专业书籍不加区分;买家完全不在意价格,即使部分图书明显高于市场价,也会直接买下。

一位书商向404 Media表示,过去一周只能卖出约20本书,近几个月每周销量飙升至数百本,是平时的五倍。他坦言:“我个人对此感受复杂,经济上对我有利,但我不喜欢那些不常见的书就这样被粉碎。”

被大量买走的书大多是“长尾、冷门、几乎没有商业价值”的书籍,比如地方史、小城镇志、已消失学科的旧专著、小语种或土著语言文献、自费出版的战争回忆录、印量极小的学术论文集。这些绝版书籍因此更易被批量收购和销毁。

Anthropic的巴拿马计划提供了一个完整的标本。2024年初,该公司启动了这一严格保密的项目。内部文件写道:“巴拿马计划是我们对全世界所有图书进行破坏性扫描的努力。我们不想让人知道我们在做这件事。”

此后一年内,该公司花费数千万美元,购买了数百万本纸质书。负责该项目的汤姆·特维(Tom Turvey)是一位曾参与Google Books项目的硅谷老兵。

今年1月的一篇报道进一步揭示,Anthropic联合创始人本·曼恩早在2021年就亲自从盗版网站LibGen下载了至少500万本盗版图书,2022年又从另一个网站下载了至少200万本(部分法庭文件记载为500万本,具体数量在诉讼中存在争议),并向同事转发链接附言:“真是太及时了!!!”(just in time!!!)。

CEO达里奥·阿莫代伊对此知情,在内部邮件中将寻求正版授权的理由概括为“法律/实践/商业上的繁琐工作”。

具体操作流程:工人使用液压切割机切掉书脊,将散开的书页送入高速生产级扫描仪,转化为高清PDF文件,然后将纸质残骸直接送往回收公司销毁。据法庭文件显示,供应商提案中标注的扫描量在50万到200万本之间,完成周期约为六个月。ISBNdb的服务条款也承认:“大规模扫描通常会毁掉书籍。工人切掉书脊,让散页通过机器,这比小心翼翼的替代方案更快、更便宜。”

ISBNdb的营销文案承认:“AI公司销毁两百万本书确实不是一个能博取同情的标题。”它建议客户将这一行为重新包装为“数字化保存”。然而,图书馆的数字化是为了保存和传播,AI公司的数字化是消耗和训练,扫描后的内容进入私有数据库,公众无法访问。

旧书被买走、拆掉、扫成数字文件,然后物理销毁。这一连串操作在法律上处于什么位置?Anthropic的15亿美元和解案给出了答案。

买书合法,偷书不行

2025年6月,联邦法官威廉·阿尔苏普(William Alsup)作出了一项双重裁定。一方面,他认定Anthropic的破坏性扫描行为属于“合理使用”(fair use),因为训练是“变革性”的。

他将此比作教师教学生写作,认为“作者无权禁止任何人将他们的作品用于培训或学习”。另一方面,同一法官认定该公司在启动巴拿马计划之前,曾下载了一个包含700万本盗版图书的数据库(LibGen),侵犯了版权。

2025年9月,阿尔苏普初步批准了Anthropic以15亿美元(约合101.62亿元人民币)和解提案。2026年7月,法官阿拉塞莉·马丁内斯-奥尔金批准了最终和解。这是美国版权案件中已知的最大和解金额,超过91%的作者和出版商已领取赔偿份额。

这组判决传递了一个清晰的信号:买书、拆书、扫描、销毁,只要书是合法购买的,法院可能不拦你;但如果你从盗版网站下载,代价会极其昂贵,每本侵权作品最高可判罚15万美元。

由此形成了一个荒诞的激励结构:如果你扫描后还留着原书或公开分享扫描件,法律地位反而更弱,因为可能产生新的版权副本并使其流入市场。

Anthropic的律师团队提出了双重辩护:其一,基于“首次销售原则”,合法购买一本书后,所有权人有权对该副本进行任何处理;其二,叠加“合理使用”,扫描件仅用于内部AI训练,不对外分发。销毁原件反而“规避了非法复制”的指控链条。

7月14日,哈切特出版集团、圣智学习集团、爱思唯尔以及畅销作家斯科特·图罗联合在纽约联邦法院对谷歌提起集体诉讼,指控其未经授权使用数百万本受版权保护的图书训练Gemini AI模型。

与Anthropic案不同,谷歌案的核心在于“授权但超出范围”:出版商曾授权谷歌通过Google Books等有限范围内使用作品,但从未授权用于训练商业AI产品。Meta也面临类似诉讼,出版商联盟指控其从LibGen、Anna's Archive、Sci-Hub等多个盗版网站获取了超过267TB的版权材料。

Anthropic的案例揭示了一个奇怪的产业逻辑:从盗版网站免费下载700万本电子书,最终付出15亿美元代价;而巴拿马计划虽然成本高昂,却被法院认定为合法。这种“合法但更贵”的路径正在重塑整个AI训练数据的供应链。ISBNdb正是这一模式的产物:它不生产数据,只是图书的搬运工,但搬运的是法律上干净的数据。

法律的模糊地带催生了新的商业模式,也带来了更深层的隐忧。

被锁进黑箱的人类智慧

这场旧书争夺战揭示了一个悖论:AI公司一边承诺“让人类知识触手可及”,一边在买断、拆毁人类知识最坚实的载体。

扫描后的数字内容进入AI公司的私有数据库,仅用于训练其模型,普通公众无法访问。公众可能获得更智能的AI助手,但代价是大量知识资源正从公共领域消失。

这与图书馆的数字化使命有着本质区别:图书馆数字化是为了保存和传播,公众可以访问数字化后的内容;AI公司的数字化是为了消耗和训练,内容进入私有数据库后公众无法访问。

前者是知识的“放大器”,后者是知识的“黑洞”。

在批量采购中,AI公司是否会区分普通图书与珍贵或绝版图书?如果稀有书籍被拆毁,它们可能永久退出流通。被大量买走的冷门书籍,地方史、土著语言文献、小语种著作等等,其中很多可能已经没有其他存世副本。当采购规模达到百万级别且完全匿名保密时,没有任何外部机制能确保稀有书籍不被混入其中。

对中小作者而言,打击同样真实。Packt Publishing合作伙伴关系副总裁(兼ExpertEdge CEO)Oli Huggins指出,AI公司目前提供的授权报价“在经济上完全不具吸引力”,一张永久AI训练许可证的报价大约只有每本书10美元。世界各地的独立作者无法聘请顶级律所追责,当自己的作品被切碎化为数字比特时,他们能做的只是看着。


几组关键数据对比

对中国AI从业者而言,挑战尤为严峻。据业内研究估计,中文高质量数据在全球大模型训练数据集中的占比极低。数据稀缺迫使国内开发者更多依赖机器翻译和合成内容,进一步加剧了数据污染。DeepSeek-V3需要14.8万亿高质量文本片段来训练,这个量级的中文高质量数据,目前根本没有。这使得“获取纯净中文纸质书数据”对中国AI公司而言同样是一个迫切但更困难的问题。

这些隐忧指向一个更根本的问题:旧书是有限的,互联网上的AI生成内容是无限的。旧书耗尽之后,AI还能去哪里?

旧书耗尽之后

即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,而新一轮模型又要从这片被污染的海洋中捞取训练素材。收购旧书只是延缓了模型塌缩的速度,并没有解决根本问题。

学术界正在探索多条出路。

有研究证明,只要真实数据在训练循环中持续存在(“累积”而非“替换”范式),模型性能不会急剧恶化。独立研究者提出的“反吞尾效应”实验表明,质量过滤器不仅能减缓退化,甚至可能逆转它。今年5月发表于《物理评论快报》的研究也发现,只需在训练中加入一条来自封闭循环之外的真实数据,就能有效阻止模型塌缩。

但这些技术路径都有局限:它们赢得的是时间,不是永恒。模型塌缩的根本矛盾是,AI的成功正在毁掉它赖以成功的数据,会因为技术优化而消失。

我们需要的不仅是更高效的数据获取方式,更是一套让技术进步与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。

当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。人类花了几个世纪积累的知识,AI公司正在用几年时间消耗殆尽。这不再是一个技术问题,而是一个关于人类文明如何与人工智能共存的根本问题。(本文首发钛媒体APP,作者 | AGI-Signal,编辑 | 焦燕)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
曝哈登两年 6000 万续约骑士,库里和杜兰特都笑了

曝哈登两年 6000 万续约骑士,库里和杜兰特都笑了

姜大叔侃球
2026-07-30 20:42:24
法国头号逃犯逃亡29年,改名送外卖,最后却栽在去游泳的路上

法国头号逃犯逃亡29年,改名送外卖,最后却栽在去游泳的路上

新欧洲
2026-07-30 19:43:38
诗妮娜贵妃赢得漂亮!穿金衣领三小主入场,苏提达王后表情太真实

诗妮娜贵妃赢得漂亮!穿金衣领三小主入场,苏提达王后表情太真实

风月得自难寻
2026-07-30 23:07:39
那个玩游戏被北大除名,复读712分进清华的高考状元,如今怎样了

那个玩游戏被北大除名,复读712分进清华的高考状元,如今怎样了

墨兰史书
2026-07-31 01:20:03
杭州女子征婚火了:不收彩礼每月倒贴3千。唯独一条底线不让步

杭州女子征婚火了:不收彩礼每月倒贴3千。唯独一条底线不让步

朗威谈星座
2026-07-31 01:58:18
穿吊带最尴尬的不是露肉,是露内衣

穿吊带最尴尬的不是露肉,是露内衣

果壳
2026-07-28 12:31:30
余华:如果一个人老实事少,不善表达,也不给人添麻烦,不论是生活还是工作,大概率会成为任人拿捏的软柿子

余华:如果一个人老实事少,不善表达,也不给人添麻烦,不论是生活还是工作,大概率会成为任人拿捏的软柿子

每日一首古诗词
2026-07-24 06:40:26
笑死人!新中国没有苦日子,除非你报了北京旅游团 ​​​ ​​​

笑死人!新中国没有苦日子,除非你报了北京旅游团 ​​​ ​​​

另子维爱读史
2026-07-29 21:27:58
美国动手,不许中国买伊朗石油,俄油也被狙击,中方已发阻断禁令

美国动手,不许中国买伊朗石油,俄油也被狙击,中方已发阻断禁令

墨羽怪谈
2026-07-31 05:19:04
见到张柏芝真人,朋友哭诉:电视是大骗纸,她脸小得像没吃饭!

见到张柏芝真人,朋友哭诉:电视是大骗纸,她脸小得像没吃饭!

草莓解说体育
2026-07-31 02:24:09
日本网友很生气:日本的永旺商场优待中国人歧视本国人!?

日本网友很生气:日本的永旺商场优待中国人歧视本国人!?

日本物语
2026-07-30 22:29:06
天气趋势基本敲定!不出意外,今年8月全国天气迎来3大明显变化

天气趋势基本敲定!不出意外,今年8月全国天气迎来3大明显变化

琴音似君语
2026-07-30 14:05:30
全网刷屏!敬一丹病危谣言真相大白,本尊亲自出面硬核辟谣

全网刷屏!敬一丹病危谣言真相大白,本尊亲自出面硬核辟谣

可乐谈情感
2026-07-31 04:54:04
中国股市:精选一只票,25%资金买进,涨30%抛出!真正的科学炒股

中国股市:精选一只票,25%资金买进,涨30%抛出!真正的科学炒股

一方聊市
2026-07-28 15:15:03
保护血管的5种食物,洋葱只排第五,第一名就藏在常吃的水果中!

保护血管的5种食物,洋葱只排第五,第一名就藏在常吃的水果中!

九哥聊军事
2026-07-30 19:28:08
一规则把外援吓跑了!洛夫顿领衔10外援逃离,CBA吸引力不如日韩联赛

一规则把外援吓跑了!洛夫顿领衔10外援逃离,CBA吸引力不如日韩联赛

弄月公子
2026-07-30 11:30:42
老祖宗留下的100句谚语,句句经典,看完豁然开朗!建议收藏

老祖宗留下的100句谚语,句句经典,看完豁然开朗!建议收藏

诗词天地
2026-07-28 14:09:14
“唐朝根本不存在”的暴论,就是一种反噬

“唐朝根本不存在”的暴论,就是一种反噬

冰川思想库
2026-07-30 13:42:42
钱再多又如何,64岁身价千万的蔡明现状曝光,40岁儿子成"心病"

钱再多又如何,64岁身价千万的蔡明现状曝光,40岁儿子成"心病"

秋姐居
2026-07-28 22:12:38
11岁女孩因杀鱼技术娴熟“走红”:已是拥有两年经验的“老师傅”

11岁女孩因杀鱼技术娴熟“走红”:已是拥有两年经验的“老师傅”

北青网-北京青年报
2026-07-30 11:19:04
2026-07-31 11:04:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
137400文章数 862485关注度
往期回顾 全部

科技要闻

苹果财报亮眼:产品卖得太好 芯片开始不够

头条要闻

龙正才被查 曾在问政节目公开承认公车私用:见怪不怪

头条要闻

龙正才被查 曾在问政节目公开承认公车私用:见怪不怪

体育要闻

曝皇马将签罗德里!转会费6000万签约4年

娱乐要闻

李小璐澄清夜宿门,被网友质疑想洗白

财经要闻

打新日确认!宇树科技IPO冲刺“冰与火”

汽车要闻

FREELANDER神行者8下线 8月10日开启预售/海外版同步推进

态度原创

艺术
数码
亲子
家居
军事航空

艺术要闻

奇瑞上海总部大楼的“伤疤”火了,号称空中社区!

数码要闻

延迟大降8ns!微星新增BIOS高效模式:标准内存跑出顶级ULL性能

亲子要闻

敖润姑姑给咕咕嘎嘎制作机器狗

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

特朗普称哈马斯将全面解除武装

无障碍浏览 进入关怀版