简直太让人气愤了!这就是美国 AI 公司的道德水准?
为了给Claude大模型“喂饭”,Anthropic干的第一件事就让人大跌眼镜:他们砸了数百万美元,在市面上疯狂采购了数百万本纸质实体书。
买回来之后干嘛呢?他们专门雇了一批工人,给这些书执行“切脊解体”——斩掉书脊、裁开每一页、高速扫描成可检索的PDF,然后把所有的纸质原书统统当成垃圾扔掉。
法院在判决书里写下了一句极其冰冷的话:纸质原件被销毁,数字副本取而代之(The print original was destroyed. One replaced the other)。
![]()
但这甚至还不是他们最离谱的操作。
判决显示,Anthropic明明有很多合法买书和授权的渠道,但法官直接在判决里戳穿:
他们更倾向于“盗窃”(preferred to steal them)。
也就是盗版。
因为创始人兼CEO 达里奥觉得,走正规授权太繁琐,盗版能完美避开法律、实务和商业上的各种麻烦。
更绝的是,连联合创始人Ben Mann都亲自下场当“搬运工”了。
2021年初,这位联创亲自下载了著名的盗版数据集Books3,里面包含19.66万本未经授权的版权书。
几个月后,他又从盗版学术资源库LibGen疯狂下载了至少500万本盗版书。
到了2022年,他们又从PiLiMi下载了至少200万本。
短短几年,Anthropic就生生囤了超过700万本盗版书。判决书明确指出,Ben Mann和公司高层心里清清楚楚,这700万本书全是盗版。
后来,内部也有员工提出了顾虑,认为继续用这些盗版书训练模型存在巨大的法律风险。但法院紧接着记录下了堪称名场面的一句话:但无论如何,他们还是把书留下了(It kept them anyway)。
![]()
难道他们没试过找正规授权吗?
也试过。
2024年,Anthropic专门从谷歌挖来了图书扫描项目的前合作负责人,给他的任务极其宏大:
搞到“世界上所有的书”。这位负责人兴冲冲地给几家大型出版商发了邮件探讨AI训练授权,出版商也很有意向,本来完全能谈成合法许可。
结果呢?
Anthropic高层直接强行叫停了谈判。
高层的逻辑极其朴素:跟出版商谈版权太费劲了,不如直接批量买书、拆书、扫描,或者直接下载,省时又省力。
更离谱的是,这些被扫描或下载的书,并不是训练完就删掉了。
Anthropic把它们统统塞进了一个永久保存的“通用中央图书馆”。
当法院要求他们披露相关证据时,法官甚至直接批评Anthropic在披露过程中进行了各种回避和推诿。
不过,整场官司最讽刺的转折来了。
法官在审理后认为:如果一家公司合法购买了实体书,将其一对一转换成数字副本并销毁原书,用于大模型训练,这在法律上是可以被认定为“合理使用”的。
也就是说,Anthropic砸钱买书、拆书、扫描那一套,本来差点让他们蒙混过关。
![]()
他们真正彻底栽掉的,是另外两件事:
第一,明知是盗版网站,依然明知故犯地下载了超过700万本盗版书;
第二,试图建立一个永久私存的数字图书馆供内部随意复制。
判决书里还特别补了一刀:Anthropic后来为了补救,跑去买了一本它此前从网上偷来的实体书,但这种补票行为,根本不能免除之前的盗版责任。
你看,这件事最耐人寻味的地方在于:Anthropic绝不是因为不懂版权规则才去盗版。
他们知道正规授权渠道在哪,知道那些书是盗版,知道法律风险有多大,甚至连谷歌图书的项目大牛都挖过来了。他们纯粹就是觉得——直接动手抢来得快。
以前我们总听这些硅谷巨头大谈特谈“AI安全”和“道德伦理”,现在看明白了:
他们的道德标准似乎只适用于未来的超级AI,至于现在的自己?先把700万本书偷到手再说。
你觉得,为了搞出所谓最聪明的AI,这种“偷书、销毁”的操作能被原谅吗?
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.