![]()
![]()
大家好,欢迎观看【山海点评】最近,AI行业又曝出一件让人大跌眼镜的事。美国AI公司Anthropic,也就是开发Claude模型的那家,被爆出为了训练大模型,竟然大批量购买纸质书,切掉书脊,高速扫描后直接粉碎销毁。
![]()
这种听起来像是科幻片里的“焚书”行为,引发了轩然大波,甚至连马斯克都看不下去了。
事情要追溯到2021年,Anthropic的联合创始人BenMann为了搭建AI训练的语料库,偷偷从影子图书馆LibGen下载了700多万本盗版书。
这数量,已经不是随便搜几本资料那么简单了。版权方很快注意到了这种行为,似乎也嗅到了些不对劲。
![]()
简单点说,就是买回来拆了扫描,最后直接丢进碎纸机。这家公司甚至花了数千万美元,从各种地方收购了约200万本印刷书,然后切掉书脊、扫描成数据,最后把书变成废纸。
有人会问,那这些书里有没有绝版或者珍稀版本呢?答案是没人知道。目录没公开,粉碎的书似乎也被销毁得干干净净。
![]()
2024年,有一批作家,包括恐怖小说家AndreaBartz,将Anthropic告上法庭,认为他们的行为已经严重侵犯版权。
案件审理期间,法院得出了两种截然不同的结论:一方面,使用书籍训练大模型,因为“有较强的转换性”,被定性为美国版权法中的“合理使用”。
![]()
但另一方面,将盗版书囤成数据仓库的做法,构成了明确的版权侵权。换句话说,用合法的书训练AI可以,但囤盗版就不行。
到了今年7月20日,法院批准了和解协议。Anthropic支付了15亿美元的赔偿金,覆盖了约48万到50万本书的版权问题,平均每本赔了3000美元。
这也是美国版权史,甚至AI行业里最大的赔偿案。据原告律师说,这不仅是笔罚款,更像是对企业利用盗版数据为自己牟利的一次高额“清算”。
![]()
这15亿美元的代价其实非常沉重,甚至相当于Anthropic2025年全年营收的一大部分。虽然这笔钱不会让公司垮掉,但足以让整个行业都感受到压力:版权问题不是小事,多少得收敛一些。
![]()
马斯克的这番表态捅破了一个更大的问题,Anthropic的“焚书式操作”,在AI行业内并不是孤例。据说还有很多AI公司为了训练数据,从二手书市场大量扫货。以前一本书一周可能都卖不出去,现在却成为市场“紧俏货”。
![]()
有人提到,Anthropic的“焚书”行为不仅威胁了公众知识的传播,也变相把大家都能接触的公共资源转化成了公司的私有数据库。这种做法,让数据确实被“保存”了,但书的物理形态,却丢了一去不返。
让人更不安的是,Anthropic本身其实还和军事领域有所关联。2025年,他们与美国国防部签订了一份价值2亿美元的合同,据说Claude模型被用在打击目标识别和战争方案制定上。
![]()
今年2月,美国国防部长要求Anthropic取消系统中有关“禁止完全自主武器”等限制,但遭到了公司CEO的拒绝。巧的是,仅仅两天后,特朗普宣布禁止所有联邦机构使用Claude的技术。
更戏剧性的是,尽管政府要“封杀”这些技术,但在对伊朗的军事行动中,美军却仍旧偷偷使用了Claude的模型。这一点让人再一次感叹:一家公司的拒绝,对国家机器来说,有多少说“不”的空间可言?
这件事背后其实揭露了一个更深层次的问题,技术发展的速度已经远远超过了法律和伦理的限制。Anthropic曾经在军用问题上做了某种程度的抗争,但两年后,却为了数据不惜走上“焚书”之路。
![]()
这种反转不是个别公司的堕落,而是整个行业在资本和生存压力下的必然产物。行业的座右铭,似乎从“不作恶”,变成了“没办法,不这样活不下去”。
那么问题来了,15亿美元的赔偿能否真正限制住AI行业?法律对AI训练开了“合理使用”这口子,未来的边界又该在哪里画?也许,底线只能留在每一个技术从业者的心里。但问题是,它还在吗?
欢迎大家聊聊你的看法,AI的进步值得以此为代价吗?
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.