![]()
据404 Media报道,亚马逊正在大规模收购珍稀书籍,切除书脊后进行扫描,以获取用于训练AI模型的数据。该媒体通过在一本珍稀书籍中植入追踪装置,最终确认书籍被送至亚马逊位于拉斯维加斯的一处设施。
这处设施代号为VGT3,其标志是一只爪子抓着书本的恐龙图案。亚马逊在回应404 Media的声明中表示,公司"通过商业渠道购买书籍,以改进客户所使用的产品和服务"。
亚马逊等科技公司在训练大语言模型时,需要消耗海量文本数据。目前,互联网上的可用内容已基本被挖掘殆尽——Anthropic甚至曾因非法使用盗版书籍而陷入法律纠纷。相比之下,珍稀书籍,尤其是已绝版或在互联网上几乎找不到的古籍,成为了训练数据的全新来源。
这类文本之所以备受青睐,原因在于其高度的"纯净性"——2022年之前出版的书籍,不可能出现任何由大语言模型生成的内容。当大语言模型大量摄入AI生成的文本时,可能引发"模型坍塌"现象,即因过度吸收AI生成内容而导致输出质量持续退化。
Q&A
Q1:亚马逊收购珍稀书籍用于AI训练,具体是怎么操作的?
A:亚马逊通过商业渠道大量购入珍稀书籍,随后在其代号为VGT3的设施(位于拉斯维加斯)中切除书脊并进行扫描,将书籍内容转化为文本数据,用于训练大语言模型。这一行为由404 Media通过在书中植入追踪装置的方式得以证实。
Q2:为什么珍稀书籍对大语言模型训练特别有价值?
A:珍稀书籍,特别是已绝版或未在互联网上数字化的古籍,提供了一批全新的训练数据来源。更重要的是,2022年以前出版的书籍完全不含AI生成内容,有效规避了"模型坍塌"的风险——这种现象是指大语言模型因摄入过多AI生成文本而导致输出质量退化。
Q3:什么是"模型坍塌"?它对大语言模型有什么危害?
A:"模型坍塌"是指大语言模型在训练过程中大量吸收AI生成的文本后,其输出质量逐渐下降的现象。由于AI生成内容本身已经是模型输出的产物,反复用于训练会引入偏差并放大错误,最终导致模型性能退化。因此,使用确认为人类创作的文本(如珍稀书籍)进行训练,被视为维护模型质量的重要手段。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.