![]()
围绕人工智能训练数据来源的问题持续引发讨论,其中一些AI企业获取书籍资源用于模型训练的方式,也成为外界关注的焦点。
公开资料显示,Anthropic曾购买大量纸质书籍,并通过拆除装订、扫描页面的方式,将纸质内容转换为数字数据,用于内部研究和人工智能模型训练。
![]()
这一做法引发争议的原因在于,部分纸质书籍经过扫描后被处理掉,外界担忧一些小众出版物和难以获取的书籍可能因此减少实体保存数量。
![]()
一些业内人士认为,随着公开网络数据逐渐被大量使用,AI企业需要寻找更多高质量数据来源,而书籍成为重要选择之一。
![]()
但如何处理这些知识载体,也成为新的社会问题,尤其是在数字化保存和传统纸质保存之间,仍然存在不同观点。
![]()
![]()
法院认为,Anthropic合法购买纸质书籍,并将其转换为数字形式用于训练人工智能模型的行为,在特定情况下可以属于美国版权法中的合理使用范围。
不过,法院并没有认定所有AI训练行为都不存在版权问题,而是区分了合法购买书籍与未经授权获取盗版资料之间的区别。
![]()
这一判决意味着,AI企业利用合法来源获得的数据进行研究,可能受到合理使用原则保护,但版权边界仍然需要进一步明确。
目前,围绕人工智能训练数据的争议,并不仅限于书籍是否被销毁,而是涉及版权、知识保存、数据来源以及技术发展的长期影响。
![]()
人工智能需要大量优质数据推动进步,而社会也需要确保重要知识资源得到合理保存,这两者并非完全对立。
![]()
未来,随着AI技术持续发展,企业、法律机构和社会公众仍需要共同探索更加透明、规范的数据使用方式,让技术创新与知识传承能够同步推进。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.