生成式AI时代有一个让人不太舒服的问题:当AI生成一张图片时,真的有人能指出是哪几张具体图片影响了它吗?
MIT计算机科学与人工智能实验室(CSAIL)的一项新研究给出了一个可能令人意外的答案——对于足够大的模型来说,答案往往是不能。研究人员Dai和Gifford在发表于《自然·通讯》(Nature Communications)的开放获取论文中,将这一现象称为"归因衰减"(attribution decay)。它指的是:随着数据集规模的扩大,任何单条训练数据的影响都变得越来越难以检测。
![]()
数据集越大,归因越模糊
研究人员想测试的,比"AI模型是否在某张特定图片上训练过"更精确。他们的方法本质上是一种反事实检验:如果删除某条特定的训练数据,会发生什么?
结果发现,随着模型和数据集规模的扩大,删除一张单独的图片,对生成结果几乎不产生可测量的影响。同样的情况也适用于删除某位艺术家的全部作品,或某个人的所有图片。换句话说,模型可能从海量数据池中学到了广泛的视觉模式,但没有任何单张图片能对某个特定输出负明确责任。
MIT研究员Zheng Dai和David Gifford教授认为,如果删除某条特定数据不会改变输出结果,那么将输出归因于被删除的样本,就很难说有什么实际意义。
这并没有解决AI版权之争
需要说明的是,这项研究并不意味着训练数据无关紧要,也没有解决AI公司能否在未经许可的情况下使用受版权保护材料这一更广泛的争议。它的关注点更窄:一张特定的训练图片能否被证明直接影响了某个特定的AI生成输出。
一个模型可能不会复制任何特定艺术家的作品,但仍然依赖数百万张图片来学习构图、光线、纹理和艺术风格等要素。
更有意思的结论是:随着数据集增长,这种关联变得越来越难以追溯。一张AI生成的图片,可能借鉴了海量素材中习得的模式,但背后并没有一个清晰可辨的源头图片。模型可能向所有人学习,但最终没有任何一张图片在最终结果上留下明显的"指纹"。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.