网易首页 > 网易号 > 正文 申请入驻

你的相机型号,正在悄悄告诉AI你拍的是什么

0
分享至


你有没有想过这样一个问题:如果给一张猫的照片换个JPEG压缩质量,AI还能认出这是猫吗?

按理说应该没问题。压缩质量这种东西,跟照片里是猫是狗有什么关系?可2025年一群研究者做了个实验,结果让人后背发凉:当他们故意让每个类别都用固定的JPEG压缩参数处理图片时,训练出来的AI模型,识别准确率会跟着这种"伪装的压缩规律"疯狂波动。换句话说,模型压根没在好好看猫和狗的区别,它在偷偷记压缩参数这个"小抄"。

这篇来自捷克技术大学和大阪大学的论文,标题就叫《Invisible Shortcuts: Why Vision Encoders Know Your Camera》,直译是"看不见的捷径:为什么视觉编码器知道你用的什么相机"。它揭开了一个大家都没太当回事的秘密:现在几乎所有主流的视觉AI模型,从CLIP到DINOv2,都在悄悄记忆图片的"身世信息",包括你用什么相机拍的、光圈多大、JPEG压缩质量是多少、有没有被锐化处理过。这些信息肉眼完全看不出来,但AI的神经网络里全都留着痕迹。

先搞清楚,"走捷径"到底是个什么老问题

深度学习圈子里有个说法,叫"shortcut learning"

**捷径学习**:指AI模型在训练时,会不由自主地依赖那些和目标"恰好相关"但其实没有因果关系的线索,来偷懒完成任务,而不是学习真正有意义的特征。

举个大家比较熟悉的例子。之前有研究发现,AI识别"奶牛"这个类别时,很大程度上是在识别"绿色草地背景",因为训练集里的奶牛照片大多是在草地上拍的。你要是把奶牛P到沙滩上,模型立马就懵了。这类偏见叫做背景关联偏见,此外还有纹理偏见(模型更看重物体的纹理而不是形状)、颜色标签偏见,甚至有论文发现LAION数据集里,纸箱子的照片经常带水印,导致模型学会了把水印和"纸箱子"这个概念绑在一起。

这些偏见有个共同点:它们都是人眼能看出来的。你看那张奶牛照片,会觉得"哦这背景是草地";你看那个纸箱子图,也能一眼发现水印。可这篇论文关注的是另一类完全不一样的东西,它们连人眼都看不见。

**处理参数(processing attributes)**:指图片在数字化处理过程中留下的痕迹,比如JPEG压缩质量、色度采样方式、锐化强度、缩放比例、插值算法类型。这些参数不会改变照片"看起来"是什么,但会在像素层面留下极其细微的统计规律。

**采集参数(acquisition attributes)**:指拍照时相机本身决定的物理参数,比如相机品牌型号、曝光时间、光圈大小、ISO感光度、焦距。这些同样是肉眼无法从照片内容判断出来的信息。

你可能会说,这些参数这么隐蔽,AI真的会去学吗?论文的答案是:会,而且学得相当起劲。

问题出在哪:数据集里藏着"隐形的默契"

要理解这件事为什么会发生,得先想明白一个更底层的问题:为什么处理参数和照片内容会扯上关系?

答案其实很朴素。想象你是个摄影师,拍足球比赛的时候大概率会用长焦镜头,因为球员离得远;拍婚礼的时候光圈往往开得比较大,为了营造背景虚化的浪漫感;拍鸟类的时候快门速度得非常快,不然鸟一动就糊了。这些习惯是人类摄影师约定俗成的经验,压根不是巧合。

论文里专门去验证了这件事。他们从Re-LAION-2B(一个几十亿规模的图文数据集)里挑出了带Exif标签(也就是拍摄参数记录)的4000万张图片,然后用主题建模的方法把配文聚成6238个主题类别。结果发现,"足球"相关主题的照片,焦距分布明显偏长;"婚礼"和"眼镜"这两个主题的光圈分布截然不同;"鸟类"和"厨房"这两个主题的曝光时间分布也差异很大。

这就是问题的根源所在:语义内容(照片里是什么)和拍摄/处理参数(怎么拍的、怎么处理的)之间,存在着系统性的、可预测的关联。

而深度学习模型的训练目标非常直白,就是想尽办法把训练集上的误差降到最低。如果它发现"只要看JPEG压缩参数就能大概率蒙对图片类别",它才不会管这是不是"投机取巧",它会毫不犹豫地把这条捷径学下来。

这就好比一个学生准备考试,发现某个老师出的选择题里,凡是选项C特别长的,正确答案有八成概率就是C。这个学生完全可以不看题目内容,只数选项长度就能拿到不错的分数。如果不这样"投机",他得老老实实把每道题的知识点都学透,那样准确率不见得更高,还费劲得多。可一旦考试换了个出题人,这套"数长度"的把戏立刻失灵,甚至比瞎蒙还惨,因为他把本该花在学知识上的精力,全砸在了记忆这种伪规律上。

模型也是一样的逻辑。这篇论文要证明的核心观点就是:视觉编码器对元数据的敏感性,根本不是什么随机的副作用或者训练噪音,而是模型在大规模语义监督(无论是ImageNet那种打标签的方式,还是LAION那种配文字说明的方式)下,主动学出来的一条捷径。

用Cramér's V量出"默契"的强弱

光凭直觉说"数据里有关联"是不够的,研究者们需要一把尺子来量化这种关联到底有多强。他们用的工具叫Cramér's V

**Cramér's V**:一种统计学指标,专门用来衡量两个分类变量之间的关联强度,取值范围是0到1,数值越大说明两个变量的关联越紧密,0表示完全独立,1表示完全对应。

他们拿JPEG压缩的质量和色度采样这两个参数组合出一个"元数据标签",然后去看这个标签和ImageNet的语义类别之间关联强不强。结果是:在ImageNet1k(1000个类别)里,这个数值是0.047;而在ImageNet21k(21000个类别,类别粒度更细)里,这个数值涨到了0.067。

这两个数字本身看着都很小,但研究者说了,重点不在绝对值大小,而在相对比较:ImageNet21k里的关联,明显比ImageNet1k更强。原因也不难猜,类别分得越细,每个类别里包含的图片往往来源越集中(比如同一批人上传的、同一个网站爬的),处理方式自然更趋同,关联性也就水涨船高。

那么,这种关联强度的差异,会不会真的影响模型的行为?论文用了几个诊断指标去检验,其中最关键的两个是"元数据预测能力"(Metadata Prediction,简称MP)和"语义预测干扰度"(Semantic Prediction Distraction,简称SPD)。

**元数据预测能力(MP)**:训练一个简单的线性分类器,去看模型提取的图像特征里,能不能预测出这张图用了什么JPEG质量、什么相机型号之类的元数据标签。如果预测准确率远高于瞎猜的概率,说明模型的特征里确实藏着这些元数据信息。

**语义预测干扰度(SPD)**:用来衡量元数据信息会不会干扰模型判断图片的语义内容。具体做法是刻意操控参与对比的图片的元数据标签,看模型的判断结果会不会因为元数据的变化而摇摆,摇摆得越厉害,说明模型越依赖元数据这个"捷径",而不是真正理解图片内容。

研究者拿了ConvNeXt、FlexiViT、Swin、ViT这四种主流架构,分别用ImageNet1k和ImageNet21k训练出来的公开模型做对比测试。结果一致地显示:在ImageNet21k上训练的模型,元数据预测准确率更高,语义预测干扰度也更大。这说明,关联性更强的数据集,训练出来的模型确实更容易学会这条捷径,而且这条捷径确实在干扰模型正常判断图片内容的能力。

亲手调节"默契强度",看模型反应

光靠观察现成数据集里天然存在的关联还不够有说服力,因为可能有别的因素在同时起作用。研究者干脆自己动手,人为制造出强度可控的关联,这样就能排除干扰,单独验证"关联强度"这一个变量对模型的影响。

具体做法是这样的:他们定义了22种不同的JPEG压缩标签(11档质量乘以2种色度采样方式),然后给ImageNet1k里的每个类别随机分配一个专属的压缩标签。接着引入一个概率参数叫pi

**pi参数**:控制每张图片是否"遵守"它所属类别的专属压缩标签的概率。当pi等于100时,某个类别下几乎所有图片都会用同一种压缩方式处理,关联性达到最大;当pi等于0时,压缩方式完全随机分配,和类别毫无关系。研究发现,Cramér's V的数值大致就等于pi的百分比数值,比如pi等于10时对应关联强度约0.1,pi等于80时对应约0.8。

用ResNet50在这些不同pi值处理过的ImageNet1k版本上训练,结果非常清晰:随着pi增大,模型预测JPEG标签的准确率明显上升,而且不只是JPEG标签,连缩放比例、相机品牌、光圈大小这些完全没有被人为操控过的元数据,模型预测它们的能力也跟着变强了。

这个发现相当耐人寻味。模型学的不是"JPEG压缩参数"这一个具体的捷径,它学到的其实是一种更广泛的能力:从像素里挖掘各种低级信号的本事。就像一个学生一旦养成了"猜题技巧"的习惯,他不会只在数学考试里猜,语文英语考试他也会下意识地去找规律偷懒。

与此同时,模型的语义识别准确率(也就是真正认出图片内容的能力)在关联强度较低时几乎没有下降,但当pi超过某个阈值后,开始明显下滑。这说明弱关联不太会伤筋动骨,但强关联会实实在在地把模型的注意力从"这是什么"抢到"这是怎么拍的"上面去,导致模型在正常测试集上的表现变差。

更有意思的是,研究者还专门测试了用同一套压缩规律处理过的"变形测试集"。也就是说,测试图片也按照训练时同样的类别对应压缩规律来处理。这时候模型的准确率反而随着pi增大而上升。这恰恰印证了模型确实在利用压缩参数这个捷径,因为测试集延续了训练集的"作弊线索",模型自然能继续蒙对。可一旦换成正常没有人为处理过的测试图片,这套本事立刻失灵。

这就好比前面提到的那个靠数选项长度蒙题的学生,如果下次考试的老师换了一个完全不同的出题习惯,这个学生的应试技巧瞬间报废,而那些真正学会知识的同学,成绩几乎不受影响。

换个数据集,同样的剧本重演

如果只在ImageNet这一种数据集上发现这个现象,未免有点单薄。研究者干脆把战场搬到了规模大得多、性质也完全不同的LAION数据集上,去验证这个规律是不是具有普遍性。

LAION用的是配文字说明的方式做监督,不像ImageNet那样打死板的类别标签。为了给每张图片确定一个"语义标签",研究者用了一种叫BERTopic的主题建模技术

**BERTopic**:一种文本主题聚类方法,先用句子编码器把每段文字(这里是图片的配文)转换成向量,再通过降维和聚类算法,把相似主题的文字自动归到一起,形成离散的"主题类别"。这篇论文用它把Re-LAION-2B的配文聚成了6238个主题,充当语义标签的角色。

有了主题标签之后,研究者构造了三个规模相同(各640万张图片)但关联强度不同的子数据集:一个是"baseline",按照数据集里原本自然存在的分布随机取样;一个是"stronger",特意把每种元数据标签集中到最常出现的40个主题里,人为加强关联;还有一个是"weaker",反过来把每种元数据标签下的主题分布拉平,削弱关联。

用ResNet50配合CLIP损失函数(也就是训练CLIP模型时用的对比学习方式),分别在这三个子集上从头训练。结果和ImageNet上的实验遥相呼应:在stronger子集上训练出来的模型,语义预测干扰度明显更高,语义识别本身的准确率也最低;在weaker子集上训练的模型则恰恰相反,语义识别能力最强,受元数据干扰也最小。

这说明什么呢?说明这个"捷径学习"现象不是ImageNet这种打标签方式独有的怪癖,而是只要存在大规模的语义监督信号,不管是类别标签还是自然语言描述,只要数据里的元数据和语义之间存在关联,模型就会本能地去利用这种关联。这是一种更底层、更普遍的学习偏好,跟具体用什么架构、什么损失函数关系都不大。

补救方法一:训练时多做点"伪装训练"

发现问题只是第一步,怎么解决才是重头戏。论文给出了两条思路,一条是在训练阶段就下手,另一条是对已经训练好的现成模型做"术后修复"。

第一条思路的灵感来自一个观察:DINOv2这个自监督模型,之前被发现是对元数据最不敏感的基础模型之一。DINOv2用了一整套很激进的数据增强手段,包括色彩抖动、灰度转换、高斯模糊。研究者猜测,正是这些增强手段"顺带"把元数据的痕迹给抹掉了。

于是他们做了个消融实验:用ResNet50在原始ImageNet1k上训练,默认用的是RandomAugment这种常见的增强策略,然后分别去掉或加上一些具体的增强手段,看模型对元数据的敏感度怎么变化。

结果显示,去掉RandomAugment里任何一项增强手段,模型对元数据的敏感度普遍会上升。而单独加上高斯模糊,能明显削弱模型对处理类元数据(比如JPEG压缩、缩放)的敏感度,但对采集类元数据(比如相机型号)影响不大。最厉害的组合是同时加上色彩抖动、模糊和灰度转换,这三样一起用,能大幅度降低模型对两类元数据的敏感度,而且几乎不影响模型本身的语义识别准确率。

这个结果解释了为什么DINOv2天生就不太容易被元数据带偏,它用的增强组合,恰好把大部分能泄露元数据信息的像素级细节给"洗掉"了。

这就好比你想让一个学生别再靠猜选项长度蒙题,最直接的办法就是把所有选项都打乱成统一的长度和格式,让"选项长度"这个作弊线索彻底失效。如果不做这种"格式统一化"处理,学生总能找到蛛丝马迹去钻空子;一旦把这些表面线索抹平,他就只能老老实实去理解题目本身了。

补救方法二:给现成模型做"术后对抗训练"

可问题是,像CLIP、DINOv2这些已经训练好并且被广泛使用的基础模型,你总不能把它们推倒重来吧?这时候就需要第二条思路:post-hoc(事后)的补救手段。

研究者设计了一个对抗式的修复流程。给定一个已经训练好、参数完全冻结的模型,先额外加一个线性变换层f,专门负责把原始特征空间"扭一扭",目标是让元数据信息变得更难被提取出来。同时训练另一个线性分类器h,专门尝试从被扭过的特征里预测元数据标签。

**对抗训练(adversarial training)**:一种"你追我赶"式的训练方式。这里h拼命想从特征里认出元数据标签,而f拼命想把特征扭成让h认不出来的样子,两者交替训练,最终目标是让f学会一种"隐藏元数据痕迹"的变换方式。

具体的训练目标由三部分组成:第一部分要求变换后的特征f(x)尽量贴近原始特征x,避免把语义信息也一起破坏掉;第二部分要求带有相同元数据标签的两张图片,变换后的特征要被推得尽量远,从而打散元数据造成的聚集效应;第三部分要求分类器h对元数据标签的预测结果趋近于完全随机(也就是最大化预测的不确定性)。这两步交替进行,重复十轮。

这套流程只用JPEG压缩参数作为监督信号来训练,结果拿去测试各种其他类型的元数据(比如缩放、相机型号、光圈),发现敏感度同样大幅下降了。也就是说,你只教它"忘记JPEG的事",它顺带把缩放、相机型号这些完全没教过的东西也一起忘了。而且,模型原本的语义识别能力基本没受影响,有些情况下甚至还略有提升。

论文特别强调了一点,这个发现跟此前一篇研究刚好相反。之前有工作发现,如果单独去修复某一种偏见(比如去掉了背景关联偏见),反而会让模型对其他类型的偏见更敏感,出现"按下葫芦浮起瓢"的情况。但这篇论文里,元数据敏感性的修复呈现出了一种正向的泛化效果,修一个漏洞,顺带把好几个类似的漏洞也堵上了。这说明模型学到的可能不是针对某个具体属性的专门捷径,而是一种更笼统的"依赖低级像素信号"的习惯,一旦这种整体习惯被纠正,各个具体表现自然也跟着改善。

这有点像戒烟。有人可能觉得,戒了香烟会不会转而更依赖咖啡因来提神。可实际情况往往是,一旦一个人真正养成了不靠外部刺激物来调节状态的习惯,他对咖啡因、对熬夜、对各种"来一口就轻松"的替代品的依赖也会一起减弱。因为改变的不是某个具体的坏习惯,而是整个应对压力的底层模式。

敏感性也不全是坏事:它成了识别AI生成图片的利器

讲到这里,你可能觉得这个"元数据敏感性"就是个纯粹该被修复的毛病。但论文接下来抛出了一个挺反直觉的转折。

之前有研究发现,直接用CLIP这种模型冻结不动、什么都不改,拿它提取的特征做一个简单的最近邻分类器,就能相当有效地分辨一张图片到底是真实拍摄的,还是Stable Diffusion这类AI模型生成出来的。这个结果一直让人有点摸不着头脑,CLIP明明是为了理解图片"内容"而设计的,怎么反倒擅长干"鉴别真伪"这种活?

论文给出的解释是:这恰恰是元数据敏感性的功劳。CLIP这类模型因为在训练中学会了捕捉像素层面的低级信号(也就是我们前面说的那些"捷径"),而AI生成的图片和真实相机拍摄的图片,在像素层面的统计特征上天然就存在差异,毕竟一个经历过物理成像和真实压缩流程,另一个完全是算法凭空画出来的。模型越擅长捕捉这些低级痕迹,自然也就越擅长把两类图片区分开。

为了验证这个猜想,研究者直接用了之前那批在不同pi值(也就是不同JPEG关联强度)下训练出来的ResNet50模型,去做一个生成图片检测的实验,测试集里包含ProGAN、CycleGAN、StyleGAN等各种生成模型产出的图片,还有Deepfake以及Stable Diffusion生成的图片。

结果相当清楚:在原始ImageNet上训练的模型,平均检测准确率是57.3%;用pi等于50训练出来的模型,涨到59.0%;用pi等于100训练出来的模型,涨到60.4%。也就是说,模型对元数据的关联记得越牢,它反而越擅长揪出AI生成的假图片。

这个发现让整件事变得立体起来。元数据敏感性对语义泛化能力来说是个负担,因为它会分散模型对真正内容的注意力;但对图像取证这类需要捕捉像素级细节差异的任务来说,它反而成了一种优势能力。这不是简单的好坏二分,而是同一个特性在不同任务场景下扮演了完全相反的角色。

顺带一提,研究者还专门测了一下,AI生成的图片本身到底带不带元数据痕迹。他们用Stable Diffusion给ImageNet的各个类别生成对应的图片,并且统一用固定的高质量JPEG参数压缩这些生成图,理论上讲,既然生成图片压根没经过什么真实的相机采集和处理流程,元数据痕迹应该被抹得干干净净才对。可实验结果却是,在这批合成图片上训练出来的模型,依然表现出和真实ImageNet相近的元数据预测能力。这说明生成模型可能在训练过程中,无意间"模仿"了它自己训练数据里那些像素级的采集和处理特征,把这种隐形的"签名"也一并复刻了出来。这就好比一个模仿名画的赝品画家,虽然完全不知道原画作者用的是什么牌子的颜料,但因为长期临摹同一批画作,笔触习惯不知不觉就带上了原作者的影子。

深挖到网络内部,看捷径藏在哪一层

论文还做了一个挺细致的分析,去看这种元数据信息到底是在神经网络的哪一层被"记住"的。他们拿ResNet50的五个残差模块(block)逐层做测试,分别测试原始IN1k训练的模型、加了额外增强手段训练的模型,以及用强关联(pi等于100)训练的模型。

结果发现,所有模型在前两个模块之后,就已经能相当准确地预测出元数据标签了,毕竟元数据这种低级信号,本来就容易被网络的浅层捕捉到,这也符合以往对卷积网络分层特征的一般认知(浅层学边缘纹理这类低级特征,深层学抽象语义)。

真正有意思的分歧出现在第三个模块之后。原始IN1k训练的模型,从这里往后,元数据预测能力开始逐渐下降,说明这个正常训练出来的模型,学会了在深层网络里主动"遗忘"低级的元数据信息,把计算资源腾出来专注于提取语义特征。而用强关联数据训练出来的模型,元数据预测能力却在深层网络里持续攀升,这个模型学不会"放手",它始终紧紧抓着元数据这条捷径不撒手,语义特征的提取反而被挤到了次要位置。

用了有效增强手段训练的模型,整体的元数据预测准确率明显更低,进一步印证了增强手段的修复效果。

还有一个细节值得单独说一说:那个用强JPEG关联训练出来的模型,虽然从来没有被特意训练过"缩放"这个属性和语义的关联,但它对缩放元数据的预测能力,同样呈现出浅层学会、深层继续攀升、无法遗忘的模式。这再次证明了,模型学到的不是针对某个具体属性的窄捷径,而是一种笼统的、对低级像素信号的整体依赖倾向。

t-SNE可视化:亲眼看到"混乱"和"修复"

为了让这种抽象的"语义混乱"变得可以被肉眼看见,研究者用了t-SNE

**t-SNE**:一种把高维数据降到二维平面进行可视化的技术,能让相似的数据点在图上聚集得更近,方便人眼直观观察数据的分布结构。

他们挑了ImageNet里的两个类别(比如"书桌"和"台式电脑"),每张图片都用两种不同的JPEG参数各处理一遍,然后把ResNet50提取出来的特征画在二维平面上。

在原始IN1k训练出来的模型上,两个类别的点基本能分得清清楚楚,而两种JPEG参数处理出来的点则混杂在一起,这正是我们希望看到的理想状态:模型看的是"这是书桌还是电脑",而不在乎"这张图用了哪种压缩方式"。

但在用pi等于80、pi等于100训练出来的模型上,画风完全变了。两个类别的点开始混在一起,反倒是两种不同JPEG参数处理出来的点,被清晰地分成了两团,尤其是pi等于100的极端情况下,几乎完全没法用类别把点区分开,但用JPEG参数却能几乎完美地把点分成两簇。这幅图非常直观地证明了:模型的"认知重心"已经彻底从"这是什么"偏移到了"这是怎么处理的"上面。

而经过前面说的那种对抗式后处理修复之后,即便是在pi等于100这种最极端的情况下,两个语义类别之间的区分度也重新变好了。这幅"修复前后对比图"某种意义上比任何数字表格都更有说服力,它让你直接看到了一个模型是怎么从"沉迷捷径"被拉回到"专注本职"的。

修复之后,模型在陌生环境里反而更能打

最后一个问题是:修复元数据敏感性,除了让模型看起来更"干净"之外,到底对实际应用有没有真金白银的好处?

答案是有的,而且体现在一个特别关键的场景:分布外泛化(out-of-distribution generalization)。

**分布外泛化能力**:指模型面对和训练数据风格、来源、拍摄条件完全不同的新数据时,依然能保持较好表现的能力。这是衡量一个模型是不是真的"学懂了"而不是"死记硬背"训练集特征的重要标准。

研究者用了三个经典的分布外测试集来检验这一点:ImageNet-C(各种图像损坏和噪声干扰)、ImageNet-R(艺术风格化渲染的图片)、ImageNet-Sketch(素描风格图片)。他们对比了CLIP、ConvNeXt、SigLIP、ViT等一批基础模型,在做过前面说的那种post-hoc对抗式修复前后的表现差异。

结果是,修复之后的表现在很多情况下有明显提升,而且提升幅度最大的正是那些原本对元数据最敏感的模型(比如各类对比学习的视觉语言模型和监督训练的ConvNeXt),对于本来就不太敏感的DINOv2这类模型,修复带来的收益就比较有限,有时甚至略有下降。

同样的趋势在训练阶段做增强修复的ResNet50上也得到了印证:ImageNet-C的准确率从44.2%提升到45.0%,ImageNet-R从34.5%提升到37.7%,ImageNet-Sketch从26.4%提升到30.0%。

这个结果把整篇论文的逻辑闭环给补齐了。既然元数据敏感性本质上是一种"投机取巧"的捷径依赖,那么当测试环境和训练环境的元数据分布不一样时(比如换了一批用不同相机拍的、经过不同压缩处理的照片),这条捷径自然就会失灵,模型表现随之下滑。而一旦你把这条捷径的依赖度降下来,模型被迫更多地依靠真正的语义特征做判断,在陌生环境里反而更稳。

这就像那个靠猜题技巧应试的学生,一旦被逼着重新学会真正理解知识点,虽然短期内在"熟悉的老师出的题"上可能进步不明显,但一旦换了个完全陌生的老师、陌生的出题风格,他的表现反而会比那些还在死抠旧套路的同学更稳健。如果不做这种"戒断训练",他会一直在舒适区里表现良好,直到某次真正的陌生考试把老底彻底露出来。

Q&A

Q1:什么是元数据敏感性,为什么视觉AI模型会有这个问题?

A:元数据敏感性指的是AI模型的特征表示里悄悄记住了图片的拍摄和处理参数(比如JPEG压缩质量、相机型号、光圈大小),而不只是图片内容本身。这是因为大规模训练数据里,图片的语义类别和这些参数之间天然存在统计关联(比如足球比赛的照片往往用长焦镜头拍摄),模型为了降低训练误差,会本能地把这种关联当成一条捷径来利用。

Q2:这种元数据敏感性能被修复吗,修复之后会不会损害模型原本的识别能力?

A:可以修复,论文提出了两种方法。一种是在训练时使用色彩抖动、模糊、灰度转换组合的数据增强手段;另一种是对已经训练好的模型加一个对抗训练的线性修复层。两种方法都能显著降低模型对元数据的敏感度,而且修复效果会泛化到没有专门训练过的其他元数据类型上,同时模型原本的语义识别准确率基本不受影响,甚至有时还略有提升。

Q3:元数据敏感性只有坏处吗?

A:不完全是。研究发现,对元数据关联越敏感的模型,反而越擅长分辨一张图片是真实拍摄的还是AI生成的,因为这种敏感性本质上反映了模型捕捉像素级低层信号的能力,而这恰恰是区分真实图片和生成图片的关键线索。这也解释了为什么CLIP这类模型在生成图片检测任务上表现出人意料地好。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
朱同志怒斥胖局长:你的肚子应该小一点!

朱同志怒斥胖局长:你的肚子应该小一点!

仕道
2026-08-14 12:21:03
杨毅:董路老师已经把我拉黑了 节目上面逗两句是节目没想到他当真了

杨毅:董路老师已经把我拉黑了 节目上面逗两句是节目没想到他当真了

818体育
2026-08-14 18:24:52
中方:这个人一贯攻击抹黑中国,曾亲自带武装部队抓扣中国公民

中方:这个人一贯攻击抹黑中国,曾亲自带武装部队抓扣中国公民

新浪财经
2026-08-15 00:45:13
美军收到紧急命令,特朗普没打垮伊朗,反让中国抓到最好的时机

美军收到紧急命令,特朗普没打垮伊朗,反让中国抓到最好的时机

空天力量
2026-08-14 17:13:24
你要说郭德纲改歌词是无心之失都能理解,但要说他带着任务,估计没人会信

你要说郭德纲改歌词是无心之失都能理解,但要说他带着任务,估计没人会信

老张侃诗词
2026-08-13 16:27:44
103比55大胜48分!男篮亚洲杯斩获开门红:张懿赵杰轰20分5板4助

103比55大胜48分!男篮亚洲杯斩获开门红:张懿赵杰轰20分5板4助

篮球快餐车
2026-08-14 15:05:05
伊朗战争竟带火韩国机场!仁川2026上半年国际客流全球第一

伊朗战争竟带火韩国机场!仁川2026上半年国际客流全球第一

摸鱼算法
2026-08-13 22:07:16
两追蜂人取走树上马蜂窝,村民四天后干活时被“杀人蜂”蜇伤死亡 两人被判赔81万

两追蜂人取走树上马蜂窝,村民四天后干活时被“杀人蜂”蜇伤死亡 两人被判赔81万

红星新闻
2026-08-14 20:09:26
上海土地续期新规落地,网友直言:这笔账可能比房产税更狠

上海土地续期新规落地,网友直言:这笔账可能比房产税更狠

爆角追踪
2026-08-14 08:02:00
重磅官宣!芬威集团16.5亿镑出售利物浦3成股份 全球第3富豪将控股

重磅官宣!芬威集团16.5亿镑出售利物浦3成股份 全球第3富豪将控股

我爱英超
2026-08-15 01:19:05
上映10天票房仅7705元!动画片《牛来》质量粗糙到全网惊呆,这不是牛来是胡来

上映10天票房仅7705元!动画片《牛来》质量粗糙到全网惊呆,这不是牛来是胡来

露珠聊影视
2026-08-14 16:43:08
8月14日,人社部关于2026年调整退休人员养老金通知公布了吗?

8月14日,人社部关于2026年调整退休人员养老金通知公布了吗?

小彬说事
2026-08-14 11:21:38
285万的房、3个被撤的学位、9年官司:一对兄弟的互相毁灭

285万的房、3个被撤的学位、9年官司:一对兄弟的互相毁灭

法师今天失业了吗
2026-08-13 17:31:46
21岁女主播让男网友白睡7天,想要收他2300元,2015年他杀死女主播

21岁女主播让男网友白睡7天,想要收他2300元,2015年他杀死女主播

汉史趣闻
2026-08-14 14:48:30
奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

轻扬墨雨
2026-08-14 13:21:23
14日凌晨大满贯:2比3世界第一出局!陈熠逆转东道主

14日凌晨大满贯:2比3世界第一出局!陈熠逆转东道主

漫川舟船
2026-08-14 11:05:49
著名学前教育学者、华东师范大学教授刘晓东因病逝世

著名学前教育学者、华东师范大学教授刘晓东因病逝世

澎湃新闻
2026-08-14 10:04:26
杨坤估计后槽牙都快咬碎了!他怎么也没想到,郭德纲改编红歌这事,能把自己也搭进去

杨坤估计后槽牙都快咬碎了!他怎么也没想到,郭德纲改编红歌这事,能把自己也搭进去

火山詩话
2026-08-13 17:00:11
普京首登南千岛群岛,日本急了

普京首登南千岛群岛,日本急了

环球网资讯
2026-08-14 07:04:10
稀土还没搞明白,中国又抓住新命脉,西方罕见认栽,这次纯怨自己

稀土还没搞明白,中国又抓住新命脉,西方罕见认栽,这次纯怨自己

浯江孤舟
2026-08-14 13:00:50
2026-08-15 04:24:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9535文章数 568关注度
往期回顾 全部

科技要闻

苹果为中国训练自有大模型,阿里提供支持

头条要闻

"龙餐馆"原型餐厅合伙人:美军聚餐经常吃一半集体起立

头条要闻

"龙餐馆"原型餐厅合伙人:美军聚餐经常吃一半集体起立

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

便利蜂加盟遭立案:“0元加盟”生意被查

汽车要闻

红旗“家”年华现场:这一次,智能科技成了主角

态度原创

时尚
健康
亲子
房产
军事航空

夏天裙子千万别买重复,看看这几款条纹裙,舒适高级又有个性

专家解答青少年脊柱侧弯七大问题

亲子要闻

醒悟吧!养育没有标准答案~

房产要闻

金茂、招商,海南多个岗位招人!

军事要闻

特朗普下令美海军弃用电磁弹射系统 改回蒸汽弹射

无障碍浏览 进入关怀版