网易首页 > 网易号 > 正文 申请入驻

当CLIP认错人的时候,你的AI助手在瞎猜答案

0
分享至


你有没有遇到过这种情况:把一张老照片给人看,对方一脸茫然地说"这是谁啊",而你明明记得这个人的样子,只是照片拍得年代久远、角度奇怪、光线也不对。

人脑很擅长处理这种情况,透过表面的视觉差异,认出同一个"人"或者同一个"东西"。但一个专门做图文检索的AI系统,可能就没那么聪明了。

这就是这篇论文要讲的故事。故事的主角是一类叫做知识型视觉问答的任务,主角遇到的麻烦,恰恰就是"认人"这件事。

先说说这个任务到底是什么。假设你拍了一张照片,问AI"这栋建筑现在归谁所有",AI光看图片是答不出来的,因为这需要额外的百科知识。这时候系统会去一个庞大的知识库里,比如维基百科,找一张长得像的图片,把对应的文字资料抓出来,再让AI读资料后回答问题。

这个"找长得像的图片"的步骤,就是整个流程里最脆弱的环节。

问题出在哪里

几乎所有做这件事的系统,用的都是一种叫CLIP的技术。

CLIP*:一种能把图片和文字都映射到同一个数学空间里的模型,通过比较图片和图片、或图片和文字在这个空间里的"距离",判断它们是不是描述同一个东西。

CLIP的强项是分辨"这张图里有没有一只猫""这是不是一片森林"这类视觉层面的相似性。但知识型问答要解决的问题完全不是这个层次。论文举了个特别直观的例子:一张酒店的照片,CLIP在维基百科图库里找相似图片时,排在前面的结果全是"看起来像"这家酒店的建筑,包括某个博物馆、某个别的度假村,真正对的那家酒店反而排到后面去了,因为不同年代拍的照片风格差异太大。系统最后从错误资料里读到了错误的酒店所有者信息,答案自然就错了。

这揪出了一个很本质的矛盾:视觉上看起来像,不代表它们说的是同一件事。反过来也一样,同一栋建筑十年前和现在拍的照片,视觉上可能天差地别,但它们指向的是同一个知识实体。

打个比方,这就像你去菜市场找"那种圆圆的绿色蔬菜",如果只按照外形去找,你可能会把苦瓜和黄瓜搞混,因为它们从远处看确实有点像。但如果你问的是"哪种蔬菜叫苦瓜",答案是唯一确定的,跟它长得像不像别的东西没关系。CLIP干的事情更接近前者:按外形归类,而知识型问答真正需要的是后者:认准这个具体的实体身份。如果继续用CLIP去做这件事,检索环节永远会有一批看着像但其实答非所问的候选资料混进来,后面无论多强的语言模型来读资料,都是在错误的地基上盖楼。

在这篇论文之前,学界的应对办法基本是在CLIP外面打补丁,比如做多阶段检索、让另一个模型去重新排序候选结果、或者对问题做各种改写增强。这些办法确实能带来提升,但检索这一步产出的候选池,本质上还是CLIP给的,天花板没有被打破。

这篇论文选择了一条不一样的路:既然CLIP的表示方式先天就不适合这个任务,那就换一种模型来做检索。

用大模型直接当检索器

论文提出的方法叫KBMR,它做的第一件事,是不再用CLIP那种"图片塔加文字塔各自独立编码再对比"的双塔结构,而是直接找一个多模态大语言模型来干检索的活。

MLLM*:多模态大语言模型,能同时理解图片和文字,通常由一个视觉编码器、一个连接层和一个语言模型主体组成,具备类似ChatGPT那样的连续推理和生成能力。

为什么大模型更适合干这件事?因为CLIP在训练时的目标,本质上是学会"这段文字描述的是不是这张图",它学到的更多是场景、物体类别这类比较粗的语义。而大模型经过大量指令数据训练之后,具备一种更细腻的理解能力,它不仅知道"这是一只鸟",还能顺着上下文琢磨"这只鸟具体是哪个物种,跟另一张照片里的鸟是不是同一种"。

具体的做法其实挺巧妙。研究者给大模型一句提示语,类似"用一个词总结上面这张图片",然后不去看大模型真正说出来的那个词,而是截取它在生成这个词之前,内部产生的最后一个隐藏状态,把这个隐藏状态直接当成这张图片的"数字指纹",拿去做相似度比较。

这一步的设计思路值得琢磨。大模型的强项在于它处理信息时是层层递进、带着上下文推理的,如果只看它最终吐出来的文字,反而丢掉了这个推理过程里积累的丰富信息。而抓取生成前一刻的隐藏状态,相当于把大模型"脑子里正在想的东西"直接拿出来用,比等它把话说完再去分析文字本身,信息量要大得多。这跟你让一个专家口头总结一件复杂的事,总结出来的三五个字肯定比他脑子里真实掌握的内容要少得多。如果只依赖那三五个字去做后续判断,会漏掉大量细节,而直接看专家脑子里此刻活跃的那些神经信号,虽然听起来有点科幻,但确实保留了更完整的判断依据。

不过,光是换个模型来编码图片,还不足以让检索变准。真正的难点在训练数据上。

训练数据的噪音困境

维基百科规模的知识库里,正样本(也就是"这确实是同一个实体"的图文配对)相对好找,但要训练出一个能分辨细微差异的检索器,还需要大量高质量的负样本,也就是那些"看起来像但其实不是"的干扰项。

这里就出现了一个新麻烦:怎么判断一个候选样本到底是不是"看起来像但其实不是"?靠人工标注,维基百科规模的数据量根本标不完;靠简单规则,又抓不住那种视觉相似度极高、但实体身份完全不同的边界案例。

论文给出的解法,是再请一个大模型来当裁判,论文管它叫语义判别器。

语义判别器*:一个专门用来判断"查询图片"和"候选图片"是否指向同一个实体的辅助大模型,它不直接输出检索结果,而是给每一对图片打一个连续的置信度分数。

这个判别器的工作方式很直接:给它一段提示,问"这两张图说的是同一个实体吗,回答是或否",然后不看它最终回答的文字,而是看它在说"是"和"说"否"这两个词时,模型内部计算出的原始概率倾向哪个更强。这两个倾向经过一个数学变换后,会变成一个0到1之间的分数,分数越接近1,说明这两张图越可能是同一个实体,越接近0,说明越不像。

这里有个细节特别关键:判别器给出的不是简单的"是/否"二元判断,而是一个连续的分数。这个设计背后的用意,是承认现实世界的相似程度本来就是一个渐变的谱系,不是非黑即白。有的候选样本跟目标实体的关系是"完全不相关",有的是"视觉上极其相似但确实是另一个东西",还有的是"部分特征相关,但主体不同"。如果强行把这些情况都压缩成0和1两个标签,训练信号里损失的信息就太多了。

论文用一组数据验证了这个判别器确实靠谱:他们专门做了一个测试,拿一万对"确实是同一实体"的图片和一万对"确实不是同一实体"的图片,分别用CLIP的相似度分数和判别器的置信度分数去区分这两类,结果判别器的区分能力(用AUC衡量,数值越接近1说明区分能力越强)达到0.91,而CLIP只有0.79。这个差距不小,说明CLIP的相似度分数里混杂了大量"长得像但不是一回事"的噪音,而判别器确实抓住了更接近实体真实身份的信号。

有了这个判别器,接下来要解决的是怎么挑出真正有训练价值的负样本。

挑负样本也要讲究方法

如果负样本选得太随便,比如随手从知识库里抓一批完全不相关的图片,模型很快就能学会分辨它们,但这种"容易的负样本"训练不出真正的辨别力,因为现实中检索器真正会犯错的地方,恰恰是那些容易混淆的边界情况。

论文的做法分了三步。第一步,先用普通的CLIP做一轮粗筛,把跟查询图片视觉上最相似的前50张候选图挑出来,形成一个"潜在负样本池",这一步的意图很朴素:既然CLIP的弱点就是容易把视觉相似但实体不同的东西搞混,那正好可以拿这个弱点来批量制造高质量的干扰项。

第二步,用前面说的判别器,给这个池子里的每一张候选图都打分,判断它跟查询图片是不是同一实体。如果分数太高,接近于查询图片和它真正的正样本之间的分数,那说明这个候选图其实语义上也非常相关,硬把它当负样本训练反而会误导模型,这类样本会被过滤掉。

第三步,为了保证保留下来的负样本"难度"分布均匀,研究者按判别器给出的分数把候选样本分成四个难度档次,每个档次随机抽两个,凑成一个固定数量的负样本集合。

这个分层抽样的设计其实是在防止一种偷懒的倾向:如果只挑分数最高的那几个负样本,训练会变得极度不稳定,模型很容易在这些极端案例上过拟合;但如果负样本难度参差不齐、覆盖各个梯度,模型能学到的是一种更连续、更细腻的判断能力,就像练习乒乓球发球,如果教练每次都发最难接的球,学员练不出基本功,还容易受挫放弃,但如果球路难度从易到难都覆盖到,学员反而能建立起完整的应对体系。这就是为什么论文特意设计了分层采样,而不是简单粗暴地只挑"最像"的那几个候选。

数据构建好了,接下来就是怎么用这批数据去训练检索器本身。

用软监督替代硬标签

传统的对比学习训练方式很直接:一个正样本,剩下所有候选全当负样本,一视同仁地推远。

对比学习*:一种常见的模型训练思路,让模型学会把相关的样本在表示空间里拉近,把不相关的样本推远。

论文认为这套思路在知识型检索里是有缺陷的。原因还是回到前面说的那个核心矛盾:负样本之间的"错误程度"其实是不一样的,有的负样本几乎完全不相关,有的负样本却带着相当高的语义关联度,如果统一按"完全错误"处理,模型学到的区分度会显得很粗糙。

于是论文把训练问题重新表述成一个分布对齐问题。检索器自己会根据当前学到的相似度,给候选集合里每个样本算出一个概率分布,这个分布代表检索器"当下的判断"。同时,判别器给出的那些连续置信度分数,也可以经过归一化变成另一个概率分布,代表一个更接近真实语义关系的"标准答案分布"。

训练的目标,就是让检索器自己的判断分布,逐渐向判别器给出的标准答案分布靠近,具体用的是一种叫KL散度的数学工具来衡量两个分布之间的差异,并且是双向计算,既让检索器往判别器那边靠,也防止检索器学得过于极端死板。

KL散度*:一种衡量两个概率分布之间差异程度的数学指标,数值越小说明两个分布越接近。

这个设计换个角度想,其实很像老师批改一份主观题,不是简单打对错,而是给出一个"这道题答对了百分之几"的评分,学生如果照着这个细致的评分去调整答案,学到的东西会比单纯知道"对"或"错"丰富得多。如果只告诉学生对错,学生下次遇到类似但不完全相同的题目,很可能还是没有判断力,因为他没学到"为什么对""错在哪个程度"这层信息。这正是论文选择用连续分布蒸馏,而不是传统二元标签硬训练的根本原因。

方法讲完了,接下来看看这套流程实际跑起来效果怎么样。

数据说话

论文在三个知名的知识型问答测试集上做了检验,分别是E-VQA、InfoSeek和OK-VQA。

先看检索本身的表现,也就是"系统能不能在候选池里把正确资料排到前面"这个能力,用的指标叫Recall@1,指第一个检索结果就命中正确答案的比例。

在E-VQA这个数据集上,表现最强的CLIP系模型(EVA-CLIP-8B)Recall@1是13.3%,而论文提出的KBMR用LLaVA-OneVision这个大模型做底座,达到了24.7%,差距超过11个百分点。在InfoSeek数据集上,最强CLIP模型是45.6%,KBMR做到了60.3%,差距接近15个百分点。

这里有个特别值得说的现象:论文也尝试直接拿现成的大模型(没有经过论文提出的训练方法)去做检索,结果发现这些"裸"大模型的检索效果反而普遍不如CLIP。这说明光换个模型架构是不够的,真正起作用的是那套用判别器生成软监督、再做分布蒸馏训练的完整流程。这也印证了前面那个判断:大模型确实有更强的语义理解潜力,但这个潜力需要经过针对性的训练才能真正释放到检索任务上。

再看下游任务的效果。检索准不准,最终要看它有没有真正帮到问答系统给出正确答案。论文把KBMR接入了好几套现有的知识型问答系统,包括EchoSight、ReflectiVA、MMKB-RAG和OMGM,只替换掉这些系统原本的检索环节,其他部分保持不动。

结果显示,几乎所有系统接入KBMR之后都有明显提升。以EchoSight带重排序的版本为例,在E-VQA上的准确率从41.8%提升到51.0%,提升了9.2个百分点;在InfoSeek上从31.3%提升到39.2%,提升7.9个百分点。OMGM系统在E-VQA上从50.2%提升到54.7%,最终跑出了当时最好的成绩。在OK-VQA数据集上,KBMR配合LLaVA-OneVision把最终问答分数拉到79.3分,比原来的OMGM系统高出12.7分。

这组数字背后的意义值得多说一句:一个只改进了检索环节的模块,居然能给多个不同架构、不同设计思路的下游系统都带来实打实的提升,说明检索确实是整条流程里被低估的瓶颈。之前学界把大量精力花在后面的重排序、过滤、推理这些环节上,某种程度上是在给一个地基不稳的房子加固上层结构。

论文还专门做了一系列细节实验,来验证每个设计决策是不是真的有必要。比如他们对比了不同的负样本挑选方式:完全随机挑选、用CLIP相似度挑选、用判别器挑选,配合硬标签或者软标签训练,一共测了六种组合。结果显示,只有同时用判别器挑负样本、又用判别器给出的连续分数做训练目标的那个组合,效果才是最好的,单独换负样本挑选方式或者单独换标签形式,提升都有限。这说明这套方法真正的价值在于"挑对负样本"和"给出细腻监督信号"两件事要配合着做,缺一不可。

论文也测了如果故意把判别器给出的分数搞乱(比如把30%的样本分数人为颠倒),效果会怎样,结果是明显变差,甚至比全用硬标签还差。这从反面证明了判别器给出的软标签信号本身是真实有效的,不是随便加个噪音就能凑效果。

另外几个小实验也挺有意思:负样本数量从4个增加到8个,效果持续提升,但从8个加到10个就基本没变化了,说明8个左右是一个性价比比较高的选择;控制标签平滑程度的一个参数(论文里叫语义锐度系数),调到1.1时效果最好,调得太小标签会变得跟硬标签差不多失去软监督的意义,调得太大又会让不同候选之间的区分度被抹平。

最后论文还放了一个具体的检索案例:一张犀鸟属鸟类的照片,CLIP检索出来的前五个结果里,混进了好几种视觉上相似但完全不同的鸟类,真正对的那个物种排到了第五位;而KBMR直接把正确的物种排在第一位,后面几个候选结果也都是分类学上相近的鸟类,检索出来的整体候选池语义上更加连贯。这个例子直观地体现了整篇论文想解决的核心问题:视觉相似度和真实的语义身份,本来就不是一回事,而这套方法确实缩小了两者之间的鸿沟。

写在后面

读这篇论文的过程中,一个念头一直在脑子里转:检索这个环节,在过去很长一段时间里,好像被当成了一个"配角"来对待。大家更愿意在生成答案的那个大模型身上下功夫,觉得只要生成端够聪明,就能弥补前面检索不准的问题。这篇论文其实在提醒一件事:如果地基本身就搭错了方向,后面盖多高的楼都会歪。

还有一个细节我觉得挺值得单独说说:判别器的AUC是0.91,CLIP是0.79,这个差距看起来不算特别夸张,但放到实际检索场景里,它意味着在那些"看起来最像但其实不是"的高难度候选样本堆里,判别器能多识别出接近两成的真正错误配对。而这恰恰是整条检索流程最容易翻车的地方,越相似的候选,越容易被误判为正确答案,一旦误判,后面的整个问答链条就建立在错误的知识资料上。这个环节的可靠性提升,杠杆效应比想象中要大。

论文里也留了一个没完全说透的问题:这套判别器本身依赖另一个大模型的理解能力,如果换一个理解能力更弱的模型来当裁判,整条训练流程的质量会打几折?论文确实做了对比,换成参数量更小的InternVL3-8B效果会下降,换成更大的InternVL3-14B又能补回来一些,但没有再往更极端的方向去探索这个边界在哪里。裁判的水平决定了整个训练数据的质量上限,这件事本身,或许值得单独拿出来做一篇论文。

Q&A

Q1:KBMR是什么?

A:KBMR是一种专门为知识型视觉问答任务设计的检索方法,它用多模态大语言模型代替传统CLIP做图片检索,能更好地识别同一实体在不同视觉表现下的语义一致性,从而找到真正相关的知识资料。

Q2:为什么CLIP在知识型问答检索里表现不好?

A:因为CLIP主要学习的是视觉层面的相似性,而知识型问答需要的是识别同一实体的能力。同一个实体在不同年代、角度拍摄下视觉差异可能很大,而不同实体也可能长得很像,这种情况下CLIP容易检索出看起来像但语义不对的资料。

Q3:KBMR相比传统方法能带来多大的提升?

A:在检索准确率上,KBMR在InfoSeek数据集上比最强CLIP模型提升了近15个百分点的Recall@1;接入多个现有问答系统后,最终问答准确率普遍提升了7到9个百分点,在OK-VQA上甚至提升了12.7分。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
9月17日深夜,美军跑路!美国见死不救盟友,伊朗叛军被无情抛弃

9月17日深夜,美军跑路!美国见死不救盟友,伊朗叛军被无情抛弃

青青衫书生
2026-09-18 18:13:36
“给你钱,让我搞一下”:29岁女子独自骑马到新疆,被一个70岁大爷性骚扰,摸了她两次大腿

“给你钱,让我搞一下”:29岁女子独自骑马到新疆,被一个70岁大爷性骚扰,摸了她两次大腿

江山挥笔
2026-09-13 11:03:46
翘臀爆乳全没了!《电锯糖心》续作女主遭大砍

翘臀爆乳全没了!《电锯糖心》续作女主遭大砍

游民星空
2026-09-17 19:10:34
田曦薇走新车发布像走T台!一句“跟穿衣服一样”夸爆车身比例

田曦薇走新车发布像走T台!一句“跟穿衣服一样”夸爆车身比例

喜欢历史的阿繁
2026-09-18 12:00:19
影视飓风Tim反掰iPhone Duo致闪屏,称并未用力,苹果回应:博主单台设备测评片面

影视飓风Tim反掰iPhone Duo致闪屏,称并未用力,苹果回应:博主单台设备测评片面

齐鲁壹点
2026-09-17 17:02:26
31岁精神科医生离职送外卖,曾是医学博士,也做驻唱,她说:做真实的自己,看看生活还有多少种可能

31岁精神科医生离职送外卖,曾是医学博士,也做驻唱,她说:做真实的自己,看看生活还有多少种可能

都市快报橙柿互动
2026-09-18 20:18:57
男篮速递!郭士强不会主动请辞,崔永熙承认打不过,胡明轩深夜发声

男篮速递!郭士强不会主动请辞,崔永熙承认打不过,胡明轩深夜发声

多特体育说
2026-09-19 00:09:29
沙特胡塞冲突之际,美官员被爆密会胡塞武装高层

沙特胡塞冲突之际,美官员被爆密会胡塞武装高层

环球网资讯
2026-09-18 06:54:14
拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

旧窗老街
2026-02-23 01:50:19
伊朗取得史诗级战果:美军损失超过50架战机!美军官方认证!

伊朗取得史诗级战果:美军损失超过50架战机!美军官方认证!

一个坏土豆
2026-09-17 21:09:34
亚马尔:若我有姆巴佩的速度,可能会领先其他球员好几个光年

亚马尔:若我有姆巴佩的速度,可能会领先其他球员好几个光年

懂球帝
2026-09-19 08:47:10
Shams:联盟准备先敲定拉斯维加斯老板人选,再推进西雅图

Shams:联盟准备先敲定拉斯维加斯老板人选,再推进西雅图

懂球帝
2026-09-19 08:27:11
《兰香如故》她智救二姐,替姐出嫁成侯府主母,结局击杀翠雀为夫报仇

《兰香如故》她智救二姐,替姐出嫁成侯府主母,结局击杀翠雀为夫报仇

露珠聊影视
2026-09-18 16:30:31
替补登场就能盘活进攻!蓉城手握尖刀,为何总压在板凳席?

替补登场就能盘活进攻!蓉城手握尖刀,为何总压在板凳席?

砚底沉香
2026-09-19 02:20:35
《交锋》直到马憩辞职引出朱应甲见面,才知,林看山出逃、李凤歌被抓,都是魏广进计划中的一部分

《交锋》直到马憩辞职引出朱应甲见面,才知,林看山出逃、李凤歌被抓,都是魏广进计划中的一部分

小七追剧站
2026-09-18 23:42:30
难怪不起诉联盟了!爆料记者:应接不暇,鲍尔默可能面临牢狱之灾

难怪不起诉联盟了!爆料记者:应接不暇,鲍尔默可能面临牢狱之灾

你的篮球频道
2026-09-18 10:58:36
特朗普怒斥“台驻美代表处”,赖清德这回麻烦大了,蓝营表态亮了

特朗普怒斥“台驻美代表处”,赖清德这回麻烦大了,蓝营表态亮了

史樍
2026-09-18 05:56:17
叫停防长赴华,总理自己却要来:捷克这盘棋,到底谁在算计谁?

叫停防长赴华,总理自己却要来:捷克这盘棋,到底谁在算计谁?

跌落星空的俯视
2026-09-17 22:55:03
262:159!美投票结果公布,危险消息传回中国,我外交部亮明立场

262:159!美投票结果公布,危险消息传回中国,我外交部亮明立场

史之韵
2026-09-18 14:45:51
震撼?英超8队欧冠+欧联首轮全胜!轰19球丢4球 2场直接对话KO西甲

震撼?英超8队欧冠+欧联首轮全胜!轰19球丢4球 2场直接对话KO西甲

我爱英超
2026-09-18 06:29:05
2026-09-19 09:04:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9891文章数 568关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

牛弹琴:菲律宾南海挑事 在中国人无法忘记的特殊日子

头条要闻

牛弹琴:菲律宾南海挑事 在中国人无法忘记的特殊日子

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

家居
房产
健康
教育
时尚

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

海口房价,降不动了!

脑动脉瘤的治疗方法,该选哪一种?

教育要闻

学校不是“无限责任公司”——给校长的校园安全责任地图与操作清单

裤子不用买贵的,蓝色牛仔裤永远不过时,大方百搭又不挑人

无障碍浏览 进入关怀版