![]()
你有没有想过,一个AI说它在"用脑子想图片",但其实它压根没在想,只是嘴上说说?
这听起来像个哲学问题,但2026年这篇来自韩国高丽大学和AIGEN Sciences的论文,把它变成了一个可以被实验室验证的科学问题。而验证结果,可能会让不少做多模态AI的研究者坐不住。
多模态大模型:能同时理解图片和文字,并且能根据图片内容回答问题的人工智能系统,比如你上传一张照片问"这只狗在做什么",它能看图回答。
近两年,一个叫"潜在视觉推理"的技术路线火了起来。它的想法很浪漫:既然人思考问题时不会把每一步都说出口,那AI是不是也可以在"心里"悄悄推理,不用把中间过程写成大段文字?于是研究者们纷纷设计各种隐藏状态、潜在视觉token,让模型在内部反复琢磨图片信息,然后再吐出答案。
这个方向听起来很有道理,论文数量也不少。但这篇论文的作者们做了一件挺"扫兴"的事:他们抓了几个当红的潜在视觉推理模型,做了个简单粗暴的测试。
核心问题:AI说的"思考",到底是真思考还是装样子
我们先弄明白,这些潜在视觉推理模型到底是怎么工作的。
潜在状态:模型内部用一串数字向量表示的中间信息,不是人类能直接读懂的文字,而是模型自己内部流转的"思维载体"。
大致流程是这样:模型看到一张图和一个问题,先把图片信息编码进某个隐藏状态里,然后让这个状态经过反复迭代更新,模拟"看图思考"的过程,最后用这个状态生成答案。听起来挺合理,对吧?
但问题来了。论文作者做了个实验,V*视觉问答基准上测试了六个主流的潜在视觉推理方法,把它们精心设计的潜在状态换成了各种"垃圾内容",包括用一张空白图片生成的状态、来自另一个不同答案样本的状态、甚至纯粹是噪声。结果呢?
有个叫UniVLR的方法,不管你怎么折腾它的潜在状态,准确率的变化都不超过0.5个百分点。
这个数字意味着什么?意味着你精心设计的、号称承载着视觉推理精髓的那串向量,换成随机垃圾,模型答案几乎不变。它压根没在用你以为它在用的东西。
这就好比一家饭店挂着"每日新鲜食材现场熬制高汤"的招牌,你偷偷把后厨的高汤锅换成自来水,结果端上桌的汤味道分毫不差。如果高汤真的重要,换了应该立刻能尝出来;换了没区别,说明所谓"现场熬制"从来没真正进入过那道菜的味道来源,招牌是挂着好看的。
那为什么会这样?作者又做了一个互补实验。他们把冻结的预训练视觉语言模型(也就是没做任何潜在推理改造的原版模型)在中间某一层的隐藏状态拆开看:包含图片和问题两部分的完整多模态状态,单独拿出来的问题部分状态,纯文字过一遍模型得到的问题状态,以及纯文字状态硬接上原始视觉特征。
结果发现,完整多模态状态达到75.9%准确率,而单独拿出来的"问题部分状态"是75.4%,几乎一样。但纯文字状态只有35.6%,硬接原始视觉特征也没帮上忙,还是35.6%。
多模态问题状态:模型看过图片之后,问题这部分token所对应的隐藏表示。它虽然只是问题的向量,但因为是在看过图之后生成的,所以已经"吸收"了图片信息。
这说明一个很关键的事实:模型看完图之后,几乎所有关于图片的有用信息,已经悄悄"渗透"进了问题状态里,不需要额外费劲设计一个专门的视觉潜在通道。而如果你想在事后硬把视觉特征拼接回一个没看过图的文字状态,是没用的,因为那不是模型自然形成的理解路径。
这两个发现放在一起,勾勒出一个很扎心的图景:现有的很多潜在视觉推理设计,可能根本没有被模型真正依赖,而模型真正依赖的视觉理解能力,其实早就藏在它看图之后自然产生的问题表示里了。
那怎么办?作者提出的方案:把退路堵死
如果一个模型的潜在推理状态可以被随便替换而不影响结果,说明存在一条"备用通道",模型可以绕过你设计的潜在状态直接拿到答案所需的图片信息。
那解决方案就很直白了:把备用通道彻底切断。
这就是这篇论文提出的CVRR方法的核心思路。
CVRR:全称Causal Visual Recurrent Reasoning,因果视觉循环推理,是这篇论文提出的新方法,它强制要求模型的最终答案必须经过一个循环更新的隐藏状态,其他任何能绕过这个状态直接获取图片信息的路径都被物理删除。
CVRR的设计分成三个关键动作,我们一个个拆开看。
第一步:从"刚看完图"的那个瞬间开始循环
前面说过,模型看完图片之后,问题状态里已经装满了视觉信息。CVRR的第一个决定是:不要从零开始搭建视觉理解,而是直接从这个已经"看过图"的问题状态出发,作为循环推理的起点。
因果视觉读取边界:模型内部哪一层是视觉信息对后续预测还有实质性影响的最后一层,这篇论文用一种叫"激活拼接"的技术手段去定位这个层。
具体做法是,研究者构造了一批成对的样本,两张不同的图片配上同一个问题,但答案不同。然后在模型的每一层,把一个样本的视觉激活值替换成另一个样本的,看这个替换对最终答案概率的影响有多大。如果替换后答案概率变化很大,说明这一层的视觉信息还在起作用;如果变化很小,说明视觉信息的影响已经消退了。
用这个方法在Qwen2.5-VL-7B模型上测试,发现第20层是个关键转折点,从这层往后,视觉信息的下游影响开始持续衰减。所以CVRR选择第21层作为循环推理的起始点。
这就像装修房子要先确定承重墙的位置。你不能随便挑一层楼开始动工,得先搞清楚哪一层还是结构关键、哪一层已经不影响整体承重了,选在那个临界点开始改造,才不会既破坏了原有结构,又浪费了改造的意义。如果选得太早,视觉信息还没充分融入,循环推理相当于从半成品开始;选得太晚,视觉信息已经消散,循环推理无从下手。
第二步:反复"回头看图",而不是只看一次就算了
光有一个好的起点还不够。如果只是把这个起点状态原样传下去,那叫初始化,不叫推理。CVRR让这个状态经历多轮更新,每一轮都重新读取同一份固定的视觉证据。
具体来说,模型复用同一个解码器层(加上一个小小的可训练适配模块LoRA),反复把上一轮的问题状态和固定不变的视觉信息重新组合、送进这一层,产生新的问题状态。这个过程重复若干次(论文里默认是4次)。
LoRA:一种参数高效的模型微调技术,不用改动模型的全部参数,只训练一小部分低秩矩阵,就能让模型适应新任务,这篇论文里CVRR的循环层用的正是LoRA微调,只占模型总参数的0.0348%。
论文里做了个特别直观的实验来验证这个"反复看图"到底有没有用。他们把某个样本的问题状态和另一个样本的视觉证据强行拼在一起,看循环推理会不会被这个"错配"的视觉证据带偏。结果显示,当模型能够访问这个视觉证据的连接通路打开时,干净的视觉证据能把一个原本错误的问题状态拉回正确答案,拉动幅度接近15个百分点;反过来,错误的视觉证据也能把一个原本正确的问题状态带偏,带偏幅度同样接近15个百分点。而一旦把这条连接通路堵住,这两种效应几乎都消失了。
这就像你在解一道数学题,每算一步都要抬头看一眼黑板上的原始条件,而不是凭记忆硬算到底。如果黑板上的条件被人偷偷换掉,你抬头一看就会被带偏;但如果你从头到尾都不看黑板,只凭第一眼的印象往下推,那换掉黑板对你毫无影响,因为你压根没在用它。CVRR的设计恰恰是逼着模型必须不断"抬头看黑板",而且真的被证明是在看。
第三步:决策前,把所有后门焊死
这是最关键、也最狠的一步。在最后一轮循环结束后,CVRR把所有的视觉状态行、以及原始的多模态缓存(也就是模型看图时产生的所有中间计算结果)统统删除。
KV缓存:Transformer模型在生成文字时,为了加速计算会把之前算过的键值对存下来复用,这里指的是模型看图看问题时产生的中间计算结果缓存,如果不删除,模型在生成答案时就能"偷看"这些缓存,绕过循环推理直接拿到图片信息。
删除之后,唯一能带着图片信息进入答案生成环节的,只剩下经过多轮循环打磨过的那个最终状态。这时候,模型如果真的答对了,只能说明它是通过循环推理拿到的视觉信息,没有别的解释。
这一步的意义在于把"应该依赖"变成了"必须依赖"。前文提到那些潜在推理方法之所以能被随便替换潜在状态而不影响结果,正是因为它们没做这一步删除动作,后门一直开着。CVRR做的事情说白了就是把后门焊死,逼着模型走前门。
实验结果:焊死后门之后,模型还能打吗
这是整篇论文最核心的验证问题:把所有备用路径都切断之后,模型的视觉理解能力会不会瞬间崩溃?
答案是不会崩溃,但前提是你得学CVRR这么设计。
论文在四个视觉问答基准上做了测试:V*(专门考验高分辨率图像细节定位能力)、MMVP(考验对视觉相似图片对的区分能力)、BLINK(一个综合性的视觉感知测试集)、以及MME-RealWorld-Lite(真实场景理解测试)。
CVRR在V*上达到81.2%的准确率,MMVP的成对准确率达到52.7%,BLINK总体准确率55.2%。这几个数字本身放在表格里看不出太多情绪,但对比一下同样被"焊死后门"的其他潜在推理方法,差距就出来了。
论文把六个可兼容的潜在推理基线方法,用同样严格的接口重新训练了一遍,也就是保留它们原本设计的推理机制,但同样删除所有备用视觉路径。结果这些方法在V*上最高只能达到39.8%,MMVP成对准确率最高只有2.7%,BLINK最高38.8%。
这个对比意味着什么?意味着"逼着模型走前门"这件事本身不难做到,任何方法都可以做,但如果你的"前门"没有设计好,模型走进去发现里面什么都没有,准确率直接崩到接近随机水平。CVRR能撑住,是因为它的前门起点选对了,是那个已经吸收了视觉信息的多模态问题状态,而不是从零重建的东西。
再换个角度想这个对比。假设你把公司所有员工的私人小道消息渠道全部关掉,只留官方公告栏。如果官方公告栏本来就写得清楚详细,员工照样能正常工作,甚至效率更高,因为信息更规范了。但如果官方公告栏一直是摆设,从没认真更新过内容,一旦把小道消息渠道关掉,公司立刻陷入信息真空,大家什么都不知道该干什么。CVRR的公告栏,也就是循环推理状态,是认真更新过的;那些基线方法的公告栏,可能一直只是摆设。
再往深挖一层,作者还做了一系列拆解实验,想搞清楚CVRR的效果到底是从哪儿来的。
拆解实验:到底哪个部件在起作用
论文设计了一组对照实验,把CVRR的三个核心组件——原生多模态初始化、持续视觉重读、可学习的循环转换——挨个拿掉,看准确率掉多少。
如果把起始状态换成一个没看过图的纯文字问题状态(论文里叫做B,专门构造用来做对照),即便保留视觉重读和训练过的循环转换,V*准确率从81.2%直接跌到37.2%,MMVP成对准确率从52.7%跌到2.0%。这个跌幅和完全没有视觉路径的情况几乎一样。
这说明一个很直白的道理:持续给模型看图,如果模型压根没有一个好的起点去理解这张图,看了也是白看。就像你给一个完全不懂法语的人反复朗读法语新闻,读一百遍他还是听不懂,因为他缺的不是"更多次接触",而是"最初的理解能力"。
反过来,如果保留原生多模态起点和训练过的循环转换,但去掉持续视觉重读这一步(也就是只在开头看一次图,之后就不再看了),V*准确率掉了12.0个百分点,MMVP成对准确率掉了34.7个百分点。这说明单纯有个好起点也不够,循环过程中真的需要不断回头看图,才能持续获得有用信息。
如果保留原生起点和视觉重读,但去掉可学习的循环转换(也就是不训练那个LoRA适配层),准确率也会下降,V*降4.7个百分点,MMVP成对准确率降20.0个百分点。
三个组件缺一不可,这个结论听起来平淡,但背后的意义是CVRR不是靠某个单一的"魔法组件"撑起来的,而是三个设计环环相扣,共同构成了一条真正被模型依赖、同时又不牺牲原有理解能力的路径。
意义追问:这个设计到底在解决什么根本矛盾
读到这里,你可能会问,绕这么一大圈,到底图什么?
图的是把一句"模型看起来在用视觉信息推理"这句话,变成一句能被实验证明的话。
在这之前,很多潜在视觉推理论文的证据链是这样的:我们设计了一个新颖的潜在状态结构,模型用了这个结构之后准确率提升了,所以这个结构里承载着有用的视觉推理。
这篇论文戳破的正是这条证据链里的一个漏洞:准确率提升,可能压根跟你设计的那个结构没关系,模型可能是靠别的备用路径拿到答案的,你设计的那部分只是个摆设,甚至是个累赘却不影响结果的摆设。
这就好比一个学生考试成绩很好,老师归功于自己新编的教材,但从没检验过,如果把教材换成一本完全不相关的书,学生成绩是不是照样很好。如果照样很好,说明学生的好成绩跟这本教材没什么关系,可能靠的是课外补习或者天赋,教材的功劳被高估了。CVRR做的,就是那个被跳过的检验环节。
进一步的因果分析
论文后面还做了几组更细致的因果检验,进一步确认循环推理状态里到底装了什么样的信息。
其中一组实验专门控制问题不变,只改变图片对应的循环状态内容,看是不是真的"图片内容变了,答案跟着变"。结果显示,干净状态下准确率73.3%,替换成另一张图对应的状态之后跌到23.6%到26.7%之间,而替换成一个纯文字的锚点状态反而有50.0%的准确率,比替换成不兼容图片内容的状态还高。这说明预测确实跟着hT(也就是最终循环状态)里携带的图片相关内容走,而不只是因为隐藏状态整体被打乱了才出问题。
另外还有一个挺有意思的发现,是关于循环过程中不同步骤到底在"看图的哪个部分"。研究者把图片切成6x6的区域格子,逐个屏蔽问题状态和某个区域视觉信息的连接,看这个屏蔽对最终答案的影响。结果显示,不同循环步骤里,真正对答案有影响的图片区域是会变化的,相邻两步之间的相似度只有0.37左右。
这说明循环推理不是简单地把同一份视觉信息反复读了四遍,而是随着问题状态的演化,模型每一步关注的图片区域也在变化。这有点像你在拼一幅拼图,第一眼扫的是整体轮廓,第二眼开始盯着某个角落的颜色匹配,第三眼又转去检查另一块的形状对不对,视线焦点一直在动,而不是一直死盯着同一个地方。
后续影响和跨模型验证
这项工作的价值不只体现在Qwen2.5-VL-7B这一个模型上。论文还额外在Gemma-3-4B、Gemma-3-12B、Gemma-4-12B、InternVL-3-9B这几个不同的多模态骨干模型上重复了整套流程,独立定位各自的视觉读取边界,训练同样的严格接口。结果InternVL-3-9B在严格路径下达到75.9%的准确率,和完整多模态路径的75.4%几乎一致,同时对循环内容的破坏表现出57.1个百分点的敏感度下降。Gemma系列模型也表现出类似的模式,只是效果强弱有差异,Gemma-3-4B这个效应偏弱一些。这说明"保留能力同时强制依赖"这个设计思路不是针对某一个模型量身定做的巧合,具备一定的跨架构可迁移性。
论文本身承认了几个局限:视觉读取边界因骨干模型而异,需要针对每个模型重新定位;目前的机制性分析主要基于多选题设置;当前设计依赖的是固定不变的视觉证据,而不是模型主动、自适应获取的视觉信息。这几点也划出了后续研究可以推进的方向,比如怎么让模型在循环过程中动态决定该重新关注图片的哪一部分,而不是被动地反复读取同一份固定内容。
写在后面
读这篇论文最触动我的地方,不是CVRR这个方法本身有多精巧,而是它提出的检验方式:如果你想证明模型真的在用某个内部机制推理,光靠"准确率提升了"这个证据是不够的,你得主动去尝试破坏那个机制,看准确率是不是真的跟着掉。
这个思路其实可以推广到很多其他场景。比如一个人说自己是通过深度思考做出某个决定的,你怎么验证他说的是真的?一个可能的检验方式是,假设换一个完全不同的思考过程,他会不会做出同样的决定。如果会,说明那个"深度思考"可能只是他事后编的一个合理化解释,真正驱动决定的是别的东西,可能是直觉,可能是习惯,可能压根没经过什么深思熟虑。
论文里UniVLR那个例子让我印象很深,换成噪声都只影响0.5个百分点的准确率。这种级别的"无所谓",说明整个学术圈里可能存在不少这种"看起来很讲道理但其实是装样子"的设计,只是没人去认真检验过。这不是说这些方法完全没用,它们的整体准确率数字确实不低,只是它们号称的那个机制,可能压根不是准确率高的真正原因。
这让我想起一个问题,学术研究里有多少"有效但理由错误"的方法,正安静地待在各种论文的实验表格里,从没被真正拆解过。
Q&A
Q1:CVRR是什么?
A:CVRR全称Causal Visual Recurrent Reasoning,是一种让AI必须真正依赖循环推理状态才能回答视觉问题的方法,它删除了所有可能绕过这个状态直接获取图片信息的备用路径,强制模型走"前门"。
Q2:为什么现有的潜在视觉推理模型可能是在自欺欺人?
A:论文测试发现,把这些模型的潜在推理状态换成随机噪声或空白图片对应的状态,准确率几乎不变,比如UniVLR方法变化不超过0.5个百分点,说明模型压根没依赖那个精心设计的状态,而是走了别的路径拿到答案。
Q3:CVRR焊死备用路径后效果会不会变差?
A:不会明显变差。CVRR在V*基准上达到81.2%准确率,MMVP成对准确率52.7%,而其他被同样删除备用路径的方法最高只能达到39.8%和2.7%,说明关键在于循环推理的起点要选对,也就是从已经看过图的问题状态开始。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.