网易首页 > 网易号 > 正文 申请入驻

遮挡关键区域,准确率从83.8掉到36.5

0
分享至

一道图形规律题,模型反复数绿色扇区、检查角度关系、来回修改假设,生成了15177个token,最后还是给了个错误答案。它不是没看图,是看着看着,把图看丢了。

这正是多模态推理里一个被反复绕开的问题:当模型进入较长的语言推理链之后,后面的推理到底还有没有视觉证据在支撑?还是说,图只在开头被"扫"了一眼,剩下的全靠文本链条自己往下猜?


美国埃默里大学的研究团队提出了一个叫 Decompose, Look, and Reason(DLR) 的方法,被 EMNLP 2026 主会接收。它的思路很朴素:让视觉语言模型像人一样,在复杂问题里不断重复三个动作——先拆解问题,再针对当前子问题"看"图,最后基于刚拿到的视觉证据推理。

视觉信息是怎么被稀释的

视觉语言模型已经能在视觉问答、数学图表理解、跨学科多模态任务里跑出很长的推理链。但和纯文本推理不同,多模态推理要在离散的语言序列和高维连续的视觉表示之间反复交互。

问题就出在这个"反复"上。已有方法大致走了三条路,每条都留了缺口。

  • 第一类把视觉信息压缩成文本描述,然后主要在语言空间里继续推理,信息损失不可避免。
  • 第二类在中间步骤引入图像patch、bounding box、crop、zoom或外部视觉工具,能增强显式grounding,但带来额外工具调用成本,还受预定义操作空间限制。
  • 第三类把中间视觉信息投影到连续嵌入空间,但现有方法常依赖局部ROI或patch,或者只在整条推理链里注入一次视觉latent。

论文指出,局部ROI并不总能和"当前推理步骤真正需要的语义证据"对上。它可能包含太多无关上下文,也可能覆盖不了跨区域关系、全局布局或抽象视觉概念。而多步推理往往要求模型在不同阶段检查不同证据,单次视觉注入撑不起完整的推理轨迹。

拆解、看、推理,循环起来

DLR把一个复杂视觉推理过程表示成由多个中间步骤组成的轨迹。第t步包含文本premise、连续视觉latent,以及基于该视觉证据生成的rationale,最终得到答案。核心是把"提出需要验证的问题"和"从图像中提取对应证据"显式耦合起来。

三个动作各管一段:

  • Decompose:模型根据当前推理上下文,决定下一步需要确认什么视觉事实,生成一个明确的premise或子问题。它回答的是"接下来需要验证什么"。
  • Look:visual grounder以premise结束位置的hidden state为条件,对图像特征执行cross-attention,输出一组连续视觉latent。和固定ROI或单一patch不同,这些latent可以编码局部细节、跨区域关系以及非局部视觉语义。
  • Reason:模型在注入视觉latent后生成当前步骤的rationale,并据此继续下一轮拆解,直到得出最终答案。

这样一来,视觉证据不再是推理开始时的一次性输入,而成了整条推理轨迹里可以动态更新的条件。从概率建模角度看,文本生成策略和视觉latent策略被共同纳入推理过程:更准确的文本拆解为visual grounder提供更明确的条件,更具任务相关性的视觉latent又反过来改善后续rationale,两者形成相互依赖的联合优化。

三阶段训练,把强化学习推进隐空间

第一阶段冻结预训练VLM主干,只训练轻量的visual grounder。模型用一组可学习的latent queries对图像特征做条件化提取,并通过双向InfoNCE对比学习,让聚合后的visual latent与目标答案的文本语义对齐。这一步的作用是建立稳定的跨模态初始化。

第二阶段通过监督微调学习结构化的DLR轨迹。训练样本显式包含premise、vis_thought、rationale与answer等结构。模型学习何时提出新的视觉premise,visual grounder则根据premise hidden state生成连续latent,并通过后续rationale与答案的语言建模损失获得梯度。这一步能让模型内化DLR格式,但latent提取仍主要是确定性的特征提取,缺乏显式探索。

第三阶段把强化学习从离散文本token扩展到连续视觉latent。标准GRPO可以直接优化文本token的离散策略,但对连续latent缺少天然的token级概率分布。DLR因此构造了一个可以显式计算策略密度与importance ratio的视觉latent policy,与文本policy联合优化。

这里有个细节值得注意。视觉-语言表示通常用cosine similarity衡量语义相似性,语义信息更多编码在向量方向而非模长里。论文据此把视觉表示视为近似位于unit hypersphere上的语义流形,提出Spherical Gaussian Latent Policy(SGLP):visual grounder先预测L2-normalized的mean direction,在其附近加入高斯扰动,再把采样结果重新投影回unit hypersphere。这样探索的重点落在语义方向上,减少把语义变化和模长变化混在一起的风险。

四个基准上的成绩单

实验以Qwen3-VL-8B-Thinking为backbone,覆盖四个以视觉为中心的benchmark:V* Bench考细粒度属性与空间关系,MathVista考视觉数学推理,MMMU-Pro考跨学科多模态推理,MMStar考综合多模态能力。为保证比较公平,ICoT、LVR与PixelReasoner等开源方法都适配到同一个backbone上。

DLR在V*、MathVista、MMMU-Pro和MMStar上分别达到83.8、82.7、63.5和76.2。相较backbone,对应提升为+4.2、+3.5、+2.6和+3.9个百分点。在MathVista上,DLR相比LVR从77.3提升到82.7。论文把这一优势归因于多步premise-conditioned visual grounding:数学视觉推理往往需要模型反复检查图表、几何关系或局部细节,在多步过程中累积证据,而不是依赖一次性latent表示。

消融实验里最扎眼的一项是latent policy objective。移除J latent后,MathVista从82.7掉到57.1,V*也从83.8降到81.5。这说明仅靠SFT学习确定性的视觉表示,难以充分发挥隐空间推理能力,显式的连续latent探索是这个框架的重要组成部分。

遮挡实验:它到底在看哪里

论文在V*Bench上做了定量faithfulness分析。随机遮挡同等数量区域时,准确率从83.8降到77.7;而遮挡DLR attention最高的区域时,准确率降到36.5,下降47.3个百分点。

这个干预结果为visual grounder识别区域与模型预测之间的功能相关性提供了定量证据,而不只是"看起来合理"的可视化。

案例研究进一步说明了weak visual grounding可能导致的overthinking。前面提到的图形规律题里,baseline反复尝试计数绿色扇区、检查角度关系和行列规律,多次修改假设,生成15177个token后仍给出错误答案。DLR则先明确需要验证"绿色扇区的相对位置规律",再根据这个premise获取视觉latent,据此生成有依据的rationale。

另一个主色判断案例中,baseline受大面积蓝色壁画的显著性影响,把房间主色判断为蓝色;DLR的分步grounding综合了墙壁、桌椅与整体布局,最终判断白色为主色。论文展示的cross-attention热力图会随premise改变关注区域,这和"每一步重新获取任务相关视觉证据"的设计是一致的。

把视觉grounding显式嵌入多步推理轨迹,在相同backbone下能稳定改善多类视觉推理任务。这是DLR给出的主要结论,也是它被EMNLP 2026主会接收的原因。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
76球!梅西是任意球破门第一人,也是最后一位任意球大神?

76球!梅西是任意球破门第一人,也是最后一位任意球大神?

林子说事
2026-09-28 14:24:10
台选举突变!78岁洪秀柱重出江湖,创党元老倒戈,沈伯洋出面救场

台选举突变!78岁洪秀柱重出江湖,创党元老倒戈,沈伯洋出面救场

梦史
2026-09-29 09:16:00
王楚钦的时代落幕?0金3银收官,赛后发言太扎心:我守住了半区

王楚钦的时代落幕?0金3银收官,赛后发言太扎心:我守住了半区

旧史新谭
2026-09-29 11:06:25
俄罗斯已经做好了最坏打算!

俄罗斯已经做好了最坏打算!

安安说
2026-09-29 09:57:47
狂飙!亚运会第9日奖牌榜出炉,中国队单日13金更进一步,比日韩加起来的2倍还多

狂飙!亚运会第9日奖牌榜出炉,中国队单日13金更进一步,比日韩加起来的2倍还多

球盲百小易
2026-09-29 00:46:28
“12岁后就怀孕的女孩很多”,她们纷纷练起拳击

“12岁后就怀孕的女孩很多”,她们纷纷练起拳击

中国新闻周刊
2026-09-29 07:26:19
小猪:德国已不是顶级球队;唯一能送出关键球的人就是基米希

小猪:德国已不是顶级球队;唯一能送出关键球的人就是基米希

懂球帝
2026-09-28 17:52:08
50岁当奶奶!卡梅隆·布尔儿媳早产10周,3磅男婴住进NICU

50岁当奶奶!卡梅隆·布尔儿媳早产10周,3磅男婴住进NICU

热搜摘要官
2026-09-28 11:05:09
大家都猜错了!知名投资人曝刘欢真正死因,8月他在餐厅状态不错

大家都猜错了!知名投资人曝刘欢真正死因,8月他在餐厅状态不错

小鱼爱鱼乐
2026-09-29 11:25:35
“嘌呤”不读 piāo líng,不要再读错了,我出过丑

“嘌呤”不读 piāo líng,不要再读错了,我出过丑

语丝纪
2026-09-14 16:07:19
泰国羽毛球女神B瓶药检仍阳性,辩称误用美容制剂,将会提起上诉

泰国羽毛球女神B瓶药检仍阳性,辩称误用美容制剂,将会提起上诉

杨华评论
2026-09-28 19:16:03
王励勤没想到,莎莎和大头的接连落败,竟让刘国梁口碑暴涨,开始怀念他了?

王励勤没想到,莎莎和大头的接连落败,竟让刘国梁口碑暴涨,开始怀念他了?

乒乓助手
2026-07-24 01:36:03
当年为什么查办褚时健?

当年为什么查办褚时健?

百晓生谈历史
2025-08-20 21:55:53
金庸给了她最仙的名字,却让她受尽屈辱,最终嫁给一个泼皮无赖

金庸给了她最仙的名字,却让她受尽屈辱,最终嫁给一个泼皮无赖

耳东文史
2026-09-29 00:01:42
想睡年纪大的女人,一定要知道这4种信号,基本不会翻车

想睡年纪大的女人,一定要知道这4种信号,基本不会翻车

来去自如的小章
2026-09-27 18:31:53
从82跌到25只用了7天,沈鼓集团暴跌70%,我还能回本吗?

从82跌到25只用了7天,沈鼓集团暴跌70%,我还能回本吗?

财经智多星
2026-09-29 11:31:25
夺命洪流退去之后:葬礼用草人代替找不到的遗体,“这是一场由我们自己制造的灾难”

夺命洪流退去之后:葬礼用草人代替找不到的遗体,“这是一场由我们自己制造的灾难”

澎湃新闻
2026-09-29 10:06:13
A股:大家要做好心理预期,股市很可能再次经历24年历史!

A股:大家要做好心理预期,股市很可能再次经历24年历史!

财经大拿
2026-09-29 07:10:17
严子怡第一投70.46米锁定金牌,为何放弃后续试投?

严子怡第一投70.46米锁定金牌,为何放弃后续试投?

林子说事
2026-09-29 01:44:47
男子炒股10年倾家荡产,如今妻子病重急需用钱,打开电脑后他傻眼

男子炒股10年倾家荡产,如今妻子病重急需用钱,打开电脑后他傻眼

罪案洞察者
2025-09-02 11:30:12
2026-09-29 12:47:00
爬虫饲养员
爬虫饲养员
业余养了只叫“龙虾”的AI爬虫,主业是给互联网打工。
183文章数 81关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

少年在大兴安岭迷山8天走出瘦20斤 父亲的一句话救命

头条要闻

少年在大兴安岭迷山8天走出瘦20斤 父亲的一句话救命

体育要闻

王楚钦回应:找不回以前打球的感觉

娱乐要闻

刘欢离世48小时 李湘一个举动口碑暴涨

财经要闻

伊朗找到了美债的七寸

汽车要闻

四驱+城市NOA 长城大狗HEV混动版上市 10.59万元起

态度原创

游戏
手机
本地
健康
公开课

《给他爱5》Switch移植项目走向终点 团队宣布关闭

手机要闻

摩托罗拉宽折叠机型Moto Book 60 Fold曝光 详细规格流出

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

洗脸越勤,痘痘反而越多?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版