一道图形规律题,模型反复数绿色扇区、检查角度关系、来回修改假设,生成了15177个token,最后还是给了个错误答案。它不是没看图,是看着看着,把图看丢了。
这正是多模态推理里一个被反复绕开的问题:当模型进入较长的语言推理链之后,后面的推理到底还有没有视觉证据在支撑?还是说,图只在开头被"扫"了一眼,剩下的全靠文本链条自己往下猜?
![]()
美国埃默里大学的研究团队提出了一个叫 Decompose, Look, and Reason(DLR) 的方法,被 EMNLP 2026 主会接收。它的思路很朴素:让视觉语言模型像人一样,在复杂问题里不断重复三个动作——先拆解问题,再针对当前子问题"看"图,最后基于刚拿到的视觉证据推理。
视觉信息是怎么被稀释的
视觉语言模型已经能在视觉问答、数学图表理解、跨学科多模态任务里跑出很长的推理链。但和纯文本推理不同,多模态推理要在离散的语言序列和高维连续的视觉表示之间反复交互。
问题就出在这个"反复"上。已有方法大致走了三条路,每条都留了缺口。
- 第一类把视觉信息压缩成文本描述,然后主要在语言空间里继续推理,信息损失不可避免。
- 第二类在中间步骤引入图像patch、bounding box、crop、zoom或外部视觉工具,能增强显式grounding,但带来额外工具调用成本,还受预定义操作空间限制。
- 第三类把中间视觉信息投影到连续嵌入空间,但现有方法常依赖局部ROI或patch,或者只在整条推理链里注入一次视觉latent。
论文指出,局部ROI并不总能和"当前推理步骤真正需要的语义证据"对上。它可能包含太多无关上下文,也可能覆盖不了跨区域关系、全局布局或抽象视觉概念。而多步推理往往要求模型在不同阶段检查不同证据,单次视觉注入撑不起完整的推理轨迹。
拆解、看、推理,循环起来
DLR把一个复杂视觉推理过程表示成由多个中间步骤组成的轨迹。第t步包含文本premise、连续视觉latent,以及基于该视觉证据生成的rationale,最终得到答案。核心是把"提出需要验证的问题"和"从图像中提取对应证据"显式耦合起来。
三个动作各管一段:
- Decompose:模型根据当前推理上下文,决定下一步需要确认什么视觉事实,生成一个明确的premise或子问题。它回答的是"接下来需要验证什么"。
- Look:visual grounder以premise结束位置的hidden state为条件,对图像特征执行cross-attention,输出一组连续视觉latent。和固定ROI或单一patch不同,这些latent可以编码局部细节、跨区域关系以及非局部视觉语义。
- Reason:模型在注入视觉latent后生成当前步骤的rationale,并据此继续下一轮拆解,直到得出最终答案。
这样一来,视觉证据不再是推理开始时的一次性输入,而成了整条推理轨迹里可以动态更新的条件。从概率建模角度看,文本生成策略和视觉latent策略被共同纳入推理过程:更准确的文本拆解为visual grounder提供更明确的条件,更具任务相关性的视觉latent又反过来改善后续rationale,两者形成相互依赖的联合优化。
三阶段训练,把强化学习推进隐空间
第一阶段冻结预训练VLM主干,只训练轻量的visual grounder。模型用一组可学习的latent queries对图像特征做条件化提取,并通过双向InfoNCE对比学习,让聚合后的visual latent与目标答案的文本语义对齐。这一步的作用是建立稳定的跨模态初始化。
第二阶段通过监督微调学习结构化的DLR轨迹。训练样本显式包含premise、vis_thought、rationale与answer等结构。模型学习何时提出新的视觉premise,visual grounder则根据premise hidden state生成连续latent,并通过后续rationale与答案的语言建模损失获得梯度。这一步能让模型内化DLR格式,但latent提取仍主要是确定性的特征提取,缺乏显式探索。
第三阶段把强化学习从离散文本token扩展到连续视觉latent。标准GRPO可以直接优化文本token的离散策略,但对连续latent缺少天然的token级概率分布。DLR因此构造了一个可以显式计算策略密度与importance ratio的视觉latent policy,与文本policy联合优化。
这里有个细节值得注意。视觉-语言表示通常用cosine similarity衡量语义相似性,语义信息更多编码在向量方向而非模长里。论文据此把视觉表示视为近似位于unit hypersphere上的语义流形,提出Spherical Gaussian Latent Policy(SGLP):visual grounder先预测L2-normalized的mean direction,在其附近加入高斯扰动,再把采样结果重新投影回unit hypersphere。这样探索的重点落在语义方向上,减少把语义变化和模长变化混在一起的风险。
四个基准上的成绩单
实验以Qwen3-VL-8B-Thinking为backbone,覆盖四个以视觉为中心的benchmark:V* Bench考细粒度属性与空间关系,MathVista考视觉数学推理,MMMU-Pro考跨学科多模态推理,MMStar考综合多模态能力。为保证比较公平,ICoT、LVR与PixelReasoner等开源方法都适配到同一个backbone上。
DLR在V*、MathVista、MMMU-Pro和MMStar上分别达到83.8、82.7、63.5和76.2。相较backbone,对应提升为+4.2、+3.5、+2.6和+3.9个百分点。在MathVista上,DLR相比LVR从77.3提升到82.7。论文把这一优势归因于多步premise-conditioned visual grounding:数学视觉推理往往需要模型反复检查图表、几何关系或局部细节,在多步过程中累积证据,而不是依赖一次性latent表示。
消融实验里最扎眼的一项是latent policy objective。移除J latent后,MathVista从82.7掉到57.1,V*也从83.8降到81.5。这说明仅靠SFT学习确定性的视觉表示,难以充分发挥隐空间推理能力,显式的连续latent探索是这个框架的重要组成部分。
遮挡实验:它到底在看哪里
论文在V*Bench上做了定量faithfulness分析。随机遮挡同等数量区域时,准确率从83.8降到77.7;而遮挡DLR attention最高的区域时,准确率降到36.5,下降47.3个百分点。
这个干预结果为visual grounder识别区域与模型预测之间的功能相关性提供了定量证据,而不只是"看起来合理"的可视化。
案例研究进一步说明了weak visual grounding可能导致的overthinking。前面提到的图形规律题里,baseline反复尝试计数绿色扇区、检查角度关系和行列规律,多次修改假设,生成15177个token后仍给出错误答案。DLR则先明确需要验证"绿色扇区的相对位置规律",再根据这个premise获取视觉latent,据此生成有依据的rationale。
另一个主色判断案例中,baseline受大面积蓝色壁画的显著性影响,把房间主色判断为蓝色;DLR的分步grounding综合了墙壁、桌椅与整体布局,最终判断白色为主色。论文展示的cross-attention热力图会随premise改变关注区域,这和"每一步重新获取任务相关视觉证据"的设计是一致的。
把视觉grounding显式嵌入多步推理轨迹,在相同backbone下能稳定改善多类视觉推理任务。这是DLR给出的主要结论,也是它被EMNLP 2026主会接收的原因。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.