网易首页 > 网易号 > 正文 申请入驻

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

0
分享至



强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。

来自哈工大、中关村学院等机构的研究团队提出 EASE(Evidence-Anchored Spatial Attention),把标注的证据区域转化为视觉 token 上的平滑目标分布,在 RL 训练过程中直接监督「回答 token 看向图像哪里」的空间注意力,且推理阶段无需任何额外标注。在 Qwen2.5-VL-7B、Qwen3-VL-4B、Qwen3-VL-8B 三个基座上,EASE 相比最强 outcome-only 基线 DAPO,平均分分别提升 2.9、3.1、2.5 个百分点。

一句话总结 EASE 的理念:不只教模型「答什么」,更教模型「看哪里」。



  • 论文标题:Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR
  • 作者单位:哈尔滨工业大学,北京中关村学院等
  • 会议:EMNLP 2026 Findings
  • 论文链接:https://arxiv.org/abs/2605.30912
  • 代码链接:https://github.com/Nrich-sunny/Attend-to-Evidence

被忽视的盲区:答对 ≠ 看对

在数学推理等纯文本任务中,最终答案的 0/1 奖励已经足够好 —— 因为解题过程全部写在思维链里,信用分配天然清晰。但在多模态场景下,证据获取发生在「看图」这一步,而这恰恰是不可见的。

论文将其形式化为一个感知信用分配问题(perception credit assignment problem):

  • 一个正确的答案,可能源于相关的视觉证据,也可能源于语言先验、标签相关性捷径或猜测;
  • 一个错误的答案同样暧昧 —— 模型是看错了区域,还是看到了正确证据却推理失误?

对于计数、小目标定位、跨区域比较、空间关系这类细粒度、多证据问题,这种歧义尤为致命:模型完全可以在「根本没看对地方」的情况下输出看似合理的文本 —— 这正是幻觉的温床。

为了验证这不是理论空想,作者先做了一个诊断实验:用一个仅经最终答案奖励 GRPO 训练的 Qwen3-VL-4B,在 HallusionBench-Image 上计算每条回答的「回答→视觉注意力分布」与「标注证据目标分布」之间的 KL 散度。结果清晰地表明:

  • 注意力与证据的错位越大,幻觉率越高(相关系数 ρ=0.34,p<0.001);
  • 产生幻觉的回答,其 KL 分布整体显著右移。



这构成了 EASE 的立论基石:outcome-only 奖励确实能提升准确率,但它系统性地遗留了注意力与证据之间的错位 —— 而这需要一个过程级的信号来修复。

EASE 方法:

把证据框变成注意力的「导航目标」

EASE 的整体思路可以用三步概括:造目标、找位置、挑时机。



证据标注流水线 —— 从 QA 对到高质量证据框



训练样本被扩展为 (I, q, a, B),其中 B 是支撑答案的证据框集合,仅作为训练元数据存在,从不进入模型输入。标注分三步走:

1. 抽短语:GPT-4.1-mini 从「图 - 问 - 答」三元组中抽取验证答案所需的最小可见实体集合;

2. 做定位:用 Grounding DINO 类 grounding 模型将短语定位成 bbox;

3. 验质量:引入不同模型家族的 Gemini 2.5 Flash-Lite 做独立验证,剔除空框、错框、模糊框 —— 避免单一模型的抽取偏差自我循环。

最终构建出约 127K 标注数据(覆盖 ZwZ74K、CLEVR、Super-CLEVR、SpaCE10、ViRL39K),并按单证据 / 多证据分成两个池子,训练时 1:1 平衡采样 —— 前者教模型局部 grounding,后者教模型跨区域收集证据。

软目标而非硬掩码 —— 高斯混合 + 背景平滑

EASE 不将证据框当成 0/1 硬掩码,而是:

  • 高斯化:每个框变成一个二维高斯,中心在框心,2σ 恰好覆盖半个框宽 / 高 —— 概率质量集中在框内,但对标注噪声、粗糙框、跨 token 的物体边缘天然宽容;
  • 等权混合:多证据样本中每个框分得相同的监督质量,防止大框主导目标,强迫模型覆盖所有证据区域而非只盯最显眼的一个;
  • 背景平滑:混入 10% 的均匀分布质量,避免把背景 token 的注意力逼到零,保留必要的视觉上下文。

第三步:

奖励门控 —— 只在「好学生」身上教方法

监督的对象是语义中间层(第 ⌊2L/3⌋ 层)上、回答 token 对视觉 token 的条件注意力分布,用「模型→目标」方向的 KL 散度将其拉向证据目标。

reward-aware gating 设计:注意力损失只施加在原始验证器奖励达标的轨迹上。错误回答的注意力模式本身就是不可靠的,把证据框强行对齐到错误轨迹上,等于在学习「误导性的对齐」。因此,EASE 只把成功轨迹当作「可靠的过程示范」来教。

消融实验印证了每一个设计:去掉高斯软目标平均分掉 2.5 分、去掉奖励门控掉 3.4 分、去掉背景平滑掉 2 分。

推理零开销

证据标注是特权训练信息(privileged information),训练完成后,模型走原生 VLM 的「图像 + 问题」通路,输出格式、解码流程完全不变。相比把 grounding 坐标写进输出文本的路线(如 Ground-R1、Point-RFT),EASE 把监督放在模型内部注意力上,更轻、也更易嵌入现有 RL 训练栈。

实验:三个基座、11 个基准、全面提升



  • 研究团队在感知(HR-Bench、V*、CV-Bench)、幻觉(POPE、HallusionBench-Image)、视觉数学(MathVista、MathVerse_V、WeMath、MMK12)与逻辑推理(LogicVista)共 11 个基准上做了同协议受控对比:在每个基座内部,EASE 在全部 11 个基准上无一例外地超过 DAPO。增益最大的恰好是视觉中心任务 ——Qwen2.5-VL-7B 上 MathVista +6.5、WeMath +4.9、MMK12 +4.6、V* +4.2,与方法的设计意图高度自洽。

  • 与公开报告的 7B 级多模态推理方法横向对比(ThinkLite-VL、VL-Rethinker、MM-Eureka、PAPO、VPPO、VGPO 等),EASE-7B 以 66.0 的平均分位列第一,并在 MathVista、MathVerse_V、WeMath、LogicVista 四项上取得最优。

  • 诊断指标上的证据:EASE 在证据注意力质量(EAM)、注意力峰定位准确率(Pointing Accuracy)、多证据覆盖率(Coverage)三项过程指标上全面优于基座与 GRPO—— 增益确实来自「注意力真的看向了证据」,而非仅仅答案正确率的账面提升。



总结


在视觉语言模型(VLM)的 RLVR(基于可验证奖励的强化学习)中,最终答案奖励只告诉模型「答对了没有」,却不告诉它「答案应该从图的哪个区域得出」。EASE 利用数据集中的证据标注框(evidence bbox),把它转成视觉 token 上的高斯混合目标分布,在 RL 训练时对高奖励轨迹的「回答 token → 图像 token」注意力做 KL 正则,教模型「看对地方」,而推理阶段完全不需要这些标注。

EASE 揭示了一个正在被越来越多工作确认的转向:多模态 RLVR 的奖励设计,正在从「结果验证」走向「过程监督」。在文本推理中,过程监督监督的是思维链;而在多模态推理中,EASE 表明,注意力本身就是可监督、且值得监督的过程信号。

作者介绍


胡瑞娜,哈尔滨工业大学与北京中关村学院的联培博士生,其研究成果发表于 EMNLP、ICML 等国际会议,研究兴趣集中于 AI 安全与对齐以及 AI Agent 在核聚变领域的应用。其哈工大导师为计算机学院省级青年人才王凯教授,中关村学院导师为北京中关村学院 x 中关村人工智能研究院 AI + 能源科学方向负责人、新烛时代联合创始人兼 CTO 汪跃。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
心梗去世的人越来越多?医生劝告:宁可打牌,也别做这7事

心梗去世的人越来越多?医生劝告:宁可打牌,也别做这7事

牛锅巴小钒
2026-09-03 10:44:32
清华美院丁荭风波后续:网传被约谈,作品被撤展,终身取消申报资格

清华美院丁荭风波后续:网传被约谈,作品被撤展,终身取消申报资格

小徐讲八卦
2026-09-02 09:30:37
朱倩老师真实颜值曝光,和精修图对比差距很大

朱倩老师真实颜值曝光,和精修图对比差距很大

映射生活的身影
2026-09-02 10:15:34
歼-16给足面子千里赴约,埃及转身追购阵风,歼-10手下败将凭啥?

歼-16给足面子千里赴约,埃及转身追购阵风,歼-10手下败将凭啥?

李健政观察
2026-09-03 11:46:37
“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

妍妍教育日记
2026-08-31 23:54:51
伊朗越打越猛,五国同时被炸,美军机被击落,特朗普恼羞成怒

伊朗越打越猛,五国同时被炸,美军机被击落,特朗普恼羞成怒

趣文说娱
2026-09-03 12:11:30
一旦赵勇下课,中国女排新的掌门人,九九成在这三人之间产生

一旦赵勇下课,中国女排新的掌门人,九九成在这三人之间产生

挽袖清风g
2026-09-02 12:34:38
越南铁路突然加价42.4%:不是向中国押注,而是怕再挖第二遍

越南铁路突然加价42.4%:不是向中国押注,而是怕再挖第二遍

一号位故事
2026-09-02 17:30:13
内塔尼亚胡:哈马斯最高层领导人之一已被控制!以防长:加沙70%已成废墟,以军摧毁了地面上所有房屋,没有居民、没有隧道,还有工作要做

内塔尼亚胡:哈马斯最高层领导人之一已被控制!以防长:加沙70%已成废墟,以军摧毁了地面上所有房屋,没有居民、没有隧道,还有工作要做

鲁中晨报
2026-09-03 13:42:03
吃相难看!王新军去世1天后,不对劲的一幕发生,秦海璐有苦难言

吃相难看!王新军去世1天后,不对劲的一幕发生,秦海璐有苦难言

妙知
2026-09-03 11:49:54
越南外交部正式发声,态度强硬。 “未经越方许可、完全非法无效”

越南外交部正式发声,态度强硬。 “未经越方许可、完全非法无效”

王姐懒人家常菜
2026-09-03 06:34:15
用21年从没坏过!网友晒2005年包浆罗技鼠标:至今仍能战CS2

用21年从没坏过!网友晒2005年包浆罗技鼠标:至今仍能战CS2

快科技
2026-08-31 17:44:13
高潮来了:黑客发力,景甜、孙宇晨的“秘密藏不住了”!

高潮来了:黑客发力,景甜、孙宇晨的“秘密藏不住了”!

默默有话说
2026-09-01 14:42:13
广东一高中生开学前一天暑假作业被偷,担心老师认为他撒谎,警方帮忙找到送回学校,当事人爸爸:作业全部写完,老师看到了,皆大欢喜

广东一高中生开学前一天暑假作业被偷,担心老师认为他撒谎,警方帮忙找到送回学校,当事人爸爸:作业全部写完,老师看到了,皆大欢喜

极目新闻
2026-09-03 13:48:05
手握15个世界冠军,和夏煊泽是好兄弟,如今在哈工大当老师太明智

手握15个世界冠军,和夏煊泽是好兄弟,如今在哈工大当老师太明智

寒士之言本尊
2026-09-02 23:30:21
难以置信!保定一中某新生班级群,有家长亮出官职求老师关照,网友:是不是想着私发给老师,结果失误发到群里了

难以置信!保定一中某新生班级群,有家长亮出官职求老师关照,网友:是不是想着私发给老师,结果失误发到群里了

火山詩话
2026-09-03 05:26:34
日本网友很疑惑:中国人为什么会觉得“现在的日本打不过中国”?

日本网友很疑惑:中国人为什么会觉得“现在的日本打不过中国”?

怪味历史连连看
2026-09-02 21:13:36
当不成总统了?80岁特朗普要跑路,白宫掀起下岗潮,万斯还在坚守

当不成总统了?80岁特朗普要跑路,白宫掀起下岗潮,万斯还在坚守

南宗历史
2026-09-03 05:26:02
美网三消息,中国男单扬眉吐气,女单只剩1人,郑钦文比赛时间确定

美网三消息,中国男单扬眉吐气,女单只剩1人,郑钦文比赛时间确定

南海浪花
2026-09-03 09:30:51
采访了50个出轨的女人,她们最后悟出的那句话,听完令人心酸

采访了50个出轨的女人,她们最后悟出的那句话,听完令人心酸

千秋文化
2026-05-26 19:26:12
2026-09-03 15:35:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13911文章数 142728关注度
往期回顾 全部

科技要闻

大模型扎堆!谷歌刚发,Meta就跟上

头条要闻

星宇股份"股价跌到惨不忍睹" 有公司邀请被劝退者加入

头条要闻

星宇股份"股价跌到惨不忍睹" 有公司邀请被劝退者加入

体育要闻

小卡回应处罚:不知晓任何规避工资帽意图

娱乐要闻

德云社停更20天再营业!

财经要闻

再见了,期房!商品房预售制卒于2026

汽车要闻

实拍捷途旅行者7 风格更潮/混动版配上华为乾崑ADS 5

态度原创

艺术
数码
本地
手机
公开课

艺术要闻

16位当代知名画家,21幅女性人物油画

数码要闻

宏碁推出5G移动网卡Connect D5P与5G CPE设备Connect X6ES

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

手机要闻

vivo X500系列标准版手机官宣搭载X300 Pro同款主摄传感器

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版