网易首页 > 网易号 > 正文 申请入驻

大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提升

0
分享至


新智元报道


DeepSeek-R1之后,「让模型想得更久」几乎成了提升推理能力的标准答案。

但对多模态大模型而言,推理 token 更多,并不必然意味着视觉推理更充分。恰恰相反,模型在开头还能准确描述图像,随着生成内容不断累积,后续推理却可能越来越依赖自己写出的文字。

只要早期描述出现一点偏差,错误就会沿着自回归链条被反复引用、逐步放大,最后得到一个语言上严丝合缝、视觉上完全失真的答案。

这不是简单的「没看见」,而是看见之后没能一直记住

从后训练角度看,问题还可以进一步抽象:在典型的自回归多模态模型中,视觉条件在生成开始时已经固定,语言轨迹却随着推理持续增长。如果强化学习只奖励最终答案,训练目标就不会主动区分两类轨迹——一类始终以图像为依据,另一类中途丢失视觉证据、靠语言先验碰巧答对。

久而久之,策略优化就可能把概率质量分配给「答案正确但证据失真」的轨迹。本文将这种由rollout数据分布、序列结构与稀疏结果奖励共同诱发的系统性视觉衰减,概括为「分布性视觉遗忘」。

西北工业大学、香港科技大学和浙江大学的研究团队提出Remember-R1,试图从源头上修正这一偏置:不修改推理流程,而是在强化学习后训练中加入三种过程奖励,让模型不仅要答对,还必须在整条推理链中持续表达、保留并准确调用视觉证据。


论文链接:https://arxiv.org/abs/2608.01314

代码链接:https://github.com/Ch921-cell/Remember-R1

模型链接:https://huggingface.co/JM-Chen/Remember-R1-7B

要理解 Remember-R1,首先要区分两个看似相近的问题:

  • 视觉感知失败:模型从一开始就没有识别出关键物体、属性或空间关系;

  • 视觉记忆失败:模型最初读取了正确证据,却在长链推理中逐渐减少对图像的依赖。

Remember-R1针对的是第二种。其关键矛盾可以写成一句话:视觉证据是固定条件,语言状态是增长变量;模型越往后推理,越容易被自己生成的文本重新定义上下文。

假设同一个问题产生两条推理轨迹:

  • 轨迹 A 在每个关键步骤都重新调用图像证据,最终答对;

  • 轨迹 B 在中途脱离图像,依靠语言先验或早期描述继续推演,也最终答对。

如果奖励函数只检查最终答案,那么两条轨迹得到的结果奖励几乎相同。对强化学习来说,它们都是「好样本」。这构成了一个典型的轨迹不可辨识问题:结果监督知道终点是否正确,却不知道模型为什么到达这个终点。

当这种不可辨识性与长序列中的自回归累积叠加,视觉遗忘就不再只是偶发错误。每轮 rollout 都可能产生一批「碰巧答对但已经不看图」的轨迹;如果这些轨迹继续获得正向优势,策略就会逐渐提高它们的生成概率。最终,被强化的不只是某个答案,而是一种越来越偏向文本自洽、越来越远离视觉证据的推理分布。

严格来说,这种偏置并非静态训练集单独造成,而是由三者共同形成:

  1. 模态分布不对称:视觉条件固定,文本上下文持续增长;

  2. 信用分配稀疏:最终答案奖励难以定位视觉依赖从哪一步开始衰减;

  3. 正确轨迹不唯一:相同答案背后,可能对应完全不同的证据路径。

现有方法通常在推理阶段补救:重新插入原图或局部图像,或者增加视觉声明和验证步骤。

它们解决的是「模型忘了之后如何再看一次」。Remember-R1则把问题前移到后训练阶段,追问的是:能否从一开始就让模型少学那些会忘记图像的轨迹?


从「答案正确」到「证据正确」

Remember-R1的核心,不是简单给模型多发几种奖励,而是重新定义什么叫「值得强化的推理」。

从优化视角看,它的总奖励可以抽象为:

总奖励 = 答案正确性奖励 + 视觉词汇奖励 + 视觉记忆奖励 + 视觉关键区域奖励

其中,答案正确性奖励决定模型有没有完成任务,另外三项奖励则约束模型用什么方式完成任务。

严格来说,论文将后三项称为过程奖励,而不是传统损失函数中的 L1、L2 或KL正则项。

但从策略优化的作用来看,它们构成了行为层面的奖励正则化:通过提高视觉忠实轨迹的相对收益,缩小「可接受策略」的范围,阻止模型沿着纯文本捷径继续优化。


第一层:用视觉词汇奖励约束「说了什么」

研究团队先从训练图像中提取物体类别、颜色、大小、数量和空间关系等短视觉词组,再通过严格的词或短语匹配,统计回答覆盖了哪些视觉事实。

奖励不仅取决于匹配了多少视觉词,还取决于这些词最后一次出现的位置。视觉证据覆盖越充分、在推理链中保持得越久,得分越高。

这一项约束的是视觉证据的语义分布:不能只在开头说一句「图中有……」,随后就进入纯语言推理;关键视觉事实必须持续出现在后续轨迹中。

第二层:用视觉记忆奖励约束「看了多久」

只要求模型反复说出视觉词,还不能证明它真的在使用图像。为此,Remember-R1从模型最后一层提取每个生成步骤对视觉 token 的注意力,并比较推理早期和后期的平均水平。

如果后期视觉注意力快速下降,奖励就会降低;如果模型在整条推理链中保持相对稳定的视觉依赖,奖励就会提高。

这一项约束的是视觉依赖的时间分布。它不要求注意力绝对不变,而是直接惩罚「越想越不看」的系统性衰减。

第三层:用关键区域奖励约束「看向哪里」

模型持续看图,并不意味着它看对了地方。无差别关注整张图像,同样可能制造虚假的视觉忠实。

研究团队将训练样本中的关键区域映射到对应的视觉 token,计算注意力落在问题相关区域的比例,并对推理后期赋予更高权重。模型不仅要保持视觉注意力,还要把有限的注意力预算持续分配给真正决定答案的区域。

这一项约束的是视觉注意力的空间分布,防止模型通过「形式上看图、实际上看错位置」来获取奖励。

三层奖励由此形成完整闭环:

  • 视觉词汇奖励约束证据有没有进入语言轨迹;

  • 视觉记忆奖励约束证据有没有贯穿推理前后;

  • 视觉关键区域奖励约束模型调用的是不是有效证据。

它们与答案正确性奖励共同进入 GRPO 训练。对同一个问题生成的多条 rollout,依据视觉证据完成推理的轨迹会获得更高相对优势,逐渐占据更多策略概率;中途滑向纯文本推理的轨迹则被压低。

最终训练集包含 38,657 个经过筛选的样本,每个样本都带有视觉关键词和关键区域标注。这里的数据标注不是为了继续向模型灌输视觉知识,而是为奖励函数提供过程锚点,让后训练能够识别「模型何时开始忘记、忘记了什么、注意力又偏向哪里」。

7B模型七项基准全涨

给推理过程增加约束,最直接的风险是过度正则化:模型可能为了反复提及图像而生成冗余描述,也可能因为注意力被强行拉回视觉 token,损害原有的推理和感知能力。

因此,Remember-R1需要回答两个问题:奖励正则化能否跨任务提升推理,以及这种提升是否以牺牲基础视觉能力为代价。


实验覆盖数学与逻辑推理、综合多模态能力和视觉感知三类任务。Remember-R1-7B在七项基准上均高于对应基座模型,与其他视觉遗忘缓解方法相比也展现出更具竞争力的整体表现。

其中:

  • MathVista从62.30提升至69.80,增加7.50 分

  • MMVet从59.44提升至72.37,增加12.93 分

  • RealWorldQA从69.28提升至69.67,基础视觉感知能力没有因过程约束而下降。

前两项结果表明,过程奖励带来的收益并未局限在一种推理任务上;RealWorldQA的结果则说明,在论文所测试的范围内,Remember-R1不是通过牺牲「看见」的能力来换取「推理」的提升,而是在重新组织模型调用既有视觉能力的方式。

这组实验为「后训练可以纠偏视觉轨迹分布」提供了实证支持。不过,它证明的是论文所覆盖模型与基准上的有效性,并不等于视觉遗忘已经被彻底消除。更准确的说法是:三种过程奖励显著降低了长链推理向纯文本分布漂移的倾向。

全新后训练范式

Remember-R1表面上在解决视觉遗忘,背后触及的却是大模型后训练中更普遍的问题:当结果奖励无法唯一确定正确行为时,模型究竟会学到哪一种策略?

后训练不仅放大能力,也规定能力如何被调用

一种常见理解是,强化学习后训练主要负责激发基础模型中已有的潜在能力。但 Remember-R1进一步表明,即使「能力已经存在」,模型在长轨迹中何时调用、持续调用多久、依据哪些证据调用,仍然取决于奖励函数如何分配优势。

换句话说,后训练优化的不只是能力上限,也在塑造能力的调用策略。模型具备视觉感知能力,不代表它会在长链推理中持续使用这种能力;只有当视觉依赖进入奖励函数,策略优化才会把「持续看图」变成高概率行为。

过程奖励的本质,是给正确性增加「证据条件」

最终答案奖励定义的是:

模型是否答对。

Remember-R1加入的过程奖励定义的是:

模型是否依据正确证据答对。

这一步看似只是奖励工程,实际上缓解了结果监督中的不可辨识性。它为「正确」增加了证据条件,让原本能够获得相同结果奖励的多条轨迹,在策略更新中被重新排序。

因此,奖励正则化不是额外教给模型一个答案,而是在改变答案背后的轨迹分布:视觉忠实的轨迹被上调,脱离观测的语言捷径被下调。

从视觉推理走向长程智能体

这种分布偏置并非图像问答独有。在长视频理解中,早期帧会被后续文本摘要覆盖;在屏幕操作中,智能体可能逐渐相信自己的动作描述,而不是最新界面状态;在机器人导航中,内部计划也可能压过实时环境反馈。

这些任务具有共同结构:外部观测相对固定或稀疏,模型内部生成的语言状态持续增长。推理越长,策略越可能从「依据环境行动」滑向「依据自身叙事行动」。

Remember-R1提供的普遍启示是:与其等模型遗忘后再增加检索、回看或验证步骤,不如在后训练阶段直接奖励「持续依据环境」的轨迹。只要能够把证据表达、记忆保持和关键区域注意力转化为可计算信号,奖励函数就有机会纠正 rollout 数据中固有的分布漂移。

结语

长链推理时代,人们习惯把更多 token、更长思考和更强能力画上等号。Remember-R1提醒我们:对于多模态模型,推理长度只有在证据没有中途退出时才有价值。

这项工作的关键贡献,不只是设计了三种视觉奖励,而是把「视觉遗忘」从推理阶段的表面故障,重新表述为可以由后训练干预的策略分布问题。答案奖励负责告诉模型终点在哪里,过程奖励则不断校准它通往终点的证据路径。

从这个意义上说,后训练的下一步可能不只是让模型获得更高分,而是让它学会:无论思考多长,都不能忘记自己的判断究竟来自哪里。

参考资料:

https://arxiv.org/abs/2608.01314

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
许家印判了,但这几个女明星凭什么替他“坐牢”?

许家印判了,但这几个女明星凭什么替他“坐牢”?

草莓解说体育
2026-08-24 05:43:40
吉林26岁保安徒手接跳楼女终身瘫痪 , 女孩家属 : 女儿有事 , 不放过你

吉林26岁保安徒手接跳楼女终身瘫痪 , 女孩家属 : 女儿有事 , 不放过你

天天热点见闻
2026-08-08 08:13:01
毛主席见北京军区司令员和政委有矛盾,询问道:为什么要吵架?

毛主席见北京军区司令员和政委有矛盾,询问道:为什么要吵架?

云霄纪史观
2026-08-21 13:42:48
A股:不用等周二开盘了,明天(8月25日),不出意外会这么走

A股:不用等周二开盘了,明天(8月25日),不出意外会这么走

财经大拿
2026-08-24 13:59:49
印媒放狠话,巴基斯坦若敢买中国歼-35,印度会先将其炸毁在机场

印媒放狠话,巴基斯坦若敢买中国歼-35,印度会先将其炸毁在机场

面包夹知识
2026-08-22 14:28:07
越南少将评价中国军队:一支部队毫无战斗力,但客观来看,这已是其中最好水平

越南少将评价中国军队:一支部队毫无战斗力,但客观来看,这已是其中最好水平

沆砀无垠
2026-08-24 06:00:03
又打起来了,以色列深夜开火,美态度转变,土耳其或被迫参战?

又打起来了,以色列深夜开火,美态度转变,土耳其或被迫参战?

小小科普员
2026-08-24 16:11:35
越南少将坦言:如果当时中国军队在谅山再多待五天,布防在那里的越军,不是被打散的问题,而是从建制上被彻底抹掉的问题, 一个都不剩下

越南少将坦言:如果当时中国军队在谅山再多待五天,布防在那里的越军,不是被打散的问题,而是从建制上被彻底抹掉的问题, 一个都不剩下

人生录
2026-08-08 00:05:22
美国特使:以方空袭前未向美方发出预警

美国特使:以方空袭前未向美方发出预警

参考消息
2026-08-23 15:33:10
冯巩现状:全家住北京老破小,68岁满脸褶子,儿子已是公司高管

冯巩现状:全家住北京老破小,68岁满脸褶子,儿子已是公司高管

揽星河的笔记
2026-08-20 14:35:02
小米玄戒O3芯片今天亮相 阔折叠新机首发搭载

小米玄戒O3芯片今天亮相 阔折叠新机首发搭载

PChome电脑之家
2026-08-24 09:58:31
南宋小尼姑思春 ,大胆写下一首“云雨词”,男人读后都脸红

南宋小尼姑思春 ,大胆写下一首“云雨词”,男人读后都脸红

长风文史
2026-04-01 12:35:21
“高中签率”,来了!本周将有4只新股申购→

“高中签率”,来了!本周将有4只新股申购→

数据宝
2026-08-24 12:21:59
无缘亚运会!媒体人透露周琦落选男篮大名单原因,杨毅被彻底“打脸”

无缘亚运会!媒体人透露周琦落选男篮大名单原因,杨毅被彻底“打脸”

禾三千体育
2026-08-24 15:21:42
华为都带不动的赛力斯:一边造马桶,一边卖玩具车,3大败笔全曝光

华为都带不动的赛力斯:一边造马桶,一边卖玩具车,3大败笔全曝光

新浪财经
2026-08-23 07:33:58
梦鸽李天一赴美不归?看到85岁李双江“现状”,原来杨洪基没说谎

梦鸽李天一赴美不归?看到85岁李双江“现状”,原来杨洪基没说谎

阿纂看事
2024-11-05 11:54:58
1985年,国安叛徒藏身南美,中国6名兵王万里锄奸,FBI颜面尽失

1985年,国安叛徒藏身南美,中国6名兵王万里锄奸,FBI颜面尽失

干史人
2026-04-14 21:10:03
人没来,座位收回,票款不退,买票没上车,空座该退钱吗?

人没来,座位收回,票款不退,买票没上车,空座该退钱吗?

许三岁
2026-08-24 09:30:53
四川省地震局回应“多地收到四川长宁7.7地震预警”:震级偏高;官方致歉

四川省地震局回应“多地收到四川长宁7.7地震预警”:震级偏高;官方致歉

娱乐的硬糖吖
2026-08-24 10:59:26
无方向盘、无踏板!特斯拉Cybercab定档9月3日 Robotaxi车队迎来“性价比”主力?

无方向盘、无踏板!特斯拉Cybercab定档9月3日 Robotaxi车队迎来“性价比”主力?

财联社
2026-08-22 17:47:09
2026-08-24 16:47:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16015文章数 67017关注度
往期回顾 全部

科技要闻

宇树科技,3天跌了1000亿

头条要闻

"新疆虎"金之镇被公诉:接受"管家式"服务 搞权色交易

头条要闻

"新疆虎"金之镇被公诉:接受"管家式"服务 搞权色交易

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

韩沛颖开撕《主角》剧组引发全网热议

财经要闻

宇树IPO:追高、被套,多久能回血?

汽车要闻

智能超混 国民家轿 上汽大众ID. ERA 5S上市 限时8.99万元起

态度原创

手机
时尚
艺术
旅游
本地

手机要闻

玄戒O3搭载小米第五代ISP:单摄支持4.32亿像素 三摄支持6400万+6400万+5000万

夏天别总穿白色T恤,试试这几款衬衫,配裤子裙子都显气质

艺术要闻

388米!中国第一高银行总部,为何要“开窗”设计?

旅游要闻

从“看演出”到“聊文化”,城墙夜话带火暑期经济

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

无障碍浏览 进入关怀版