网易首页 > 网易号 > 正文 申请入驻

激发多模态智能体决策潜力!清华&北大&腾讯联合提出GTR训练框架

0
分享至



论文第一作者为魏彤,清华大学在读博士生,研究方向为大模型智能体和强化学习,导师为清华大学兴军亮、史元春;共同一作为腾讯杨一君;合作者为北京大学卢宗青;通讯作者为叶德珩。

基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Reward, RLVR)能够在大语言模型(LLMs)上有效提升思维链(Chain-of-Thought, CoT)决策的能力。然而对于多模态大模型(VLM)智能体的目标导向的动作推理任务,强化学习在复杂问题上并不能很好地提升决策能力,甚至会导致思维过程的退化。

来自清华、北大和腾讯的研究团队深入研究了这一“思维崩塌”(thought collapse)的现象,发现由于模型训练的反馈仅依赖于最终动作,RL 训练无法有效约束 CoT 思维过程,导致 VLM 智能体思维退化,丧失多样性,并输出不一致和不完整的思路。



为了对抗思维崩塌,研究团队提出思维引导的强化学习(Guided Thought Reinforcement, GTR)框架,通过自动化修正器提供过程引导,在 RL 训练中实时优化模型的思路,且无需依赖人类的精细标注。在困难的卡牌游戏和具身智能任务中,基于 LLaVA-7B 的智能体用很小的规模实现了相比 SOTA 显著的成功率提升。



  • 论文标题:GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
  • 论文链接:https://arxiv.org/pdf/2503.08525

1.“思维崩塌” 现象影响 RLVR 训练效果

不像纯文本的智能体训练,由于多模态信息的引入和决策流程复杂性的提高,在交互性视觉环境中用 RL 训练 VLM 智能体更加困难。而其中 “思维崩塌” 的现象则主要体现在以下几点:

  • 智能体的 CoT 过程失去多样性,对于不同的视觉和文本输入给出相同的思路。
  • 模型输出思路不正确、不一致、不完整,虽在输出思路,但已丧失思考能力。
  • 思维能力的丧失极大限制了模型的决策能力,难以释放模型潜力。

实验中发现,更大的模型、更长的训练时间也均展示出思维崩塌的情况。因此,问题的核心原因是强化学习的训练机制:

  • 环境提供的奖励完全由模型最终的动作决定。
  • 比动作输出更长且更基础的思维过程缺少评估和监督,只能依赖结果奖励间接引导。
  • 在动作步骤多、状态空间大、复杂程度高的任务中,这一问题更加显著。

因此,这证明了 VLM 智能体的强化学习训练中,过程引导有着至关重要的作用。

2.GTR 框架如何避免模型 “不懂装懂”?

此前的相关工作也对过程引导的方法做出了研究。然而,常见的过程奖励模型(Process Reward Models, PRMs)需要精细标注的多模态数据训练,昂贵且费力;且固定数据集上的训练容易产生偏差,不适用于动态的交互式环境。

此外,用 VLM 进行打分的 VLM-as-a-judge 方法效果也不佳。这是由于简单的数值奖励难以提供充足的信息量和有效的指导,尤其考虑到大模型更强的 reward hacking 能力。在模型基础能力较差的情况下,缺少正向激励也容易导致悲观探索的问题。



因此,我们需要找到一个足够简单、可规模化且有信息量的思维引导方式。在 GTR 框架中,“修正器模型”(corrector model)承担了这一至关重要的角色。



GTR 利用一个外部的 VLM 模型作为修正器,在强化学习的每一步,先对智能体思路中识别和推理的正确性进行评估,如果发现不正确或者不一致的情况,则利用智能体的状态输入进行修正。通过在常规的 PPO 过程中加入一个针对思路 token 的 SFT loss,将模型的思路与修正器给出的正确结果对齐,形成一个“思维 + 动作”、“SFT+PPO” 的联合训练框架。

通过这种方式,强化学习与思维引导互相形成了补充。思维引导为训练提供了更多的监督信号,强化学习也能通过可验证奖励的反馈,使得修正过程无需专家级别的外部模型提供高质量的参考轨迹,让智能体能够突破外部模型的能力天花板。

针对在线训练样本偏移的问题,GTR 引入了 DAgger 策略缓解错误累积。框架还通过为智能体增加格式奖励和重复惩罚、为修正器模型提供工具调用弥补专业知识等方法,进一步提升了数据质量。

GTR 训练过程的伪代码如下:



3.GTR 的实验效果


论文在 gym_cards 和 ALFWorld 两个常用的 VLM 智能体测试任务上进行了实验评估。智能体基于 LLaVA-7B,使用 GPT-4o 作为修正器训练。以仅包含强化学习的 RL4VLM 和仅包含思路引导的方法(SFT-only)作为基线进行比较。

在 gym_cards 中最困难的 24 点纸牌游戏中,GTR 在 15k 的训练步数内达到了最高 17.5% 的成功率,大幅超过了两个基线方法(2.5%、11.0%),甚至突破了 GPT-4o,即其修正器模型的水平(13.5%)。



而在更简单的、思维崩塌现象不显著的另外三个游戏中,GTR 相比于 RL4VLM 也能取得突破,并达到10 倍其规模的预训练模型的能力水平。



对于家用机器人场景的具身智能任务 ALFWorld,为了模拟真实环境,同时避免模型利用额外文本信息绕开多模态决策,实验中去掉了环境提供的文本观察,模型仅能依赖视觉信息进行决策。GTR 比起 RL4VLM 能够有效避免思维崩塌带来的性能下降,提升模型决策能力。







消融实验研究则证明了训练全过程思维引导的重要性、工具调用提升修正器专业知识的必要性和 DAgger 缓解在线训练分布偏移的有效性。同时指出,采用完整输出的 SFT 会限制 RL 的反馈,并使训练容易受到修正器幻觉的影响。

4. 研究意义与展望

本项研究揭示了多模态大模型智能体强化学习训练中,思维崩塌现象对训练稳定性和性能提升的限制。而通过修正器模型进行思路修改,GTR 在无需数据标注的条件下实现了实时自动化的思维过程监督,使过程引导与强化学习有机结合,互为补充,展现出强大的性能优势。

这一创新性的分析和解决方案也能够为复杂长时任务中大模型智能体的训练提供更多的启发和可能性。

更多细节请见原论文。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

小徐讲八卦
2026-02-12 12:13:20
哈里梅根月底返英长住,英首相回应安保争议:这是他们的私事

哈里梅根月底返英长住,英首相回应安保争议:这是他们的私事

影视情报室
2026-08-21 00:16:15
车主参加发布会收到假labubu!奕境总经理:我们的错 申请采购1万件正品当礼品

车主参加发布会收到假labubu!奕境总经理:我们的错 申请采购1万件正品当礼品

快科技
2026-08-20 19:39:07
穆杰塔巴开始接管“战争机器”:伊朗高层大换血背后的真正逻辑

穆杰塔巴开始接管“战争机器”:伊朗高层大换血背后的真正逻辑

老羊漫话
2026-08-21 07:19:31
文强被枪决16年后,他的儿子文伽昊沦为月薪3000的普通打工者,这样的结局令人感慨不已

文强被枪决16年后,他的儿子文伽昊沦为月薪3000的普通打工者,这样的结局令人感慨不已

人生录
2026-08-10 00:05:13
拒不让座!女孩火车上放零食占座,遭路人围攻,恶心的一幕出现了

拒不让座!女孩火车上放零食占座,遭路人围攻,恶心的一幕出现了

调侃国际观点
2026-08-20 19:18:28
17岁女孩被困保时捷,服务区工作人员7分钟救援:无110无追责、仅道歉买水、继续坐,实在耐人寻味

17岁女孩被困保时捷,服务区工作人员7分钟救援:无110无追责、仅道歉买水、继续坐,实在耐人寻味

少爷写春秋
2026-08-21 00:03:44
学籍案弟弟哽咽发声:媳妇和他离婚,养父母去世,母亲说他自私

学籍案弟弟哽咽发声:媳妇和他离婚,养父母去世,母亲说他自私

许三岁
2026-08-20 07:35:01
加速肿瘤恶化的因素:饮酒排在第5,排在第一的,可能患者经常做

加速肿瘤恶化的因素:饮酒排在第5,排在第一的,可能患者经常做

荆医生科普
2026-08-20 18:10:13
张雪机车在台湾被查扣!张雪:扣一台送一台 送到两岸统一为止

张雪机车在台湾被查扣!张雪:扣一台送一台 送到两岸统一为止

念洲
2026-08-21 07:14:33
女友让我陪她回家过年,看到她爸后我愣了,居然是我们公司董事长

女友让我陪她回家过年,看到她爸后我愣了,居然是我们公司董事长

千秋文化
2026-08-17 19:36:34
1200 万投入票房为零,北电副院长《小兵张嘎》动画考古对比《牛来》再引行业热议!

1200 万投入票房为零,北电副院长《小兵张嘎》动画考古对比《牛来》再引行业热议!

海藻娱乐
2026-08-20 11:09:11
10辆摩托车组团冲卡驶入广深高速,仅行驶约7公里发生多车相撞,28岁骑手身亡,多人被追究刑责,官方提醒

10辆摩托车组团冲卡驶入广深高速,仅行驶约7公里发生多车相撞,28岁骑手身亡,多人被追究刑责,官方提醒

扬子晚报
2026-08-20 14:50:23
什么是气象站——关于自动气象站

什么是气象站——关于自动气象站

测控技术有限公司
2025-07-03 17:16:08
恒大人寿前董事长梁栋等56人被判刑

恒大人寿前董事长梁栋等56人被判刑

观察者网
2026-08-20 16:20:08
香港演员定居深圳扰民被投诉,邻居好言相劝被怼,嫌吵买别墅!

香港演员定居深圳扰民被投诉,邻居好言相劝被怼,嫌吵买别墅!

普陀动物世界
2026-08-21 01:39:13
河南省纪委监委:孟宪英被查

河南省纪委监委:孟宪英被查

新浪财经
2026-08-21 06:46:27
首例5胞胎长大了,父亲已劳累去世,母亲直言:如能重来一个也不要

首例5胞胎长大了,父亲已劳累去世,母亲直言:如能重来一个也不要

柳絮忆史
2025-07-22 07:15:03
玩家干过的蠢事:强行打败“无法杀死”的敌人,把系统给干宕机了

玩家干过的蠢事:强行打败“无法杀死”的敌人,把系统给干宕机了

街机时代
2026-08-19 18:06:55
病的太重!"精日分子"的好日子到头了,国家要出手了,一定要狠治

病的太重!"精日分子"的好日子到头了,国家要出手了,一定要狠治

北纬的咖啡豆
2026-08-10 11:31:15
2026-08-21 09:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13803文章数 142724关注度
往期回顾 全部

科技要闻

快手Q2研发狂烧45亿:如何面对双面夹击

头条要闻

美媒称要"按美国条件推动中国改革开放" 中国媒体反怼

头条要闻

美媒称要"按美国条件推动中国改革开放" 中国媒体反怼

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

任重晒全家福官宣二胎喜讯

财经要闻

包起号、包上榜 流量围城里的中小餐馆

汽车要闻

比总部还大?比亚迪藏在上海虹桥的巨无霸闪充站!

态度原创

家居
本地
房产
艺术
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

先导片|攀登不止,让不同的故事在此连接

房产要闻

265亿资产甩出!三亚老牌地产巨头,正在集体退场!

艺术要闻

中国最强“造假大师”张大千:靠假画骗翻半个画坛,专家看完直接认输

军事要闻

知情人士称美国“林肯”号航母开始返航

无障碍浏览 进入关怀版