网易首页 > 网易号 > 正文 申请入驻

多模态大模型学会回头「看」:中科院自动化所提出GThinker模型

0
分享至

尽管多模态大模型在数学、科学等结构化任务中取得了长足进步,但在需要灵活解读视觉信息的通用场景下,其性能提升瓶颈依然显著。现有模型普遍依赖基于知识的思维模式,却缺乏对视觉线索的深度校验与再思考能力,导致在复杂场景下频繁出错。

为解决这一难题,来自中科院自动化研究所紫东太初大模型研究中心的研究者提出 GThinker,一个旨在实现通用多模态推理的新型多模态大模型。

GThinker 的核心在于其创新的「线索引导式反思(Cue-Guided Rethinking)」模式,它赋予了模型在推理过程中主动校验、修正视觉理解的能力。

通过精心设计的两阶段训练流程,GThinker 在极具挑战性的 M³CoT 综合推理基准上取得了超越了最新的 O4-mini 模型,并在多个数学及知识推理榜单上展现出 SOTA 性能,证明了该方法的有效性和泛化能力。目前,论文、数据及模型均已开源。

  • 论文链接:https://arxiv.org/abs/2506.01078
  • 项目地址:https://github.com/jefferyZhan/GThinker
  • 开源仓库:https://huggingface.co/collections/JefferyZhan/gthinker-683e920eff706ead8fde3fc0

慢思考的瓶颈:

当模型在通用场景「视而不见」

当前,无论是开源的 Qwen2.5-VL,还是闭源的 GPT-4o,多模态大模型的能力边界正在被不断拓宽。尤其在引入了思维链(CoT)等慢思考策略后,模型在数学、科学等逻辑密集型任务上的表现得到了显著增强。

然而,这些进步并未完全转化为在通用多模态场景下的推理能力。与拥有明确答案和严格逻辑结构的数理任务不同,通用场景(如理解一幅画的寓意、分析复杂的日常情景)往往涉及:

  • 高度的视觉依赖:答案强依赖于对图像中多个、甚至有歧义的视觉线索的正确解读。
  • 复杂的推理路径:没有固定的解题范式,需要模型根据具体问题灵活组织推理步骤。

现有方法,无论是基于结构化 CoT 的,还是基于结果奖励强化学习的,都存在明显的局限性。它们在推理中一旦对某个视觉线索产生误判,往往会「一条道走到黑」,缺乏中途 「回头看」、修正认知偏差的机制。

现有主流多模态推理方法的特点与局限性

GThinker:

从 「思维链」 到 「再思考链」

为了打破这一瓶颈,研究团队提出了 GThinker,其核心是一种全新的推理模式 ——「线索引导式反思」(Cue-Guided Rethinking)。该模式将推理过程升级为一种更接近人类思维的「思考 - 反思 - 修正」闭环,它不强制规定僵化的推理结构,而是要求模型在自由推理后,对关键视觉线索进行一次系统性的回溯验证。

Cue-Rethinking核心流程,虚线框代表可能进行

整个过程分为三个阶段:

1. 自由初始推理:模型根据问题和图像内容,自由地进行一步步推理,同时使用

标签标记出其所依赖的关键视觉线索。

2. 反思触发:在初步推理链完成后,一个反思提示(如 「Let's verify each visual cue and its reasoning before finalizing the answer.」)被触发,引导模型进入基于再思考阶段。

3. 基于视觉线索的反思:模型逐一回顾所有标记的视觉线索,检查其解释是否存在不一致、错误或遗漏。一旦发现问题,模型会修正或补充对该线索的理解,并基于新的理解重新进行推理,最终得出结论。

GThinker推理模式示例

以上图为例,GThinker 在初步推理中可能将图形误判为 「螃蟹」。但在再思考阶段,它会发现 「红色三角形更像虾头而非蟹身」、「蓝粉组合更像虾尾而非蟹钳」,从而修正整个推理路径,最终得出正确答案 「虾」。这种机制使得 GThinker 能够有效处理有歧义或误导性的视觉信息,极大地提升了推理的准确性。

两阶段训练法:

如何教会模型进行再思考?

为了让模型内化这种强大的反思能力,GThinker 设计了一套环环相扣的两阶段训练框架。

GThinker整体训练流程示例图

模式引导冷启动

不同于数理领域在预训练后自然涌现的反思能力,单纯依靠来结果奖励强化学习 「探索」 出如此复杂的再思考行为,不仅成本高昂且效率低下。因此,GThinker 首先通过监督微调的方式,为模型 「冷启动」 构建基于视觉线索的再思考能力。

为此,首先通过「多模态迭代式标注」构建了一个包含 7K 高质量冷启动样本数据集:利用 GPT-4o、O1、O3 等多个先进模型的互补优势,对覆盖通用、数学、科学三大领域的复杂问题进行迭代式地推理和标注,生成了包含高质量再思考路径的训练数据。

在训练时,GThinker 采用「模式引导选择性格式化」策略,仅对那些基座模型会产生视觉误判的样本应用完整的 「反思链」 格式,其余则保留为标准推理格式。这使得模型能够学会在 「需要时」才进行反思,而非机械地执行。

激励强化学习

在掌握 「如何思考」 以及基于视觉线索进行 「再思考」 的能力基础上,GThinker 进一步引入基于可验证奖励的强化学习方法,设计混合奖励机制并构建覆盖多种推理类型的多场景训练数据,以持续激励模型在多样化任务中进行主动探索,从而实现思维模式的跨场景泛化迁移。

  • 多场景数据构建:广泛收集开源推理数据,并通过 embedding 聚类的方式进行均衡和多样性采样,从中精选包含约 4K 条多场景、多任务的强化学习训练数据集,为泛化能力的提升提供数据保障。

  • DAPO 训练:相较于 GRPO,DAPO 采用动态采样的方式,保证 batch 样本的有效性,并应用无 KL 和 clip higher 等策略,更适用于长链思考和探索,使模型学会在不同场景下选择最优推理方式。

  • 混合奖励计算:针对选择题、数学题等常见任务类型,分别采用精确匹配、Math-Verify 工具校验的方式计算奖励,对于通用场景下常见的开放式简答题,通过加入格式化响应让模型回答归纳到短语或单词的形式,以应用精确匹配的计算方式,从而确保了奖励信号的准确性和进一步拓展支持任务的多样性。

结果

在复杂、多步及多领域的多模态推理基准 M3CoT 上,GThinker 在多个场景的测试中超过当前先进的开源多模态推理模型及 O4-mini。

在通用场景(MMStar、RealWorldQA)、多学科场景(MMMU-Pro)及数学基准测试中,GThinker 实现了优于或不逊于现有先进模型的表现,证明了 GThinker 所学的再思考能力并未造成 「偏科」,而是实现了整体通用能力提升。

尽管 GThinker 的数据均为复杂推理任务构建,但经过这一方法及数据的训练后,当前最领先的开源模型依然能够在通用指标上进一步提升。研究团队选取了OpenCompass 闭源多模态榜单中 10B 规模下最新排名前三的开源模型,在学术榜单上进行测试。结果显示,GThinker 在这三款模型上均带来约 1 个百分点左右的平均性能提升,进一步印证了其方法的有效性与泛化能力。

Demo

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1992年,水利专家黄万里教授留下三封绝命书,强烈反对三峡工程

1992年,水利专家黄万里教授留下三封绝命书,强烈反对三峡工程

磊子讲史
2026-03-14 11:24:53
林肯号航母被曝士气低落,有人试图跳海,美海军发言人:该舰仍完全有能力完成全部任务

林肯号航母被曝士气低落,有人试图跳海,美海军发言人:该舰仍完全有能力完成全部任务

红星新闻
2026-08-12 18:00:06
收了28年的过路费,终于不收了!全国多地高速陆续免费!

收了28年的过路费,终于不收了!全国多地高速陆续免费!

留在X的世界
2026-08-12 13:03:15
不愧风水轮流转!陈思诚也没想到,宠了4年的阮巨,还是辜负了他

不愧风水轮流转!陈思诚也没想到,宠了4年的阮巨,还是辜负了他

凡知
2026-08-11 18:08:51
中国超市不是不想学胖东来,是不敢学,永辉超市就是例子

中国超市不是不想学胖东来,是不敢学,永辉超市就是例子

猪小艳吖
2026-08-11 23:49:34
雷州招聘事件后续:工单流转六十余天才移交纪委,12345 为何挡不住招考不公?

雷州招聘事件后续:工单流转六十余天才移交纪委,12345 为何挡不住招考不公?

十为先生
2026-08-10 15:05:17
396年,东晋皇帝司马曜酒后失态,对身旁的张贵人说:"你年近三十,美色不如当年,又没子嗣,白占着一个贵人的名位,明天我就废了你"

396年,东晋皇帝司马曜酒后失态,对身旁的张贵人说:"你年近三十,美色不如当年,又没子嗣,白占着一个贵人的名位,明天我就废了你"

磊子讲史
2026-08-01 15:58:21
NBA经纪人施瓦茨谈湖人队以125亿美元售出:都不肯在老将身上花钱

NBA经纪人施瓦茨谈湖人队以125亿美元售出:都不肯在老将身上花钱

好火子
2026-08-13 01:12:03
上将被查、院士被除名,这背后释放的信号,比你想的更不简单

上将被查、院士被除名,这背后释放的信号,比你想的更不简单

李昕言温度空间
2026-03-19 22:56:18
穆里尼奥谈当年从曼联下课:不是我主动走人,俱乐部为解雇决定付出长久代价

穆里尼奥谈当年从曼联下课:不是我主动走人,俱乐部为解雇决定付出长久代价

体育闲话说
2026-08-11 05:50:26
德国总理公开对付中国的毒计,26国震惊:就连特朗普也不敢!

德国总理公开对付中国的毒计,26国震惊:就连特朗普也不敢!

兵鉴史
2026-06-22 19:55:13
绝不容忍!谁给他们的胆量?几个印度人公然在“中华龙脉”生火

绝不容忍!谁给他们的胆量?几个印度人公然在“中华龙脉”生火

猪小艳吖
2026-06-26 13:36:25
24枚导弹零拦截:基辅!

24枚导弹零拦截:基辅!

汉唐智库
2026-08-12 01:28:18
实锤了!六款新 iPhone 被系统泄露

实锤了!六款新 iPhone 被系统泄露

花果科技
2026-08-12 23:06:49
大陆全时待战,特战旅已到台海一线,台军怕啥来啥,郑丽文谈统一

大陆全时待战,特战旅已到台海一线,台军怕啥来啥,郑丽文谈统一

春风笑语
2026-08-12 07:23:36
儿子昨天结婚,订了40桌,每桌6千,没成想收到的份子钱让我心凉

儿子昨天结婚,订了40桌,每桌6千,没成想收到的份子钱让我心凉

千秋文化
2026-07-03 19:19:04
比恐怖主义更危险的,是对文明本身的仇恨

比恐怖主义更危险的,是对文明本身的仇恨

斌闻天下
2026-07-22 06:55:03
上海14岁初中女生跳楼自杀给父母留下三页遗书:若有来生绝不再见

上海14岁初中女生跳楼自杀给父母留下三页遗书:若有来生绝不再见

深度报
2025-08-15 22:42:15
公安部定死“三个当场”,当场要回执,不给你就握住了翻盘底牌

公安部定死“三个当场”,当场要回执,不给你就握住了翻盘底牌

水泥土的搞笑
2026-08-12 12:36:19
原来他是王馥丽儿子,靠《狂飙》45岁大器晚成,如今2年拿2个奖

原来他是王馥丽儿子,靠《狂飙》45岁大器晚成,如今2年拿2个奖

乡野小珥
2026-08-13 01:06:31
2026-08-13 03:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13742文章数 142718关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

冲上热搜:银行能办结婚证了

头条要闻

冲上热搜:银行能办结婚证了

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

全系600km续航/空间表现出色 奇瑞风云T7预售10.99万起

态度原创

时尚
手机
亲子
艺术
游戏

炎炎盛夏,正好Sportique一下!

手机要闻

折叠屏iPhone命名方案再曝,会是“iPhone Ultra”吗?

亲子要闻

未来的儿媳妇,以后逢节你必有礼物!

艺术要闻

工笔的魂,写意的骨!这位画家把两者一融,画中人美得惊心动魄!

《羊蹄山之魂 完整版》预购开启!568港币 10月发售

无障碍浏览 进入关怀版