网易首页 > 网易号 > 正文 申请入驻

研究人员提出OThink-R1,让大模型自行决定是否需要深度思考

0
分享至

近日,浙江大学硕士生张盛佳和所在团队发现:深度推理模型的部分推理过程是不必要的。一方面,目前的深度推理模型在面对一些例如“1+1=?”的简单问题时,也需要大费周章地进行深度思考。而人类在面对诸如此类的简单问题时,往往能够凭直觉给出答案;另一方面,在一些简单任务上(例如,常识问答和小学生数学题),即使不具有深度推理能力的大模型也能取得较好的效果。本次研究基于所观察到的现象提出了一种解决方案,使得深度推理大模型在解决问题时,能够自行决定是否进行深度思考,有利于计算资源更加合理的分配,提升大模型的推理效率。

据介绍,受限于数据与算力的规模,预训练以 Transformer 为基础架构的大模型所带来的收益正在不断式微。那么,该如何进一步提升大模型的能力?近来,以 DeepSeek-R1、OpenAI o1 为代表的深度推理大模型突破了预训练 Scaling Law 的限制,通过增加测试时计算资源的投入,在多种复杂任务上取得了优异的效果。与非深度推理大模型相比,深度推理大模型通过模仿人类进行深度思考,能够更加准确地理解用户的需求,更加深入地分析用户提出的问题。

然而,目前的深度推理大模型面临严重的冗余思考问题:即使面对例如“1+1=?”这样的简单问题,深度推理大模型也需要进行长时间的思考,造成了计算资源的浪费。

实际上,人类的思考模式可以分为“根据直觉得出答案”的快思考和“进行深入分析得出答案”的慢思考。在面临一些简单的问题时,人类往往能够通过直觉直接给出答案。

受到人类思考模式的启发,该团队提出了这样一个问题:如何赋予深度推理大模型自动切换快慢思考的能力,自行决定是否需要进行深度思考,从而更加合理地利用计算资源?

针对该问题,他们提出了一种创新性解决方案。具体来说,本研究首先对非推理模型(模仿人类快思考,直接给出答案)和深度推理模型在简单任务(例如,常识问答和小学生数学题)上均成功解决的问题进行统计,收集这类问题上深度推理模型的推理思维链。通过大量比较推理思维链的异同,本研究总结出“必要推理”和“冗余推理”的多条特征,并根据此将深度推理思维链分类为必要推理和冗余推理,将冗余推理中的深度推理部分删除,构成一批混合推理思维链数据集。最后,基于该数据集对深度推理模型进行监督微调,赋予深度推理模型自动切换快慢思考的能力。

因此,本研究对实现“Test-time Scaling Law”具有十分重要的意义,其赋予了深度推理大模型自动切换快慢思考的能力,使得模型能够更加合理的分配计算资源。因此,模型能够通过内部知识直接给出一些简单问题的答案,也能够开启深度思考,细致地分析一些困难的问题。

据介绍,本次研究项目是 OPPO 与浙江大学联合攻关课题之一。受年初 DeepSeek-R1 一系列研究的启发,该团队尝试着来探索 DeepSeek-R1 模型的相关性质。如前所述,他们发现在使用 DeepSeek-R1 模型时,即使问很简单的问题,例如“1+1=?”或者“请帮我修改我的作业”之类的问题,也会生成特别长的思维链。这实际上是不必要的,不仅增长用户等待时间,还会浪费计算资源。

在研究初期,最困扰该团队的是如何设计稳定的模型输出结果验证器。一方面,他们发现 DeepSeek-R1 这类模型,遵循指令的能力不够优秀。这就导致模型推理的结果不具有特定的格式,加大了提取模型结果的难度。

另一方面,该团队自己构建了许多模型的输出结果验证器,但是这些结果验证器没有很好地考虑各种输出结果的风格,十分不稳定。有时会出现模型回答是正确的,但是并未正确地提取模型的答案。或者提取到错误的模型答案导致无法正确地评估各个模型的效果,以及无法正确地评估该团队所提出方法的效果。

在这个问题解决之后,该团队最初始的方案是想基于 GRPO 算法,利用强化学习的方式去激发出模型快慢思考的能力。然而,DeepSeek-R1 这一类模型指令遵循能力差,该团队设计了许多 prompt,都无法在训练的初期让模型输出跳过深度思考过程的回答。于是该团队转向设计奖励函数,期望能够通过设计一类特殊的奖励函数,让模型的思考过程长度首先降为 0,然后慢慢增长。经过该团队多次尝试,该团队设计了一类在理论上能够达到该效果的奖励函数,但是经过多次尝试,该奖励函数在实际中并未达到该团队的目标效果。

这个时候该团队尝试着使用 DPO 算法,将快思考的回答作为正样本,慢思考的回答作为负样本,进行模型训练。该团队进行了许多实验,DPO 效果极其不稳定,训练出的模型均表现出效果大幅下降。在阅读相关文献后,该团队发现,DPO 这类算法不适合分布剧烈变化的情况。于是最后该团队尝试使用监督微调的方式,进行模型的训练。具体做法是,收集训练集上推理模型的正确回答,删除这其中非推理模型也能解决的问题上推理模型的深度思考过程,使用监督微调进行训练。这个方案在初期取得了相比于之前两个方案更优的效果:模型性能不会大幅下降,同时模型能够开始自行决定是否思考。

然而,该团队发现,这个方案仍然无法很好地迁移到其他场景下,仍然会造成模型性能的大幅降低。于是该团队开始考虑,是否在非推理模型能够解决的问题上,模型的一部分深度思考过程也是必要的。从这个想法出发,该团队开始利用大模型对深度思考过程进行分类,将其分类为有效思考和冗余思考,重新构造数据集进行监督微调。最终,在这个方案下,该团队做出了比较好的效果。尽管该团队的研究已经赋予了推理大语言模型自动切换快慢思考的能力,但目前 OThink-R1 还依赖大模型 LLM-Judge 来判断推理冗余。未来该团队期望继续深入研究,以端到端的方式来赋予模型自动切换快慢思考的能力。

参考资料:

标题:OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation

作者:Shengjia Zhang (Zhejiang University), Junjie Wu (OPPO Research Institute), Jiawei Chen (Zhejiang University), Changwang Zhang (OPPO Research Institute), Xingyu Lou (OPPO Research Institute), Wangchunshu Zhou (OPPO Research Institute), Sheng Zhou (Zhejiang University), Can Wang (Zhejiang University), Jun Wang (OPPO Research Institute)

链接: https://arxiv.org/abs/2506.02397

运营/排版:何晨龙

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
贾浅浅撤职不到7天,父亲贾平凹被全网怒批,换掉红色刊名太嚣张

贾浅浅撤职不到7天,父亲贾平凹被全网怒批,换掉红色刊名太嚣张

许三岁
2026-07-22 01:15:07
不买了!印尼总统突然宣布:全面停止进口柴油!到底发生了什么?

不买了!印尼总统突然宣布:全面停止进口柴油!到底发生了什么?

话史官1
2026-07-23 02:36:24
为啥邹市明比王宝强惨?原因很现实,冉莹颖比马蓉多了2个杀招

为啥邹市明比王宝强惨?原因很现实,冉莹颖比马蓉多了2个杀招

一盅情怀
2026-07-22 15:44:00
油价大涨近0.8元/升,创6年“最大下跌”92汽油接近“6元时代”后近乎“全涨起来”,下次7月31日调价,92汽油或重回“8元时代”!

油价大涨近0.8元/升,创6年“最大下跌”92汽油接近“6元时代”后近乎“全涨起来”,下次7月31日调价,92汽油或重回“8元时代”!

猪友巴巴
2026-07-23 09:23:13
央视对蔡磊的称呼变了!四字之差释放强烈信号,刘强东的话没说错

央视对蔡磊的称呼变了!四字之差释放强烈信号,刘强东的话没说错

郭蛹包工头
2026-07-23 01:53:19
谢贤被曝已火葬,狄波拉携儿女现身送别,前任coco哭到声音沙哑

谢贤被曝已火葬,狄波拉携儿女现身送别,前任coco哭到声音沙哑

180视角
2026-07-21 10:02:06
本想怒斥种族歧视,看清是中国肯德基后,美国网友默默删掉长文

本想怒斥种族歧视,看清是中国肯德基后,美国网友默默删掉长文

原广工业
2026-07-22 14:51:14
万斯迎来男婴,创150年来副总统育儿先例

万斯迎来男婴,创150年来副总统育儿先例

天老爷
2026-07-21 23:11:45
印度极有可能成为,一颗“毁灭”世界的定时炸弹?

印度极有可能成为,一颗“毁灭”世界的定时炸弹?

李云飞Afey
2026-07-21 21:38:07
人社部:指导各地结合实际提高本地基础养老金标准

人社部:指导各地结合实际提高本地基础养老金标准

21世纪经济报道
2026-07-22 16:12:32
网传90后1.7亿人口多达1亿未婚,知乎网友分享身边经历,评论区句句扎心,实在结不起婚!

网传90后1.7亿人口多达1亿未婚,知乎网友分享身边经历,评论区句句扎心,实在结不起婚!

眼光很亮
2026-07-23 07:03:55
中国足协:深表遗憾

中国足协:深表遗憾

吉刻新闻
2026-07-23 00:08:05
嫌弃母亲丢人不让参加婚礼 员工被“最爱发钱的老板”当场辞退:不孝之人,企业不养

嫌弃母亲丢人不让参加婚礼 员工被“最爱发钱的老板”当场辞退:不孝之人,企业不养

闪电新闻
2026-07-23 00:47:11
别等自然解体!仁爱礁破船早已被菲方焊死礁盘,看懂这场长期博弈

别等自然解体!仁爱礁破船早已被菲方焊死礁盘,看懂这场长期博弈

行者聊官
2026-07-22 16:43:33
一位老知青的感慨:人生的意义是什么,现实重压下幸福之路在何方

一位老知青的感慨:人生的意义是什么,现实重压下幸福之路在何方

草根情感故事茶社
2026-07-21 09:31:23
台媒曝大S为去韩国定居,多次找S妈要钱,甚至转千万帮具俊晔创业

台媒曝大S为去韩国定居,多次找S妈要钱,甚至转千万帮具俊晔创业

翰飞观事
2026-07-22 14:20:58
人走茶凉!谢霆锋没想到,谢贤去世后,张柏芝因2个举动口碑暴涨

人走茶凉!谢霆锋没想到,谢贤去世后,张柏芝因2个举动口碑暴涨

往史过眼云烟
2026-07-22 16:34:46
项立刚:贾平凹的书画可用“拙劣”二字来评价!《延河》杂志刊头字体更迭旧事,再度发酵

项立刚:贾平凹的书画可用“拙劣”二字来评价!《延河》杂志刊头字体更迭旧事,再度发酵

火山詩话
2026-07-22 07:33:29
常州已有人确诊!近期高发,致死风险极高

常州已有人确诊!近期高发,致死风险极高

中吴网
2026-07-22 21:26:10
美联储铁了心不降息,企图拖垮中国,中国房贷利率还能撑多久?

美联储铁了心不降息,企图拖垮中国,中国房贷利率还能撑多久?

史虇的生活科普
2026-07-21 19:32:05
2026-07-23 10:00:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
16998文章数 515142关注度
往期回顾 全部

科技要闻

特斯拉仨月狂揽2000亿,车卖爆,钱没赚着

头条要闻

牛弹琴:中东又一个战场开辟 4名年轻美士兵战死回国

头条要闻

牛弹琴:中东又一个战场开辟 4名年轻美士兵战死回国

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

47岁汤唯宣布二胎产子 大女儿10岁

财经要闻

谷歌财报强劲 但加速“烧钱”引市场担忧

汽车要闻

智能舒适却依旧硬核 泰钽700仍是台与众不同的硬派SUV

态度原创

手机
时尚
旅游
本地
军事航空

手机要闻

荣耀MagicOS 10 7月更新收官!最后一批超20款机型推送升级

你的脸型适合什么衣领?这5种怎么搭都好看

旅游要闻

不用自驾!全线漫游最美中牟

本地新闻

杭州诗意路名,自带氛围感

军事要闻

乌克兰高层爆发严重内斗 泽连斯基撤换"屠夫"总司令

无障碍浏览 进入关怀版