网易首页 > 网易号 > 正文 申请入驻

DECS从源头消除冗余思考,实现推理token减半且性能不降反升

0
分享至



本文作者来自复旦大学、上海交通大学和上海人工智能实验室。一作江书洋为复旦大学和实验室联培博士生,目前是实验室见习研究员,师从上海交通大学人工智能学院的王钰教授和张娅教授。

以 DeepSeek-R1、OpenAI GPT Thinking 为代表的大型推理模型,通过长达数千 token 的「思维链」在各类复杂推理任务中展现出卓越的性能。然而,这些模型普遍存在一个核心问题,即过度思考(overthinking) :即便模型已得出正确答案,其推理过程中仍反复出现「wait...」「let me check...」「alternatively...」等自我修正与回溯性表达,造成大量冗余计算,带来大量无意义计算开销。

这一现象已引起学术界与工业界的广泛关注。一种直观的解决策略是引入「对长推理的惩罚机制」,即在强化学习训练过程中加入对过长推理序列的长度惩罚奖励项,以促使模型生成更为简洁的推理路径。

然而,实际操作中面临显著困难:若加重惩罚力度,模型倾向于省略必要的推理步骤,导致性能显著下降;若减轻惩罚力度,冗余推理依旧存在,效率难以提升。因此,推理效率与性能之间难以实现有效平衡。

在这篇 ICLR 2026 的 Oral 论文中,来自复旦大学、上海交通大学和上海人工智能实验室的研究团队首次从理论层面系统揭示了「长度惩罚」策略的根本局限性,并基于此提出了一套全新的训练框架 DECS,在五项域内基准和两项域外基准测试中,均实现了推理长度减少超过 50% 的显著成效,同时模型准确率不降反升。



  • 论文地址:https://openreview.net/forum?id=kdeiRledV6
  • 项目地址:https://pixas.github.io/decs-iclr26-site/

长度惩罚为何总是「误伤好人」?

研究团队对当前主流强化学习框架(如 GRPO)中的序列长度惩罚机制进行了一次深入的理论分析,相关证明可详见论文原文,结论揭示了两个此前从未被系统性指出的致命缺陷:

缺陷一:对高熵探索 token 的无差别攻击。模型在推理过程中生成的「wait」「however」「alternatively」等高熵 token,本质上是逻辑衔接的「状态转移」,是找到正确答案所必需的探索行为。然而序列级的长度惩罚不区分 token 类型,一条正确的长推理链上的所有 token 都会均匀地收到负面梯度信号。当训练数据中简单题占多数、且各题回答长度差异大时,这种对高熵 token 的压制会不断累积,最终导致模型丧失探索能力,过早收敛到次优策略。

缺陷二:对局部冗余的「变相奖励」。团队引入了一个极为关键的概念 ——必要推理前缀(Necessary Reasoning Prefix, NRP) ,即从推理开始到首次得出正确答案所需的最短 token 序列。在 NRP 之后多出来的所有 token,本质上都是冗余。然而,现有的序列级奖励机制中,一条已经包含了 NRP 的较短回答,其 NRP 之后的冗余 token 可能仍然会收到正奖励,因为整条序列在组内相对较短。这种「奖励冗余」的信号严重扭曲了优化方向,让模型学不会在该停的时候停下来。



图 1 序列长度惩罚的两个副作用

DECS:一次「解耦」如何根治过度思考

基于上述两个理论发现,DECS 从两个维度对训练过程进行了精准重构:

第一步:解耦 token 级奖励,精准识别并惩罚冗余。

团队训练了一个轻量级的 NRP 检测器(judge model),用于定位推理链中从起始到第一个包含正确答案的「块」之间的所有 token。一旦确定了 NRP 的边界,DECS 就会对奖励函数进行「解耦」:NRP 范围内的必要推理 token 永远不受惩罚;而 NRP 之后出现的每一个冗余推理 token,都会恒定为负奖励。

通过解耦必要 token 和冗余 token,算法确保了模型只被禁止「画蛇添足」,而非在推理的每一步都进行无效思考,但并不影响模型通过反思和多样化推理推导得到正确答案。

第二步:课程式批次调度,保护探索能力不受伤。

惩罚冗余虽然直接,但也存在一个隐忧:在训练早期,惩罚信号可能无意中波及到那些看似冗余、实为探索的高熵 token。DECS 的做法是动态调整训练 batch 中简单题的比例:当模型当前的平均 NRP 占比较低(即冗余还比较多)时,就少放简单题;随着训练推进、冗余逐步减少,再逐渐提高简单题的比重。

这套课程数据调度策略本质上是一个缓冲机制,在确保冗余被充分压缩的同时,给模型留出充足的探索空间,避免「一刀切」式的惩罚扼杀了推理的多样性。



图 2 DECS 训练示意图

实验验证:多个数据集推理长度砍半,性能反升

实验覆盖了 DeepSeek-R1-Distill-1.5B、7B 以及 Qwen3-4B 三个主流基座模型,在 AIME2024/2025、MATH500、GPQA-Diamond、LiveCodeBench-v6 等七个数学、科学与编程基准上进行了系统评估。

结果令人瞩目:在 1.5B 模型上,DECS 将平均推理 token 数量削减了57.17%,而 Pass@1 准确率反而提升了2.48 个百分点;在更成熟的 7B 模型上,尽管模型本身的过度思考程度较轻,DECS 依然砍掉了49.50%的思考 token,同时带来0.8 个百分点的准确率增益。在与 ThinkPrune、TLMRE、LC-R1 等主流基线方法的对比中,DECS 在效率 - 性能综合指标(AES score)上分别以0.12 和 0.14的优势显著领先。

更关键的是跨域泛化能力:DECS 的 NRP 检测器仅使用数学语料训练,但其效率优势却强有力地迁移到了科学推理(GPQA-Diamond,56.33%token 缩减)和编程任务(LiveCodeBench-v6,33.52%token 缩减)上。

这验证了一个更深层的洞见 ——过度思考是一个跨领域的系统性现象,而 DECS 的机制足够本质,可以无差别地将模型从冗余推理中解放。



表 1 DECS 性能对比

消融实验进一步验证了两个核心组件的互补关系:去掉课程式调度,模型在压缩推理的同时出现了显著的性能退化,印证了文章中揭示的探索抑制问题;而单独去掉解耦奖励,模型仍然残留约25%的冗余 token,佐证了序列级奖励无法消除全部冗余的结论。



图 3 消融实验对比:解耦奖励和课程调度都至关重要

意义与启示

DECS 这项工作的核心价值,并不在于其几乎无损的压缩指标本身,而在于它所提出的问题以及从理论视角证明的结论。

当前,业界普遍聚焦于「如何让模型更善于思考」,却鲜有研究从系统性与理论层面回答两个更为根本的问题:「什么不值得思考?」以及「何时应当停止思考?」。

DECS 通过严谨的理论分析与扎实的实验验证,证明了高效推理的真正瓶颈并非模型的能力边界,而在于训练目标的精妙设计。

对于那些正受困于推理大模型高昂成本与延迟的部署者而言,DECS 提供了一套无需牺牲精度、完全开源的技术方案,相关代码已开源于 GitHub。

同时,DECS 入选 ICLR 2026 Oral 的认可也进一步印证:要从根本上缓解「过度思考」问题,优化必须回归奖励函数的本质,从策略梯度的底层机制入手,在源头消除冗余推理 token。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
死马当活马医!邓卓翔为武汉足球拼了,铁人一旦降级,徐正源铁定无缘国足主帅

死马当活马医!邓卓翔为武汉足球拼了,铁人一旦降级,徐正源铁定无缘国足主帅

刀锋体育
2026-10-05 08:00:14
1964年阿尔巴尼亚送来1万多株树苗当国礼,全国12个试种点全部失败,唯独甘肃陇南这个穷山沟,50年后干出了45亿产值?

1964年阿尔巴尼亚送来1万多株树苗当国礼,全国12个试种点全部失败,唯独甘肃陇南这个穷山沟,50年后干出了45亿产值?

扶苏聊历史
2026-10-05 17:03:11
“巨人之旅”夺冠后赵家驹身价破千万,签约费翻了10倍!“再多流量和商业我都接得住,我不存钱,钱全交给妻子”

“巨人之旅”夺冠后赵家驹身价破千万,签约费翻了10倍!“再多流量和商业我都接得住,我不存钱,钱全交给妻子”

大风新闻
2026-10-05 10:19:07
数据炸裂!邓弗里斯在荷兰队大爆发,皇马右后卫二选一难题仍在

数据炸裂!邓弗里斯在荷兰队大爆发,皇马右后卫二选一难题仍在

福酱的小时光
2026-10-06 05:47:19
赖清德连任就武统?岛内挖双重陷阱,就等大陆跳,大陆心里门儿清

赖清德连任就武统?岛内挖双重陷阱,就等大陆跳,大陆心里门儿清

陈辉论剑
2026-10-05 17:05:31
唏嘘!14岁随父母移民美国,打拼半生实现美国梦!丈夫激进投资惨亏上亿美元,疑杀妻后自杀

唏嘘!14岁随父母移民美国,打拼半生实现美国梦!丈夫激进投资惨亏上亿美元,疑杀妻后自杀

华人生活网
2026-10-06 04:13:40
知名外籍武打演员何麦因突发心脏病在香港去世,享年64岁;系刘家良入室弟子,为“黄飞鸿第五代传人”, 家人以“毫无预警”形容这场噩耗

知名外籍武打演员何麦因突发心脏病在香港去世,享年64岁;系刘家良入室弟子,为“黄飞鸿第五代传人”, 家人以“毫无预警”形容这场噩耗

大风新闻
2026-10-05 18:00:27
为何林锦岐看到《寒山图》就确定了许兰香就是沈大学士的孙女?

为何林锦岐看到《寒山图》就确定了许兰香就是沈大学士的孙女?

刺头体育
2026-10-05 11:15:49
蒙古国开始后悔了!当年选择独立,如今面对现实,却多了一份无奈

蒙古国开始后悔了!当年选择独立,如今面对现实,却多了一份无奈

西楼知趣杂谈
2026-10-05 16:33:21
蒙古全国上下掀起还债热潮,民众主动捐献马匹,不少人开着卡车跨境来华批量采购物资转售,这一系列现象的背后,究竟藏着怎样的深层动因?

蒙古全国上下掀起还债热潮,民众主动捐献马匹,不少人开着卡车跨境来华批量采购物资转售,这一系列现象的背后,究竟藏着怎样的深层动因?

人生录
2026-10-05 14:29:37
为什么都在宣传用了新能源车就回不去了?看网友评论:引万千共鸣

为什么都在宣传用了新能源车就回不去了?看网友评论:引万千共鸣

另子维爱读史
2026-08-04 21:35:07
俄方寸步不让:天然气管道非得取道蒙古进入中国

俄方寸步不让:天然气管道非得取道蒙古进入中国

果妈聊娱乐
2026-10-01 16:13:46
全国各大寺院陷入倒闭潮,不是顾客少了,而是自己把自己拖垮了!

全国各大寺院陷入倒闭潮,不是顾客少了,而是自己把自己拖垮了!

风干迷茫人
2026-07-06 18:12:51
收官大战打响!CCTV5直播,国足29年不败,输球邵佳一或将下课

收官大战打响!CCTV5直播,国足29年不败,输球邵佳一或将下课

刘哥谈体育
2026-10-06 02:17:45
直击人心!陈震转发长文引爆集体怀旧,一串数字戳破时光错觉,网友:80后都快五十了

直击人心!陈震转发长文引爆集体怀旧,一串数字戳破时光错觉,网友:80后都快五十了

火山詩话
2026-10-05 15:34:23
刘銮雄妻子甘比现身上海科技展,一身造型引热议

刘銮雄妻子甘比现身上海科技展,一身造型引热议

娱你同欢
2026-10-04 20:18:51
最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

智慧生活笔记
2026-10-01 09:54:07
WTT中国大满贯:女单32强全诞生!孙颖莎涉险过关、姜依依一轮游

WTT中国大满贯:女单32强全诞生!孙颖莎涉险过关、姜依依一轮游

行舟问茶
2026-10-06 03:35:53
回族祖先来自哪个民族?很多人以为是"阿拉伯人",其实并不是,回族真正的民族源流是谁?

回族祖先来自哪个民族?很多人以为是"阿拉伯人",其实并不是,回族真正的民族源流是谁?

磊子讲史
2026-10-05 11:18:16
快船104-101击败勇士!这一战诞生4个事实:湖人不该放走八村

快船104-101击败勇士!这一战诞生4个事实:湖人不该放走八村

篮球大视野
2026-10-05 09:55:19
2026-10-06 06:03:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

孙颖莎整顿乒乓球观赛礼仪:有闪光灯、呐喊等干扰

头条要闻

孙颖莎整顿乒乓球观赛礼仪:有闪光灯、呐喊等干扰

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
数码
家居
手机
公开课

艺术要闻

绝了!一点“炫色”的视觉游戏,竟能美成这样?看完直接沦陷!

数码要闻

海外消费者网购下单两次AMD锐龙7 9850X3D处理器,均被调包成十年前的酷睿i3-3000系列产品

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

三星Galaxy S27 Ultra基础颜色选项曝光:黑色、蓝色、浅粉色、白色

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版