网易首页 > 网易号 > 正文 申请入驻

o1之后下一个范式?隐式CoT大突破,让推理不再「碎碎念」

0
分享至

魏熙林为本篇文章第一作者。魏熙林是复旦大学博士生,师从林达华教授,研究兴趣主要集中在 multi-modal LLMs 和 efficient AI。目前在上海人工智能实验室实习,指导 mentor 是臧宇航、王佳琦。

今天推荐一个 Implicit Chain-of-Thought(隐式推理) 的最新进展 ——SIM-CoT(Supervised Implicit Chain-of-Thought)。它直击隐式 CoT 一直「扶不起来」的核心痛点:隐式 token 一旦 scale 上去,训练就容易塌缩到同质化的 latent 状态,推理语义直接丢失。

SIM-CoT 的关键招式是一个 plug-and-play 的 step-level 监督模块:训练时用辅助解码器把每个 latent token「拉回」到可对齐的推理步骤上,既稳住优化、避免 collapse,又让隐式推理第一次真正可解释 —— 你甚至能把每个 latent token 解码成人类可读的中间推理步骤。

更爽的是:推理阶段零额外开销(辅助解码器训练完就丢),但效果却很猛:在 GPT-2 上相对 supervised CoT +2.1%、相对 Coconut +8.2%、相对 CODI +4.3%,在更大的 LLaMA(1B/3B/8B)上也能稳定带来 +1.5%~+9.0% 的提升,并且在 8–16 个隐式 token 这种 “前人容易崩” 的设置下依然稳得住。

目前这项研究刚刚中稿顶会 ICLR 2026,论文、代码、模型权重均已开源,欢迎使用!

  • Paper: https://arxiv.org/pdf/2509.20317
  • Code: https://github.com/InternLM/SIM-CoT
  • Huggingface: https://huggingface.co/collections/Wiselnn/sim-cot-supervised-implicit-chain-of-thought

图 1:(a) 潜变量不稳定:隐式 token 增多起初能提精度,但训练会变得不稳定,甚至塌缩。(b) 信息丢失:失败模型(5 个隐式 token)在隐式表示中丢失关键运算符信息(如 +、−),导致复杂推理无法进行。(c) 距离偏移:失败模型的 latent 间距离收缩、彼此过于相似,同时 latent 逐渐偏离词表嵌入空间中心。(d) 语义同质化:失败模型的 latent 表征趋同,解码结果分布变窄,输出多为数字;正常模型则能生成更丰富的内容。

从显式 CoT 到隐式 CoT:latent 稳定性与监督对齐的重大难点

复杂推理任务(如数学、符号推理、代码推理)长期以来都依赖显式 Chain-of-Thought(CoT):模型把中间步骤一条条写出来,既能提升正确率,也便于人类检查与纠错。

如今,随着推理需求不断增长,显式 CoT 的两大瓶颈越来越突出:成本方面,长 CoT 会显著拉高 token 开销与时延;效果方面,显式步骤容易被数据格式牵着走,出现「模板化推理」、冗长但无效的「自说自话」。

这些局限性推动研究者转向一种更「省 token」的新范式 —— 隐式 CoT(Implicit CoT)。它不再把推理步骤完整写出来,而是用少量隐式 token /latent 表征在模型内部完成多步推理:理论上既能保留推理能力,又能显著降低推理开销。

但把隐式 CoT 真正做稳、做强,远比想象中难,关键挑战在于:隐式 token 到底学到了什么?以及作者团队如何保证它学到的是「可用的推理」,而不是「投机的捷径」?

一个典型现象是 latent instability(潜变量不稳定):当你尝试增加隐式 token 数量来「scale 推理容量」时,模型往往不是变强,而是训练开始抖动,甚至直接 collapse(塌缩)。塌缩后的隐式 token 会出现明显的 信息丢失 —— 尤其是对符号推理至关重要的算子信息(+、−、×、÷ 等)被抹掉;同时 latent 之间的表示会越来越像,出现语义同质化:不同 token 学到的东西高度重合,最后解码出来的内容范围变窄,常常只剩下数字或非常单一的片段,复杂推理自然就做不下去。

现有隐式 CoT 方法在监督粒度上差异很大:Coconut 基本只做答案级监督,模型被要求「最后答对」,但中间 latent 学什么几乎不受约束;CODI 虽然引入了蒸馏信号,把显式 CoT 的信息压到连续 latent 里,但更多是轨迹 / 整体路径级对齐。

SIM-CoT 的关键突破正是 step-level 监督:训练时用辅助解码器把每个 latent 对齐到对应推理步骤,从根上稳定并丰富 latent 推理空间,同时推理阶段不增加任何开销。

图 2: 框架对比:Coconut(左上)、CODI(右上)与 SIM-CoT(下)。Coconut/CODI 仅在答案或轨迹层面进行粗粒度监督;SIM-CoT 引入解码器将隐式 latent 与逐步推理对齐,在不增加推理开销的前提下提升性能。

监督设计新思路:好的隐式推理应当能被「逐步解码」回显式思维链

为了解决隐式 CoT 在 scale implicit tokens 时容易出现的不稳定与塌缩(latent 语义变得同质、算子信息丢失、复杂推理失效)这一关键难题,作者团队提出一个新的视角:隐式推理的质量,与其「可对齐的逐步语义」成正比。换句话说,如果每个隐式 latent 真的在做第 k 步推理,那么它就应该能被一个轻量的解码器「翻译」回对应的显式步骤(比如产生关键算子、关系、子目标),从而让 latent 不再是黑盒的连续向量,而是具备可控的推理结构。

基于这一动机,作者团队提出 SIM-CoT 的训练框架:在训练阶段引入一个辅助 decoder,把每个隐式 latent 与对应的 step-level 推理进行对齐监督(而不是像 Coconut 只监督答案、或像 CODI 更偏轨迹级 / 整体级的粗粒度对齐)。

这样一来,模型在学习「如何答对」的同时,也被强约束去学习「每一步该想什么」,从根源上抑制语义坍缩;更重要的是,推理阶段直接移除 decoder,保持零额外开销,但作者团队依然可以在分析时把隐式步骤解码出来做中间推理可视化,同时获得更强的性能与更稳定的 token scaling 效果。

SIM-CoT 实验结果

作者团队对 SIM-CoT 带来的收益做了系统评估,结论非常明确:更准、更稳、还更省 token。

(i)GPT-2 上:首次做到「隐式 CoT 反超显式 CoT」,且 token 更省。

在 in-domain 的 GSM8k-Aug 上,SIM-CoT(以 Coconut 为骨干)把准确率从 36.6% 提升到 44.8%(+8.2),同时也超过显式 SFT-CoT 的 42.7%;并且保持隐式推理的低 token 开销(平均 token 远低于 SFT-CoT),论文总结为 2.3× token efficiency。

(ii)Out-of-domain 泛化更稳:整体平均提升显著。

在 GSM-Hard / MultiArith / SVAMP 三个外推数据集上,SIM-CoT(Coconut 骨干)的 out-of-domain 平均准确率从 42.6% 提升到 46.9%(+4.3),说明它并不是「只会背训练域步骤」,而是确实把 latent 空间推理做扎实了。

(iii)在更强的隐式基线与更大模型上依然有增益,并显著提升稳定性。

在 GPT-2 上叠加到 CODI 之上也能继续涨(in-domain +0.6,out-of-domain 平均 +0.3);扩展到 LLaMA 3.2 3B 时依然稳定带来 +1.5(in-domain)/+0.7(out-of-domain 平均) 的提升;论文也报告在 LLaMA-3.1 8B 上对 CODI 提升 +3.0。

(iv)效率不打折:推理阶段无额外开销,还更快。

因为辅助 decoder 只在训练期使用,推理期移除,所以 SIM-CoT 推理效率与其他隐式方法一致;同时在 GPT-2 上相对显式 CoT 仍体现出明显速度优势。

图三:作者团队在 GPT-2 以及 LLaMA 1B/3B/8B 基座上系统验证了 SIM-CoT 的性能提升,结果表明该方法在不同模型规模下均稳定有效。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
5.24米!吉利“大块头”,外观大改

5.24米!吉利“大块头”,外观大改

手机评测室
2026-10-05 11:50:47
冠心病最怕的早餐!医生反复提醒:宁可不吃,也别碰这4种早餐

冠心病最怕的早餐!医生反复提醒:宁可不吃,也别碰这4种早餐

任医生聊健康
2026-10-04 18:50:06
普京:我们很快都将开上中国汽车,价格便宜质量好,“我的孙辈将来会做翻译,他们会说中文”!特朗普、马斯克等人的后代也在学中文

普京:我们很快都将开上中国汽车,价格便宜质量好,“我的孙辈将来会做翻译,他们会说中文”!特朗普、马斯克等人的后代也在学中文

台州交通广播
2026-10-02 15:29:45
局势彻底变天了!中日对峙一天天拖下去,越来越多国家终于意识到:中日若兵戎相见,不会像俄乌冲突那样给第三方牟利的机会,而是一场血战

局势彻底变天了!中日对峙一天天拖下去,越来越多国家终于意识到:中日若兵戎相见,不会像俄乌冲突那样给第三方牟利的机会,而是一场血战

林杰论事
2026-10-03 02:28:50
凡是添了孙子的家庭,你们发觉没有,老人都有四个变化!

凡是添了孙子的家庭,你们发觉没有,老人都有四个变化!

热心市民小黄
2026-10-05 12:37:28
三星S27 Ultra顶配实锤:强到离谱,却不是谁都该买

三星S27 Ultra顶配实锤:强到离谱,却不是谁都该买

小柱解说游戏
2026-09-28 17:26:43
大家别想进崔培军的公司了,去年挣2.7亿,给员工分了1.8亿

大家别想进崔培军的公司了,去年挣2.7亿,给员工分了1.8亿

一口娱乐
2026-10-03 09:24:45
不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

冷紫葉
2026-09-19 12:41:16
10-5夺冠!英媒犀利点评,袁思俊哽咽表态,吴宜泽说出关键!

10-5夺冠!英媒犀利点评,袁思俊哽咽表态,吴宜泽说出关键!

陈錈爱体育
2026-10-05 03:12:22
兄弟我又想她了~

兄弟我又想她了~

果粉之家
2026-09-24 13:12:51
中美终于谈妥,统一成定局,大陆海警进金门水域,民进党当局破防

中美终于谈妥,统一成定局,大陆海警进金门水域,民进党当局破防

青青衫书生
2026-10-02 17:46:41
亚运会最终金牌榜产生,最后2金决出,亚运会男女MVP也均产生!

亚运会最终金牌榜产生,最后2金决出,亚运会男女MVP也均产生!

第五才子
2026-10-04 18:38:09
湖人国王季前赛首战:10月5日萨克拉门托开打

湖人国王季前赛首战:10月5日萨克拉门托开打

慢享生活集
2026-10-05 13:14:20
两绿营前民代现身力挺!柯志恩:“新潮流”拼钱袋、我拼下一代

两绿营前民代现身力挺!柯志恩:“新潮流”拼钱袋、我拼下一代

台海新时光
2026-10-05 09:57:16
赴台中为江启臣站台,郑丽文怒批民进党:缺电让传统产业苦不堪言

赴台中为江启臣站台,郑丽文怒批民进党:缺电让传统产业苦不堪言

海峡导报社
2026-10-04 12:10:04
梅德韦杰夫警告美国:此举将导致全面太空战争

梅德韦杰夫警告美国:此举将导致全面太空战争

看看新闻Knews
2026-10-04 20:30:44
全球震动!哈佛研究证实:中国不是崛起,而是正在慢慢回归

全球震动!哈佛研究证实:中国不是崛起,而是正在慢慢回归

叹为观止易
2026-09-24 17:14:28
《兰香如故》直到玉婵离开,林锦岐才明白,兰香的筹谋有多狠

《兰香如故》直到玉婵离开,林锦岐才明白,兰香的筹谋有多狠

天玑影视说
2026-10-04 21:31:28
恐慌!普京下达撤离令,基辅将遭残酷打击,欧洲瞬间进入高度警戒

恐慌!普京下达撤离令,基辅将遭残酷打击,欧洲瞬间进入高度警戒

浮光惊掠影
2026-10-05 05:45:56
全世界仅有三个国家实行户口政策吗,这一事实确实令人感到困惑

全世界仅有三个国家实行户口政策吗,这一事实确实令人感到困惑

老范谈史
2026-10-05 02:02:37
2026-10-05 13:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

DeepSeek Harness国庆假期上新!

头条要闻

牛弹琴:美20岁大兵酒店掐死39岁日本女子 日本举国哗然

头条要闻

牛弹琴:美20岁大兵酒店掐死39岁日本女子 日本举国哗然

体育要闻

30天30队·灰熊:守夜人与雪诺

娱乐要闻

蔡康永事件发酵!品牌火速切割

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
时尚
家居
教育
亲子

艺术要闻

第八届山西省油画作品展 油画选(一)

十一长假,中产挤爆“旅游兴趣班”

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

真是百思不得其解,无从下手了

亲子要闻

小呗的烦恼:林志玲咋变了?

无障碍浏览 进入关怀版