网易首页 > 网易号 > 正文 申请入驻

仅需10%思维链标注,等同全量性能!中科院发布推理监督新范式

0
分享至

来源:市场资讯

(来源:新智元)

新智元报道

编辑:LRST

【新智元导读】大语言模型(LLMs)推理能力近年来快速提升,但传统方法依赖大量昂贵的人工标注思维链。中科院计算所团队提出新框架PARO,通过让模型学习固定推理模式自动生成思维链,只需大模型标注1/10数据就能达到全量人工标注的性能。这种方法特别适合像金融、审计这样规则清晰的领域,为高效推理监督提供了全新思路。

过去一年,大语言模型(LLMs)的推理能力迎来爆发式提升,其核心范式——SFT+RLVR——已成为主流。

SFT(Supervised Fine-Tuning)通过高质量的思维链(rationales)有监督地微调模型,而RLVR(Reinforcement Learning with Verifiable Rewards)则进一步利用可验证奖励信号通过强化学习扩展模型的推理能力,无需思维链监督。

然而,为SFT阶段标注高质量思维链的过程既昂贵又耗时,难以规模化。

中科院计算所团队通过系统实验发现,对于「模式化推理」(Patterned Reasoning)任务,并不需要大量人工思维链,只需让模型掌握任务的推理模式即可。

论文链接:https://arxiv.org/pdf/2510.12643

他们提出了一个简单而高效的框架——PARO(Pattern-Aware LLMs as Rationale AnnOtators),仅用 1/10 的LLM自动标注数据,性能几乎等同于全量人工标注,为解决「思维链监督昂贵、难以扩展」的核心问题提供了全新的视角与方案。

什么是 Patterned Reasoning?

固定模式下的「程序化推理」

并非所有推理任务都要求模型「临场思考」。

有一类任务,虽然语义复杂,但推理路径几乎固定—— 这就是模式化推理任务(Patterned Reasoning Tasks)。

直观理解就是:不同样本内容不同,但「解题思路」一模一样。

常见的例子包括准则驱动的任务,例如:

形式化地,这类任务的执行过程可以抽象为,其中:

是稳定的推理模式(Reasoning Pattern),代表任务所需遵循的固定步骤或逻辑框架;

是样本特定内容(Instance-specific Content),即每个实例不同的文本、数值或事实;

表示将模式应用到内容的过程,生成最终输出。

自适应推理任务(Adaptive Reasoning Tasks)

在这些任务中,模型无法依赖统一模式,因为不同样本可能需要完全不同的解题策略。

例如:

形式上,这类任务可表示为,此时是随样本变化的推理模式,模型需要根据输入灵活选择最合适的思维路径。

为什么Patterned Reasoning值得关注?

研究人员指出,很多金融、审计、法律、风控等工业界的任务(如自定义类别的分类任务、抽取类任务、审核类任务)本质上都是 patterned reasoning——同一套「执行步骤/判断流程」适用于不同实例,实例间主要差别是输入内容而非推理策略。

例如该论文主要研究了两类金融领域的模式化推理任务:

数值语义匹配(NSM):判断两处数值是否指代同一个数值事实。 推理流程:定位数值 → 结合上下文理解数值含义 → 语义分解、对齐 → 逐条判断判断是否等价。

交易目的分类(TPC):判断银行交易流水的用途。推理流程:识别账户与交易方向 → 提取关键词 → 对照预定义的分类体系 → 输出类别。 虽然每条交易内容不同,但规则和决策逻辑是一致的。

这些任务有个共同点:不需要「灵感式推理」,只要遵循固定步骤。

因此,对该类任务,论文提出了关键假设:

模型真正需要学习的,不是每条人类思维链的具体内容,而是背后统一的「推理模式」。

控制实验

推理监督中,什么才是关键?

论文以NSM任务作为代表性的模式化推理任务。为避免数据污染对结论产生干扰,研究团队自行收集了10万条样本并标注正确答案,同时邀请专家精心标注了1万条人工思维链。

NSM任务上不同训练策略的性能比较

通过两个对照实验,研究人员揭示了在SFT + RLVR范式下,模型主要在SFT阶段学习到任务的推理模式,而人工思维链的数量与质量对最终性能的影响并不显著:

1.数量敏感性实验:将SFT的人工思维链数量从10k随机减少至1k(保持推理模式不变),SFT阶段性能明显下降;但经过RLVR优化后,两者差距几乎消失(图2a)。

结果说明只要 SFT 能够有效传授推理模式,RLVR可以通过强大的自我探索能力弥补差距。

2.质量扰动实验:将25%的人工思维链替换为GPT-4.1生成的错误思维链(但保持整体推理模式不变),SFT+RLVR的最终性能依然接近原版,甚至在部分设置下略有提升——作者推测这是由模型生成的「多样性」带来的正向作用。

进一步证明:「推理模式更重要而非每条标注思维链都要完美」 。

这些实验同时揭示了SFT与RLVR的分工机制:

SFT用标注的思维链教模型「怎么思路化地解题」;

RLVR利用规则化、可验证的奖励信号,将所学推理模式泛化到更多任务实例中。

模型真的学到了「推理模式」吗?

为了验证模型是否真的「内化了推理模式」,作者设计了一个颇具启发性的分析工具,用于刻画不同训练策略下模型的推理行为。

核心思路是:

找出那些「一旦换词就会导致答案变化」的关键token——这些高影响力token,正是模型的推理锚点。

具体而言,研究人员提出并实现了「基于采样的关键token检测」方法。

其基本原理是:

识别模型生成回复中的高熵token 位置(即模型最犹豫的地方);

研究团队使用该方法提取了经不同训练策略(SFT+RLVR / pure-RLVR / UFT)得到的模型的 forking token,结果发现:

SFT+RLVR训练的模型,其forking token更具任务相关性——也就是说,模型的关键决策点集中在与任务语义相关的词汇上。

具体来看(见图3),SFT+RLVR 模型的forking token多为「任务关键词」(如 different, main_business),而pure-RLVR或UFT模型的forking token则更多是与任务无关的连接词或泛词(如but, because)。

这说明在后两种策略中,模型的推理模式尚未得到良好内化。

由此可见:SFT+RLVR不仅优化了结果,更让模型真正掌握了任务的推理模式。

PARO

用模式先验让大模型「自标注思维链」

基于上述发现,研究人员提出了PARO(Pattern-Aware LLMs as Rationale AnnOtators) —— 让LLM在「模式提示」下生成思维链,取代人工标注。

流程非常简单实用:

1.Prompt设计

写清任务说明;

明确推理模式,通过人类专家撰写,详细列出步骤化的形式;

给出格式规范和若干示例。

2.生成器选择

使用强推理模型(论文用 Qwen3-235B-thinking)生成思维链。

3.训练流水线

用生成思维链构造SFT数据;

然后走标准的SFT+RLVR优化流程。

研究人员在NSM与TPC两项任务上实现了该流程并报告了结果,如图4所示。

在NSM数据集上:SFT(1k, PARO)+RLVR的准确率与F1(92.2 / 83.6)几乎匹配SFT(10k, Human)+RLVR(92.3 / 83.2),仅使用大模型标注的1k条思维链即可达到10k人工标注思维链相当的性能。这是论文最直观也最有说服力的结论。

另外PARO优于直接蒸馏大模型内部推理轨迹的方法SFT(1k, Distill)+RLVR。

从实验到落地

如何应用PARO?

先分类

把推理任务按「是否模式化」分类(参考论文对 pattern 的形式化描述)。只对模式化推理任务尝试PARO。

小规模尝试

人工写任务的详细推理步骤并附带少量思维链示例,用强推理模型生成少量PARO思维链。对比同数量的纯人工思维链,关注最终指标与标注成本。如果PARO效果接近甚至超越人工标注, 证明可行。

质量监控

用forking-token检测或人工抽查来评估PARO思维链训练的模型是否真的「对齐了推理模式」;如果关键决策点与任务相关性较差,补充更细致的推理模式或者提供更多的数据。

让模式取代人力

让模型学会「有章可循地思考」

这篇论文传递了一个重要信号:

对于可模式化的推理任务,推理模式比标注思维链的数量和质量更关键。

PARO给出了一个高性价比、可落地的推理监督新范式:

推理模式提示 → LLM生成思维链 → SFT → RLVR

在金融、审计、法律等规则性强的工业场景中,这种思路有极高的实用价值。更重要的是,它隐含着一种趋势:

推理监督的未来,或许不是「人教模型」,而是「模型教模型」。

参考资料:

https://arxiv.org/pdf/2510.12643

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
辣椒再次被关注!研究发现:脑出血吃一次辣椒,等于给血管添堵?

辣椒再次被关注!研究发现:脑出血吃一次辣椒,等于给血管添堵?

叙说医疗健康
2026-10-02 08:00:56
目不识丁,出尽洋相?于和伟在金鹰奖上的发言,打了内娱明星的脸

目不识丁,出尽洋相?于和伟在金鹰奖上的发言,打了内娱明星的脸

翰飞观事
2026-10-01 19:11:20
又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

汉史趣闻
2026-09-10 18:28:47
巴萨致命危机!皇马死磕到底!强硬要求剥夺诺坎普 13 座冠军

巴萨致命危机!皇马死磕到底!强硬要求剥夺诺坎普 13 座冠军

澜归序
2026-10-02 09:28:55
副总统的兄弟,也被查了

副总统的兄弟,也被查了

中国新闻周刊
2026-10-02 07:30:14
水谷隼分析:即便日本男团亚运会拿了冠军,洛杉矶奥运会依旧没戏

水谷隼分析:即便日本男团亚运会拿了冠军,洛杉矶奥运会依旧没戏

看尽人间百态
2026-10-02 09:27:38
在农村待两个月你就会明白:一个月有1500元的退休金,到底有多重要

在农村待两个月你就会明白:一个月有1500元的退休金,到底有多重要

蝉吟槐蕊
2026-10-01 15:16:12
几乎全假货!利润高达2400%,为何消费者还一头扎进去争相购买?

几乎全假货!利润高达2400%,为何消费者还一头扎进去争相购买?

兵卒史
2026-10-01 14:07:08
亚运会最新金牌榜:中国155金霸榜,日本单日轰9金,韩国突破30金

亚运会最新金牌榜:中国155金霸榜,日本单日轰9金,韩国突破30金

章民解说体育
2026-10-02 07:24:42
尴尬!C罗不在,拉莫斯一踢主力就进球:进12球 葡萄牙10场全胜

尴尬!C罗不在,拉莫斯一踢主力就进球:进12球 葡萄牙10场全胜

念洲
2026-10-02 07:00:56
彻底摊牌了!台积电重磅突破:不止2nm、3nm,硅芯片时代结束了?

彻底摊牌了!台积电重磅突破:不止2nm、3nm,硅芯片时代结束了?

疯狂小菠萝
2026-09-30 12:38:47
斗胆预测:继房贷贴息后,楼市“王炸”大招已在路上了

斗胆预测:继房贷贴息后,楼市“王炸”大招已在路上了

专业聊房君
2026-09-30 17:09:56
六省2026年养老金计发基数已经出炉,最高涨292元,最低仅52元。

六省2026年养老金计发基数已经出炉,最高涨292元,最低仅52元。

碎月导师
2026-10-02 07:00:05
活塞太难受!杜伦可以做三种选择,签960万资质报价,活塞更难受

活塞太难受!杜伦可以做三种选择,签960万资质报价,活塞更难受

你的篮球频道
2026-10-02 09:25:31
中日在联合国激烈过招,朝鲜代表突然下场参战,战局瞬间一边倒

中日在联合国激烈过招,朝鲜代表突然下场参战,战局瞬间一边倒

知法而形
2026-09-30 13:35:59
男排半决赛时间出炉!中国队再遇老对手很难打,2日18点20分开打

男排半决赛时间出炉!中国队再遇老对手很难打,2日18点20分开打

老吴说体育
2026-10-01 20:53:35
真的太不尊重人了!亚运86公斤举重比赛前,韩国朴惠正说:我以为李雯雯早就退役了

真的太不尊重人了!亚运86公斤举重比赛前,韩国朴惠正说:我以为李雯雯早就退役了

林子说事
2026-10-01 09:26:51
房贷贴息政策:国家替你付1%的利息,没替你付房价的1%

房贷贴息政策:国家替你付1%的利息,没替你付房价的1%

将军箭
2026-09-30 16:07:49
得知我买房后,男友家凑钱也买了一套,我:你一个月7千工资6千5还房贷,咋活?!他:还有你呀,花你的钱!

得知我买房后,男友家凑钱也买了一套,我:你一个月7千工资6千5还房贷,咋活?!他:还有你呀,花你的钱!

烟火人间故事汇
2026-08-15 18:30:07
女股民投入122万加盟赵一鸣,经营半年算账,全家为何沉默?

女股民投入122万加盟赵一鸣,经营半年算账,全家为何沉默?

放开他让wo来
2026-10-01 16:43:17
2026-10-02 10:00:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4948967文章数 9710关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

迪拜航空安全事件疑点重重 副驾驶用何物刺伤机长未知

头条要闻

迪拜航空安全事件疑点重重 副驾驶用何物刺伤机长未知

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

教育
游戏
手机
艺术
时尚

教育要闻

“一校一策”的学校课程实施方案:内涵阐释与实践理路

《GTA6》十大新情报汇总 天气载具多结局等

手机要闻

缓解折痕加深:苹果首款折叠iPhone Duo支持更换保护膜

艺术要闻

第四届中国美术奖铜奖获得者——李卓

在米兰,用时装唤醒内心的自我

无障碍浏览 进入关怀版