网易首页 > 网易号 > 正文 申请入驻

阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题

0
分享至

梦晨 发自 凹非寺
量子位 | 公众号 QbitAI

推理大模型开卷新方向,阿里开源长文本深度思考模型QwenLong-L1,登上HuggingFace今日热门论文第二。

其32B参数版本超过OpenAI-o3-mini、Qwen3-235B-A22B等,取得与Claude-3.7-Sonnet-Thingking相当的性能。

除测评分数外,论文中还详细展示了一个金融文档推理的案例。传统模型容易被无关细节误导,而QwenLong-L1通过回溯和验证机制过滤干扰信息,正确整合关键数据

任务要求:根据文档回答问题“将优先票据的发行成本与第一年的利息支出合并计算,总资本成本是多少?”

首先出场的基础模型DeepSeek-R1-Distill-Qwen-14B被文档中“自2011年10月15日起每半年支付一次利息”误导,根据不相关的时间和财务信息,错误计算了第一年的利息支付

接下来,经过额外SFT的版本仍然未能解决这个问题。

它在对不相关文档进行过度分析的循环中自我怀疑,最终尽了最大生成限制(10000 tokens),却没有给出最终答案。

相比之下,虽然QwenLong-L1-14B最初也表现出类似的分心,但它很快进行了有效的自我反思。通过及时验证和回溯,成功过滤掉了不相关的细节,得出了正确答案。

那么,QwenLong-L1是如何做到的?

渐进式上下文扩展

首先,现有推理模型在面对长文本(如几万字甚至更长)时遇到什么问题?

Qwen团队通过对比实验发现,长文本推理的强化学习训练存在两个“硬伤”:

一是训练效率低,传统强化学习(RL)方法在长文本中容易陷入局部最优,奖励收敛慢,限制了策略优化时的探索行为。

二是优化过程不稳定,长文本任务的输出长度更高、输入长度分布不均匀,导致策略更新时的方差被放大,训练过程中参数更新不稳定(如KL散度坐过山车)。

为此团队提出QwenLong-L1训练框架,核心是通过渐进式上下文扩展让模型逐步适应长文本推理。训练过程分为两阶段:

预热监督微调(Warm-Up Supervised Fine-Tuning)

在开始强化学习之前,先用高质量的演示数据进行监督微调,让模型先具备基本的长文本理解能力、推理链生成能力和答案提取能力。

团队从DeepSeek-R1蒸馏了5.3K个高质量的问题-文档-答案三元组,确保模型有个稳定的起点。实验结果显示,这个”热身”阶段对后续的强化学习训练至关重要。

课程引导的分阶段强化学习(Curriculum-Guided Phased Reinforcement Learning)。

从短文本逐步过渡到长文本。例如,先训练模型处理2万token的文本,稳定后再增加到6万token,最后到128K。每个阶段只关注对应长度的文本。

此外还引入了难度感知的回溯采样机制。在进入下一阶段时,会保留前一阶段中最难的样本(平均准确率为零的那些),确保模型不会”忘记”如何处理困难案例。

长文本问答的答案往往比较开放,单纯的规则匹配太死板,可能漏掉正确答案。

QwenLong-L1在强化学习训练中采用混合奖励函数,结合了基于规则的验证和LLM-as-a-Judge。

规则验证也就是直接检查答案是否与标准答案完全一致(如数学题计算结果是否正确),再用另一个模型判断答案的语义是否正确(应对答案表述不同但意思一致的情况),两者结合避免单一规则过于严格或宽松

在DocMath、Frames、2WikimQA等七个长文本基准测试中,QwenLong-L1-14B相比基础模型R1-Distill-Qwen-14B,平均提升了4.1分,超越了Gemini-2.0-Flash-Thinking和Qwen3-32B。

QwenLong-L1的32B版本相比基础模型提升了5.1分,达到70.7的平均分。这个成绩不仅超过了OpenAI-o3-mini(70.4分)、Qwen3-235B-A22B(70.6分),甚至和Claude-3.7-Sonnet-Thinking(70.7分)打成平手。

团队还针对Test-time Scaling性能做了评估。当生成16个候选答案时,QwenLong-L1-14B的表现超过了DeepSeek-R1和OpenAI-o1-preview。

最后论文中还深入探讨了两个问题:

  1. 既然SFT相对简单便宜,为什么还要费劲搞强化学习(RL)?

实验结果很有启发性。长文本SFT确实能带来2.6分的提升,比短文本SFT的效果更好。但是,如果在长文本SFT的基础上再做RL,提升幅度只有0.3分;而在短文本SFT基础上做RL,却能提升3.2分。

对此团队提出一个观点:SFT提供了一种经济的性能提升方式,而RL则是达到最优性能必不可少的

通过跟踪分析了四种关键推理行为发现3个结论:信息定位(grounding)、子目标设定(subgoal setting)、回溯(backtracking)和验证(verification)。

  • 所有模型都展现出明显的推理行为,尤其是信息定位行为出现频率最高,这证明了它在处理上下文依赖推理时的重要性;
  • 强化学习训练过程中,这些行为会逐渐增强,并与性能提升高度相关,表明强化学习能有效调整输出空间,优先保留有助于得出准确解答的推理模式
  • 虽然SFT模型也能学会这些行为,但这些表面上的行为模仿并没有带来实质性能提升,这揭示了SFT更关注表面模式匹配,而非实质推理能力的培养。

论文地址:
https://arxiv.org/pdf/2505.17667

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
坎塞洛回归仪式临阵取消,球衣已备好人在通道内暴怒

坎塞洛回归仪式临阵取消,球衣已备好人在通道内暴怒

晚风知我意21
2026-08-20 07:40:54
彻底反转!日本人终于怒了:宁愿拆靖国神社,也要吃饱饭活下去

彻底反转!日本人终于怒了:宁愿拆靖国神社,也要吃饱饭活下去

星落山间
2026-08-19 02:15:44
把“靖国神社”改称“战犯神社”的同时,“日本天皇”这个称谓也应该调整了

把“靖国神社”改称“战犯神社”的同时,“日本天皇”这个称谓也应该调整了

青陆
2026-08-19 13:31:11
终于查清!围剿郭德纲的幕后黑手是谁?于谦多年前忠告一语成谶

终于查清!围剿郭德纲的幕后黑手是谁?于谦多年前忠告一语成谶

枯蝶
2026-08-18 19:03:36
国乒从“养狼”到“关门”。松岛辉空曾说:“在中国练一个月,顶在日本打一年”。

国乒从“养狼”到“关门”。松岛辉空曾说:“在中国练一个月,顶在日本打一年”。

乒乓乐园
2026-08-20 01:04:04
前国脚:足协出事我乐得蹦高!恨之入骨希望他们死 必须落井下石

前国脚:足协出事我乐得蹦高!恨之入骨希望他们死 必须落井下石

念洲
2026-08-20 08:00:25
凶手将死者掩埋在 20 米深的地下,甚至扬言警方不可能找到死者遗体!2017年的案子

凶手将死者掩埋在 20 米深的地下,甚至扬言警方不可能找到死者遗体!2017年的案子

法网恢恢
2026-08-20 02:44:14
后果很严重!清华毕业的赵海峰只有3个结局,网友发帖预测引发争议:5亿都摆不平了

后果很严重!清华毕业的赵海峰只有3个结局,网友发帖预测引发争议:5亿都摆不平了

火山詩话
2026-08-19 05:47:34
官媒重磅!字字对准赵海峰、郁廷栋!看似温和发声,实则钉死结局

官媒重磅!字字对准赵海峰、郁廷栋!看似温和发声,实则钉死结局

呼呼历史论
2026-08-20 10:20:48
大S豪宅正式完成过户,具俊晔被曝分走约1.5亿,S妈无份,网友:汪小菲还了多年房贷居然成了外人?

大S豪宅正式完成过户,具俊晔被曝分走约1.5亿,S妈无份,网友:汪小菲还了多年房贷居然成了外人?

In风尚
2026-08-20 06:04:59
中菲达成临时安排!

中菲达成临时安排!

安安说
2026-08-20 10:55:49
这才是宋美龄的真实样貌,不是电视剧演员扮演的!

这才是宋美龄的真实样貌,不是电视剧演员扮演的!

动物奇奇怪怪
2026-08-20 12:46:33
办升学宴女儿墙倒塌致5死17伤,主家是低保户条件不好本不想办,邻居、村民劝他,好不容易出了一个学习好的

办升学宴女儿墙倒塌致5死17伤,主家是低保户条件不好本不想办,邻居、村民劝他,好不容易出了一个学习好的

极目新闻
2026-08-19 17:17:06
刚刚,全球首款mRNA癌症疫苗大获成功!肿瘤治疗彻底变天了!1137名患者等来历史一刻

刚刚,全球首款mRNA癌症疫苗大获成功!肿瘤治疗彻底变天了!1137名患者等来历史一刻

徐德文科学频道
2026-08-20 14:15:47
“敢发射就击落?”美国智库放话再敢发射试试,试试就试试!

“敢发射就击落?”美国智库放话再敢发射试试,试试就试试!

安安说
2026-08-20 11:04:01
8月20日,2026年如果养老金不再调整,养老金低的人会更吃亏吗?

8月20日,2026年如果养老金不再调整,养老金低的人会更吃亏吗?

社保小达人
2026-08-20 10:57:14
为了洗地,某些大v能“无耻”成这样,是我没想到的!

为了洗地,某些大v能“无耻”成这样,是我没想到的!

走读新生
2026-08-19 15:06:29
他逃亡16年,靠赃款娶4个漂亮老婆生12个娃,被捕时身家有几个亿

他逃亡16年,靠赃款娶4个漂亮老婆生12个娃,被捕时身家有几个亿

小武侃风云
2026-08-19 03:07:34
2米14,2米15,2米29,让美国男篮头疼的球队诞生了

2米14,2米15,2米29,让美国男篮头疼的球队诞生了

篮球大视野
2026-08-19 16:55:20
父亲患病,三个儿子凑不齐3万医药费,他没怨言,悄悄卖了祖屋

父亲患病,三个儿子凑不齐3万医药费,他没怨言,悄悄卖了祖屋

兰姐说故事
2026-02-05 10:50:09
2026-08-20 14:48:49
量子位 incentive-icons
量子位
追踪人工智能动态
13174文章数 176539关注度
往期回顾 全部

科技要闻

DeepSeek Harness更新多模态支持

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

汪峰也没想到章子怡,挖到了一条财路

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

城区油耗3L级 长安CS55蓝鲸超擎混动 7.99万起

态度原创

家居
教育
时尚
本地
健康

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

立秋之后,我用5个动作给孩子的心理松松土,养出一颗大心脏

内娱还在三件套的时候,韩综已经卷到“扛大炮”了

本地新闻

先导片|攀登不止,让不同的故事在此连接

这种脊柱侧弯,运动能救!

无障碍浏览 进入关怀版