网易首页 > 网易号 > 正文 申请入驻

清华团队:1.5B 模型新基线!用「最笨」的 RL 配方达到顶尖性能

0
分享至

如果有人告诉你:不用分阶段做强化学习、不搞课程学习、不动态调参,只用最基础的 RL 配方就能达到小模型数学推理能力 SOTA,你信吗?

清华团队用两个 1.5B 模型给出了答案:不仅可行,还特别高效。

  • 核心发现: 单阶段训练 + 固定超参数 = SOTA 性能 + 省一半算力
  • 意外之喜: 训练曲线平滑得像教科书,4000 步没遇到任何 "典型问题"
  • 关键启示: 充分 scale 的简单 baseline,可能比我们想象的强大得多

  • 技术博客:https://relieved-cafe-fe1.notion.site/JustRL-Scaling-a-1-5B-LLM-with-a-Simple-RL-Recipe-24f6198b0b6b80e48e74f519bfdaf0a8
  • 开源模型:https://huggingface.co/collections/hbx/justrl
  • 评测脚本:https://github.com/thunlp/JustRL

背景:RL 训练小模型的 "技术军备竞赛"

2025 年初,DeepSeek-R1 开源后,如何用 RL 训练 1.5B 级别的推理模型成为了热门研究方向。短短几个月内,这个领域经历了快速的技术演进:早期的工作尝试超参数调优和长度控制;随后出现了多阶段渐进训练,每个阶段调整数据难度和 RL 超参数;也有方法引入了课程学习,用部分解作为提示精心设计难度梯度;最激进的做法直接将 rollout 数量提升到 512 次,用算力进行暴力探索。

近期工作用到的技术对比

这些方法都取得了不错的效果,性能在不断刷新。 动态采样、KL 重置、自适应惩罚、长度控制…… 各种稳定技术和优化 trick 被逐一引入。每个新工作都在前人基础上增加新的模块和机制,整个训练 pipeline 变得越来越复杂。

然而,这种复杂度的增长也带来了困惑:这些技术真的都是必要的吗?当不同工作组合使用不同的技术子集时,我们很难分辨哪些是解决根本问题的,哪些只是在修补其他设计选择带来的副作用。更重要的是,如果 baseline 本身就不稳定,那么为了稳定它而加入的技术,可能只是在治标而非治本。

清华团队带着一个朴素的想法开始了这项工作:"如果我们用最基础的配方,但训练得足够充分,能到什么水平?"

于是就有了JustRL—— 名字的意思是 "就这样"。

方法:极简到极致的训练配方

JustRL 的设计哲学是 "减到不能再减"。研究者刻意避免了近期工作中常见的复杂技术,只保留了最基础的组件。

训练配方简单到令人意外: 算法使用标准的 GRPO,没有任何魔改;训练只有一个阶段,从头到尾连续进行;超参数完全固定,不做任何动态调整;数据来自常规的数学问题集,不进行离线难度筛选、不做数据增强、不使用 dynamic sampling。

更关键的是,同一套超参数在两个完全不同的起点上都有效。 第一个实验使用 DeepSeek-R1-Distill-Qwen-1.5B 作为基座,这是一个相对较弱的起点(AIME 2024 准确率 29%);第二个实验使用 OpenMath-Nemotron-1.5B,这已经是一个相当强的基座(AIME 2024 准确率 61%)。研究者没有针对不同模型调整任何参数,在 9 个数学推理基准(AIME 2024/2025、AMC 2023、MATH-500、Minerva Math、OlympiadBench、HMMT/CMIMC/BRUMO 2025)上的全面评测显示,JustRL 达到了 1.5B 模型的最高水平。

一个关键问题:会不会是用了更多算力?正好相反,我们用了更少。

从弱基座起步的 JustRL-DeepSeek-1.5B,最终在 9 项基准上平均达到 54.87%,超越了采用 9 阶段训练的 ProRL-V2(53.08%)。更值得注意的是计算效率:JustRL 使用的总 token 预算约为 1.4E+11,仅为 ProRL-V2 的一半,为 BroRL 的五分之一。在算力 - 性能的权衡上,JustRL 达到了一个新的平衡点。

从强基座起步的 JustRL-Nemotron-1.5B 表现更加出色,平均准确率达到 64.32%,略微超过使用课程学习的 QuestA(63.81%)。关键的差异在于,QuestA 需要完整的推理轨迹来构建 hint,还要分阶段调整提示难度;而 JustRL只需要标准的问题与标答,不需要额外的数据工程,总 token 预算也相对较小。

整个训练在 32 张 A800-80GB GPU 上进行,每个模型训练约 15 天。相比一些需要多阶段训练、频繁调参的方法,JustRL 的工程复杂度和计算开销都显著更低。这些结果的意义不仅在于数字本身,更在于它们揭示的一个可能性:很多时候,我们可能低估了简单方法在充分 scale 下的潜力。

意外发现:4000 步训练,异常平稳

也许比最终性能更令人惊讶的是训练过程本身。研究者详细记录了 JustRL-DeepSeek-1.5B 整个 4000 步 RL 过程中的关键动态指标:策略熵、平均奖励、响应长度。

策略熵始终在 1.2-1.4 范围内健康震荡,没有出现向上漂移(探索崩塌)或向下崩溃(过早收敛);平均奖励从 - 0.6 单调上升到 +0.4,虽然有噪声但趋势清晰,没有长时间的 plateau 或突然的下跌;响应长度从初始的 8000 tokens 自然压缩到 4000-5000 tokens,并稳定在这个范围,这一切都是在没有使用 overlong penalty 的情况下发生的,仅仅设置了最大 16k 的上下文长度。

JustRL-DeepSeek-1.5B 的训练 dynamic

这与很多现有工作报告的训练困难形成鲜明对比。

  • ProRL:"我们观察到熵崩溃和训练不稳定性…"
  • BroRL:"训练到瓶颈只能加 rollout 加大探索…"
  • QuestA:"需要课程学习避免熵崩塌(简单题)或者减缓学习效率(难任务)…"

而在 JustRL 的训练中,这些问题都没有出现。这给了我们一个有趣的观察:也许在某些配置下,当 baseline 足够简单、训练规模足够充分时,一些在复杂系统中出现的稳定性问题可能就不容易发生。

一个有趣的插曲:加 "优化" 反而更差

训练过程中,团队尝试了两个 "按常理应该有帮助" 的修改。这两个实验的结果颇具启发性。

第一个实验是加入显式的长度惩罚。 动机很直接:不少工作证明长度惩罚有效,那么添加一个惩罚项应该能让模型输出更简洁,提高训练效率。结果却令人意外:性能从 55% 下降到 50%。深入分析发现,显式惩罚导致了熵崩塌,熵值从 1.2-1.4 降到 0.4-0.6 ,探索空间被过早压缩。模型还没来得及充分探索有效的解题策略,就被迫收敛到更短的响应上。

第二个实验是换用更宽松的验证器。 逻辑同样合理:减少假阴性(正确答案被误判为错误)应该能提供更清晰的学习信号。但性能继续下滑到 45%。可能的原因包括:更宽松的验证器虽然减少了误判,但也降低了学习信号的细粒度 ——"几乎正确" 和 "完全正确" 不再有明显区分;另一种可能是,严格的格式要求实际上在迫使模型发展更鲁棒的内部推理,而宽松的验证器消除了这种压力。

两组 ablation 效果

这说明什么?一方面,ablation 在接近 2ksteps 的尺度上才开始分道扬镳,意味着现有的 RL tricks ablation 可能在小规模上(几十 / 几百步)得到的结论不一定适合于大规模 scaling,要验证 tricks 的作用可能长期才能看出区别;另一方面,不是说这些技术本身不好(它们在其他工作中确实有效),而是:

  • 技术的价值高度依赖于baseline 的特性
  • 在一个稳定的 baseline 上,某些 "优化" 可能适得其反
  • 不是所有看起来合理的东西都该加

这个工作想说什么?

不是要证明 "简单永远最好"

  • 不是说: "复杂方法都没用"
  • 而是说: "我们可能低估了简单方法在充分 scale 下的潜力"
  • 不是说: "大家都做错了"
  • 而是说: "建立清晰的简单 baseline,能更准确地评估复杂技术的价值"
  • 不是说: "永远别用复杂技术"
  • 而是说: "先验证简单方法的极限在哪,再决定是否需要复杂度"

写在最后:关于 "够用" 的哲学

"Perfection is achieved, not when there is nothing more to add, but when there is nothing left to take away.“
— Antoine de Saint-Exupéry, Airman's Odyssey

JustRL 不是要证明 "简单就是答案"。它想提醒的是:在不断追求技术创新的同时,别忘了回头看看 —— 最朴素的方法,在足够的努力下,能做到什么程度。

也许在 RL 训练小模型这个领域,我们一直在做加法:加阶段、加调度、加采样策略、加稳定技巧。也许现在是时候试试奥卡姆剃刀的做法:减到不能再减,看看还剩什么。JustRL 的发现是:剩下的,可能已经够用了。

如果你正在做 RL,不妨试试:先把简单配方训练充分,看看它能带你走多远。

也许你会发现:够用了。

也许你会发现:还不够,但现在你知道差在哪了。

无论哪种,都是有价值的收获。"如无必要,勿增实体"。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杭州路边出现“胶囊小吃车”,需2万押金+每月1200多元租金,自带油烟机和空调,有夫妻摆摊4天每天近1000元流水

杭州路边出现“胶囊小吃车”,需2万押金+每月1200多元租金,自带油烟机和空调,有夫妻摆摊4天每天近1000元流水

极目新闻
2026-07-22 10:40:59
突发!乌克兰高层爆发严重内斗,泽连斯基宣布撤换乌军总司令,瑟尔斯基“下课”!乌防长一周前刚遭解职,总理也被“劝退”

突发!乌克兰高层爆发严重内斗,泽连斯基宣布撤换乌军总司令,瑟尔斯基“下课”!乌防长一周前刚遭解职,总理也被“劝退”

每日经济新闻
2026-07-22 08:58:09
谢贤火葬仅1天,林青霞怒斥,一言不发的王菲终于不再顾及体面

谢贤火葬仅1天,林青霞怒斥,一言不发的王菲终于不再顾及体面

探源历史
2026-07-22 13:08:10
耐克在中国最大零售合作商宣布:2027年起全面终止线上平台销售 滔搏大跌超20%

耐克在中国最大零售合作商宣布:2027年起全面终止线上平台销售 滔搏大跌超20%

闪电新闻
2026-07-22 11:24:52
明天大暑,使劲吃这菜,一降火、二强筋骨、三健脾胃,现在正当季

明天大暑,使劲吃这菜,一降火、二强筋骨、三健脾胃,现在正当季

阿龙美食记
2026-07-22 08:32:19
许昕怒怼网友:马龙带飞我?那他为啥不带飞你?一般人请不动我

许昕怒怼网友:马龙带飞我?那他为啥不带飞你?一般人请不动我

念洲
2026-07-22 08:33:55
甄珍坦言毕生遗憾:最后悔离开谢贤,嫁给了婚内追求我的刘家昌

甄珍坦言毕生遗憾:最后悔离开谢贤,嫁给了婚内追求我的刘家昌

观史搜寻着
2026-07-22 13:53:21
18人阵亡、耗费375亿美金,美军公布最新对伊战事损失

18人阵亡、耗费375亿美金,美军公布最新对伊战事损失

界面新闻
2026-07-22 16:14:37
特朗普终于承认了:我们就是在干预中国事务!还补了一句:台湾太小了,我不在乎

特朗普终于承认了:我们就是在干预中国事务!还补了一句:台湾太小了,我不在乎

听心堂
2026-07-22 13:54:00
这个脸不能给!中国外长赴菲律宾参会,一不赴宴二没与菲外长见面

这个脸不能给!中国外长赴菲律宾参会,一不赴宴二没与菲外长见面

阿龙聊军事
2026-07-22 11:07:43
花旗:AI最终可能在中国取代约7000万个工作岗位

花旗:AI最终可能在中国取代约7000万个工作岗位

风向观察
2026-07-22 09:41:20
大瓜!某投行的“刷牙门”

大瓜!某投行的“刷牙门”

挖掘机007
2026-07-22 13:24:42
“暑假工5天把家里干破产”上热搜:新型巨婴,是这样榨干父母的

“暑假工5天把家里干破产”上热搜:新型巨婴,是这样榨干父母的

嫹笔牂牂
2026-07-22 07:13:11
罕见一幕出现!王毅落地菲律宾,马科斯召见中方大使,提了3条件

罕见一幕出现!王毅落地菲律宾,马科斯召见中方大使,提了3条件

菠萝欣赏家本尊
2026-07-22 04:00:32
突发!东莞两家30多年港资工厂同时宣告停产,近300名职工面临失业,未提及经济补偿

突发!东莞两家30多年港资工厂同时宣告停产,近300名职工面临失业,未提及经济补偿

火山詩话
2026-07-22 06:38:03
于东来:胖东来禁止员工相互借钱行为

于东来:胖东来禁止员工相互借钱行为

界面新闻
2026-07-22 09:29:12
演员凯莉·霍特尔车祸去世,年仅19岁

演员凯莉·霍特尔车祸去世,年仅19岁

情感大头说说
2026-07-22 15:38:13
谢贤送别仪式最戳人 最让人破防的是,工作人员曝出的一个细节:仪式结束后,张柏芝独自留在灵前,摆上了一碗亲手熬煮的陈皮红豆沙

谢贤送别仪式最戳人 最让人破防的是,工作人员曝出的一个细节:仪式结束后,张柏芝独自留在灵前,摆上了一碗亲手熬煮的陈皮红豆沙

市井大实话
2026-07-22 11:05:11
ZAN 进入 BBA 的价格区间,长期考验开始了

ZAN 进入 BBA 的价格区间,长期考验开始了

晚点LatePost
2026-07-21 22:13:17
上海40岁女子自曝丈夫和侄女保持关系2年,破坏18年婚姻

上海40岁女子自曝丈夫和侄女保持关系2年,破坏18年婚姻

九方鱼论
2026-07-22 06:39:14
2026-07-22 17:08:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13576文章数 142698关注度
往期回顾 全部

科技要闻

怕了?美财长扬言:严查中国AI

头条要闻

半年被骗近2万 88岁退休教授遭77万条未读信息"包围"

头条要闻

半年被骗近2万 88岁退休教授遭77万条未读信息"包围"

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

谢贤:人可以风流,但不能下流!

财经要闻

美国想对中国AI动手?"大人,时代变了"

汽车要闻

上汽贾健旭谈汽车全球化:出海要合规 欧洲人只爱小车是误解

态度原创

教育
本地
旅游
数码
公开课

教育要闻

32岁小镇做题家vs23岁海淀鸡娃:高考后的幸存人生,谁失望了,谁想通了

本地新闻

杭州诗意路名,自带氛围感

旅游要闻

高温热浪再度来袭!上海各大主题乐园各出妙招,解锁夏日清凉新体验

数码要闻

三星HBM混合键合芯片量产推迟!2029年配合英伟达新GPU

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版