网易首页 > 网易号 > 正文 申请入驻

日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

0
分享至


新智元报道


每一轮强化学习到底应该把哪些数据交给模型?

这个问题正随着推理模型和 RLVR 的发展变得更加重要。随着强化学习在大模型后训练中的作用不断增强,模型练什么、怎么练,也需要更仔细地安排。一道题可能起初很难,训练一段时间后却能稳定答对。哪些数据该继续保留,学习权重和领域配比该怎样调整,都需要结合模型的训练状态重新考虑。

而数据策略方法往往不止一种,如何把不同方法比较清楚,还有一些实际难题。不同方法各有一套实现,换个筛选规则就可能要改训练器;比较效果时,模型、奖励函数和训练预算又未必一致。即使分数提高了,也很难判断收益究竟来自数据策略,还是其他训练设置。

为了解决数据策略接入和效果比较中的麻烦问题,北大DCAI团队联合UCAS、上海算法创新研究院、中关村学院最新发布DataFlex-RL。


GitHub 开源仓库:https://github.com/haolpku/DataFlex-RL

论文地址:https://huggingface.co/papers/2609.06107

少花时间反复修改训练器,多留精力验证数据策略是否有效,是DataFlex-RL最直接的价值。

DataFlex-RL复用verl的训练流程,把数据选择、样本重加权和领域配比调整做成可配置组件,让开发者可以在同一套RLVR/GRPO流程中配置三类动作:

  • 选择哪些rollout参与当前更新;

  • 给样本或token分配多大的学习权重;

  • 决定下一批数据从哪些领域采样。

这些策略直接复用 RL 循环已经产生的奖励、优势、token 概率和 prompt 分组等信号,rollout、验证和策略更新代码基本保持不变。

论文发布后获得了社区的关注,并登上HuggingFace #2 Paper of the day。论文中组织了591次实验,在多种模型和数学、逻辑、科学任务上,检验数据策略。


三大动态数据策略维度

选择、加权、混合

在GRPO训练中,模型会对同一道题生成多个回答,由验证器给出奖励,再根据组内奖励差异更新模型。DataFlex-RL将数据策略分成三类:选择决定哪些回答参与当前更新,加权调整它们对更新的贡献,混合根据历史反馈改变后续批次的领域构成。


数据选择,控制哪些回答参与策略更新

同一道题生成的回答,提供的学习信号可能很不相同。在基于组内奖励差异的 GRPO 中,一组回答全部正确或全部错误,通常无法形成有区分度的 advantage。

DataFlex-RL 支持按组内解出率、advantage 排名、奖励方差和回答效率进行筛选。

difffilter是一个具体例子:每道题生成五个回答,只保留解出率严格处于0.2与0.8之间的组,也就是答对两个或三个的情况,将更新集中到中间难度的题目。maxvar保留组内奖励方差最大的子集,gfpo按奖励与回答长度的比值选择,topk保留advantage幅值排名靠前的回答。

这里筛选的是已经生成的回答,当前实现通过0/1权重控制策略损失,因此不会减少已经发生的生成成本。评估效率时,还需要关注实际参与更新的数据量。

动态重加权,调整不同样本的学习强度

有时研究者希望保留当前批次中的全部回答,同时让部分样本承担更大的更新权重,重加权就用于这种情况。

DataFlex-RL 支持回答级和 token 级权重:softmax、per根据advantage幅值调整回答贡献,diffband对奖励落在指定分位区间内的样本加权,ar利用已有token概率,对低概率token施加相对较低的权重。

这些方法会将权重均值归一到1,尽量控制整体损失尺度的变化。

动态领域混合,根据历史表现调整配比

数学、逻辑和科学任务的学习进度可能不同,固定比例未必适合每个阶段。DataFlex-RL用滑动窗口累计各领域的训练反馈,再由mixer更新后续批次的目标比例。


混合策略会先在warmup阶段积累反馈,再按配置的间隔更新比例。当前插件通过自定义replay buffer从可用样本中按领域选取,实际进入训练的数据还会受到各领域候选数量的限制,因此需要同时观察目标比例和实际数据分布。

统一技术架构

让数据策略灵活接入训练

三类策略作用的位置不同,都需要接入训练流程、读取反馈,再把判断转成具体操作。DataFlex-RL通过verl插件接入训练,复用已有信号,并将打分与执行分开,让策略组件可以独立替换。

插件化接入,复用verl训练流程

要比较不同数据策略,首先需要让它们在同一套训练流程里运行。DataFlex-RL以插件形式接入verl,通过注册机制提供自己的trainer。

对于选择和加权,插件在原有advantage计算完成后读取信号,运行数据策略,再将结果写入verl已有的rollout_is_weights字段。选择结果转成0/1权重,加权策略返回连续权重,两者都由现有策略损失接口处理。领域混合使用单独的trainer与自定义replay buffer,累计反馈并按更新后的领域比例选取可用样本。

不同策略共用模型生成、奖励验证和模型更新流程,改动集中在数据策略的接入位置。开发者新增方法时,可以沿用这些训练能力,把主要工作放在策略组件上。当前插件面向verl v1 trainer接口,使用前需要确认宿主版本兼容、插件能够正常注册。

共享训练信号,减少重复打分

接入训练之后,策略还需要判断依据。奖励反映回答表现,advantage提供策略更新信号,token log-prob记录 token 概率。这些数据已经随训练产生,scorer可以直接读取并计算所需分数。

策略不需要为了打分额外执行一次模型前向,可以复用相同的信号处理代码。共享的是信号来源和计算逻辑,并不要求所有策略使用同一个分数;领域混合还需要把反馈按领域累计成历史统计。

训练过程还会记录保留比例、权重统计、领域目标比例和反馈,方便检查策略是否按预期运行。

打分与执行解耦,通过组件替换策略

有了分数,接下来才是决定怎样使用它。DataFlex-RL将这两步分别交给Scorer和Actuator。Scorer根据输入信号计算分数,执行器将分数转换成保留索引、连续权重或领域比例。


有了分数,接下来才是决定怎样使用它。同一份advantage幅值分数可以交给topk做筛选,也可以交给softmax生成连续损失权重。

组件按名称注册,再通过配置组合:基于已有信号新增筛选方法时,通常只需实现执行规则;需要新的判断依据时,再扩展scorer。

实验结果

从基础训练增益到动态数据调度

论文共进行了591次实验,覆盖不同基础模型,以及数学、逻辑和科学任务。核心实验在Qwen2.5-7B-base上展开,包含13个配置,每个配置使用12个配对随机种子,共完成156次运行。实验先确认GRPO能够有效训练模型,再观察三类数据策略如何参与后续训练。

在Qwen2.5-7B-base上,未训练模型的平均得分为42.01,采用均匀采样的标准GRPO基线训练后提升到49.77,平均提升7.76个百分点。在Llama-3.1-8B-base上,模型也从10.87提升到21.12,平均提升10.25个百分点。


这组结果建立了后续实验的参照系:GRPO 带来基础训练增益,数据策略继续安排回答、学习权重和领域配比。

选择和重加权实验覆盖difffilter、maxvar、gfpo、topk、ar、per、softmax和diffband。它们从回答筛选、样本权重和 token 权重等角度调整训练信号,在相同模型、数据和训练预算下进行比较。

领域混合实验中,reward_gap、dump_ucb和tscl根据领域奖励差距、探索反馈和训练变化速度,更新后续批次的采样比例。相对于固定等比例混合,三种方法的平均提升分别为0.45、0.61和0.16个百分点,展示了根据训练反馈调整领域配比的方式。


在Llama-3.1-8B-base上,论文继续测试选择、重加权和领域混合配置,验证同一套组件能够迁移到不同模型并沿用相同的训练与评测流程。

此外Table 8从评测侧补充了这一比较:覆盖数学、逻辑和科学三个领域时,不同完整汇总方式得到的结果整体较为接近;调整评测覆盖范围后,方法排序也会发生变化。



这些实验展示了DataFlex-RL的工作闭环:训练时读取奖励、优势和token概率等已有信号,动态调整当前批次的样本选择与学习权重,或更新后续批次的领域配比;验证时通过配置切换策略,沿用同一套训练和评测流程,记录执行过程并比较结果。

DataFlex-RL不仅提供了一个动态训练框架,还提供了一个有效的验证接口,方便研究者观察数据调度在不同模型、任务和训练阶段中的实际作用。

从更大的AI+Data生态看,北大DCAI团队此前已经开源DataFlex,并支持与LLaMA-Factory无缝集成,覆盖Select、Mix、Reweight和Reorder等数据操作。DataFlex-RL则将这套数据灵活处理思路进一步延伸到 RLVR/GRPO 训练过程,根据训练反馈动态调度rollout和领域数据。两套工具形成互补,共同覆盖从数据准备到强化学习更新的更多环节,让数据策略更方便地进入实际训练流程。

关于作者

梁昊,北京大学大数据科学研究中心博士,曾获得国家奖学金,连续两年北京大学校长奖学金,第一作者发表10+篇CCF-A论文/期刊。

主导 Data-Centric AI 系列开源项目设计开发,项目累计获得上万 GitHub Star,其中 DataFlow 项目荣获 ICML SeePhy 比赛冠军,智源 LIC 挑战赛冠军。同时带领团队负责 Camel,LLaMAFactory 项目的数据模块设计开发,分别获得17k+和74k+ stars。

北京大学 DCAI 团队,专注于大模型数据系统研究与Data-Centric AI基础设施建设,开源DataFlow、DataFlex、One-Eval、3AGameFactory、OpenWorldLib等多个项目。

参考资料:

https://huggingface.co/papers/2609.06107

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
疫苗女王高俊芳伏法,丈夫也入狱,罪名除疫苗造假,还有家族贪腐

疫苗女王高俊芳伏法,丈夫也入狱,罪名除疫苗造假,还有家族贪腐

阿裤趣闻君
2026-09-25 14:32:26
以色列总理内塔尼亚胡公开表示:我手里是一台“星链”终端设备,我要把这台设备送给伊朗代表团,这样伊朗人民就能行使选择权,获取真相

以色列总理内塔尼亚胡公开表示:我手里是一台“星链”终端设备,我要把这台设备送给伊朗代表团,这样伊朗人民就能行使选择权,获取真相

吉刻新闻
2026-09-25 14:52:35
第14艘055露面!万吨大驱旧订单告一段落,1.5万吨新舰2028亮相?

第14艘055露面!万吨大驱旧订单告一段落,1.5万吨新舰2028亮相?

一些小事
2026-09-25 20:48:40
未来越南会非常惨!因为越南骗了中国,背弃了跟中国的合作

未来越南会非常惨!因为越南骗了中国,背弃了跟中国的合作

果妈聊娱乐
2026-09-25 11:43:29
四川网红“打假”刀郎:曝20年前遇车祸被表哥冒名顶替,今想要回身份复出遭人身威胁!

四川网红“打假”刀郎:曝20年前遇车祸被表哥冒名顶替,今想要回身份复出遭人身威胁!

火鱼观点
2026-09-24 11:11:28
女篮无缘决赛!全员沮丧目睹韩国庆祝,宫鲁鸣张子宇脸黑,唐子婷特写

女篮无缘决赛!全员沮丧目睹韩国庆祝,宫鲁鸣张子宇脸黑,唐子婷特写

篮球资讯达人
2026-09-25 17:22:19
国务院发话!国家体育总局再出击!没提樊振东,却句句在“撑腰”

国务院发话!国家体育总局再出击!没提樊振东,却句句在“撑腰”

瓜农娟姐
2026-08-03 16:32:43
李治廷中秋官宣当爸爸,已低调结婚3年,混血儿妻子黄发大眼漂亮

李治廷中秋官宣当爸爸,已低调结婚3年,混血儿妻子黄发大眼漂亮

早起的鸟儿有饭吃
2026-09-25 14:20:10
日本女篮二队入亚运决赛!时隔八年保底银牌创纪录 日媒:有望拿冠军

日本女篮二队入亚运决赛!时隔八年保底银牌创纪录 日媒:有望拿冠军

颜小白的篮球梦
2026-09-25 23:12:59
该来的终于来了!菲律宾强闯仁爱礁后,被眼前这一幕直接吓傻眼了

该来的终于来了!菲律宾强闯仁爱礁后,被眼前这一幕直接吓傻眼了

共工之锚
2026-09-26 00:17:02
U23国足劲敌来了!9人旅欧韩国4球狂胜越南,球迷:为免兵役真猛

U23国足劲敌来了!9人旅欧韩国4球狂胜越南,球迷:为免兵役真猛

足球大腕
2026-09-26 00:18:06
事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

阿讯说天下
2026-08-30 06:10:34
5次欧冠破门全给了利物浦,如今他们想签下这个噩梦

5次欧冠破门全给了利物浦,如今他们想签下这个噩梦

绿茵狂热者
2026-09-25 23:15:18
给团长当8年警卫,退伍时团长却避而不见,临走行李里发现绝密档案

给团长当8年警卫,退伍时团长却避而不见,临走行李里发现绝密档案

萧竹轻语
2025-09-09 19:21:59
亚运会人气最高5位运动员,孙颖莎第2,张雨霏第4,第一无可争议

亚运会人气最高5位运动员,孙颖莎第2,张雨霏第4,第一无可争议

卷史
2026-09-25 02:51:39
女排明年建队思路:龚翔宇等人压阵,重点打磨唐欣成主力接应

女排明年建队思路:龚翔宇等人压阵,重点打磨唐欣成主力接应

金毛爱女排
2026-09-26 00:00:11
《兰香如故》要不是祖父点破,林锦岐不知,他给林家已埋下三颗雷

《兰香如故》要不是祖父点破,林锦岐不知,他给林家已埋下三颗雷

楼兰娱姐
2026-09-25 15:13:33
CCTV5+直播U23中泰大战!张玉宁+拜合拉木冲垮泰国!首发两处急需调整

CCTV5+直播U23中泰大战!张玉宁+拜合拉木冲垮泰国!首发两处急需调整

刀锋体育
2026-09-25 20:17:19
美国脸都不要了!贝森特把话说死了,能不能回国得看特朗普脸色

美国脸都不要了!贝森特把话说死了,能不能回国得看特朗普脸色

冰语历史
2026-09-26 01:23:04
台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

抽象派大师
2026-09-20 16:57:21
2026-09-26 02:15:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16275文章数 67092关注度
往期回顾 全部

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

头条要闻

特朗普:这次访问富有成效

头条要闻

特朗普:这次访问富有成效

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

好甜!井柏然刘雯结伴看李荣浩演唱会

财经要闻

月饼卖不动了...

汽车要闻

小鹏G9L VS 保时捷卡宴,同场实测讲解

态度原创

家居
手机
数码
游戏
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

华为深夜突然推送!702MB鸿蒙大更新,正式版实锤了?

数码要闻

PNY被曝拒绝RTX 5090保修 理由是没有使用显卡随附的电源线

曝PS6流片完成:2027年11月发售 可能900美元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版