网易首页 > 网易号 > 正文 申请入驻

AReaL v1.0.5 x 昇腾RL全能力解读(二):训推共卡与多教师蒸馏——资源效率与能力...

0
分享至

来源:市场资讯

(来源:华为计算)

上一期介绍了Code Agent长序列RL训练,本次继续解读AReaL-Ascend v1.0.5的两大创新:训推共卡部署形态与Multi-Teacher On-Policy Distillation。这两项能力分别解决了资源效率与能力融合两大核心痛点。

AReaL-Ascend v1.0.5新增了训练与推理共卡(Colocated Training & Rollout)能力。

相比训推分离需要分别为Trainer和Rollout Engine准备独立NPU资源,共卡模式让Training和vLLM Rollout复用同一组NPU,通过训练/推理阶段交替使用设备,大幅降低RL实验的资源门槛。

这一模式尤其适合:

NPU资源紧缺:无需额外准备独立Rollout Pool;

On-Policy训练:训练完成后使用最新policy直接进入下一轮 rollout,减少policy staleness;

快速调试与稳定复现:资源拓扑更简单,更适合作为RL correctness / convergence baseline。

因此,AReaL-Ascend现在可以同时支持两种部署方式:

训推分离:面向大规模异步吞吐;

训推共卡:面向资源效率、严格On-Policy和快速复现。

共卡实现:Ray调度+AWEX IPC Zero-Copy

共卡模式的核心流程可以概括为:

Ray NPU BindTrainingWeight OffloadStride ForkLaunch vLLM on the Same NPUsRolloutAWEX Weight Update

其中包含如下几个关键优化:

NPU Bind:Ray纳管NPU后,每个Training Worker固定绑定一张 NPU,为后续推理复用建立稳定的设备映射。

Stride Fork:根据vLLM推理实例的TP/并行规模,将一组Training Worke重新组织成一个推理实例,并复用原有Ray placement。

IPC Zero-Copy:推理进程通过IPC handle直接映射训练进程中的 NPU权重显存,避免 NPU → CPU → NPU 的额外数据搬运。

Group Tensor Packing:在IPC序列化前按照shape / dtype合并 Tensor,大幅减少大模型场景下的IPC handle数量和系统资源消耗。

Recursive Partition:基于AWEX transfer plan对训练权重进行重分片,仅向目标inference rank发送其所需权重,支持训练与推理并行策略不一致的场景。


训推共卡的核心价值在于“零拷贝”——通过AWEX IPC技术,推理进程可以直接映射训练进程的显存权重,避免了传统方案中“显存→CPU→显存”的冗余数据搬运。对于27B级别的大模型,这意味着节省了数十GB的数据传输开销和数秒的等待时间。

Qwen3.6-27B单节点共卡样例

v1.0.5已提供Qwen3.6-27B + Geometry3K + GRPO + AWEX Colocate 的可运行样例:

https://github.com/HwVanICI/AReaL/blob/ascend-v1.0.5/examples/vlm_npu/qwen3_6_27b_geometry3k_grpo_awex_colocate.yaml

样例配置:


运行命令:

python examples/vlm/geometry3k_grpo.py \--config examples/vlm_npu/qwen3_6_27b_geometry3k_grpo_awex_colocate.yaml


Qwen3.6 27B单机即可完成多模态RL训练200step长稳

Multi-Teacher On-Policy Distillation:让多个领域专家能力汇聚到一个模型

除了Agentic RL,On-Policy Distillation正在成为大模型后训练中非常重要的一条技术路线。

传统RL可以将一个模型针对特定领域持续强化,但真正构建通用模型时,一个困难的问题是:

如何把多个已经训练好的领域专家能力,高效、稳定地整合到一个 Student Model中?

Multi-Teacher On-Policy Distillation(MOPD)正是针对这一问题提出的后训练范式。

为什么需要MOPD?

想象一下:你有一个擅长数学的模型A、一个精通代码的模型B、一个长于搜索的模型C——如何把它们的能力融合到一个通用模型中?传统方案是离线蒸馏,但存在“训练-测试分布不匹配”的问题。MOPD让Student模型自己生成内容,再由各领域Teacher实时评价,确保蒸馏信号始终对齐Student的真实行为。

MOPD的核心思路是:

针对不同domain,分别训练独立的expert / teacher;

不直接使用teacher离线生成的数据训练student;

由student自己进行on-policy rollout;

对student真正生成的token,由对应domain teacher进行token-level scoring;

将teacher-student log-probability gap转换成稠密优化信号;

最终将RL objective与distillation objective联合优化。

这相比传统off-policy distillation的一个重要优势是:MOPD通过on policy的方式,让teacher只在student当前策略真实采样出来的样本上打分,从而减少train-test distribution mismatch(训练分布和测试分布不匹配)/ teacher-student distribution mismatch(教师模型见过 / 生成的数据分布,和学生模型实际产出的数据分布不一致)。

一句话大白话总结:

传统离线蒸馏:老师提前出好卷子,学生刷卷子学习,只有参考答案那条路径有评分;学生一旦写的和参考答案中间步骤不一样,就没有参考答案可以参考。

MOPD:学生现场做题, 学生写任何一步,不管是不是标准答案,老师现场针对你写出来的这一步给分。

MOPD论文进一步报告了其在多领域能力集成上的效果,并已经用于MiMo-V2-Flash的工业级后训练实践,这也使得Multi-Teacher + On-Policy Distillation成为近期非常值得关注的post-training方向。

AReaL-Ascend中的MOPD

AReaL-Ascend v1.0.5已提供完整的MOPD示例:

文档:https://github.com/HwVanICI/AReaL/blob/ascend-v1.0.5/examples/distillation/mopd/README.md

当前example使用两个不同领域:

  • AIME:数学推理领域;

  • LeetCode:代码生成领域。

并已在如下环境完成验证:

2 台 Atlas 800T A3 Nodes (16卡)


AIME Reward:0.51 → 0.75 / 25 steps


LeetCode Reward:0.31 → 0.69 / 25 steps

Domain-aware Teacher Routing(领域感知教师路由)

AReaL支持按照dataset domain将不同trajectory路由到不同的 teacher:


例如:

AIME trajectory -> AIME TeacherLeetCode trajectory -> LeetCode Teacher

这种设计可以让每个专家教师专注于自己擅长的领域,提升蒸馏信号的针对性 。

除了domain routing,AReaL还支持mixture routing:多个teacher可以同时对同一trajectory进行scoring,再对它们的token log-probability进行加权组合。Mixture Routing提供了一种更灵活、更强大的知识蒸馏范式。 通过智能地融合多个专家教师的知识,来训练出一个能力更全面、更强大的学生模型,解决单一教师模型无法应对的复杂问题 。

RL + Distillation联合优化

MOPD并不是简单imitation。

Student首先自己rollout,Teacher再对Student已经生成的token进行评价。

简化理解,可以把每个token的teacher signal看成:

Teacher 更认可这个 token提高该 token 的学习优势Teacher 相比 Student 更不认可这个 token降低该 token 的学习优势

这种token级别的精细化反馈,为模型提供了比传统RL中“整体回答打分”更丰富、更及时的优化指引,相当于每一步都有教师给予实时指导。

在AReaL中,最终actor objective可以同时包含:

RL Loss + MOPD Distillation Loss

因此可以同时利用:

Reward signal:告诉模型最终任务是否完成;

Teacher token-level signal:告诉模型生成过程中哪些token更接近领域专家策略。

相比只有terminal reward的RL,这提供了更加稠密的optimization signal。两种信号配合使用,既能确保模型最终目标不偏离,又能显著缓解纯RL训练稀疏、不稳定的问题,提升整体训练效率与收敛质量。

这类能力对于未来的模型后训练非常有价值:不同团队可以独立训练Math、Code、Search、Agent等领域Expert,再通过Multi-Teacher On-Policy Distillation将它们的能力逐步集成到一个通用Student中。这为"专家能力融合"提供了一条可规模化、可工程化的技术路径。

下期预告:下一期将介绍LoRA RL能力,并梳理LoRA RL的快速上手路径,帮助开发者低成本开启AReaL RL后训练之旅!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
特朗普:准备签和平协议了再和普京见面

特朗普:准备签和平协议了再和普京见面

看看新闻Knews
2026-09-03 10:26:05
简氏2026发布复盘:巴基斯坦歼十没有击落阵风战机,打中的全是拖曳诱饵!

简氏2026发布复盘:巴基斯坦歼十没有击落阵风战机,打中的全是拖曳诱饵!

步论天下事
2026-09-01 09:17:26
今日油价:今天2026年9月3日,国内加油站调整后92、95汽油最新零售价一览!

今日油价:今天2026年9月3日,国内加油站调整后92、95汽油最新零售价一览!

沙雕小琳琳
2026-09-03 11:08:36
“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

林林先生
2026-08-27 19:14:35
中国卖武器,爆发了!

中国卖武器,爆发了!

燕梳楼频道
2026-09-03 13:00:29
当不成总统了?80岁特朗普要跑路,白宫掀起下岗潮,万斯还在坚守

当不成总统了?80岁特朗普要跑路,白宫掀起下岗潮,万斯还在坚守

南宗历史
2026-09-03 05:26:02
王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

可乐谈情感
2026-08-30 07:27:10
太贵了!4人吃南昌拌粉花156元,辽宁游客怀疑被多收100元,看完菜单恍然大悟

太贵了!4人吃南昌拌粉花156元,辽宁游客怀疑被多收100元,看完菜单恍然大悟

火山詩话
2026-09-02 10:20:03
连根手指都塞不进去!特斯拉Model Y L后轮塌了,车主们炸了

连根手指都塞不进去!特斯拉Model Y L后轮塌了,车主们炸了

道哥说车
2026-09-03 09:25:17
沃特金斯谈新月首秀:这场比赛达到英超水平,希望每场都进球

沃特金斯谈新月首秀:这场比赛达到英超水平,希望每场都进球

懂球帝
2026-09-03 14:49:19
2026基础养老金迎来调整,人社部给出方向,70岁老人能额外加钱吗

2026基础养老金迎来调整,人社部给出方向,70岁老人能额外加钱吗

陈博世财经
2026-09-03 13:58:49
沉默三个月后,中方动真格了,冻结安世21亿资产,荷兰求饶无效

沉默三个月后,中方动真格了,冻结安世21亿资产,荷兰求饶无效

跳跳历史
2026-09-02 08:18:38
韩媒报道:朴彩英拒绝100亿韩元中国奶茶代言

韩媒报道:朴彩英拒绝100亿韩元中国奶茶代言

韩小娱
2026-09-03 15:24:07
吴易昺3‑0横扫达克沃斯闯进美网32强!低谷从来不等于终点

吴易昺3‑0横扫达克沃斯闯进美网32强!低谷从来不等于终点

嘴角上翘
2026-09-04 00:28:41
一查吓一跳!井柏然3700万北京豪宅曝光,内部装饰到底有多壕?

一查吓一跳!井柏然3700万北京豪宅曝光,内部装饰到底有多壕?

往史过眼云烟
2026-09-03 22:01:15
大满贯16连胜!阿尔卡拉斯3-1跻身美网32强,下轮将战吴易昺

大满贯16连胜!阿尔卡拉斯3-1跻身美网32强,下轮将战吴易昺

全景体育V
2026-09-03 11:16:34
3542万印度移民流出,西方多国关上大门,中国恐意外“接盘”?

3542万印度移民流出,西方多国关上大门,中国恐意外“接盘”?

千羽解读
2026-09-03 10:17:05
血糖达到多少会烂脚?脚部出现这4个信号,可能是糖尿病足来临了

血糖达到多少会烂脚?脚部出现这4个信号,可能是糖尿病足来临了

健康之光
2026-09-03 09:45:26
华侨城退出,招商蛇口超5亿接下深圳国际会展中心全盘运营权

华侨城退出,招商蛇口超5亿接下深圳国际会展中心全盘运营权

南方都市报
2026-09-03 14:17:19
彻查!信号强烈!中央升级反腐“天网”!

彻查!信号强烈!中央升级反腐“天网”!

职场资深秘书
2026-09-03 13:02:35
2026-09-04 01:24:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4650621文章数 9444关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

本地
艺术
数码
房产
教育

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

艺术要闻

投资8亿,全球最大!北京文化新地标2028年建成

数码要闻

AMD肾上腺素驱动26.9.1可选更新发布

房产要闻

投资50亿!三亚又一重大配套,方案曝光!

教育要闻

161中学校长吴伟东:铸牢基础教育根基,培育全面发展栋梁

无障碍浏览 进入关怀版