网易首页 > 网易号 > 正文 申请入驻

传统UED瓶颈被打破,强化学习也能精准定位「最近发展区」

0
分享至



本文第一作者来自国防科技大学数智建模与仿真国家级重点实验室(State Key Laboratory of Digital Intelligent Modeling and Simulation)2024 级博士生原方,通讯作者为国防科技大学曾俊杰助理研究员、李庆伦博士,并由尹全军研究员、秦龙副教授、沈思淇长聘副教授(厦门大学)、谢毓湘教授、杨俊强副研究员共同合作完成。研究团队长期聚焦建模仿真、强化学习等相关方向研究。

训练强化学习智能体时,一个常见问题是:有些 level 太简单,智能体跑几遍就会;有些 level 又太难,智能体几乎得不到有效反馈。前者只是在重复已有能力,后者则会把训练预算消耗在无效探索上。真正有价值的训练环境,往往位于二者之间。它刚好超过智能体当前能力边界,但又没有难到完全学不会。换句话说,强化学习训练也存在某种「最近发展区」:高效训练的关键,不只是生成更多 level,而是找到当前阶段最值得学的 level。

Unsupervised Environment Design(UED)正是围绕这一问题展开。UED 不再把训练环境看作固定数据集,而是通过自动生成、选择或重放 level,动态塑造训练分布,让智能体在持续学习中获得更好的泛化能力。但 UED 面临一个核心难题:系统需要知道,哪些 level 真正推动了智能体学习。

近日,来自国防科技大学、厦门大学等机构的研究者提出了PACE(Parameter Change Environment Design)。PACE 使用 level 诱导的策略参数变化作为训练价值信号,直接衡量该 level 是否带来实际学习进展。该工作已被 ICML 2026 接收。



  • 论文题目:PACE: Parameter Change for Unsupervised Environment Design
  • 论文链接:https://doi.org/10.48550/arXiv.2605.01358

UED:让训练环境自己形成课程

UED 的出发点并不复杂。传统强化学习通常先给定一批训练环境,再让智能体在其中反复学习。但训练环境并非越多越好,也不是越难越好。如果 level 太简单,智能体很快进入「舒适区」,只能巩固已经掌握的行为;如果 level 太难,智能体又会进入「恐慌区」,长期得不到有效奖励。两种情况都会削弱学习效率和最终泛化能力。

在 UED 之前,Domain Randomization 已经表明,环境多样性有助于提升泛化能力;但这类方法通常只是静态地随机采样环境参数,难以根据智能体当前的学习状态动态调整训练内容。

UED 进一步将「训练什么」纳入学习过程:系统不再把训练环境视为固定背景,而是动态生成、选择或重放 level,并根据某种评价信号决定哪些 level 更值得保留、重放或进一步编辑。理想情况下,这些 level 应该持续贴近智能体当前能力边界:既不轻易被解决,也不完全超出可学习范围。

现有 UED 方法通常需要一个 score 来评价 level。常见做法包括 regret、GAE、MaxMC 等。这些信号在实践中有效,但它们更多从可解性差距、价值估计误差或回报估计出发,没有评估「这次训练到底带来了多少策略改进」。另一类方法更直接,例如 Marginal Benefit 会比较策略更新前后的表现变化,因此更接近真实学习进步。但它需要额外 rollout 来估计更新前后的回报,计算开销更高,估计方差也更大。

因此,UED 的核心问题就变成了:如何简单而准确地判断一个 level 是否真正推动了智能体的学习

PACE:用参数变化衡量学习进步

PACE 的核心判断很直接:如果一个 level 真正促成了学习,那么智能体在这个 level 上训练后,策略参数应该发生有意义的变化。也就是说,PACE 不再把 level 的价值建立在 regret、GAE 或 Monte Carlo return 等间接信号上,而是直接观察该 level 诱导的策略更新。









进一步假设这一步更新沿着局部梯度方向进行,即





将其代入一阶展开,可得目标提升的近似形式:



这个近似关系说明:在局部梯度更新假设下,一个 level 带来的目标提升与其诱导的策略参数变化平方范数成正比。因此,PACE 将 level score 定义为:







图 1:PACE 工作流程图。

基于这一 score,PACE 的运行过程可以分为两个部分:level scoringpolicy training(图 1)。







整个过程不断交替进行:新 level 被生成并打分,高价值 level 被写入 buffer,buffer 中的 level 又被优先重放来训练策略。由此,PACE 用策略参数变化构造出一种内生的学习进步信号,并用它驱动训练课程随智能体能力动态演化。

实验结果:从迷宫泛化到开放式任务









图 2:MiniGrid 上的零样本迁移性能。



表 1:MiniGrid 上的整体泛化指标。

为了进一步检验 PACE 在更复杂任务中的适用性,论文还在Craftax上进行实验。Craftax 是一个面向开放式强化学习的 JAX benchmark。随着探索推进,智能体会遇到新的区域、机制和目标,任务分布也会持续变化,因此更能检验 UED 方法是否能在长训练过程中持续提供有效课程。





表 2:Craftax 上 20 个未见过 levels 上的平均回报和标准差。

结语与展望

在强化学习智能体需要持续适应未见环境的背景下,如何准确识别真正推动学习的 levels 是 UED 的关键问题;PACE 通过参数变化这一简单、低方差、计算友好的内生信号,将环境评价直接建立在 realized learning progress 之上,从而减少代理指标偏差、高方差估计和额外 rollout 开销的影响,并为构建更稳定、更可扩展的自适应训练课程提供了新的思路。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
父母若是有以下7种疾病,子女基本都会遗传,不少人并不清楚!

父母若是有以下7种疾病,子女基本都会遗传,不少人并不清楚!

健康之光
2026-03-03 17:35:03
官宣恋情!女足最美国脚520秀恩爱 与1男子遮脸比心 疑似国足红星

官宣恋情!女足最美国脚520秀恩爱 与1男子遮脸比心 疑似国足红星

我爱英超
2026-05-21 10:43:43
CCTV5直播!中国男足决赛再碰日本,完胜澳洲后剑指亚洲杯冠军

CCTV5直播!中国男足决赛再碰日本,完胜澳洲后剑指亚洲杯冠军

球盲百小易
2026-05-22 01:31:51
72只流浪猫组成灭鼠大队,出发前还拍了合照…全是丧彪级别啊

72只流浪猫组成灭鼠大队,出发前还拍了合照…全是丧彪级别啊

普陀动物世界
2026-05-20 20:41:26
乌克兰通过法律程序,将“俄乌战争”,命名为“乌克兰独立战争”

乌克兰通过法律程序,将“俄乌战争”,命名为“乌克兰独立战争”

我心纵横天地间
2026-01-22 18:41:25
007新作有多"性感"?开发商:预告片里早给过暗示了

007新作有多"性感"?开发商:预告片里早给过暗示了

菜但瘾大第一名
2026-05-20 17:06:50
三军用命!绝处逢生!CBA大黑马救赛点到1-2,6人上双,MVP15中4

三军用命!绝处逢生!CBA大黑马救赛点到1-2,6人上双,MVP15中4

砚底沉香
2026-05-22 00:13:16
1996款马自达MX-5 Miata无底价拍卖:17.9万英里经典敞篷跑车

1996款马自达MX-5 Miata无底价拍卖:17.9万英里经典敞篷跑车

甜度百分百21
2026-05-21 00:06:23
“50块一颗”变“50块一克”,南京一犯罪团伙以劣充好卖鹿茸,暴力威逼老人买单,100多人被骗,涉案金额90余万,28人全部获刑

“50块一颗”变“50块一克”,南京一犯罪团伙以劣充好卖鹿茸,暴力威逼老人买单,100多人被骗,涉案金额90余万,28人全部获刑

大风新闻
2026-05-21 18:16:09
北京医院搬迁潮:大量三甲医院集体搬到五环外,评论区已经吵翻

北京医院搬迁潮:大量三甲医院集体搬到五环外,评论区已经吵翻

谭谈社会
2026-05-21 06:47:13
神舟二十三号倒计时,3.5小时对接空间站,香港航天员已预定

神舟二十三号倒计时,3.5小时对接空间站,香港航天员已预定

眼底星碎
2026-05-21 17:01:00
TA:因偷拍门无缘升超决赛,南安普顿球员考虑对俱乐部采取法律行动

TA:因偷拍门无缘升超决赛,南安普顿球员考虑对俱乐部采取法律行动

懂球帝
2026-05-21 06:18:17
北京这夜,被大方露事业线的何穗惊艳,才明白陈伟霆眼光有多毒辣

北京这夜,被大方露事业线的何穗惊艳,才明白陈伟霆眼光有多毒辣

阿凫爱吐槽
2026-05-21 03:39:46
受宠若惊!同事发520红包称“单纯的喜欢”,已婚美女直言很纠结

受宠若惊!同事发520红包称“单纯的喜欢”,已婚美女直言很纠结

火山詩话
2026-05-21 15:40:21
"大鱼"竟然是内贾德?以色列故意不炸死他,就是为了让他上台

"大鱼"竟然是内贾德?以色列故意不炸死他,就是为了让他上台

林子说事
2026-05-22 00:35:46
法网女单抽签:郑钦文首轮战资格赛选手 32号种子王欣瑜战塔格尔

法网女单抽签:郑钦文首轮战资格赛选手 32号种子王欣瑜战塔格尔

醉卧浮生
2026-05-21 20:42:34
母猫在交配之后为何会满地打滚,攻击公猫?

母猫在交配之后为何会满地打滚,攻击公猫?

宇宙时空
2026-05-19 15:25:08
蒙古人为什么这么恨中国?四个大实话,听完别不舒服

蒙古人为什么这么恨中国?四个大实话,听完别不舒服

犟种美食
2026-05-22 00:41:32
“指纹锁”退出中国家庭?开锁师傅说了实话,我连夜换回了铁将军

“指纹锁”退出中国家庭?开锁师傅说了实话,我连夜换回了铁将军

巢客HOME
2026-04-08 15:48:09
女生主动起来有多黏人?网友:这些女的太开放了

女生主动起来有多黏人?网友:这些女的太开放了

带你感受人间冷暖
2026-01-27 00:20:06
2026-05-22 03:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13054文章数 142651关注度
往期回顾 全部

科技要闻

小米YU7 GT正式发布:售价38.99万元

头条要闻

女子高空跳伞遇难 原计划今年订婚

头条要闻

女子高空跳伞遇难 原计划今年订婚

体育要闻

常住人口7000的小镇,拥有了一支德甲球队

娱乐要闻

反转!金秀贤与金赛纶未成年时交往不实

财经要闻

潮水退去,裸泳的一定不止五粮液

汽车要闻

雷军:YU7首战Model Y八败两胜 输给全球销冠不丢人

态度原创

旅游
教育
时尚
健康
数码

旅游要闻

景区NPC可以出彩但不能出格

教育要闻

高考地理|气候详解

今年夏天最流行的4组搭配,谁穿谁好看!

外泌体与干细胞竟是“快递”与“工厂”的关系?

数码要闻

精准操控不误触!一加Ace 6至尊版让点击精准如物理外挂

无障碍浏览 进入关怀版