网易首页 > 网易号 > 正文 申请入驻

换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26

0
分享至

来源:市场资讯

(来源:新智元 新智元)


新智元报道


扩散策略正在成为机器人控制中的热门路线。它可以把动作生成看成一个逐步去噪的过程,从噪声中一步步恢复出可执行的动作序列。

问题在于,真实机器人世界从来不是一个固定剧场:地面摩擦会变,身体参数会变,质量和阻尼会变,甚至同一个任务也会因为动力学不同而需要完全不同的动作模态。

UC Berkeley、北京大学、CMU、清华大学联合提出的DADP(Domain-Adaptive Diffusion Policy)不是为每个动力学条件单独训练一个策略,而是训练一个能够感知当前域、并在生成动作时主动利用这个域信息的统一策略。


论文链接:

https://arxiv.org/abs/2602.04037

实验结果显示,DADP在MuJoCo和Adroit的零样本跨域控制任务中取得强表现,OOD场景优势尤其明显。


图1:论文中给出的跨域MuJoCo总览结果,DADP在Seen、Unseen、OOD三类设置上整体表现最强。

机器人策略的「换环境失灵」难题

在强化学习和模仿学习里,策略往往与某个训练环境深度绑定。它看到的是特定重力、特定摩擦、特定身体比例下的数据;一旦部署环境发生变化,原本学到的动作模式就可能失效。

过去的主流思路大致分成两步:先从交互历史里抽取一个域表征,再把这个表征喂给策略网络,让策略知道自己正处在什么样的动力学条件下。问题是,这两步都可能出错。

第一,最近历史里不仅有静态域信息,比如摩擦系数、腿长、关节阻尼,也有瞬时状态信息,比如当前速度、步态相位、高阶运动趋势。如果表征学习任务只要求预测下一状态,模型很容易把这些瞬时线索也编码进去。这样得到的表征会在同一个域内漂移,反而不够稳定。

第二,即便学到了不错的域表征,简单把它拼接到策略输入上,也不一定能让扩散模型真正利用它。标准扩散策略从同一个纯高斯噪声分布开始去噪,不同域的动作模态都要从同一团噪声里被恢复出来,域信息只是在旁边提醒一句,生成过程本身并没有被重写。

先学静态域

再改写生成过程


第一步:把上下文「拉远」,过滤瞬时线索

DADP的第一个核心动作叫Lagged Context Dynamical Prediction。直观来说,它不再只使用紧邻当前时刻的最近历史来预测下一状态,而是引入一个时间偏移量Δt,让上下文与当前预测点隔开。

当Δt很小时,最近历史中的速度和步态相位可以直接帮助预测下一状态,模型会顺手把这些瞬时信息也塞进表征里。当Δt逐渐增大,时间局部线索的帮助变弱,模型更依赖那些在整个域内保持不变的因素。论文最终采用一个更极端、也更干净的默认设置:Δt→∞,也就是从同一域的另一条episode中采样上下文。

这一步的效果很像让模型回答一个问题:不要告诉我机器人这一秒正迈哪条腿,只告诉我它生活在怎样的物理世界里。


图2:随着Δt从1增大到32,再到∞,Walker2d的域表征从混杂逐渐变成清晰簇。


图3:表征质量随Δt增大而提升。Walker2d线性探针准确率从27.9%提升到99.3%。


第二步:把域表征写进扩散策略,而不是只放在输入旁边

DADP的第二个核心动作,是domain-aware diffusion injection。标准扩散策略从纯高斯噪声出发;DADP则让去噪过程从一个带有域偏置的混合高斯分布出发。简单说,学到的域表征z不再只是策略输入的一部分,而是变成扩散先验的中心之一。

这带来一个直接好处:不同动力学域不必从完全相同的噪声云里各自摸索动作模态,而是从更靠近自己动作流形的位置开始生成。与此同时,DADP还把表征偏移纳入扩散目标,让模型在每一步去噪中同时学习噪声和域偏移。

如果说普通条件策略只是告诉模型「你现在在哪个域」,DADP更像是提前把模型放到了「这个域应该出发的位置」。


图4:标准扩散与DADP扩散的去噪过程对比。DADP的生成轨迹更早按域分离。

实验结果

论文将评测分成三类。

Seen是训练中出现过的域,用来测试策略能否同时掌握多个训练动力学;Unseen是训练范围内部的新参数组合,用来测试插值泛化;OOD则采样到训练因子空间之外,考验真正的外推能力。

在MuJoCo中,研究团队使用Ant、HalfCheetah、Walker2d、Hopper四个环境,并引入摩擦、阻尼、腿长、躯干长度、质量等动力学变化。

为了验证复杂接触和操控场景,论文还加入Adroit的Door与Relocate任务。评测采用zero-shot设置:测试时没有未见域的专家数据,策略只能依赖在线交互历史形成上下文。


图5:主结果表。DADP在大多数MuJoCo设置中领先或接近最优,OOD优势尤其明显。

结果最醒目的地方在Walker2d:DADP在Seen、Unseen、OOD三档分别达到3999、2834、2197,而Meta-DT对应为1304、889、954。也就是说,当身体参数和接触条件变化更强时,DADP的优势被显著放大。

在Ant和Hopper上,DADP同样稳定领先。在HalfCheetah上,Meta-DT在Unseen插值设置略高,但DADP在Seen与OOD设置更强。Adroit操控任务中,DADP在Door的Seen设置不是最高,但在Unseen与Relocate上保持竞争力,说明方法并不只适用于行走机器人。


消融实验:表征更好,还是扩散用法更好?

论文的消融实验把问题拆开看。第一组看Δt是否真的提升表征质量。结论很直接:随着上下文与当前时刻的距离拉大,线性探针准确率上升,重建损失下降。Walker2d从Δt=1到Δt=∞,准确率从27.9%到99.3%,重建损失从476.1降到3.2。

第二组看表征到底该怎么用。只把表征拼到输入里,效果并不稳定;只把先验变成混合高斯,也有帮助但不够。DADP的完整版本同时做两件事:用表征偏置扩散先验,并让模型预测包含表征偏移的复合目标。


图6:表征使用方式消融。完整DADP在Walker2d和HalfCheetah上取得最高或接近最高表现。

在Walker2d上,端到端扩散基线的Seen/Unseen为3722/2852,条件策略如果使用Δt=1的表征,反而降到2093/1617;完整DADP达到3991/3015。HalfCheetah上,完整DADP的mastery达到96%,明显高于端到端扩散的80%

为什么这条路线值得注意

DADP的意义不只是把扩散模型又用到一个机器人控制任务上。更关键的是,它把「域表征」从一个附加输入,提升为生成分布的一部分。

对于需要跨摩擦、跨质量、跨形态泛化的机器人策略,这种做法更接近控制问题本身:不同动力学下,最优动作分布本来就应该不同。

论文还给出两个工程上很有意思的补充结果:

第一,在非平稳摩擦变化下,同一个Walker2dcheckpoint仍能保持较高表现,说明在线上下文能在一定程度上跟踪变化;

第二,在把DDIM采样压缩到一步时,标准扩散策略性能几乎崩塌,而DADP保留了更多性能,因为它从一开始就站在更靠近目标动作流形的位置。

当然,DADP也不是终点。论文明确指出,当前方法主要围绕静态或分段稳定的动力学展开。未来更难的问题是:当域本身随时间持续变化时,如何既保留稳定域因素,又不丢掉真正有用的时间变化信号。

结语

从「识别当前环境」到「改写动作生成过程」,DADP给出了一个很清晰的方向:跨域控制不应只停留在给策略额外喂一个标签,而应让域信息进入策略生成动作的底层机制。

对于机器人来说,真正的泛化不是在一个固定模拟器里跑高分,而是在换了地面、换了身体、换了动力学以后,依然知道自己该如何行动。

DADP的野心就在这里:让扩散策略不只是会生成动作,还能先读懂动作背后的物理世界。

参考资料:

Wang,P. et al. DADP: Domain Adaptive Diffusion Policy. ICML 2026. https://arxiv.org/abs/2602.04037

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
6-11!威尔逊惨败世界第一无缘卫冕,特鲁姆普斩获上海大师赛第二冠

6-11!威尔逊惨败世界第一无缘卫冕,特鲁姆普斩获上海大师赛第二冠

世界体坛观察家
2026-08-02 22:35:19
姆巴佩和新援中锋极度适配,穆帅可排4-1-2-1-2双前锋阵容

姆巴佩和新援中锋极度适配,穆帅可排4-1-2-1-2双前锋阵容

福酱的小时光
2026-08-02 09:07:34
两个半月前送绝平,如今友谊赛直红!本托:坑C罗这事,我认真的

两个半月前送绝平,如今友谊赛直红!本托:坑C罗这事,我认真的

林子说事
2026-08-03 00:34:16
男孩的“救命水杯”停产!全球网友翻箱倒柜,最后中国工厂出手了

男孩的“救命水杯”停产!全球网友翻箱倒柜,最后中国工厂出手了

北美省钱快报
2026-08-02 01:15:43
4死2伤,长沙一高层建筑凌晨发生火灾,现场图片曝光,有小区业主呼吁治理群租房

4死2伤,长沙一高层建筑凌晨发生火灾,现场图片曝光,有小区业主呼吁治理群租房

Mr王的饭后茶
2026-08-02 19:34:25
外媒:伊朗伊斯兰革命卫队称又摧毁3架美军F-35

外媒:伊朗伊斯兰革命卫队称又摧毁3架美军F-35

参考消息
2026-08-02 14:18:10
中日韩全军覆没,固态电池已经布局10多年,为何却还不能量产?

中日韩全军覆没,固态电池已经布局10多年,为何却还不能量产?

沙雕小琳琳
2026-08-02 08:48:04
8岁男孩出游回来脸色蜡黄,不爱吃饭,妈妈以为中暑累了,医生:不是厌食,是撑

8岁男孩出游回来脸色蜡黄,不爱吃饭,妈妈以为中暑累了,医生:不是厌食,是撑

浙江卫视
2026-08-02 07:36:58
个人存款达到这个数,你已经是富裕家庭,超过了全国90%的家庭

个人存款达到这个数,你已经是富裕家庭,超过了全国90%的家庭

史之铭
2026-07-19 02:28:55
持股极少的蔡崇信,凭什么永久掌控阿里?

持股极少的蔡崇信,凭什么永久掌控阿里?

小陆搞笑日常
2026-08-02 10:34:51
网友反映接驳车40分钟未开空调,有乘客敲窗抗议,春秋航空道歉:突发空调故障,车内温度异常时间约5分钟,已对所有车辆全面复查

网友反映接驳车40分钟未开空调,有乘客敲窗抗议,春秋航空道歉:突发空调故障,车内温度异常时间约5分钟,已对所有车辆全面复查

都市快报橙柿互动
2026-08-02 13:31:14
“实惠套餐要消失了?” 明天起,中国电信停止第三方互联网办卡!三大运营商利润正集体下滑

“实惠套餐要消失了?” 明天起,中国电信停止第三方互联网办卡!三大运营商利润正集体下滑

新浪财经
2026-07-31 18:28:04
说句“电影难看”被扣上孙子,可怕吗?

说句“电影难看”被扣上孙子,可怕吗?

胖胖说他不胖
2026-08-02 04:16:38
全部人都预判日本经济衰退,可没人想到,崩这么快、垮得这么彻底

全部人都预判日本经济衰退,可没人想到,崩这么快、垮得这么彻底

素衣读史
2026-08-02 04:45:53
读《羊脂球》发现:跟任何人交往,只要你表现出讨好、迎合、没主见,对方就会得寸进尺,这样只会让你越来越廉价,正确的做法是做到这两条

读《羊脂球》发现:跟任何人交往,只要你表现出讨好、迎合、没主见,对方就会得寸进尺,这样只会让你越来越廉价,正确的做法是做到这两条

心理观察局
2026-08-02 06:54:12
宋词排名第一的词,全词慷慨激昂,豪情万丈,被誉为一词压两宋

宋词排名第一的词,全词慷慨激昂,豪情万丈,被誉为一词压两宋

长风文史
2026-08-01 21:29:12
从对华强硬到敲定访华:卡拉斯北京之行,背后是欧盟多重现实考量

从对华强硬到敲定访华:卡拉斯北京之行,背后是欧盟多重现实考量

一口娱乐
2026-08-03 00:36:06
大家提前做好准备,不出意外的话,8月开始中国或将出现4大变化

大家提前做好准备,不出意外的话,8月开始中国或将出现4大变化

凡知
2026-08-02 14:14:42
太难杀了 小米空调被烧融仍能运行 高管也被震撼

太难杀了 小米空调被烧融仍能运行 高管也被震撼

快科技
2026-07-31 22:02:23
日本低失业率之谜:无效岗位与文化坚守

日本低失业率之谜:无效岗位与文化坚守

金哥说新能源车
2026-08-03 00:17:08
2026-08-03 01:52:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4289751文章数 9122关注度
往期回顾 全部

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

头条要闻

52岁中国登山家王钟确认遇难 遗体被雪崩冲到千米之下

头条要闻

52岁中国登山家王钟确认遇难 遗体被雪崩冲到千米之下

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

徐克和多位港星送别施南生

财经要闻

央行:继续实施好适度宽松的货币政策

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

本地
艺术
数码
房产
公开课

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

艺术要闻

看了这些照片,我才发现自己被骗了20年!原来大自然才是真正的“心机婊”?

数码要闻

中国广电部署下半年重点工作:加快推进电视业务升级等

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版