网易首页 > 网易号 > 正文 申请入驻

LaDi-WM模型大幅提升机器人操作策略的成功率和跨场景泛化能力

0
分享至

在机器人操作任务中,预测性策略近年来在具身人工智能领域引起了广泛关注,因为它能够利用预测状态来提升机器人的操作性能。然而,让世界模型预测机器人与物体交互的精确未来状态仍然是一个公认的挑战,尤其是生成高质量的像素级表示。

为解决上述问题,国防科大、北京大学、深圳大学团队提出LaDi-WM(Latent Diffusion-based WorldModels),一种基于隐空间扩散的世界模型,用于预测隐空间的未来状态。

具体而言,LaDi-WM 利用预训练的视觉基础模型 (Vision Fundation Models) 来构建隐空间表示,该表示同时包含几何特征(基于 DINOv2 构造)和语义特征(基于 Siglip 构造),并具有广泛的通用性,有利于机器人操作的策略学习以及跨任务的泛化能力。

基于 LaDi-WM,团队设计了一种扩散策略,该策略通过整合世界模型生成的预测状态来迭代地优化输出动作,从而生成更一致、更准确的动作结果。通过在虚拟和真实数据集上的大量实验,LaDi-WM 能够显著提高机器人操作任务的成功率,尤其是在 LIBERO-LONG 数据集上提升27.9%,超过之前的所有方法。

  • 论文地址:https://arxiv.org/abs/2505.11528
  • 项目主页:https://guhuangai.github.io/LaDiWM.github.io/

论文创新点:

1.一种基于隐空间扩散的世界模型:使用视觉基础模型构建隐空间的通用表示,并在隐空间学习可泛化的动态建模能力。

2.一种基于世界模型预测迭代优化的扩散策略:利用世界模型生成未来预测的状态,将预测的状态反馈给策略模型,迭代式地优化策略输出。

图 1 :(左)通过任务无关的片段学习隐扩散世界模型;(右)通过世界模型的未来状态预测来优化策略模型

技术路线

该团队提出一种利用世界模型优化策略学习的框架,以学习机器人抓取操作相关的技能策略。该框架可分为两大阶段:世界模型学习和策略学习。

A. 世界模型学习:

(a)隐空间表示:通过预训练的视觉基础模型对观测图像提取几何表征与语义表征,其中几何表征利用 DINOv2 提取,而语义表征则使用 Siglip 提取。

(b)交互扩散:同时对两种隐空间表示实施扩散过程,并在扩散过程中让二者充分交互,学习几何与语义表征之间的依赖关系,从而促进两种表示的准确动态预测。

图 2 : 基于交互扩散的世界模型架构

B. 策略模型训练与迭代优化推理

(a)结合世界模型的未来预测引导策略学习:将世界模型给出的未来预测作为额外的输入,引导策略模型的准确动作预测;模型架构基于扩散策略模型,有利于学习多模态动作分布。

(b)迭代优化策略输出:策略模型可以在一个时间步多次利用世界模型的未来预测作为引导,从而不断优化自身的动作输出。实验显示,该方案可以逐渐降低策略模型的输出分布熵,达到更准确的动作预测。

图 3 : 基于未来预测引导的策略模型架构

实验结果

虚拟实验:

在公开的虚拟数据集(LIBERO-LONG,CALVIN D-D)中,团队验证了所提出框架在机器人抓取相关的操作任务上的性能。在实验中,世界模型的训练数据会与策略模型的训练数据区分开,从而验证世界模型的泛化能力。对于 LIBERO-LONG,给定语言指令,多次执行并统计机器人完成各项任务的成功率。对于 CALVIN D-D,连续给定五个语言指令,多次执行并统计平均完成任务的数量。

在 LIBERO-LONG 数据集,为了验证世界模型对策略模型的引导作用,团队仅使用 10 条轨迹去训练各任务,对比结果如表 1 所示。相比于其他方法,LaDi-WM 能够提供精确的未来预测,并将预测反馈给策略模型,不断优化动作输出,仅需少量训练数据即可达到 68.7% 的成功率,显著优于其他方法。

表 1: LIBERO-LONG 性能对比

在 CALVIN D-D 数据集上,LaDi-WM 同样展示了在长时任务中的强大性能(表 2)。

表 2: CALVIN D-D 性能对比

团队进一步验证了所提出框架的可扩展性,如图 4 所示。

(a)逐渐增大世界模型的训练数据,模型的预测误差逐渐降低且策略性能逐渐提升;

(b)逐渐增大策略模型的训练数据,抓取操作的成功率逐渐提升;

(c)逐渐增大策略模型的参数量,抓取操作的成功率逐渐提升。

图 4 : 可扩展性实验

为了验证 LaDi-WM 的跨场景泛化能力,团队在 LIBERO-LONG 上训练世界模型,并直接应用于 CALVIN D-D 的策略学习中,实验结果如表 3 所示。若是使用在 LIBERO-LONG 训练的原始策略模型,直接应用到 CALVIN D-D 是不工作的(表第一行);而使用在 LIBERO-LONG 训练的世界模型来引导 CALVIN 环境下的策略学习,则可以比在 CALVIN 环境训练的原始策略的性能高 0.61(表第三行)。这表明,世界模型的泛化能力要优于策略模型的泛化能力。

表 3: 跨场景实验结果。L 代表 LIBERO-LONG,C 代表 CALVIN D-D

团队进一步探索了利用世界模型迭代优化的工作原理。团队收集不同迭代轮次下策略模型的输出动作并绘制其分布,如图 5 所示。迭代优化的过程中,输出动作分布的熵在逐渐降低,这表明策略模型每一步的输出动作更加稳定,从而提升整体的抓取成功率。

图 5 : 迭代优化的动作分布对比

真机实验:

团队也在真实场景中验证了所提出框架的性能,具体操作任务包括「叠碗」、「开抽屉」、「关抽屉」以及「抓取物体放入篮子」等,如图 6 所示。

图 6 : (左)真实场景环境;(右)机器人实际操作样例

在真实场景中,LaDi-WM 将原始模仿学习策略的成功率显著提升 20%(表 4)。

表 4: 真实场景性能对比

图 7 展示了最终所得策略模型在不同任务上的执行轨迹,从图中可以发现,提出的策略能够在不同光照条件以及不同初始位置的情况下有鲁棒的泛化性。

图 7 : 真实场景机器人执行轨迹

总结

国防科大、北京大学、深圳大学团队提出了一种隐空间扩散的世界模型 LaDi-WM(Latent Diffusion-based World Models),利用视觉基础模型提取通用的隐空间表示,并在隐空间学习可泛化的动态建模。同时,团队提出基于世界模型的未来预测来引导策略学习,在推理阶段通过迭代式地优化策略输出,从而进一步提高策略输出动作的准确度。团队通过虚拟与真机上广泛的实验证明了 LaDi-WM 的有效性,所提出的方法显著提升了机器人抓取操作技能的性能。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚运52年来最大夺冠年龄纪录!陈芋汐用坚守探索中国女子跳台极限

亚运52年来最大夺冠年龄纪录!陈芋汐用坚守探索中国女子跳台极限

杨华评论
2026-09-29 18:11:07
林诗栋男单夺冠!王励勤王皓面无表情+全队没鼓掌 秦志戬伸懒腰

林诗栋男单夺冠!王励勤王皓面无表情+全队没鼓掌 秦志戬伸懒腰

念洲
2026-09-29 10:02:10
官宣开赛阶段报销!隐瞒伤情?伦纳德的交易裂开了!

官宣开赛阶段报销!隐瞒伤情?伦纳德的交易裂开了!

贵圈真乱
2026-09-29 10:33:03
河南郑州一对父子常年在工地干活,每天不吃饭不喝水只喝啤酒,一天能喝十几瓶,均查出股骨头坏死

河南郑州一对父子常年在工地干活,每天不吃饭不喝水只喝啤酒,一天能喝十几瓶,均查出股骨头坏死

台州交通广播
2026-09-29 20:30:40
刚拿冠军就退役,当晚直接打包行李走人,这姑娘的操作把全网看傻

刚拿冠军就退役,当晚直接打包行李走人,这姑娘的操作把全网看傻

静若梨花
2026-08-29 10:42:55
世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

福建睿平
2026-08-28 07:25:16
终于破案了!蚊子专挑你咬并非因为血型!真正原因很多人都搞错了

终于破案了!蚊子专挑你咬并非因为血型!真正原因很多人都搞错了

白浅娱乐聊
2026-09-26 00:42:53
《兰香如故》大结局:直到圆房后,许兰香才明白,林锦岐一直守身如玉

《兰香如故》大结局:直到圆房后,许兰香才明白,林锦岐一直守身如玉

天玑影视说
2026-09-29 21:39:47
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
真相扎心!美女演员爆料短剧的床戏,都是忍着恶心拍的:她和男主躺在上面亲亲亲,都快吐上面了,枕头和被子味都特别大,发酸发臭

真相扎心!美女演员爆料短剧的床戏,都是忍着恶心拍的:她和男主躺在上面亲亲亲,都快吐上面了,枕头和被子味都特别大,发酸发臭

火山詩话
2026-09-29 06:32:57
以军斩首北加沙头号军事首长 德拉帕蒂对总参谋部动刀

以军斩首北加沙头号军事首长 德拉帕蒂对总参谋部动刀

西楼饮月
2026-09-29 21:14:35
美联储降息都难以挽救中国楼市?高盛预测:房价真底部在2027年?

美联储降息都难以挽救中国楼市?高盛预测:房价真底部在2027年?

爱看剧的阿峰
2026-09-30 07:40:28
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
亚运会0金收官后,王楚钦不再隐瞒,原来他和孙颖莎的处境一样

亚运会0金收官后,王楚钦不再隐瞒,原来他和孙颖莎的处境一样

林子说事
2026-09-30 05:53:19
马筱梅晒7个月儿子正面照,长相神似奶奶张兰,她坦言不愿意生二胎了

马筱梅晒7个月儿子正面照,长相神似奶奶张兰,她坦言不愿意生二胎了

追影客栈
2026-09-29 12:30:44
中秋晚会主持翻车!全程不看镜头:观众一眼出戏 是提词器装错了?

中秋晚会主持翻车!全程不看镜头:观众一眼出戏 是提词器装错了?

阿废冷眼观察所
2026-09-28 03:53:04
“班里10个男生,9个有小辫子”,家长天塌了:贫民太子的美梦

“班里10个男生,9个有小辫子”,家长天塌了:贫民太子的美梦

熙熙说教
2026-09-28 12:05:34
无锡市水利局原副局长邹永明接受纪律审查和监察调查

无锡市水利局原副局长邹永明接受纪律审查和监察调查

扬子晚报
2026-09-29 17:49:25
基辅多地遭袭:乌国家科学院主席团大楼起火,楼内人员爬窗逃生

基辅多地遭袭:乌国家科学院主席团大楼起火,楼内人员爬窗逃生

澎湃新闻
2026-09-29 10:41:21
荷兰制裁以色列——道德外衣之下的肮脏

荷兰制裁以色列——道德外衣之下的肮脏

老王说正义
2026-09-29 10:21:03
2026-09-30 10:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14105文章数 142740关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

头条要闻

牛弹琴:全部美军灰溜溜走了 伊拉克举国兴奋放假4天

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

时尚
教育
亲子
本地
手机

老板,我的脑子好像忘在家里了

教育要闻

全美顶尖公立大学,未来两年将狂砍2.25亿美金预算!

亲子要闻

超长长长长蛋挞店的规则~老板也太有爱心啦!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

手机要闻

涉及约5000人:古尔曼称苹果已搁置AI替代AppleCare客服计划

无障碍浏览 进入关怀版