网易首页 > 网易号 > 正文 申请入驻

从未见过现实世界数据,MIT在虚拟环境中训练出机器狗,能跑酷

0
分享至

机器之心报道

编辑:杜伟

如今,机器人学习最大的瓶颈是缺乏数据。与图片和文字相比,机器人的学习数据非常稀少。目前机器人学科的主流方向是通过扩大真实世界中的数据收集来尝试实现通用具身智能,但是和其他的基础模型,比如初版的 StableDiffusion 相比,即使是 pi 的数据都会少七八个数量级。MIT 的这个团队希望用生成模型来作为机器人学习的新数据源,用工程手段来取代传统的数据收集,实现一条通过由生成模型加持的物理仿真来训练机器人视觉的技术路线。

随着机器人在训练过程中持续进化,进一步提升技能所需的数据也在增长。因此获取足够的数据对于提升机器人的性能至关重要,但在当前实践中,针对新场景和新任务获取数据是一个从头开始不断重复的手动过程。

另一种替代方法则是在模拟环境中训练,从中可以对更多样化的环境条件进行采样,并且机器人可以安全地探索故障案例并直接从它们自己的行为中学习。尽管业界已经在模拟物理和渲染方面投入了大量资金,但目前为实现真实性所做的最佳实践仍与现实存在差距。

一方面渲染真实的图像意味着要制作细致、逼真的场景内容,但大规模手动制作此类内容以获得机器人 sim-to-real(模拟到现实)迁移所需要的多样性,成本过高。另一方面,如果缺少多样化和高质量的场景内容,在模拟环境中训练的机器人在迁移到真实世界时表现得太脆弱。

因此,如何在无限的虚拟环境中匹配现实世界,并将色彩感知融入到 sim-to-real 学习中,这是一个关键挑战。

近日, MIT CSAIL 的研究者开发出了一套解决方案,他们将生成模型作为机器人学习的新数据源,并使用视觉跑酷(visual parkout)作为试验场景,让配备单色相机的机器狗快速攀爬障碍物。

研究者的愿景是完全在生成的虚拟世界中训练机器人,而核心在于找到精确控制语义组成和场景外观的方法,以对齐模拟物理世界,同时保持对于实现 sim-to-real 泛化至关重要的随机性。

  • arXiv 地址:https://arxiv.org/pdf/2411.00083
  • 项目主页:https://lucidsim.github.io/
  • 论文标题:Learning Visual Parkour from Generated Images

下图 2 为本文 LucidSim 方法概览:采用了流行的物理引擎 MuJoCo,并在每一帧上渲染了深度图像和语义掩码,这些一起被用作深度条件 ControlNet 的输入。然后从已知的场景几何和相机姿态变化中计算真值密集光流,并在接下来的六个时间步中扭曲原始生成帧以生成时间一致的视频序列。

在学习方面,研究者训练的视觉策略分为两个阶段完成:首先优化策略以模拟从特权教师收集的 rollout 中获得的专家行为。在经过这一预训练步骤后,策略表现不佳。因此,后训练步骤包括从视觉策略本身收集 on-policy 数据,并与当前收集的所有数据的学习交错进行。重复这一步骤三次使得该视觉策略显著提升了自身性能。

研究者表示,该策略足够稳健,在他们的测试场景中可以将零样本转换为真实世界的色彩观察。

下面我们来看一段视频展示:

机器之心

,赞91

LucidSim:利用物理引导生成多样化视觉数据

研究者考虑了这样一种 sim-to-real 设置,机器人在模拟环境中接受训练,并无需进一步调整就能迁移到现实世界。他们对自己打算部署机器人的环境已经有部分了解,可能是粗略的描述或者参考图像。

由于信息不完整,研究者依赖生成模型内部的先验知识来填补空白。他们将这一引导过程称为先验辅助域生成(Prior -Assisted Domain Generation,PADG),并首先采用对合成不同域至关重要的自动提示技术。

LLM 成为多样化、结构化的提示来源。研究者很早就观察到,从同一提示中重复采样往往会重现类似的图像。因此,为了获得多样化的图像,他们首先使用了包含标题块、查询详情的「元」提示,以提示 ChatGPT 生成批量结构化的图像块,最后以一个要求 JSON 结构化输出的问题结束。具体如下图 4 所示。

研究者的要求包括特定天气、一天中的时间、光照条件和文化遗址。手动编辑生成的图像提示是不切实际的,因而他们通过生成少量图像来调整元提示,并进行迭代直到它们始终可以生成合理的图像。下图 5 下面一行显示了相同元提示、不同图像提示的多样化样本示例。

在几何和物理引导下生成图像。研究者增强了一个原始文本到图像模型,在增加额外语义和几何控制的同时,使它与模拟物理保持一致。他们首先将图像的文本提示替换为提示和语义掩码对,其中每个对应一种资产类型。比如在爬楼梯场景中,研究者通过文本指定了粗略轮廓内台阶的材质和纹理。

为了使图像在几何上保持一致,研究者采用了现成的 ControlNet,该模型使用来自 MiDAS 的单目深度估计进行训练。条件深度图像则通过反转 z 缓冲区并在每一张图像内进行归一化处理来计算。此外,调整控制强度以避免丢失图像细节非常重要。他们采用的场景几何是以往工作中出现的简单地形,包括可选的侧墙。同时避免随机化几何地形以专注视觉多样性分析。

为了制作短视频,研究者开发了 Dreams In Motion(DIM)技术,它根据场景几何计算出的真值光流以及两帧之间机器人相机视角的变化,将生成图像扭曲成后续帧。生成的图像堆栈包含对跑酷至关重要的计时信息。生成速度也很重要,DIM 显著提高了渲染速度,这得益于计算流和应用扭曲要比生成图像快得多。具体如下图 6 所示。

通过 on-policy 闭环训练来学习稳健的真实世界视觉策略

训练过程分为两个阶段:一是预训练阶段,通过模拟有权直接访问高度图的特权专家来引导视觉策略,其中高度图通过 RL 进行训练。研究者从专家及其不完美的早期检查点收集 rollout,并向专家查询动作标签以监督视觉策略。该视觉策略在预训练后表现不佳,但在第二阶段即后训练阶段做出了足够合理的决策来收集 on-policy 数据。具体如下图 7 所示。

研究者遵循 DAgger,将 on-policy rollout 与上一步中的教师 rollout 相结合。他们从专家教师那里收集了动作标签,并用余弦学习率计划下使用 Adam 优化器运行 70 个梯度下降 epoch。研究者在实验中仅需重复迭代 DAgger 三次就可以实现接近专家表现程度的视觉控制器。实际上第二阶段中的闭环训练过程是机器人出色表现的主要原因。

一个简单的 transformer 控制模型架构。研究者提出了一个简单的 transformer 架构,与之前extreme parkour, 使用 transformer 大大减少了处理多模态输入时控制模型架构的复杂度,如下图 8 所示。以往四足跑酷的相关工作使用复合架构,首先使用 ConvNet 将深度图处理成紧凑的潜在向量,然后使用循环骨干网络。

研究者使用了带有多查询注意力的五层 transformer 骨干网络,输入的相机视频被切成小块,并由一个卷积层并行处理。然后,他们将这些 token 与同一时间步的本体感受观察的线性嵌入堆叠在一起。研究者对所有时间步重复此操作,并在 token 级添加了可学习的嵌入。他们发现,对于 RGB 图像,在卷积之前包含批归一化层也有帮助。

最后,研究者通过堆叠在输入序列末尾的额外类 token 来计算动作输出,然后是 ReLU 潜在层和线性映射。

实验结果

在实验环节,研究者考虑了以下任务:

  • 追踪足球(chase-soccer);
  • 追踪橙色交通锥(chase-cone);
  • 攀爬各种材质的楼梯(stairs)。

他们分别在现实世界和一小部分使用 3D 高斯泼溅来模拟创建的真实世界场景中评估学习到的控制器性能。这些基准环境的示例如下图 9 所示。

此外,研究者进行了以下基线比较:

  • 需要特权地形数据(障碍)的专家策略;
  • 使用相同 pipeline 训练的深度学生策略;
  • 使用纹理上经典域随机化训练的 RGB 学生策略;
  • 以及本文基于 DIM 生成的帧堆栈进行训练的 LucidSim。

从生成图像中学习要优于域随机化

在模拟评估中,研究者观察到 LucidSim 在几乎所有评估中都优于经典域随机化方法,如下表 1 和表 6 所示。其中,域随机化基线方法能够在模拟中非常高效地爬楼梯,但在跨越障碍任务中表现不佳。这是因为深度学生网络在 3D 场景中遭遇了微妙且常见的 sim-to-real 差距。

比如由于受到栏杆的影响,Oracle 策略在其中一个爬楼梯场景(Marble)中表现不佳,因为它在训练环境中从未见过栏杆。相反,LucidSim 受到的影响较小。

从零样本迁移到现实世界

研究者在配备廉价 RGB 网络摄像头的 Unitree Go1 上部署了 LucidSim,在 Jetson AGX Orin 上运行了推理。每个任务都在多种场景中进行评估,并记录了机器人是否追到了目标物(追逐)或成功跨越障碍物。

下图 11 展示了 LucidSim 与域随机化方法的比较结果,其中 LucidSim 不仅能够识别经典的黑白足球,而且由于之前看到了具有丰富多样性的生成数据,因而可以泛化到不同颜色的足球。

对于跨越障碍(hurdle)和爬楼梯(stair)场景,Domain Rand. 无法始终如一地识别前方障碍物,并经常出现正面碰撞,而 LucidSim 能够始终如一地预测前方的障碍物并成功跨越。

学习 on-policy 要优于原始的专家数据 Scaling

研究者在下图 12 中,将基于 on-policy 的学习与原始的专家数据收集方法进行了比较。结果显示,通过额外专家专用数据训练获得的性能增益很快达到饱和。在跨越障碍和爬楼梯场景中,通过 DAgger 进行 on-policy 学习对于制定足够稳健的策略很有必要。

下图 10 展示了 LucidSim 和域随机化基线方法下 DAgger 产生的益处,其中前者的整体性能更高。

仅深度的策略过拟合训练几何

除了极限跑酷,研究者还考虑了两种深度策略,它们都接受了与 LucidSim 相同的训练,但输入深度不同。第一种(如上表 1 和表 6 第三行)接收远距剪切至五米的深度,并实现 120° FoV(视场角)。第二种(上表 1 和表 6 第四行)接收剪切至两米的深度。

在模拟评估中,研究者观察到,使用未剪切深度的策略会过拟合训练场景中的最小和简单几何,并被评估场景背景中的干扰因素所干扰。而视觉有限的深度策略不太会受到测试场景中多样性的影响,并且性能可以显著地提高。

理解 DIM 的速度和性能

图像生成是本文 pipeline 中的瓶颈。DIM 大大加速了每个策略的展开,同时通过权衡多样性提供动态一致的帧堆栈。研究者探究了独立生成每一帧如何影响学生网络的性能,他们认为跨越障碍场景最具挑战性。如下图 13 所示,在性能类似的情况下,DIM 可以在短时间内实现相同结果。

强大的条件降低多样性和图像细节

研究者需要权衡几何准确率与生成图像细节丰富度。当条件强度过低时,图像会偏离场景几何(如下图 14 左侧)。当条件强度过高时,图像会失去多样性和丰富细节(图 14 右侧),并且由于过约束而变得失真严重。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
3.17亿美元,雷霆队休赛期已将薪资总额及奢侈税罚款大幅削减了

3.17亿美元,雷霆队休赛期已将薪资总额及奢侈税罚款大幅削减了

好火子
2026-07-20 03:55:11
向太曝施南生临终细节:手脚溃烂,徐克最难受,真相令人吃惊

向太曝施南生临终细节:手脚溃烂,徐克最难受,真相令人吃惊

悦君兮君不知
2026-07-19 01:30:37
中国“最散装”的省?省内南北差异大,同省人都不互认老乡?

中国“最散装”的省?省内南北差异大,同省人都不互认老乡?

叮当当科技
2026-07-19 10:23:57
西班牙队赢得世界杯首批官方冠军戒指

西班牙队赢得世界杯首批官方冠军戒指

北青网-北京青年报
2026-07-20 08:30:03
40岁保姆:拿着雇主的高工资提供特殊服务,老公得知后和我离婚了

40岁保姆:拿着雇主的高工资提供特殊服务,老公得知后和我离婚了

孢木情感
2026-07-18 15:11:38
糖化血红蛋白新标准来了!不再是6.5%,快看你达标了没?

糖化血红蛋白新标准来了!不再是6.5%,快看你达标了没?

荷兰豆爱健康
2026-07-19 16:14:37
拉波尔特苦等法国未能上场,加入西班牙队后最终夺得所有冠军

拉波尔特苦等法国未能上场,加入西班牙队后最终夺得所有冠军

懂球帝
2026-07-20 07:08:09
洛杉矶华裔男子杀害赴美探亲岳父母,其自卫辩解未被法庭采信

洛杉矶华裔男子杀害赴美探亲岳父母,其自卫辩解未被法庭采信

深夜探案馆
2026-07-20 00:05:05
德容世界杯重伤,国际足联将向巴萨支付巨额赔偿

德容世界杯重伤,国际足联将向巴萨支付巨额赔偿

丁蓳解说
2026-07-19 15:32:58
房山新市郊铁路开通被吐槽是鸡肋,对比自驾公交地铁差距有多大?

房山新市郊铁路开通被吐槽是鸡肋,对比自驾公交地铁差距有多大?

据说说娱乐
2026-07-20 01:39:10
利好来了!大批A股公司业绩预增,出手回购

利好来了!大批A股公司业绩预增,出手回购

21世纪经济报道
2026-07-19 22:24:06
为省5000元机票,一家五口从内蒙古自驾回湖北,车坏在半路亏了2.4万元,车上没空调特产全馊了

为省5000元机票,一家五口从内蒙古自驾回湖北,车坏在半路亏了2.4万元,车上没空调特产全馊了

都市快报橙柿互动
2026-07-19 20:26:36
交易洗牌后!下赛季西部排名预测:火箭第3、湖人第5!

交易洗牌后!下赛季西部排名预测:火箭第3、湖人第5!

运筹帷幄的篮球
2026-07-19 12:00:49
世纪同台!比伯携BTS防弹少年团登陆世界杯决赛,麦当娜夏奇拉阵容炸裂

世纪同台!比伯携BTS防弹少年团登陆世界杯决赛,麦当娜夏奇拉阵容炸裂

热搜摘要官
2026-07-20 01:44:44
加息突变!美联储,大消息!重大利好,事关太空算力!两融集中强平?多家券商回应!影响一周市场的十大消息

加息突变!美联储,大消息!重大利好,事关太空算力!两融集中强平?多家券商回应!影响一周市场的十大消息

证券时报
2026-07-19 18:20:06
如何看待“如果严格执行劳动法,会有很多企业活不下去,发生大规模裁员”这种说法?

如何看待“如果严格执行劳动法,会有很多企业活不下去,发生大规模裁员”这种说法?

碧翰烽
2026-07-18 09:18:12
老蒋接见杨振宁恩师合影,注意看姿态,与主席见杨振宁截然不同!

老蒋接见杨振宁恩师合影,注意看姿态,与主席见杨振宁截然不同!

丁隗解说
2026-07-19 05:18:38
偷鸡不成蚀把米!以为能替蒋方舟鸣不平,没承想自己被扒个底朝天

偷鸡不成蚀把米!以为能替蒋方舟鸣不平,没承想自己被扒个底朝天

爱下厨的阿酾
2026-07-18 11:08:40
新冠卷土重来?医生建议:家中常备这5个东西,关键时刻能救命

新冠卷土重来?医生建议:家中常备这5个东西,关键时刻能救命

健康之光
2026-07-16 18:40:07
正式公布!丰田2027换代混动发动机,油耗低至2.1升

正式公布!丰田2027换代混动发动机,油耗低至2.1升

刘哥谈体育
2026-07-20 03:43:58
2026-07-20 09:00:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13552文章数 142694关注度
往期回顾 全部

科技要闻

Kimi K3单项登顶 整体落后前沿模型2-3个月

头条要闻

48岁阿根廷教练曾被质疑是"菜鸟" 已带队夺一冠一亚

头条要闻

48岁阿根廷教练曾被质疑是"菜鸟" 已带队夺一冠一亚

体育要闻

西班牙捧起大力神杯 美国总统特朗普颁奖

娱乐要闻

王侃因病逝世 两年前与父亲牛犇同台

财经要闻

“国家队”护盘,稳市机制持续护航A股

汽车要闻

被追尾还能自动加速逃生?华为乾崑智驾ADS 5.0 OTA时间表发布,只有这台车不用等!

态度原创

时尚
数码
亲子
健康
公开课

看来看去夏天还是穿T恤最合适,不用买太贵,舒适百搭又经典

数码要闻

长鑫存储供应链开启工艺转型 旨在DDR6商用前抢占先机

亲子要闻

灵动创想变形金刚尖锋对决盲盒之星曜款铁皮

刮痧也会刮出脑梗?讲个真实案例

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版