网易首页 > 网易号 > 正文 申请入驻

伯克利×斯坦福×CMU 新作:48,000 条合成轨迹,让人形机器人零样本学会"行走+抓取"

0
分享至


伯克利×斯坦福×CMU 新作:48,000 条合成轨迹,让人形机器人零样本学会"行走+抓取"VLK:48,000 条合成轨迹,让人形机器人零样本学会"行走+抓取"

论文:VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

团队:Amazon FAR · UC Berkeley · Stanford · CMU(Yen-Jen Wang、Jiaman Li、Pieter Abbeel、Koushil Sreenath、Angjoo Kanazawa、Guanya Shi、C. Karen Liu 等 12 位作者)

arXiv:2606.30645| 项目主页:vision-language-kinematics.github.io

导语

让一个 1.3 米高、约 35kg 的 Unitree G1 人形机器人,在一个陌生客厅里听懂指令、走过去、蹲下搬起箱子、再放到另一处——全程零真实世界微调。VLK 用一台 iPhone 扫描 + 3DGS 重建场景 + 48,000 条纯合成轨迹,就把这件事做成了。当业界还在为"真实操作数据又贵又难采"发愁时,这个团队证明了:人形机器人最稀缺的"视觉-语言-运动"数据,可以像拍电影一样在重建场景里"合成"出来。

硬核科普(Tech Wiki)Loco-Manipulation(移动操作)

一句话定义:机器人同时完成"移动身体"与"操作物体"两项能力耦合的任务,比如走过去、蹲下、搬箱子。

类比说明:就像人搬家时的完整动作链——先走到纸箱前,弯腰抱起来,转身,走到目的地放下。这不是"走路"和"抓取"的简单拼接,而是全身协调的连续动作。

机器人场景:对人形机器人而言,这要求全身 30+ 个关节协同控制,且必须在行走中保持平衡。它是人形机器人从"演示机"走向"干活"的关键能力。

VLA(Vision-Language-Action,视觉-语言-动作模型)

一句话定义:把摄像头看到的画面 + 人类的自然语言指令,直接映射成机器人动作的端到端模型。

类比说明:就像开车时副驾说"前面路口左转",你同时看路、听指令、打方向盘。VLA 就是把"看、听、做"塞进同一个神经网络。

机器人场景:以 π0、RT-2 为代表的 VLA 是当前具身智能的主流范式。VLK 正是从一个预训练 VLA(π0.5)初始化而来。

3D Gaussian Splatting(3DGS,三维高斯泼溅)

一句话定义:用几千个"带颜色的小椭圆点"高效重建和渲染真实三维场景的技术。

类比说明:就像用无数彩色水彩点点拼出一幅画,近看是点、远看是完整的房间。相比传统网格建模,它更真实、渲染更快。

机器人场景:VLK 用 iPhone 扫描 + 3DGS 重建真实办公室和公寓,把"真实环境"变成了可以反复渲染、随意摆弄的"数字沙盘",让机器人可以在里面"无限次练习"。

Flow Matching(流匹配)

一句话定义:一种生成模型训练方式,通过"学一条从噪声到真实数据的平滑路径"来生成高质量输出。

类比说明:就像用一支笔从模糊的起点画出一条直线,逐步描到精确的目标——比传统扩散模型的"随机布朗运动"更快、更稳。

机器人场景:π0.5 用 Flow Matching 生成动作序列,VLK 沿用这套范式来生成全身运动轨迹,单次推理仅需约 31ms。

Sim-to-Real(仿真到现实迁移)

一句话定义:让机器人在仿真环境里学会的技能,能直接搬到真实机器人上执行。

类比说明:就像飞行员先在飞行模拟器里练几百小时,第一次真机上天也能从容应对。难点在于"模拟器里的世界"和"真实世界"总有差异。

机器人场景:VLK 通过视觉域随机化(光照、相机、颜色抖动)弥合这一差距,让纯合成数据训练的模型在真实 G1 上"零样本"可用。

核心突破:VLK 深度拆解痛点:为什么之前的方法搞不定?

人形机器人做移动操作,本质要学一个映射:**"第一视角看到的画面 + 语言指令" → "全身运动轨迹"。训练这种映射,需要海量同步配对**的三元组数据:第一视角图像、语言指令、机器人可执行的运动学轨迹。

但现实是——没有任何现成数据源能规模化提供这种完整三元组

人类视频:有画面、有语言,但没有机器人的运动学轨迹(人 ≠ G1,关节构型完全不同);

遥操作采集:有轨迹、有画面,但人工成本极高,且难以覆盖多样场景和指令;

仿真数据:场景渲染得再逼真,也**不是"真实的房间"**,迁移到物理世界总有"虚拟感"落差。

关键瓶颈

瓶颈 1:视觉、语言、运动学三类信号难以在同一个数据源中天然对齐

瓶颈 2:人工遥操作采集人形机器人数据慢且贵,规模化困难。

方案:在"重建的真实场景"里合成一切

VLK 的核心思路非常干脆:既然真实三元组数据采不到,那就用"真实场景重建 + 程序化运动合成 + 事后渲染"把它造出来。

数据生成流水线(四步)

场景重建:用 iPhone 14 Pro(RGB + LiDAR)配合 Polycam 扫描真实办公室与公寓,得到公制尺度的 3DGS 场景;手动标注物体的语义 3D 包围盒与可行走区域。

路点生成:根据场景几何,自动采样合法的行走、抓取、放置位置(waypoints)。

运动合成:用一个条件扩散模型(CHOIS 风格,Transformer 去噪器)生成 Unitree G1 的全身运动,跟随这些路点。导航模型用 BONES-SEED 数据训练,交互模型则把 OMOMO 数据集(大规模人-物交互运动捕捉)经 OmniRetarget 重定向到 G1。运动表示采用 [全局位置, 6D 旋转, 关节角正余弦],避免角度环绕的不连续。

第一视角渲染:在 Isaac Sim 中回放合成运动,用与物理相机标定一致的虚拟 ZED 2i 相机渲染第一视角图像,并对光照、颜色、相机参数做随机化,增强迁移性。

如此,每一条轨迹自动配好了视觉 + 语言 + 运动学的完整三元组——两个场景各生成48,000 条,总计耗时约600 GPU-hours,全程无需人工干预


*图 1:VLK 的"先遣图"。上半部分是三种原子技能(走、抓、放)在重建场景中生成、在真实 G1 上执行;下半部分展示长时程行为可以由原子技能的"指令链"拼接而成。这张图说明:合成数据不是玩具,而是能直接产出真实行为的。"

VLK 策略架构

输入:当前第一视角 RGB 图像 + 语言指令 + 当前 G1 运动学状态(含手腕接触标签[c^L, c^R],告诉模型"哪只手正在碰东西");

骨干网络:从预训练的π0.5(Physical Intelligence 的 VLA 模型)初始化并全模型微调;

输出:未来 1 秒(30 帧 @ 30Hz)的全身运动学轨迹;

训练目标:Flow Matching 的 x₀-prediction 目标,主损失 L_traj = ‖x̂ − x‖²。

辅助损失(让轨迹更"物理可用")

L_total = 1.0·L_traj + 0.5·L_脚地接触 + 0.2·L_根轨迹一致性
+ 1.0·L_踝关节FK + 1.0·L_手腕FK + 0.05·L_脚滑动

其中前向运动学(FK)损失直接约束脚踝、手腕的末端位置精度,脚滑动正则化抑制"漂移滑步",这些细节让合成轨迹能直接被物理跟踪器消化。

部署(分解式架构):VLK 策略只预测运动学轨迹,再由一个基于SceneBot接触感知全身跟踪器(对视觉/语言"盲",只接收参考轨迹 + 本体感知)将其转换成 50Hz 的关节级 PD 目标。感知策略可以纯合成数据训练,物理执行交给跟踪器——两者解耦,各司其职


图 2:看懂这张图就读懂了一半论文。上面是"造数据"的四步流水线,下面左侧是 VLK 策略(从 π0.5 初始化、用配对数据微调),右侧是部署时的全身跟踪器。合成数据从"生成"到"消耗"形成完整闭环。


图 3:合成数据的"实物照"。每一行都是一条训练样本:左边是第一视角画面(带相机位姿可视化),右侧是 G1 全身轨迹(绿色为当前帧、渐变色为未来轨迹)。"看 + 说 + 动"三种信号天然对齐。

效果:实验证明了什么?

在真实Unitree G1上,VLK 在实验室与公寓两个物理环境中完成了120 次真实世界试验(6 种模式 × 20 次),全部零真实世界微调

场景

任务

真实成功率

仿真成功率

实验室

Walk To(走过去)

20/20

994/1000

实验室

Turn Around(原地转身)

20/20

843/1000

实验室

Pick (Floor)(地面抓取)

16/20

731/1000

实验室

Put (Floor)(地面放置)

20/20

991/1000

实验室

Pick (Surface)(桌面抓取)

11/20

458/1000

实验室

Put (Surface)(桌面放置)

8/20

569/1000

公寓

Walk To

19/20

948/1000

公寓

Turn Around

18/20

813/1000

公寓

Pick (Floor)

18/20

749/1000

公寓

Put (Floor)

20/20

987/1000

公寓

Pick (Surface)

13/20

521/1000

公寓

Put (Surface)

15/20

722/1000

关键指标

最强项:导航(Walk To 20/20)与地面放置(Put Floor 两场景均 20/20),纯合成数据即可逼近满分;

最难点:桌面放置(实验室 8/20)与桌面抓取(实验室 11/20)——涉及手腕接触、表面高度估计,是全系统最"脆弱"的环节,也正好指向后续改进方向;

决定性消融:给 Pick (Floor) 去掉手腕接触标签后,真实世界成功率直接跌到0/5——这个看似不起眼的输入,是抓取成败的胜负手。

实验表现与视频演示五类真实世界任务族

1. Navigation(零样本导航):4 个目标(黑椅子、凳子、白椅子、木桌),起始位姿随机化,纯语言指令驱动导航。跨布局泛化:训练时见过的布局与测试时不同,依旧稳定完成。

2. Box Lifting(搬箱):小、中、大三种尺寸箱子,从地面拿起再放回,无需按尺寸调整策略——验证了跨物体泛化

3. Multi-Stage(多阶段任务):运行时通过流式语言指令串联"行走→抓取→携带→放置",像聊天一样把任务链搭起来。

4. Robustness(鲁棒性):两种极端干扰——中途搬动家具改变场景布局(动态场景变化),以及频闪迪斯科灯光视觉干扰。系统依然能干活。

5. Long-Horizon(长时程任务):持续数分钟,反复串联"导航 + 抓取放置",考验长时间执行下的稳定性与漂移控制。


图 5:最"提气"的一张图。上排展示实验室里搬箱、放箱的连贯动作序列;下排是公寓场景在频闪灯光和家具变动下的执行快照——合成数据训练出来的策略,在"不按套路出牌"的真实环境里依然稳得住。

两个关键消融

数据量消融(Figure 4):把每布局每模式的合成轨迹量从 10% 加到 100%——Pick (Surface) 从 0% 提升到 46%。结论很明确:导航任务数据量少也能达到高成功率,但接触丰富的感知条件化操作(尤其桌面抓取)需要更多场景接地监督。

视觉域随机化消融(Table 2):不加随机化时行走成功率仅 **41%,只加相机随机化到 48%,只加光照随机化直接飙到 87%**,全套随机化达到 **90%**。光照是最重要的"仿真鸿沟弥合剂"。

系统实时性

端到端重规划延迟63ms,其中 59% 花在 GPU Flow Matching 采样(37ms,RTX 5090);

重规划周期约 555ms,8.8 倍余量——系统远没有跑在极限上;

相邻动作块间重叠 10 帧(约 0.33s),保证动作连贯;动模糊问题用 Laplacian 方差选最清晰帧解决。

视频演示

完整视频(YouTube):https://youtu.be/ZB6k_iMJP7M

项目主页分场景视频(可直接点开看):

搬箱:task2_box.mp4

多阶段任务:task3_multi.mp4

迪斯科灯光鲁棒性:task4_disco.mp4

长时程任务:task5_lh1.mp4

导航四目标:task1_nav4.mp4

技术溯源与关联工作团队脉络

这是"人形机器人数据/控制"方向的一条完整生态链:

年份

工作

核心贡献

与 VLK 的关系

2024

OmniH2O(Yen-Jen Wang 等)

通用灵巧人形机器人遥操作

团队早期代表作,验证 G1 全身控制

2025

BONES(Jiaman Li 等)

大规模人形运动数据集

提供导航运动数据来源(BONES-SEED)

2025

OMOMO(Jiaman Li、C. Karen Liu 团队)

大规模双手人-物交互运动捕捉

交互运动经 OmniRetarget 重定向到 G1

2025

π0.5(Physical Intelligence)

Flow Matching 驱动的 VLA 基础模型

VLK 策略的初始化骨干

2026

SceneBot(Sirui Chen)

人形全身跟踪策略

VLK 的物理执行层

2026

VLK(本作)

重建场景合成 VLK 监督数据

把整条链"合成数据化"

技术演进路线

**从"采数据"到"造数据"**:

继承点

沿用π0.5的 Flow Matching 动作生成范式与预训练权重(初始化 + 全量微调);

复用OMOMO / BONES-SEED的运动先验(经 OmniRetarget 重定向到 G1);

使用SceneBot作为成熟的物理跟踪层。

改进点

把"数据从哪来"的回答从遥操作/动捕变成3DGS 重建场景 + 程序化合成,数据规模与多样性不再受真人示教约束;

提出"感知-规划与物理执行解耦"的分解式架构:VLK 只管运动学预测,跟踪器管物理落地,让感知策略可以纯合成数据训练

首次证明:重建真实场景中的合成交互,可以为 sim-to-real 的基于感知的人形移动操作提供有效监督

局限与边界(诚实说)

受 OMOMO 数据覆盖限制,当前只支持箱式物体的双手搬运——杯子、工具等小物体抓不了

表面高度变化下的操作可靠性不足(桌面放置实验室仅 8/20 正是例证);

合成数据依赖 3DGS 重建质量,场景语义标注仍需人工介入。

资源直达

论文:https://arxiv.org/abs/2606.30645

项目主页:https://vision-language-kinematics.github.io/

代码:Coming Soon(项目页标注 ⌨ Code coming soon)

演示视频:https://youtu.be/ZB6k_iMJP7M

X 速览:VLK 摘要 · 跟踪器 SceneBot · 全系统亮点

相关项目:SceneBot 全身跟踪 · π0.5

一句话总结:人形机器人最贵的数据,正在被 3DGS + 合成运动"量产"。VLK 用 600 GPU-hours 换来 96,000 条跨场景轨迹,换来真实 G1 上的零样本导航与搬箱——这条"重建场景造数据"的路,很可能就是人形机器人从实验室走向千家万户的捷径。

Mbot具身智能实验室

让尖端科技触手可及,人人皆可探索未来


Mbot基础交流群等你加入,下方扫码联系

具身-杰西

Mbot具身-小助手

Mbot-视频号

Mbot-公众号

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
河南一景区电子屏“吹空调”走红,景区:目的为缓解游客心情,气温超35‌℃才开放,目前已改播其他内容

河南一景区电子屏“吹空调”走红,景区:目的为缓解游客心情,气温超35‌℃才开放,目前已改播其他内容

极目新闻
2026-08-15 16:33:12
色诱刷单设陷阱!深圳一男子往偏僻山中送现金时,被警方拦截

色诱刷单设陷阱!深圳一男子往偏僻山中送现金时,被警方拦截

南方都市报
2026-08-17 20:07:41
全民拒接来电,但骚扰电话已然找到新的路径!

全民拒接来电,但骚扰电话已然找到新的路径!

夜深爱杂谈
2026-08-09 20:25:32
前球员:目前的意甲国米、那不勒斯、科莫属第一梯队

前球员:目前的意甲国米、那不勒斯、科莫属第一梯队

懂球帝
2026-08-17 21:57:10
偷鸡不成蚀把米!以为能毁掉郭德纲,没成想自己也被扒个底朝天

偷鸡不成蚀把米!以为能毁掉郭德纲,没成想自己也被扒个底朝天

不似少年游
2026-08-17 17:05:01
乌媒:乌克兰出现由日本人组成的战斗分队,参与俄乌冲突,与俄军作战

乌媒:乌克兰出现由日本人组成的战斗分队,参与俄乌冲突,与俄军作战

扬子晚报
2026-08-16 10:31:45
看完《龙餐馆》后,我最大的请求是:若沈腾拿不了影帝,也必须给蒋奇明一个最佳男配!

看完《龙餐馆》后,我最大的请求是:若沈腾拿不了影帝,也必须给蒋奇明一个最佳男配!

娱乐故事
2026-08-12 22:28:02
博主:鲲城主帅张耀坤离任已是板上钉钉,他有望执教中国U16

博主:鲲城主帅张耀坤离任已是板上钉钉,他有望执教中国U16

懂球帝
2026-08-17 18:58:09
2026年,圈地收费、愈演愈烈的“景区门票经济”,终于穷途末路!

2026年,圈地收费、愈演愈烈的“景区门票经济”,终于穷途末路!

萧嚉影视解说
2026-08-16 13:08:50
全球罕见!福建女子查出怀孕,没想到胎儿不在子宫,竟长在脾脏上……

全球罕见!福建女子查出怀孕,没想到胎儿不在子宫,竟长在脾脏上……

福建卫生报
2026-08-03 18:45:39
演员海顿·潘妮蒂尔突然离世,年仅36岁!她因在《超能英雄》(Heroes)中饰演“啦啦队长”一角走红全球,曾出演《音乐之乡》《惊声尖叫》等

演员海顿·潘妮蒂尔突然离世,年仅36岁!她因在《超能英雄》(Heroes)中饰演“啦啦队长”一角走红全球,曾出演《音乐之乡》《惊声尖叫》等

鲁中晨报
2026-08-17 15:14:17
朱女士再曝细节:假证不止用于医院,丈夫多次对外展示假结婚证

朱女士再曝细节:假证不止用于医院,丈夫多次对外展示假结婚证

阿讯说天下
2026-08-04 10:08:10
一旦开战,中国若发射一枚东风41,得付出多大的代价?

一旦开战,中国若发射一枚东风41,得付出多大的代价?

小正说娱乐
2026-03-19 18:51:30
开学通知太突然!中小学2026秋季开学时间已定,别错过!

开学通知太突然!中小学2026秋季开学时间已定,别错过!

牛锅巴小钒
2026-08-17 06:20:04
一点不惯着!日本禁令一出,中企反手取消订单,这次轮到日企慌了

一点不惯着!日本禁令一出,中企反手取消订单,这次轮到日企慌了

可乐爱微笑
2026-08-17 15:03:32
杭州相亲角吵翻:索要50万彩礼可以,一提婚检就炸毛,女生究竟怕什么

杭州相亲角吵翻:索要50万彩礼可以,一提婚检就炸毛,女生究竟怕什么

十为先生
2026-08-17 18:39:46
警察这十种行为,每一种都违法!老百姓必须知道

警察这十种行为,每一种都违法!老百姓必须知道

职场资深秘书
2026-08-16 10:04:01
西方战略专家曾直言:从国力角度来说,中国领土恐怕最终会全收回

西方战略专家曾直言:从国力角度来说,中国领土恐怕最终会全收回

赶山的姑娘
2026-08-14 18:35:25
太让人心疼了,一个15岁的小姑娘,一个人在欧洲8天连拿3个冠军,身边竟连一个教练都没有

太让人心疼了,一个15岁的小姑娘,一个人在欧洲8天连拿3个冠军,身边竟连一个教练都没有

乒乓乐园
2026-07-30 18:32:07
第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

蜉蝣说
2026-07-17 09:47:08
2026-08-18 00:39:00
杰西讲具身 incentive-icons
杰西讲具身
一名分享AI前沿的分享官,专注具身智能前沿知识
132文章数 1关注度
往期回顾 全部

科技要闻

马斯克600亿美元买条近路

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

体育要闻

C罗:可能是生涯最后一年 未来都规划好了

娱乐要闻

立案风波席卷德云社多场巡演叫停!

财经要闻

爱丽家居跨界玩存储:溢价背后藏着机密案

汽车要闻

2027款艾瑞泽8 PRO 年轻人的务实之选

态度原创

健康
数码
教育
亲子
房产

专家解答青少年脊柱侧弯七大问题

数码要闻

红魔官宣游戏平板5 Pro主流FPS游戏165Hz高刷全面上线

教育要闻

“你这样的,是真不配当爹!”流量背后,被消费的孩子,网友怒吼

亲子要闻

我一直很庆幸自己有几个这样好的表哥表姐。 杨雪呀

房产要闻

刚刚官宣!海口房价,又跌了!

无障碍浏览 进入关怀版