伯克利×斯坦福×CMU 新作:48,000 条合成轨迹,让人形机器人零样本学会"行走+抓取"VLK:48,000 条合成轨迹,让人形机器人零样本学会"行走+抓取"
论文:VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes
团队:Amazon FAR · UC Berkeley · Stanford · CMU(Yen-Jen Wang、Jiaman Li、Pieter Abbeel、Koushil Sreenath、Angjoo Kanazawa、Guanya Shi、C. Karen Liu 等 12 位作者)
arXiv:2606.30645| 项目主页:vision-language-kinematics.github.io
导语
让一个 1.3 米高、约 35kg 的 Unitree G1 人形机器人,在一个陌生客厅里听懂指令、走过去、蹲下搬起箱子、再放到另一处——全程零真实世界微调。VLK 用一台 iPhone 扫描 + 3DGS 重建场景 + 48,000 条纯合成轨迹,就把这件事做成了。当业界还在为"真实操作数据又贵又难采"发愁时,这个团队证明了:人形机器人最稀缺的"视觉-语言-运动"数据,可以像拍电影一样在重建场景里"合成"出来。
硬核科普(Tech Wiki)Loco-Manipulation(移动操作)
一句话定义:机器人同时完成"移动身体"与"操作物体"两项能力耦合的任务,比如走过去、蹲下、搬箱子。
类比说明:就像人搬家时的完整动作链——先走到纸箱前,弯腰抱起来,转身,走到目的地放下。这不是"走路"和"抓取"的简单拼接,而是全身协调的连续动作。
机器人场景:对人形机器人而言,这要求全身 30+ 个关节协同控制,且必须在行走中保持平衡。它是人形机器人从"演示机"走向"干活"的关键能力。
VLA(Vision-Language-Action,视觉-语言-动作模型)
一句话定义:把摄像头看到的画面 + 人类的自然语言指令,直接映射成机器人动作的端到端模型。
类比说明:就像开车时副驾说"前面路口左转",你同时看路、听指令、打方向盘。VLA 就是把"看、听、做"塞进同一个神经网络。
机器人场景:以 π0、RT-2 为代表的 VLA 是当前具身智能的主流范式。VLK 正是从一个预训练 VLA(π0.5)初始化而来。
3D Gaussian Splatting(3DGS,三维高斯泼溅)
一句话定义:用几千个"带颜色的小椭圆点"高效重建和渲染真实三维场景的技术。
类比说明:就像用无数彩色水彩点点拼出一幅画,近看是点、远看是完整的房间。相比传统网格建模,它更真实、渲染更快。
机器人场景:VLK 用 iPhone 扫描 + 3DGS 重建真实办公室和公寓,把"真实环境"变成了可以反复渲染、随意摆弄的"数字沙盘",让机器人可以在里面"无限次练习"。
Flow Matching(流匹配)
一句话定义:一种生成模型训练方式,通过"学一条从噪声到真实数据的平滑路径"来生成高质量输出。
类比说明:就像用一支笔从模糊的起点画出一条直线,逐步描到精确的目标——比传统扩散模型的"随机布朗运动"更快、更稳。
机器人场景:π0.5 用 Flow Matching 生成动作序列,VLK 沿用这套范式来生成全身运动轨迹,单次推理仅需约 31ms。
Sim-to-Real(仿真到现实迁移)
一句话定义:让机器人在仿真环境里学会的技能,能直接搬到真实机器人上执行。
类比说明:就像飞行员先在飞行模拟器里练几百小时,第一次真机上天也能从容应对。难点在于"模拟器里的世界"和"真实世界"总有差异。
机器人场景:VLK 通过视觉域随机化(光照、相机、颜色抖动)弥合这一差距,让纯合成数据训练的模型在真实 G1 上"零样本"可用。
核心突破:VLK 深度拆解痛点:为什么之前的方法搞不定?
人形机器人做移动操作,本质要学一个映射:**"第一视角看到的画面 + 语言指令" → "全身运动轨迹"。训练这种映射,需要海量同步配对**的三元组数据:第一视角图像、语言指令、机器人可执行的运动学轨迹。
但现实是——没有任何现成数据源能规模化提供这种完整三元组:
人类视频:有画面、有语言,但没有机器人的运动学轨迹(人 ≠ G1,关节构型完全不同);
遥操作采集:有轨迹、有画面,但人工成本极高,且难以覆盖多样场景和指令;
仿真数据:场景渲染得再逼真,也**不是"真实的房间"**,迁移到物理世界总有"虚拟感"落差。
关键瓶颈:
瓶颈 1:视觉、语言、运动学三类信号难以在同一个数据源中天然对齐;
瓶颈 2:人工遥操作采集人形机器人数据慢且贵,规模化困难。
方案:在"重建的真实场景"里合成一切
VLK 的核心思路非常干脆:既然真实三元组数据采不到,那就用"真实场景重建 + 程序化运动合成 + 事后渲染"把它造出来。
数据生成流水线(四步):
场景重建:用 iPhone 14 Pro(RGB + LiDAR)配合 Polycam 扫描真实办公室与公寓,得到公制尺度的 3DGS 场景;手动标注物体的语义 3D 包围盒与可行走区域。
路点生成:根据场景几何,自动采样合法的行走、抓取、放置位置(waypoints)。
运动合成:用一个条件扩散模型(CHOIS 风格,Transformer 去噪器)生成 Unitree G1 的全身运动,跟随这些路点。导航模型用 BONES-SEED 数据训练,交互模型则把 OMOMO 数据集(大规模人-物交互运动捕捉)经 OmniRetarget 重定向到 G1。运动表示采用 [全局位置, 6D 旋转, 关节角正余弦],避免角度环绕的不连续。
第一视角渲染:在 Isaac Sim 中回放合成运动,用与物理相机标定一致的虚拟 ZED 2i 相机渲染第一视角图像,并对光照、颜色、相机参数做随机化,增强迁移性。
如此,每一条轨迹自动配好了视觉 + 语言 + 运动学的完整三元组——两个场景各生成48,000 条,总计耗时约600 GPU-hours,全程无需人工干预。
![]()
*图 1:VLK 的"先遣图"。上半部分是三种原子技能(走、抓、放)在重建场景中生成、在真实 G1 上执行;下半部分展示长时程行为可以由原子技能的"指令链"拼接而成。这张图说明:合成数据不是玩具,而是能直接产出真实行为的。"
VLK 策略架构:
输入:当前第一视角 RGB 图像 + 语言指令 + 当前 G1 运动学状态(含手腕接触标签[c^L, c^R],告诉模型"哪只手正在碰东西");
骨干网络:从预训练的π0.5(Physical Intelligence 的 VLA 模型)初始化并全模型微调;
输出:未来 1 秒(30 帧 @ 30Hz)的全身运动学轨迹;
训练目标:Flow Matching 的 x₀-prediction 目标,主损失 L_traj = ‖x̂ − x‖²。
辅助损失(让轨迹更"物理可用"):
L_total = 1.0·L_traj + 0.5·L_脚地接触 + 0.2·L_根轨迹一致性
+ 1.0·L_踝关节FK + 1.0·L_手腕FK + 0.05·L_脚滑动
其中前向运动学(FK)损失直接约束脚踝、手腕的末端位置精度,脚滑动正则化抑制"漂移滑步",这些细节让合成轨迹能直接被物理跟踪器消化。
部署(分解式架构):VLK 策略只预测运动学轨迹,再由一个基于SceneBot的接触感知全身跟踪器(对视觉/语言"盲",只接收参考轨迹 + 本体感知)将其转换成 50Hz 的关节级 PD 目标。感知策略可以纯合成数据训练,物理执行交给跟踪器——两者解耦,各司其职。
![]()
图 2:看懂这张图就读懂了一半论文。上面是"造数据"的四步流水线,下面左侧是 VLK 策略(从 π0.5 初始化、用配对数据微调),右侧是部署时的全身跟踪器。合成数据从"生成"到"消耗"形成完整闭环。
![]()
图 3:合成数据的"实物照"。每一行都是一条训练样本:左边是第一视角画面(带相机位姿可视化),右侧是 G1 全身轨迹(绿色为当前帧、渐变色为未来轨迹)。"看 + 说 + 动"三种信号天然对齐。
效果:实验证明了什么?
在真实Unitree G1上,VLK 在实验室与公寓两个物理环境中完成了120 次真实世界试验(6 种模式 × 20 次),全部零真实世界微调:
场景
任务
真实成功率
仿真成功率
实验室
Walk To(走过去)
20/20
994/1000
实验室
Turn Around(原地转身)
20/20
843/1000
实验室
Pick (Floor)(地面抓取)
16/20
731/1000
实验室
Put (Floor)(地面放置)
20/20
991/1000
实验室
Pick (Surface)(桌面抓取)
11/20
458/1000
实验室
Put (Surface)(桌面放置)
8/20
569/1000
公寓
Walk To
19/20
948/1000
公寓
Turn Around
18/20
813/1000
公寓
Pick (Floor)
18/20
749/1000
公寓
Put (Floor)
20/20
987/1000
公寓
Pick (Surface)
13/20
521/1000
公寓
Put (Surface)
15/20
722/1000
关键指标:
最强项:导航(Walk To 20/20)与地面放置(Put Floor 两场景均 20/20),纯合成数据即可逼近满分;
最难点:桌面放置(实验室 8/20)与桌面抓取(实验室 11/20)——涉及手腕接触、表面高度估计,是全系统最"脆弱"的环节,也正好指向后续改进方向;
决定性消融:给 Pick (Floor) 去掉手腕接触标签后,真实世界成功率直接跌到0/5——这个看似不起眼的输入,是抓取成败的胜负手。
实验表现与视频演示五类真实世界任务族
1. Navigation(零样本导航):4 个目标(黑椅子、凳子、白椅子、木桌),起始位姿随机化,纯语言指令驱动导航。跨布局泛化:训练时见过的布局与测试时不同,依旧稳定完成。
2. Box Lifting(搬箱):小、中、大三种尺寸箱子,从地面拿起再放回,无需按尺寸调整策略——验证了跨物体泛化。
3. Multi-Stage(多阶段任务):运行时通过流式语言指令串联"行走→抓取→携带→放置",像聊天一样把任务链搭起来。
4. Robustness(鲁棒性):两种极端干扰——中途搬动家具改变场景布局(动态场景变化),以及频闪迪斯科灯光视觉干扰。系统依然能干活。
5. Long-Horizon(长时程任务):持续数分钟,反复串联"导航 + 抓取放置",考验长时间执行下的稳定性与漂移控制。
![]()
图 5:最"提气"的一张图。上排展示实验室里搬箱、放箱的连贯动作序列;下排是公寓场景在频闪灯光和家具变动下的执行快照——合成数据训练出来的策略,在"不按套路出牌"的真实环境里依然稳得住。
两个关键消融
数据量消融(Figure 4):把每布局每模式的合成轨迹量从 10% 加到 100%——Pick (Surface) 从 0% 提升到 46%。结论很明确:导航任务数据量少也能达到高成功率,但接触丰富的感知条件化操作(尤其桌面抓取)需要更多场景接地监督。
视觉域随机化消融(Table 2):不加随机化时行走成功率仅 **41%,只加相机随机化到 48%,只加光照随机化直接飙到 87%**,全套随机化达到 **90%**。光照是最重要的"仿真鸿沟弥合剂"。
系统实时性
端到端重规划延迟63ms,其中 59% 花在 GPU Flow Matching 采样(37ms,RTX 5090);
重规划周期约 555ms,8.8 倍余量——系统远没有跑在极限上;
相邻动作块间重叠 10 帧(约 0.33s),保证动作连贯;动模糊问题用 Laplacian 方差选最清晰帧解决。
视频演示
完整视频(YouTube):https://youtu.be/ZB6k_iMJP7M
项目主页分场景视频(可直接点开看):
搬箱:task2_box.mp4
多阶段任务:task3_multi.mp4
迪斯科灯光鲁棒性:task4_disco.mp4
长时程任务:task5_lh1.mp4
导航四目标:task1_nav4.mp4
技术溯源与关联工作团队脉络
这是"人形机器人数据/控制"方向的一条完整生态链:
年份
工作
核心贡献
与 VLK 的关系
2024
OmniH2O(Yen-Jen Wang 等)
通用灵巧人形机器人遥操作
团队早期代表作,验证 G1 全身控制
2025
BONES(Jiaman Li 等)
大规模人形运动数据集
提供导航运动数据来源(BONES-SEED)
2025
OMOMO(Jiaman Li、C. Karen Liu 团队)
大规模双手人-物交互运动捕捉
交互运动经 OmniRetarget 重定向到 G1
2025
π0.5(Physical Intelligence)
Flow Matching 驱动的 VLA 基础模型
VLK 策略的初始化骨干
2026
SceneBot(Sirui Chen)
人形全身跟踪策略
VLK 的物理执行层
2026
VLK(本作)
重建场景合成 VLK 监督数据
把整条链"合成数据化"
技术演进路线
**从"采数据"到"造数据"**:
继承点:
沿用π0.5的 Flow Matching 动作生成范式与预训练权重(初始化 + 全量微调);
复用OMOMO / BONES-SEED的运动先验(经 OmniRetarget 重定向到 G1);
使用SceneBot作为成熟的物理跟踪层。
改进点:
把"数据从哪来"的回答从遥操作/动捕变成3DGS 重建场景 + 程序化合成,数据规模与多样性不再受真人示教约束;
提出"感知-规划与物理执行解耦"的分解式架构:VLK 只管运动学预测,跟踪器管物理落地,让感知策略可以纯合成数据训练;
首次证明:重建真实场景中的合成交互,可以为 sim-to-real 的基于感知的人形移动操作提供有效监督。
局限与边界(诚实说)
受 OMOMO 数据覆盖限制,当前只支持箱式物体的双手搬运——杯子、工具等小物体抓不了;
表面高度变化下的操作可靠性不足(桌面放置实验室仅 8/20 正是例证);
合成数据依赖 3DGS 重建质量,场景语义标注仍需人工介入。
资源直达
论文:https://arxiv.org/abs/2606.30645
项目主页:https://vision-language-kinematics.github.io/
代码:Coming Soon(项目页标注 ⌨ Code coming soon)
演示视频:https://youtu.be/ZB6k_iMJP7M
X 速览:VLK 摘要 · 跟踪器 SceneBot · 全系统亮点
相关项目:SceneBot 全身跟踪 · π0.5
一句话总结:人形机器人最贵的数据,正在被 3DGS + 合成运动"量产"。VLK 用 600 GPU-hours 换来 96,000 条跨场景轨迹,换来真实 G1 上的零样本导航与搬箱——这条"重建场景造数据"的路,很可能就是人形机器人从实验室走向千家万户的捷径。
Mbot具身智能实验室
让尖端科技触手可及,人人皆可探索未来
![]()
Mbot基础交流群等你加入,下方扫码联系
具身-杰西
Mbot具身-小助手
Mbot-视频号
Mbot-公众号
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.