![]()
来源:机器人大讲堂
一个砸下2.1万GPU小时,一个把单技能训练压到10小时。机器人获得身体技能,正在出现两种截然不同的工程路径。
8月12日,《Science Robotics》同一期刊出了两篇机器人全身运动控制论文。
一篇是RAI Institute与波士顿动力联合团队提出的零样本具身技能迁移运动模仿框架ZEST,登上本期封面;
![]()
![]()
论文链接:https://www.science.org/doi/10.1126/scirobotics.aec7695
另一篇来自英伟达GEAR团队,构建了一个机器人运动跟踪基础模型SONIC。
![]()
![]()
论文链接:https://www.science.org/doi/10.1126/scirobotics.aed4592
两边盯着的都是同一个问题:怎样让机器人掌握越来越多接近人类的全身动作?
但两边花钱、花算力的方式,几乎走向两个极端。
ZEST走的是一条更“轻”的路线。
它把动作捕捉、普通单目视频甚至关键帧动画都接进同一套训练流程。针对具体技能,一张NVIDIA L4 GPU训练约10小时,策略就可以从仿真直接部署到真机。波士顿动力人形Atlas因此学会了匍匐、侧手翻和霹雳舞,宇树G1能跳芭蕾、爬箱,波士顿动力四足机器人Spot甚至完成了连续后空翻。
![]()
英伟达则把大模型时代熟悉的Scaling路线搬进了人形机器人控制。
SONIC吃下约 700小时动作捕捉数据、超过1亿帧、模型参数从120万一路扩到4200万,最终用128张GPU训练7天,总计算量约 2.1万GPU小时。目标不是再训练一个单独技能,而是把大量人类运动压进一个统一的全身控制策略。
在宇树G1真机上,SONIC测试了123组不同动作序列,成功率达到99.2%,并支持实时跟随人体动作。
![]()
一个是1张GPU、约10小时,拼训练效率和算法设计;一个是128张GPU、7天,拼数据、模型和算力规模。
换句话说,ZEST在压低“新增一个技能”的边际成本;SONIC则愿意先支付更高的一次性训练成本,换取更大的动作覆盖范围。
01.
同样教机器人学动作,两边算的是两笔账
今天的人形机器人已经不缺“会走”的演示。
更难的问题是,它能不能蹲下、跪地、翻滚、跳舞、钻过低矮空间;碰到箱子时能不能用膝盖、手臂甚至躯干参与支撑;换一个动作以后,又要不要重新设计一套控制逻辑。
传统的模型控制擅长处理定义清楚的运动,但复杂动作一多,工程量很快膨胀。
尤其是霹雳舞、匍匐、翻滚这类全身多接触动作,机器人什么时候用脚、什么时候手撑地、膝盖什么时候碰地,接触顺序、摩擦、冲击和动力学误差都会叠在一起。
ZEST的研究团队专门指出,传统全身MPC通常围绕预先定义的末端接触设计,对膝盖、前臂、躯干等任意身体部位参与接触的动作处理起来更困难。
强化学习绕开了一部分显式建模,却又带来新的麻烦。
每多一种行为,常常意味着新的奖励设计、训练流程和参数调整。英伟达团队同样把这一点视为人形控制难以Scaling的重要原因:走路的奖励函数,并不能自然教会机器人跳舞、爬行或者完成遥操作。
于是,两篇论文分别选择从成本的两端下手。
ZEST压缩的是“生产一个新技能”的流程。SONIC压缩的是“为每个技能单独训练一个控制器”的必要性。
02.
ZEST:把“教会一个新动作”压缩成一天
ZEST首先把动作数据的入口做得很宽。
专业动作捕捉可以用,手机拍摄的普通单目视频也可以用,甚至不完全符合真实物理规律的关键帧动画也可以作为参考。
这些数据最终走的是同一条管线:录制 → 三维重建 → 动作重定向 → 仿真训练 → 真机执行。
![]()
其中最有现实意义的是手机视频。
研究团队直接用手持手机拍摄人的动作,从视频中恢复3D姿态,再将人的运动映射到机器人身体。团队称,把一段拍好的视频转换成机器人参考动作只需要几分钟,因此实际流程可以做到:早上录一段动作,白天训练,晚上就在真机上运行。
为了把复杂动作训出来,ZEST用了两个关键设计。
一个是“挑难题”。系统把长动作切成多个片段,哪里失败得多,后续训练就更多采样哪里,而不是把算力平均撒出去。
另一个有点像学自行车时扶一把。训练高动态动作早期,系统会给机器人施加一个虚拟的辅助力,帮助它渡过最容易摔倒的阶段;动作越来越熟以后,这股辅助力会逐渐衰减到零。消融实验中,去掉这套辅助课程后,训练20小时的表现才大致追上完整ZEST训练10小时的水平。
结果是,一套相对精简的方法跑到了三种差别很大的机器人身体上。
Atlas完成了行走、慢跑、翻滚、匍匐、侧手翻和霹雳舞;G1完成芭蕾、跳箱和上下爬箱;Spot则从动画中学会倒立、桶滚和连续后空翻。
但这里需要注意,ZEST的“zero-shot”主要指的是策略在仿真里训练完成后,不再针对真机做额外微调,直接进行Sim-to-Real部署,并不意味着机器人看见一个从未训练过的新动作就能立即学会。论文的真机实验中,每项技能仍然对应一个专门训练的策略。
所以ZEST现阶段更准确的定位,是一条高效率的技能生产线。
机器人每多学一个动作,依然要训练,但训练它所需要的人工设计和工程步骤,被尽可能压缩了。
03.
SONIC:先砸2.1万GPU小时,练出一套“通用身体”
英伟达做了几乎相反的选择。
既然语言模型和视觉模型已经证明,数据、模型和算力不断扩大可以换来更好的泛化能力,那么人形机器人控制能不能也Scale?
SONIC就从这里开始。
团队把人形机器人的“运动跟踪”定义成基础任务:给机器人一段人类动作参考,让它尽可能在符合真实物理约束的情况下复现。
然后直接扩大三个变量。
动作数据从小规模一路扩到 700小时、超过1亿帧;网络规模从 120万参数扩到4200万参数;训练计算量从约2000 GPU小时、9000 GPU小时,一直拉到 2.1万GPU小时,最大版本使用128张GPU训练7天。
结果并不只是模型把训练集背得更熟。
在完全未出现在训练集里的动作类别上,最大模型的仿真跟踪成功率达到99.6%;部署到真实宇树G1后,团队测试了123段不同运动序列,成功率达到99.2%。
![]()
这里已经出现了和ZEST很不一样的目标。
ZEST的逻辑是,来一个技能,高效训练一个可靠策略。SONIC则希望,先训练一个足够宽的运动策略,后面来的不同动作都尽量落进它已经学会的运动空间里。
因此,SONIC真正重要的部分还在后面。
英伟达在这套通用运动策略上又搭了一个统一接口。
摄像头实时捕捉人的姿态,可以让G1跟着人运动;VR设备可以遥操作;文字、音乐和视频则先通过上游运动生成模型变成目标动作,再交给SONIC执行。
![]()
单一的通用控制策略由多种输入方式驱动。( A ) 视频远程操作:从单目RGB视频流中估计全身运动并实时跟踪。( B ) 文本控制:目标运动由自然语言提示生成。( C ) 音乐控制:目标运动由音乐生成,并根据旋律和节奏结构进行调整。( D ) VR全身远程操作:操作员控制机器人完成一系列动态全身动作。每个面板显示按时间顺序排列的帧序列。
这里需要区分:SONIC本身并不是直接理解文字的语言模型,它承担的是身体执行层。
再往上一层,英伟达把GR00T N1.5 VLA模型也接了进来。
VLA负责根据视觉和任务预测动作目标,SONIC的统一运动Token负责把这些目标转成全身运动。
![]()
VLA 驱动的移动操控任务。每行显示按时间顺序排列的帧序列(时间从左到右)。(A)通过三点式接口将苹果取放至盘子。(B)取胡萝卜。(C)取刷子。(D)踩踏板打开垃圾桶。(E)将汽水罐放入垃圾桶:拿起汽水罐,移动位置,踩下踏板,然后扔出去。(F)移动钻头和箱子:拿起钻头,放入箱子,然后搬运到货架上。
于是,G1不仅能走到桌边拿苹果,还能走到垃圾桶前,用一只脚踩踏板开盖,同时保持单腿平衡;更复杂的任务里,它要先拿起易拉罐,再移动到垃圾桶前、踩开盖子,最后把罐子扔进去。
在五类移动操作任务中,这套VLA+SONIC系统平均成功率为75%。
![]()
04.
机器人需要什么样的身体底座?
到这里,再看那组最抓眼球的数字:
EST,一个具体技能策略用单张NVIDIA L4训练约10小时;SONIC则动用128张GPU连续训练7天。
两者并不能直接比较效率。
因为ZEST仍然以具体技能为训练单位,解决的是怎么把一个新动作更快、更少工程地搬到真机上;SONIC则试图把大量运动一次性压进一个统一策略,解决的是怎么让同一个控制器本身覆盖更多动作。
一个希望“新动作来了,也能很快学会”;一个希望“新动作来了,最好本来就会”。
![]()
但放到整个机器人系统里,两者解决的其实仍然是同一层问题——身体怎么动。
在它们之上,还有VLA、Agent、任务规划和运动生成模型,负责回答机器人“现在要做什么”;再往下,则是关节、电机以及真实的机器人本体,负责把运动真正执行出来。
这也意味着,ZEST和SONIC只是机器人获得全身运动能力的两种工程选择,未必会走向真正的二选一。
对于动作相对明确、但种类不断增加的场景,能否低成本快速生成新技能很重要;而当上层VLA开始不断向机器人下发变化更大的运动目标时,一个覆盖足够广、可以反复调用的通用运动控制器也会越来越重要。
更长期看,两种思路甚至可能逐渐靠近。
ZEST已经在仿真中尝试把15种动作放进一个多技能策略;SONIC则在扩大通用动作覆盖的同时,把控制接口进一步接向实时人体姿态、VR和VLA。
路线不同,方向却越来越清楚:机器人不可能永远靠工程师一个动作一个动作地手工“雕”出来。
下一阶段真正要解决的,是怎样让身体技能像模型能力一样持续扩张,既能大规模预训练,又能在遇到长尾新技能时快速补上。最终实现把越来越多的人类动作,变成机器人稳定、可复用的身体能力。
阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”
![]()
未来知识库是 “21世纪关键技术研究院”建 立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。
截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告
(加入未来知识库,全部资料免费阅读和下载)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.