![]()
有一个很容易被忽略的事实:教会一个机器人做某件事,和教会它在任何速度下都能做好这件事,是两码事。
想象你在教一个新手司机开车。他在你悉心指导下,以每小时30公里的速度,顺利完成了一次从家到超市的驾驶,完美停车入位。你很满意,觉得他学会了。可第二天你让他以每小时60公里开同样一段路,他却在最后停车时撞上了路牙。
问题出在哪里?他学到的到底是"怎么开车",还是"在这个特定速度下,方向盘该转多少度、刹车该踩多深"?如果是后者,那他学到的其实是一份僵化的动作脚本,而不是真正的驾驶能力。
这正是马里兰大学的研究者们在机器人模仿学习领域捕捉到的一个悬而未决的问题。他们发现,几乎所有评估机器人模仿学习效果的方法,都在测试换个场景行不行、换个物体行不行、换个指令行不行,却极少有人问过:换个速度,还行不行?
这篇论文的名字很直白:模仿学习能否保留灵巧操作中的时间鲁棒性?答案,可能会让不少人意外。
被忽视的维度:速度
在机器人研究里,模仿学习是一种很流行的训练方式。
模仿学习:让机器人观察专家(可以是人类操作员,也可以是一个写死规则的程序)完成任务的过程,然后训练一个神经网络策略去复现这个过程,而不需要工程师手写每一步的控制逻辑。
这种方法的魅力在于省事:你不用绞尽脑汁去写"抓取角度该是多少度、力度该多大"这种精细的控制代码,只需要让专家做几百次示范,机器就能自己总结出规律。
但问题来了。专家在做示范的时候,是以什么节奏在做的?如果专家演示得比较从容,机器学到的很可能只是"从容节奏下"的动作模式。一旦你要求这个学出来的策略加快执行速度,会发生什么?
这篇论文的研究者们决定认真回答这个问题。他们没有选择一个抽象的实验室任务,而是设计了一个非常贴近现实的场景:让一个人形机器人抓取一个包裹,把它翻转过来,再塞进一个货架格子里。这个任务被命名为ParcelStow。
ParcelStow:一个专门用来测速度的擂台
先说说这个实验台长什么样。
机器人是一个固定底座的人形机器人(Unitree G1),配了一只六指的仿人手(RealHand L6)。桌上放着一个80毫米乘55毫米乘40毫米的塑料包裹模型,重120克。机器人的任务是:抓起包裹,把它抬离桌面,绕轴翻转90度,横向移动334毫米,然后精确地塞进一个只留了10毫米余量的收纳格里,最后松手让包裹稳定地停在里面。
整个过程被拆分成14个阶段:停靠、接近、预抓取、闭合、停顿、抬升、翻转、转移、插入前停顿、插入、插入后停顿、松开、撤回、稳定。
研究者做了一个关键设计:他们只让抓取之前的动作阶段保持固定时长,而把抓取之后(抬升、翻转、转移、插入等)的时长按一个叫做速度因子r的系数压缩。当r等于1时是正常速度,r等于2时,这些后续动作的耗时就砍半。
为什么要这么切割?因为抓取动作本身涉及手指闭合和力量控制,如果这部分也跟着加速,会引入太多混杂因素,搞不清楚失败到底是因为抓得不稳还是动得太快。研究者想要一个干净的实验:抓取阶段永远一样,只有后面的动作速度在变。
这就像做菜时候的一个对照实验。你想知道"炒菜火候快慢"对味道的影响,但如果你连食材切法都跟着变,那最后炒出来味道不对,你根本分不清是火候的问题还是刀工的问题。ParcelStow把"抓取"这道工序钉死不变,只让"后续操作"这道工序的节奏发生变化,这样测出来的结果才能干净地归因到速度本身。
任务成功与否不是靠人眼判断,而是由一串写死的判定条件组成:包裹中心必须上升超过20毫米且两根手指同时施力超过1牛顿才算抓稳,插入时包裹中心必须越过入口平面至少50毫米,松手后包裹要在0.4秒内保持线速度低于每秒2厘米、角速度低于每秒0.2弧度、最终姿态偏差小于10度才算真正稳定放置。这一整套判据非常严格,几乎不给任何侥幸空间。
专家 vs 学徒:同一把尺子量到底
研究者请出了一位脚本专家。
脚本专家:一段用传统机器人控制方法(逆运动学加轨迹插值)手写出来的程序,它不依赖任何神经网络,而是按照预先设定的几何路径点行动,可以看作"标准答案"式的对照组。
这位脚本专家在正常速度下,100次尝试全部成功。接着,研究者用它生成了300段示范数据,喂给三种主流的模仿学习模型去训练,其中最主要的一种叫做ACT。
ACT(Action Chunking with Transformers):一种基于Transformer架构的模仿学习方法,它的特点是一次性预测未来一段时间的动作序列(叫做"动作块"),而不是像专家那样每一步都临时计算,这样做的好处是动作更连贯,但也意味着它对节奏变化的适应方式和专家完全不同。
在正常速度下,ACT训练出来的策略同样做到了100次尝试100次成功。看起来天衣无缝,两者打平。
但研究者没有止步于此。他们把速度因子r从0.5一路调到3,在每一个速度点上,让专家和ACT用完全相同的100组初始条件(包裹位置的微小偏移、机器人关节的初始抖动)进行对比测试。
结果在r等于2(也就是动作耗时砍半)的时候彻底分道扬镳:专家的成功率是84%,ACT的成功率只有53%。整整31个百分点的差距,在两者起跑线完全一样的情况下凭空出现了。
这就是这篇论文最核心的发现:两个策略在正常速度下表现完全一致,并不意味着它们在别的速度下也一致。
研究者还训练了另外两个初始化参数不同的ACT模型,分别叫ACT-B和ACT-C。它们从r等于1到r等于2,成功率分别下滑了34和48个百分点,而专家只下滑了16个百分点。也就是说,不管换哪个随机种子训练出来的ACT,面对提速这件事,它们的表现都比专家脆弱得多。
这里有个细节值得多说一句。研究者还试过用不同数量的示范数据重新训练ACT,分别用50份、100份、297份数据。随着数据量增加,正常速度下的成功率从27%提升到44%再到100%,数据越多学得越好,这符合直觉。可是在r等于2的高速测试下,三个版本的成功率分别是46%、44%、53%,几乎没有随数据量的增长而提升。
这说明什么?说明单纯堆更多的示范数据,并不能治好"速度脆弱症"。这就好比你让一个学生反复刷同一类型的数学题,他确实能把这类题做得更快更准,但如果考试突然把时间砍半,他依然会手忙脚乱,因为他学到的是"如何解这道题",而不是"如何在压力下调整解题节奏"。数据量解决的是准确性问题,不是鲁棒性问题。
失败到底发生在哪一步?
光知道成功率下降还不够,研究者想搞清楚:ACT到底是在哪个环节掉的链子?
他们把每一次尝试拆解成阶段,记录每个策略最终卡在哪个阶段。结果发现,在r等于2的情况下,ACT在抓取和抬升这两个最早的阶段,和专家表现得一模一样,100次全部成功。差距是从翻转阶段开始出现的:ACT在这里丢了5次,专家一次没丢。
真正的分水岭出现在插入阶段。ACT有89次成功走到了插入判定这一步,但其中只有53次最终真正稳稳地放进了格子里。剩下的47次失败里,35次是插入时姿态没对准,10次是卡在了收纳格入口动弹不得,还有个别是打滑或超时。
这意味着,ACT绝大多数的失败,不是发生在"抓不稳"或者"半路掉了",而是发生在临门一脚的插入环节。速度越快,机器人对齐插入角度的精细控制能力就越差。
为了进一步确认问题出在哪儿,研究者设计了一个很巧妙的实验,叫做相对运动交接。
相对运动交接:在机器人完成抓取动作之后,不再让它自己的策略继续控制后续动作,而是强行把专家那一段抓取之后的手部相对运动路径"移植"过来,让被测试的策略执行同样的运动轨迹,借此单独检验抓取环节留下的抓取姿态到底稳不稳。
这就好比接力赛跑。你想知道第一棒选手交接棒的手法有没有问题,与其让第二棒选手按自己的节奏冲刺(这样掺杂了太多变量),不如让所有人都用同一种标准的冲刺方式,只看接棒瞬间的手法差异会不会影响最终成绩。如果换了统一冲刺方式后大家成绩还是不一样,那问题肯定出在交接棒那一下,而不是后面谁跑得快。
结果显示:在这种统一运动路径下,ACT的每一次抓取,在翻转和转移阶段都完整保住了包裹,一次都没掉。这说明抓取本身没问题,自由空间里的搬运也没问题。
但当这段统一路径继续延伸到插入、松手、稳定这几个环节时,只有64%的尝试最终成功完成任务,而专家用同样这套统一路径能做到95%。
这个结果很微妙。它说明ACT自己抓取时留下的初始状态(比如包裹在手里的角度偏移),已经悄悄埋下了后续失败的种子,即便后面用的是同一段专家轨迹,这颗种子依然会发芽。研究者进一步测量发现,失败案例在交接瞬间的姿态偏移中位数是3.1度、5.5毫米,而成功案例是2.2度、3.9毫米,失败组的偏差确实更大,但两组数据重叠得也很厉害,没法拿这个偏移量直接一刀切地预判成败。
抓得稳不稳,有一把物理的尺子
除了看动作轨迹,研究者还引入了一个来自经典力学的概念,用来给"抓取质量"打分。
力封闭(Force Closure):描述手指接触点的分布和施力方向,是否足以在理论上完全约束住被抓物体、抵抗任意方向的外力干扰的一个数学判据,数值大于0表示这次抓取在物理上是"稳固的"。
这个判据不依赖任何学习模型,完全是基于接触点几何和摩擦系数算出来的物理量。研究者对所有六种策略、所有速度下总共414次没有达到力封闭状态的抓取进行了统计,结果发现没有一次成功完成整个任务。
这个结论几乎是斩钉截铁的:力封闭是任务成功的必要条件,但不是充分条件。反过来说,如果抓取时手指的接触方式在物理上就撑不住这个包裹的重量和转动惯量,那不管后面策略多聪明,这次尝试注定失败。研究者还进一步分析了这个力封闭数值的连续大小(不只是正负)能不能用来预测成败,发现效果并不稳定,在不同的测试集上表现忽高忽低,说明它只是一个门槛判据,不是一个精细的评分体系。
有意思的是,不同ACT模型抓取时踩到这个物理红线的比例也不一样:ACT-A是8%,ACT-B是21%,ACT-C高达34%。同样的架构、同样的训练数据、仅仅是初始化参数不同,竟然会导致抓取稳定性出现这么大的差别,这也从侧面说明神经网络学出来的抓取策略,内部其实藏着相当大的不确定性。
速度不是越快越糟,是有一道看不见的坎
研究者还专门做了一组只针对专家的校准实验,想搞清楚专家自己的极限在哪里。
结果是这样的:专家在r等于1到2之间表现得相当稳健,成功率始终维持在84%以上;但一旦跨过2这个坎,成功率断崖式下跌,到r等于2.5时只剩29%,到r等于3时几乎归零(64次里只成功1次)。
研究者深挖了这背后的物理原因。他们发现,专家在插入前的最小姿态偏差,从r等于1时的2.2度,一路涨到r等于2.25时的8.9度,再到r等于2.5时的10.3度,恰好越过了10度的成功容忍线。与此同时,插入深度中位数从56.3毫米降到49.1毫米,包裹撞击收纳格的接触力峰值从3.1牛顿涨到8.1牛顿。
而与此形成对比的是,机器人手臂关节的速度利用率始终保持在17%以下,远没有触及硬件极限。这说明专家失败的原因不是机械臂跟不上速度,而是留给精细对齐动作的时间窗口被压缩得太短了,导致每一次修正姿态的机会都变少,误差就这样一点点累积,直到撞上10度这道物理红线。
这个发现也是研究者划定"示范速度范围"的依据。他们把r等于0.5到2这个区间定为示范范围,是纯粹基于专家表现的校准结果得出的,完全没有参考过任何学习模型的成绩,避免了拿着答案去凑题目的嫌疑。
写在后面
读完这篇论文,我最先想到的不是机器人,而是那些考试临场发挥失常的学生。
我们常常用一次考试来判断一个人"学会了没有",可这次考试的时长、节奏、压力,恰好和他平时练习时的状态一致。如果换一个更紧张的场合,同样的知识储备,表现可能天差地别。这篇论文用非常严谨的实验,把这个模糊的直觉变成了可以量化的数字:31个百分点的差距,不是错觉,是真实存在的能力缺口。
还有一个细节让我印象很深:力封闭这个判据是纯粹的物理概念,跟神经网络毫不相干,却成了预测任务成败最硬的一道门槛。这提醒我一件事,当我们讨论一个学习系统"聪不聪明"的时候,有时候答案根本不在算法层面,而在于它有没有满足一些最基本的物理约束。再花哨的策略,如果一开始抓取姿势就没抓稳,后面怎么补都是徒劳。
这篇论文没有给出解决方案,它更像是一份体检报告,告诉整个领域:你们一直在测的那些指标,可能漏掉了一个很关键的维度。至于怎么让模仿学习的策略在速度变化时也保持稳健,这道题目现在还没人交出满分答案。
如果有一天你的家庭机器人,平时干活麻利又准确,突然有一天你让它"快一点",它会不会也像论文里的ACT那样,在最后关头把东西撞歪?
Q&A
Q1:ParcelStow是什么?
A:ParcelStow是马里兰大学研究者设计的一个机器人操作基准测试,任务是让人形机器人抓取一个包裹、翻转它,再插入收纳格中,专门用来测试不同执行速度下机器人策略的成功率变化。
Q2:ACT模仿学习策略在什么情况下会失败?
A:论文发现ACT在正常速度下能做到100%成功,但在最高示范速度(动作耗时砍半)时成功率降到53%,失败主要集中在插入阶段,47次失败中有35次是插入姿态没对准。
Q3:力封闭对机器人抓取任务成功有多重要?
A:研究测试了414次没有达到力封闭状态的抓取,结果无一例外全部任务失败,说明力封闭是任务成功的必要条件,但满足力封闭并不能保证任务一定成功。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.