网易首页 > 网易号 > 正文 申请入驻

机器人为什么学不会"通用"这件事

0
分享至


你有没有想过,为什么家里的扫地机器人很聪明,但你没法把它的"大脑"直接装到炒菜机器人身上?

这背后藏着一个机器人研究领域一直没解决好的难题:不同的机器人身体结构差太多了。一个单臂机械手有7个自由度,一个双臂机器人可能有14个,而人形机器人轻松突破29个自由度。它们的"动作语言"完全不同,就像让一个只会说中文的人突然要指挥法语、德语、日语三个团队同时干活,你得先解决翻译问题,才能谈协作。

过去几年,机器人学界一直在尝试训练"通才型"的机器人策略,也就是用一套模型控制多种不同身体的机器人。这类模型现在有个专门的名字。

**VLA模型(Vision-Language-Action,视觉-语言-动作模型)**:一种能同时理解画面、听懂指令、并输出机器人动作的AI模型,是当下机器人智能的主流架构。

但做"通才"远比做"专才"难。今天要说的这篇论文,来自香港科技大学(广州)和COCO Matrix团队的DyPES-VLA,就是冲着这个难题去的。它在三个仿真测试平台上都拿到了当前最好的成绩,还真机测试了三种完全不同的机器人身体,效果相当亮眼。

在往下讲之前,先说说这件事到底卡在哪儿。

核心问题:训练一个"通才"机器人,到底难在哪

假设你现在要训练一个AI,让它同时会开单臂机械手、双臂协作机器人、还有一个有手有脚的人形机器人。你手头有三种机器人产生的示范数据,怎么把它们捏合到一个模型里?

过去的方法基本分成两条路。

第一条路是"统一动作格式"。简单说就是,不管机器人长什么样,先把它们的动作都翻译成同一种标准语言,比如统一用末端执行器的位置和姿态来表示动作。这条路听起来挺合理,但代价不小,你需要做坐标变换、逆向运动学计算,工作量随着机器人种类增加会指数级上升。更麻烦的是,这种"强行翻译"会把两件本该分开的事情搅在一起:机器人之间共享的交互规律,和每个机器人身体特有的控制细节。

这就好比你要给三个不同乐器的演奏者写同一份乐谱。小提琴、钢琴、鼓的发声方式天差地别,如果你硬要发明一种"通用记谱法",逼着所有乐器按同一种符号演奏,最后可能三种乐器都没法把自己的特长发挥出来。如果不统一格式呢?那乐队就没法合奏,各自为战。这就是过去方法面临的两难。

第二条路更基础的问题是,现有方法几乎只靠"动作标签"来学习。就是说,模型只从"机器人做了什么动作"这一件事上学东西,而完全没有利用海量的人类操作视频、机器人操作视频里蕴含的规律,比如物体是怎么被碰到的、抓取瞬间发生了什么、场景是怎么随着交互变化的。这些视频数据不需要标注机器人的具体动作指令,却包含着大量关于"物理世界如何运作"的免费知识,现有方法基本没有把这块蛋糕吃干净。

DyPES-VLA就是针对这两个问题,给出了自己的解法。

拆开看DyPES-VLA的设计思路

DyPES-VLA这个名字本身就是答案的浓缩:DyPES代表"Dynamics Priors and Embodiment-Specific control",翻译过来就是"共享的动力学先验"加上"针对具体身体的专属控制"。

这两句话拆开来看,其实回应的正是刚才说的两个问题。

**动力学先验(Dynamics Priors)**:指的是不同机器人、不同场景下都反复出现的物理规律,比如物体如何运动、接触瞬间会发生什么、交互后场景怎么变化。这些规律是"跨身体"通用的,不管是人手还是机械爪,抓起一个杯子后手会往哪个方向使力,规律是一样的。

那怎么让模型学到这些通用规律?研究者的思路是用"预测未来画面"这件事来倒逼模型理解物理世界。

用"预测未来"来学会看懂物理世界

DyPES-VLA的第一阶段训练,做的事情听起来有点绕:给模型看当前的画面、听懂指令,然后让它去预测几步之后会发生什么画面变化,而不是直接去学动作指令。

具体的流程是这样的。模型先用一个预训练好的视觉语言模型,把当前的摄像头画面、语言指令、还有机器人身份信息(比如这是哪种机器人、控制频率是多少)一起编码,同时还塞进去一批"可学习的查询令牌"。

**查询令牌(Query Tokens)**:一组可学习的、类似占位符的向量,它们和视觉、语言信息一起被处理,最终携带的信息会成为整个模型的"共享接口",后续所有任务都从这批向量里提取信息,而不是直接从原始画面或文字里取。

这批查询令牌输出后得到的结果,论文管它叫"查询状态"。接下来关键的一步来了:有一个专门的"未来生成头",它接收的输入只有查询状态,不接触当前画面本身,任务是根据这个查询状态,重建出未来某一帧画面。

**未来生成头(Future Generation Head)**:这里用的是一种叫SANA的图像生成模型,作用是根据查询状态,生成经过压缩编码的未来帧图像,用生成质量来倒逼查询状态"记住"足够多关于物体运动和场景变化的信息。

为什么这个设计很巧妙?因为生成器完全被"断了后路",它看不到当前的原始画面,只能靠查询状态里携带的信息来猜未来会发生什么。如果查询状态里没有存住关于"接触""运动""因果"的信息,生成器根本没法把未来画面画出来。这就相当于逼着查询状态必须成为一个"信息瓶颈",所有跟动态变化有关的知识都得被压缩进这几十个向量里。

这个设计让我想起小时候玩的"传话游戏"。一群人排成队,第一个人看一张图,然后只能用嘴描述给下一个人,一个个传下去,最后一个人要根据听到的描述把图画出来。如果传话的人说得含糊,最后画出来的东西肯定跑偏。这个游戏逼着每个传话者必须把最关键的信息说清楚,废话越少越好。DyPES-VLA里的查询状态就是那个"传话中间人",它被逼着必须把物体怎么动、怎么碰、场景怎么变这些核心信息浓缩进有限的向量里,因为生成器完全靠它才能画出未来。如果不这样设计,直接让生成器看到原始画面,那查询状态就可能变成"打酱油"的摆设,学不到真正有用的东西。

这一步训练用的数据很有意思,既包括没有动作标注的人类操作视频(来自一个叫EgoDex的第一视角人类操作数据集),也包括三个仿真环境自己产生的视频。因为这个预测任务不需要动作标签,所以海量的、便宜的视频数据都能被利用上,这正好补上了前面说的"浪费视频数据"的漏洞。

第二根柱子:专属身体的动作头

学完了共享的物理规律,接下来的问题是:怎么把这些规律翻译成每个机器人具体该怎么动?

这就是"Embodiment-Specific"(专属身体)要解决的事。DyPES-VLA用了一个叫MoE的结构来处理这件事。

**MoE(Mixture-of-Experts,混合专家模型)**:一种神经网络设计,网络内部准备了多组"专家模块",根据输入的不同,动态选择用哪一组专家来处理,而不是让所有输入都走同一条计算路径。

在DyPES-VLA里,这个动作头是一个16层的扩散变换器(术语上叫DiT),里面每一层都分成两部分:注意力层是所有机器人共享的,负责处理动作序列里"这个时刻和那个时刻怎么关联"这种跨时间的结构规律;而前馈网络部分则是按机器人类型路由的专家模块,单臂机器人走一组专家,双臂机器人走另一组,人形机器人再走第三组。

**扩散变换器(Diffusion Transformer, DiT)**:结合了扩散模型(从噪声逐步还原出目标数据的生成方式)和Transformer架构的一种网络结构,这里被用来从随机噪声出发,逐步"去噪"生成出真实可执行的机器人动作序列。

这个设计的巧妙之处在哪儿?它把"通用的东西"和"专属的东西"精确地分了工。时间上的规律,比如一个动作序列前后应该怎么衔接,这种结构性的东西是跨机器人共享的,不管是单臂还是双臂,动作片段内部的时间连贯性道理是相通的。但具体到"这个关节该转多少度""这只手爪应该张多大",这就完全是每种机器人独有的物理约束了,必须用专属的模块来处理。

这就好比一个连锁餐厅的中央厨房体系。所有分店共用同一套采购流程、同一套食材品控标准,这是"共享的部分";但到了具体炒菜环节,川菜馆有专门的川菜师傅,粤菜馆有专门的粤菜师傅,因为口味和火候的讲究完全不一样,硬让川菜师傅去掂勺粤菜是要出问题的。如果不设置这层区分,让所有机器人的动作都挤在同一个前馈网络里学,会发生什么?论文的实验数据给出了答案:换成一个"大家共用一个动作头"的版本后,RoboTwin这个双臂机器人任务上的成功率从89.02%掉到了87.85%,RoboCasa人形机器人任务上更是从59.25%掉到57.17%,足足少了两个多百分点。这说明硬挤在一起确实会造成互相干扰。

而更妙的地方是,每个机器人还配了一对专属的"编码器-解码器",负责把这个机器人的原生动作格式(不管是7维还是14维还是29维)转换成模型内部统一处理的宽度,处理完了再转换回去。这意味着整个流程压根不需要提前手动把不同机器人的动作格式统一起来,每个机器人保留自己的"母语",翻译工作被丢给了模型自己去学。

再说一个细节,机器人的身份信息不是随便塞进去的,而是被"翻译"成了一段文字描述,比如"数据来源是libero,机器人型号是Franka Panda单臂夹爪,控制频率20赫兹,动作维度7",这段文字和视觉、语言信息一起被丢进视觉语言模型里处理。这样做的目的是让模型能明确区分"这条数据到底是哪个机器人产生的",避免不同来源的数据互相搞混。实验也验证了这一点:去掉这段元数据描述后,模型在几个任务上都出现了小幅下滑,最多掉了0.5个百分点,说明这个设计确实在帮模型分清楚"我现在是在控制哪个身体"。

两阶段训练,先学道理再学手艺

整个训练过程分成两个阶段,逻辑很清晰。

第一阶段叫"动力学先验预训练",只用动作无关的视频数据,训练视觉语言模型、查询令牌,还有那个未来生成头,让模型先把物理世界的基本规律摸透。这个阶段跑了十万步。

第二阶段叫"跨身体协同训练",这时候才引入真正带动作标签的机器人示范数据,同时优化未来预测目标和动作预测目标,两者的损失函数按一个系数加权组合起来,这个系数论文里设成了0.05,意思是动作学习是主线,未来预测是辅助的正则化项,帮着让共享表示保持住之前学到的物理规律不跑偏。这个阶段跑了二十万步。

到了真正部署使用的时候,那个负责"预测未来画面"的生成头会被直接砍掉,不参与推理,只留下动作头根据查询状态直接吐出可执行的动作。这个设计也挺聪明的,训练时靠预测未来这个"额外作业"来强化学习效果,但真正上岗干活时,不需要真的去画一张未来的图,直接省了这一步的计算开销。

这就像运动员的训练和比赛。平时训练时教练会让运动员做很多辅助性的力量练习、专项技巧练习,这些练习本身不是比赛项目,但能强化比赛时需要的核心能力。真正上场比赛的那一刻,运动员不会再做那些辅助动作,他直接调用练出来的能力去完成比赛任务。DyPES-VLA里那个"预测未来画面"的环节,就是训练阶段的辅助练习,比赛(也就是实际执行动作)时用不上,但它锻炼出来的能力已经融进了查询状态里。

三个仿真战场上的成绩单

论文在三个业界公认的仿真测试平台上验证了效果,这三个平台代表了三种截然不同的机器人身体。

RoboTwin 2.0是一个双臂机器人(ALOHA-AgileX,14个自由度)的测试平台,覆盖50种不同任务,测试环境分"干净"和"随机化"两档,随机化档会打乱背景、光照和物体摆放位置来增加难度。

RoboCasa-GR1模拟的是一个29自由度的Fourier GR-1人形机器人在厨房场景里干活,比如把奇异果放进篮子、把面包放进烤箱。

LIBERO则考验一个7自由度的Franka Panda单臂机器人在桌面上完成各种拿取任务。

DyPES-VLA用同一个训练好的模型(业内叫"单一检查点",意思是不针对每个测试平台单独微调)去同时打这三个平台,成绩如下表:

| 测试平台 | DyPES-VLA成绩 | 对比最强基线 |

| RoboTwin 2.0(双臂) | **89.02%** | Qwen-VLA 86.65% |

| RoboCasa-GR1(人形) | **59.25%** | ABot-M0 58.3% |

| LIBERO(单臂) | **98.0%** | X-VLA 98.1%(微调后专才) |

在RoboTwin上超过同类"通才模型"Qwen-VLA整整2.37个百分点;在RoboCasa人形机器人任务上,甚至超过了专门为这个任务单独训练调优的"专才模型"ABot-M0;在LIBERO上,虽然比经过专门微调的X-VLA低了0.1个百分点,但要知道X-VLA是"每个任务单独训一个模型"的打法,而DyPES-VLA是"一个模型打天下",这个差距几乎可以忽略。

真实机器人上的表现更能说明问题

仿真测试固然重要,但机器人研究最终要落地到真实世界。论文团队用三种真实物理机器人做了测试:7自由度的Franka Research 3单臂机械手、14自由度的AgileX COBOT Magic双臂机器人、还有配备了灵巧手的Unitree G1人形机器人。

三个任务分别是:把奇异果放进篮子、把杯子里的水倒进碗里、把书放到书架上。团队用同一个在仿真环境训练好的模型,再拿真实机器人采集的1800条示范数据做了联合微调(只微调了5000步,相对轻量),最后得到一个能同时操控三种机器人身体的统一策略。

对比结果很直观:

| 方法 | 平均成功率 |

| ACT(每种机器人单独训练9个模型) | 32.4% |

| GR00T-N1.6(联合微调的通才模型) | 59.6% |

| DyPES-VLA(联合微调的通才模型) | **75.6%** |

倒水这个任务在人形机器人G1上表现最能说明差距的显著性。ACT这个需要单独训练的方法在G1倒水任务上的成功率是0%,完全失败;GR00T-N1.6提升到32%;而DyPES-VLA达到52%。把书放到书架上这个任务上,ACT在G1上也是0%成功,GR00T-N1.6是24%,DyPES-VLA是36%。这些数字背后说明的是,人形机器人的控制难度天然比单臂、双臂高得多,因为自由度更多、平衡要求更复杂,而一个能学到跨身体共享规律的模型,在最难啃的那个身体上反而拉开了更大的相对优势。

拆解每个部件到底有没有用:消融实验

论文还专门做了消融实验,一块块拆掉某个设计,看看性能会掉多少,这样才能确认每个部件真的在起作用,而不是碰巧凑效果。

| 去掉的部件 | RoboTwin | RoboCasa-GR1 | LIBERO |

| 完整DyPES-VLA | **89.02** | **59.25** | **98.0** |

| 去掉未来预测目标 | 86.67 | 56.75 | 96.1 |

| 去掉第一阶段预训练 | 87.76 | 58.33 | 96.7 |

| 换成共享的动作头(去掉MoE) | 87.85 | 57.17 | 96.8 |

| 去掉机器人身份元数据 | 88.50 | 58.75 | 97.6 |

从数字上看,去掉未来预测这个目标,掉分最狠,RoboTwin掉2.35分,RoboCasa掉2.5分,LIBERO更是掉了1.9分。这说明"预测未来"这件事确实是整个方案里最有含金量的一步,不是可有可无的装饰。

去掉MoE换成共享动作头,损失也不小,尤其在人形机器人任务上掉了2.08个百分点,验证了前面说的,不同身体的动作确实需要专属处理,硬挤在一起会互相打架。

为了进一步证实"未来预测"这一步到底学到了什么,论文还做了一个挺有意思的探针实验。他们训练了一个简单的线性分类器,专门去检测查询状态里到底能不能"读出"接触即将开始或结束的信息,也就是判断机器人手爪是否快要碰到物体、或者快要松开物体。结果显示,完整版模型在这个判断任务上的AUPRC指标(一种衡量分类效果的指标,数值越高说明区分能力越强)在"接触即将开始"这一项上达到86.3%,而去掉未来预测目标的版本只有70.8%,差了整整15.5个百分点。这个数字挺让人意外的,说明未来预测这个训练目标真的在查询状态里埋下了关于"接触""因果"这类物理规律的信息,而不只是一个听起来好听但实际没什么作用的花架子。

写在后面

读完这篇论文,让我印象最深的其实不是那个98%的成功率数字,而是那个"接触检测探针"实验。因为它做的是一件很朴素的事:直接打开黑箱,去验证"未来预测"这个训练目标到底有没有在模型内部留下痕迹。很多论文里的辅助训练目标,效果好可能只是碰巧,但这个探针实验用一个具体的、可量化的方式证明了因果关系,不是"加了这个loss效果变好了",而是"加了这个loss之后,模型内部确实多了一种可以被读出来的、关于物理接触的知识"。这种验证方式比单纯堆砌成功率数字更让人信服。

另一个值得琢磨的地方是,论文里提到的三种机器人身体(单臂、双臂、人形)覆盖的自由度跨度从7一路到29,几乎是四倍的差距,但整个框架没有为每种身体单独设计任何手工规则的坐标变换,这在工程上其实是个挺大的取舍。省去了大量人工对齐的工作量,但代价是模型必须自己学会"翻译",训练数据的规模和质量要求会更高。论文没有细讲万一遇到第四种、第五种完全陌生的机器人身体时,这套MoE专家系统要怎么扩容,是重新训练一个新专家,还是能靠已有专家插值出来?这个问题留在了论文之外,倒是挺值得追问的。

Q&A

Q1:DyPES-VLA是什么?

A:DyPES-VLA是香港科技大学(广州)团队提出的一种跨身体机器人操控模型,核心思路是先用"预测未来画面"的方式学习不同机器人通用的物理动态规律,再用专属的混合专家(MoE)动作头把这些规律翻译成每种机器人自己的动作指令,不需要手动统一不同机器人的动作格式。

Q2:DyPES-VLA在哪些机器人平台上做了测试?

A:仿真环境测试了三个平台:RoboTwin 2.0(14自由度双臂机器人)、RoboCasa-GR1(29自由度人形机器人)、LIBERO(7自由度单臂机器人),单一检查点分别拿到89.02%、59.25%、98.0%的成功率。真实机器人测试用了Franka Research 3单臂、AgileX COBOT Magic双臂、Unitree G1人形三种物理平台,联合微调后平均成功率达到75.6%。

Q3:DyPES-VLA为什么不需要手动统一不同机器人的动作格式?

A:因为它把"共享的物理规律"和"专属身体的控制细节"拆开处理了。共享部分靠未来预测任务训练出的查询状态来承载,专属部分靠MoE动作头里针对每种机器人的专属编码器、解码器和前馈专家来处理,每个机器人保留自己原生的动作空间,不需要提前做坐标变换或逆向运动学计算。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
当一个经济体不愿意投资,那就不完全是信心的问题 

当一个经济体不愿意投资,那就不完全是信心的问题 

生命可以承受之轻
2026-08-13 16:48:57
千亿龙头中报业绩暴增三倍!603256:终止6亿元电子布项目

千亿龙头中报业绩暴增三倍!603256:终止6亿元电子布项目

大众证券报
2026-08-13 23:30:22
山口百惠:我的祖籍是上海

山口百惠:我的祖籍是上海

大侠霍元乙
2026-07-24 09:55:24
电车遮羞布一块块被撕下,销量连续下跌,电车车企慌了

电车遮羞布一块块被撕下,销量连续下跌,电车车企慌了

柏铭锐谈
2026-08-13 22:25:18
二人独处,女人不抗拒肢体亲近,唯独介意男人这三种行为

二人独处,女人不抗拒肢体亲近,唯独介意男人这三种行为

三农老历
2026-07-11 19:31:24
惊人的父子定律:爸爸什么样,儿子大概率就什么样

惊人的父子定律:爸爸什么样,儿子大概率就什么样

户外阿毽
2026-08-08 10:22:54
给千万企退工人一个公道:年年调资不是福利,是缴费换来的权益

给千万企退工人一个公道:年年调资不是福利,是缴费换来的权益

你在偷看谁
2026-08-12 20:02:35
张颖颖曝大S死因隐情,难怪小菲频频讨好S妈,大S生前早有暗示

张颖颖曝大S死因隐情,难怪小菲频频讨好S妈,大S生前早有暗示

吴蒂旅行ing
2026-08-13 14:14:57
街机只有日版才是原汁原味,就是辣眼睛的画面太多

街机只有日版才是原汁原味,就是辣眼睛的画面太多

街机时代
2026-08-12 18:00:03
善待买断工龄下岗工人!再不妥善处理,以后再无弥补机会

善待买断工龄下岗工人!再不妥善处理,以后再无弥补机会

白米饭怎么吃
2026-07-31 19:25:54
克林顿:我后悔让乌克兰放弃核武器,其次是让中国加入世贸组织

克林顿:我后悔让乌克兰放弃核武器,其次是让中国加入世贸组织

战域笔墨
2026-07-19 06:34:29
姆巴佩度假秀恩爱被嘲不务正业,欧冠金球真不重要了?看懂他凌晨四点加练才知多可怕

姆巴佩度假秀恩爱被嘲不务正业,欧冠金球真不重要了?看懂他凌晨四点加练才知多可怕

草莓解说体育
2026-08-08 11:29:46
得知美国向日本扔了原子弹,毛主席非但不高兴,反而气得拍桌子!

得知美国向日本扔了原子弹,毛主席非但不高兴,反而气得拍桌子!

凉州辞
2026-08-04 13:45:03
豪门冷暖两重天:平民儿媳黯然离场,圈层名媛从容入局

豪门冷暖两重天:平民儿媳黯然离场,圈层名媛从容入局

布丁冰淇淋
2026-08-03 21:02:34
“女生30分钟”事件走红,哭诉错过上大学机会,网友:你送外卖都够呛

“女生30分钟”事件走红,哭诉错过上大学机会,网友:你送外卖都够呛

熙熙说教
2026-07-30 18:25:22
人有没有肠息肉,看吃饭就知道?肠道内长息肉,吃饭或有这几表现

人有没有肠息肉,看吃饭就知道?肠道内长息肉,吃饭或有这几表现

医学科普汇
2026-08-04 23:15:03
越南少将坦言:如果当时中国军队在谅山再多待五天,布防在那里的越军,不是被打散的问题,而是从建制上被彻底抹掉的问题, 一个都不剩下

越南少将坦言:如果当时中国军队在谅山再多待五天,布防在那里的越军,不是被打散的问题,而是从建制上被彻底抹掉的问题, 一个都不剩下

人生录
2026-08-08 00:05:22
不打也不放开封锁和制裁,美国欲困死伊朗革命卫队?

不打也不放开封锁和制裁,美国欲困死伊朗革命卫队?

高博新视野
2026-08-11 19:26:42
畸形审美?演技尴尬,油头粉面,却总演主角的几位男星,实在离谱

畸形审美?演技尴尬,油头粉面,却总演主角的几位男星,实在离谱

大眼妹妹
2026-08-11 06:43:03
1948 年,淮海战役未解谜团,杜聿明晚年直言,真正强敌并非粟裕,而是那位常在紧要关头暗中截断自身退路的寡言总长

1948 年,淮海战役未解谜团,杜聿明晚年直言,真正强敌并非粟裕,而是那位常在紧要关头暗中截断自身退路的寡言总长

磊子讲史
2026-07-14 10:50:11
2026-08-14 04:07:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9516文章数 568关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

手机
时尚
旅游
游戏
军事航空

手机要闻

荣耀Robot Phone成了,Magic9要来了

HYROX赛场上的美照怎么拍出来的?

旅游要闻

春城昆明名字根源,不是滇池不是美景,源自两千年前滇西古老部族!

曾为LPL夺S赛冠军,如今沦落登峰组9连败,Jiejie归队遭质疑!

军事要闻

特朗普发文:伊朗已经完蛋

无障碍浏览 进入关怀版