网易首页 > 网易号 > 正文 申请入驻

CoRL 2026|让机器人更会动,从学会「起步」开始

0
分享至



本文共同第一作者为戴美坡、庄启源、徐赫洋,通讯作者为东南大学青年首席教授魏秀参,研究方向为具身智能、计算机视觉与机器学习。本研究围绕机器人模仿学习与生成式动作策略,探索可学习源分布对机器人操作的作用。

在机器人模仿学习中,扩散模型与流匹配模型将动作生成建模为条件采样,从专家演示中学习动作分布,并通过迭代生成动作序列。这类策略已被用于抓取放置、工具使用与双臂协同等操作任务。

生成式机器人策略通常从与当前观测无关的标准高斯分布出发。A2A、VITA 等方法开始利用本体感知或视觉信息构造生成起点,但主要将起点视为确定性的估计,尚未显式建模其不确定性。这引出了一个问题:动作生成的起点应该是一个确定值,还是一个分布?如果是分布,其方差应该固定,还是随机器人状态变化?

针对这一问题,东南大学魏秀参团队提出LeaP(Learnable source Prior),一种由本体感知信息驱动的可学习源先验。LeaP 联合预测初始高斯分布的均值与方差,为动作生成提供状态相关的随机初始化。在 RoboTwin 的 15 项仿真操作任务上,其平均成功率达到81.6%,较采用相同编码器与生成器的标准高斯基线提升 25.5 个百分点。

相关论文已被机器人学习国际会议CoRL 2026接收,代码已开源。

  • 论文标题:Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies
  • 论文链接:https://arxiv.org/abs/2606.17408
  • 项目仓库:https://github.com/SEU-VIPGroup/LeaP
  • 项目主页:https://daimeipo.github.io/LeaP/



图 1|三种动作生成起点:标准高斯噪声、由观测确定的起点,以及 LeaP 学习的条件概率分布。

LeaP:面向动作生成的可学习源先验

LeaP 的核心设计是将固定的标准高斯源分布替换为本体感知条件下的对角高斯分布,联合学习其均值与方差。先验提供与机器人状态相关的随机初始化,生成器进一步结合视觉与本体感知信息细化动作。

具体而言,LeaP 将本体感知特征输入两层 MLP 先验头,输出均值与对数方差,构造对角高斯分布。均值决定初始样本的分布中心,方差控制各动作维度上样本的离散程度,两者共同随机器人状态调整。

实际采样时,模型将标准高斯噪声逐维缩放,再加上预测均值,得到生成起点。训练和推理都保留这一随机采样过程。一段动作的各时间步共享分布参数,但独立采样;细致的时序关系交给后续生成器学习。

先验仅接收本体感知信息,生成器则同时接收视觉与本体感知特征。两者分别承担初始分布建模与动作细化,使 LeaP 能够接入现有生成器,保持其架构和推理求解器不变。

训练采用三项联合目标:流匹配损失学习从源样本到专家动作的变换;负对数似然损失监督先验的条件概率分布;对比对齐损失在特征空间中建立源样本与配对专家动作的对应关系。先验与生成器通过这三项损失端到端优化。



图 2|LeaP 框架:本体感知决定先验分布,视觉与本体感知共同指导动作生成。

实验结果与分析

团队在 RoboTwin 的 15 项双臂操作任务上检验这一设计,涵盖抓取放置、工具使用与双臂协同。每项任务使用 50 条专家演示,每个随机种子评估 100 次,最终报告 3 个种子的结果。各方法使用相同的 DP3 PointNet 点云编码器。



表 1|15 项任务的平均成功率,报告 3 个随机种子的均值与标准差。BridgePolicy 为本研究团队依据原论文复现的版本。

最直接的对照来自 NoPrior:它与 LeaP 共享编码器、生成器和流匹配流程,使用标准高斯起点。25.5 个百分点的差距体现了可学习先验及其训练机制的收益。LeaP 也高于使用确定性起点的 VITA 和 A2A,分别领先 6.5 和 7.8 个百分点。

在模型规模与训练效率方面,LeaP 总参数量为 13.22M,其中先验头约 0.21M,占总量约 1.6%。在打开笔记本电脑任务的实验中,LeaP 训练 1000 轮达到 91% 成功率,超过四个主要基线训练 3000 轮后的表现,展示了改善收敛效率的潜力。



图 3|模型规模与训练收敛对比。左:各方法的参数量与 15 项任务平均成功率,包含 ACT、DP3 等方法;右:打开笔记本电脑任务中,各方法的成功率随训练轮数的变化。

这一趋势也出现在真实机械臂上。在 Franka Research 3 的抓取方块、关闭盒子、抓取并放置沙袋三项任务中,每项使用 100 条遥操作演示,并随机设置物体位置测试 20 次。LeaP 平均成功率为80.0%,高于 A2A 的 68.3%、VITA 的 56.7% 和 NoPrior 的 46.7%;相较 NoPrior 提升 33.3 个百分点。



图 4|真实机械臂上的三项操作任务及各方法成功率。

消融实验:先验的输入、分布形式与训练目标

研究通过消融实验考察先验的输入、分布形式与监督目标。实验在抓取不同瓶子、打开笔记本电脑、交接方块三项 RoboTwin 任务上进行,每项任务评估 100 次。

先验应以什么信息为条件?保持生成器接收的信息不变,仅调整先验的输入。仅用本体感知的 LeaP 平均成功率达到 85.3%,视觉及三种视觉与状态融合方案则为 59.3%—70.3%。三种融合方式均未带来提升,说明下降并非某一种融合方式特有的现象。源分布可视化进一步显示,本体感知先验将样本放在目标动作附近,而引入视觉特征的变体则容易偏离目标。这些结果支持论文中的分工:先验依据机器人状态确定与动作相关的起点,生成器再结合视觉信息细化动作。

先验应采用什么形式?所有可学习先验都优于标准高斯基线,但在这组实验中,表达能力更强的全协方差高斯和高斯混合模型并未超过 LeaP 的对角高斯。更关键的是一组三方对照:仅使用预测均值时,成功率为 78.0%;加入固定标准差为 1 的高斯噪声后,反而降至 62.7%;联合学习均值与状态自适应方差则达到 85.3%。这表明,仅有随机性并不够;相比直接加入固定幅度的噪声,学习与当前状态相适应的不确定性更为有效。

先验应接受什么监督?仅通过流匹配损失训练先验,平均成功率为 59.7%,高于无先验基线的 47.7%,但仍低于完整模型的 85.3%。可学习先验本身已有收益,显式监督则进一步改善了效果:去掉对比对齐或似然监督,成功率分别降至 74.7% 和 74.3%。似然损失监督先验对专家动作的条件密度建模,对比损失约束源样本与配对动作在特征空间中的对应关系,两者提供互补的学习信号。

跨生成器的通用性。同一先验使流匹配的平均成功率从 47.7% 提升至 85.3%;在扩散桥中,相比采用先验均值的确定性起点,完整 LeaP 分布将成功率从 68.7% 提升至 76.7%。前者展示了替换标准高斯源的整体收益,后者表明,在已有状态相关均值的基础上,学习状态自适应方差仍能带来提升。这支持将源分布作为可复用的设计模块,与生成器设计相互补充。



图 5|先验输入、分布形式、训练监督与生成器类型的消融结果,报告三项任务下的平均成功率。

总结

LeaP 将源分布纳入生成式机器人策略的设计,通过轻量网络联合学习状态相关的均值与方差,为动作生成提供可学习的随机初始化。仿真、真实机械臂和跨生成器实验验证了这一设计的有效性。目前的验证集中在桌面操作,对角高斯也未显式建模动作维度之间的相关性;更复杂的先验形式与机器人形态仍有待探索。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
尴尬了!原定26桌婚宴突来36桌:山东新娘学生家长全家赴宴,10桌缺口让主家酒店总管,集体懵圈

尴尬了!原定26桌婚宴突来36桌:山东新娘学生家长全家赴宴,10桌缺口让主家酒店总管,集体懵圈

火山詩话
2026-10-06 08:31:34
中网前3种子全出局!高芙0-2爆冷首输梅尔滕斯 无缘八强创生涯最差

中网前3种子全出局!高芙0-2爆冷首输梅尔滕斯 无缘八强创生涯最差

醉卧浮生
2026-10-07 16:25:49
染红后微笑离场!前国脚怒批韦世豪:不顾集体利益 惯犯 永远改不了

染红后微笑离场!前国脚怒批韦世豪:不顾集体利益 惯犯 永远改不了

风过乡
2026-10-07 08:23:48
约10万士兵出现溃退!莫斯科全城加强戒备,俄军战壕实情曝光

约10万士兵出现溃退!莫斯科全城加强戒备,俄军战壕实情曝光

影孖看世界
2026-10-06 21:13:22
完美谢幕!39岁梅西正式结束21年国家队生涯,赛后告别:想一辈子留在国家队,但是时候了

完美谢幕!39岁梅西正式结束21年国家队生涯,赛后告别:想一辈子留在国家队,但是时候了

封面新闻
2026-10-07 11:30:44
大结局来了!欧某某踢到铁板,身份被扒、全网社死:逼哭空姐的那一跪,终于反噬到自己身上

大结局来了!欧某某踢到铁板,身份被扒、全网社死:逼哭空姐的那一跪,终于反噬到自己身上

秋风妃
2026-10-06 22:06:46
时隔3年重返中网八强!6届大满贯冠军斯瓦泰克2-0横扫10号种子

时隔3年重返中网八强!6届大满贯冠军斯瓦泰克2-0横扫10号种子

醉卧浮生
2026-10-07 14:46:09
“你该继续贫困!”女生每天一杯瑞幸被举报,公务员都没这么奢侈

“你该继续贫困!”女生每天一杯瑞幸被举报,公务员都没这么奢侈

番外行
2026-10-05 20:54:27
被记者拦车采访,葡萄牙主帅热苏斯回应C罗长文声明:我没什么可说的;葡媒:热苏斯团队已提前知晓C罗声明,且认为内容可以接受

被记者拦车采访,葡萄牙主帅热苏斯回应C罗长文声明:我没什么可说的;葡媒:热苏斯团队已提前知晓C罗声明,且认为内容可以接受

大风新闻
2026-10-07 14:06:14
战火升级、巴土入局 中东“同室操戈”何时休?

战火升级、巴土入局 中东“同室操戈”何时休?

看看新闻Knews
2026-10-07 00:01:32
郑钦文苦战再取中网胜利,排名持续攀升:“我感觉所有人都想击败我”

郑钦文苦战再取中网胜利,排名持续攀升:“我感觉所有人都想击败我”

寒律
2026-10-07 11:40:31
1000赛9连败!周杰伦现场观战,张之臻遭逆转止步上海大师赛首轮

1000赛9连败!周杰伦现场观战,张之臻遭逆转止步上海大师赛首轮

全景体育V
2026-10-07 17:01:03
号称世界第一的华西医院到底有多强?输了两天液,发现医生一直在骂同行

号称世界第一的华西医院到底有多强?输了两天液,发现医生一直在骂同行

华庭讲美食
2026-10-06 12:20:28
不可思议啊!网传江苏夫妻教数学物理五年收入340万,还清房贷车贷,目标300万躺平

不可思议啊!网传江苏夫妻教数学物理五年收入340万,还清房贷车贷,目标300万躺平

火山詩话
2026-10-06 07:37:59
一觉醒来,我的导师获得诺奖了!河南一高校副教授发文恭喜,称导师在科学研究中非常严谨,对学生也十分真诚,去年曾来学校进行指导

一觉醒来,我的导师获得诺奖了!河南一高校副教授发文恭喜,称导师在科学研究中非常严谨,对学生也十分真诚,去年曾来学校进行指导

极目新闻
2026-10-07 01:50:11
国庆高速数据彻底打脸!油电大势已定,再也回不去了

国庆高速数据彻底打脸!油电大势已定,再也回不去了

华庭讲美食
2026-10-06 02:59:29
中国航发动力:铸就航空“中国心”,五家上市公司协同发展谱新篇

中国航发动力:铸就航空“中国心”,五家上市公司协同发展谱新篇

终南听雨
2026-10-07 17:10:17
再见了康辉,再见了李梓萌,再见了朱迅,央视主持迎来疯狂大洗牌

再见了康辉,再见了李梓萌,再见了朱迅,央视主持迎来疯狂大洗牌

大眼妹妹
2026-10-06 22:31:58
拔出萝卜带出泥!王皓风波再次升级,报警竟意外将半个饭圈拉下水

拔出萝卜带出泥!王皓风波再次升级,报警竟意外将半个饭圈拉下水

棠棣分享
2026-10-07 07:40:16
刚刚,诺贝尔物理奖爆冷!82岁狂人一人独揽,凿穿南极冰川

刚刚,诺贝尔物理奖爆冷!82岁狂人一人独揽,凿穿南极冰川

新智元
2026-10-06 18:52:40
2026-10-07 18:48:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

地雷风波升级 金与正强硬发声:就是野兽也都不能进出

头条要闻

地雷风波升级 金与正强硬发声:就是野兽也都不能进出

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

吴奇隆举旗活动取消,不赚钱也守立场

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

教育
亲子
艺术
时尚
本地

教育要闻

【预告】10月8日|南方教研大讲堂第196场:AI赋能高中地理海洋生态文明主题研学

亲子要闻

宝蓝和叔叔玩过家家扮演大人,叔叔藏起来吃零食不让宝蓝找到

艺术要闻

颜真卿随手写的三件草稿,看着歪歪扭扭,却被评价:水平在《兰亭序》之上!

赫本的小黑裤,裤装界的气质王者

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版