高德 ABot-M0.5 登陆 Evo-Studio 榜单:移动操作模型的一次系统性尝试![]()
引言
移动操作(Mobile Manipulation)——即机器人在移动底盘的同时完成精细抓取与操作——一直是具身智能研究中公认的难点之一。其难度并非单纯来自模型规模,而是源于导航与操作这两类行为在时间尺度、动力学特性上的本质差异。
近期,高德地图计算机视觉实验室(AMAP CV Lab)发布了面向该问题的世界-动作模型(World Action Model, WAM)ABot-M0.5,并已在第三方评测平台Evo-Studio(studio.evomind-tech.com,同源的 VLA SOTA Leaderboard 见 sota.evomind-tech.com,由 EvoMind 团队联合上海交通大学 MINT Lab 维护)收录的 RoboTwin 2.0、LIBERO-Plus、RoboCasa365 等基准中提交了评测数据。本文尝试梳理这项工作的核心方法,并结合公开榜单对其表现做一个相对客观的介绍。
需要说明的是,Evo-Studio 是一个由学术团队维护、持续更新的社区榜单,其排名会随新模型的加入而动态变化。本文引用的具体数值均来自论文原文及项目仓库,建议感兴趣的读者直接访问榜单站点核实当前的实时排名。
一、问题的提出:三个结构性错配
论文将移动操作任务中现有方法(反应式 VLA 策略,以及一般化的 WAM)的局限,归纳为三个层面的"错配":
时间粒度错配世界模型通常以较粗的时间粒度对未来视频进行预测。然而抓取、接触、对准等精细操作发生在极短的时间窗口内,粗粒度的视频预测难以保留这些局部的接触动力学信息。
动作空间错配底盘移动属于低频率、大范围的动作,机械臂操作则是高频率、局部化且对接触高度敏感的动作。若将二者置于同一动作空间中联合建模,不同动力学特性的梯度信号会相互干扰,影响各自的学习效率。
训练-推理不一致逆动力学模型在训练阶段通常以真实的未来观测为条件来学习动作预测,但在推理阶段,模型只能依赖自身生成("想象")的未来观测。这种训练与推理条件之间的分布差异,会在长时程任务中随时间步累积放大,导致执行误差扩大。
这三点错配,构成了论文提出改进方案的出发点。
二、方法:三级对齐![]()
针对上述问题,ABot-M0.5 提出了对应的三项设计,论文称之为"三级对齐范式"。
时间粒度对齐:引入帧级潜在动作
论文在粗粒度视频表征与具体机器人动作之间,引入了一个中间表征——**帧级潜在动作(Latent Action)**。整体信息流为:
视频潜表征 → 潜在动作 → 可执行机器人动作
该潜在动作表征与具体机器人形态无关,理论上可以从不带动作标注的视频数据中学习,起到桥接"粗粒度世界建模"与"细粒度底层控制"的作用,用于捕捉局部视觉状态转变与接触动力学。
动作空间对齐:双层混合专家结构(Dual-level MoT)
为缓解移动与操作两类动作相互干扰的问题,论文设计了双层混合专家 Transformer 结构:
在模态层面,视频、潜在动作、可执行动作三类信号分别使用独立的投影头,避免不同模态的表征相互坍缩;
在动作层面,移动(底盘)与操作(机械臂)进一步拆分为两个独立的子模块,各自拥有专属的前馈网络与输出头,但共享自注意力层,以保留两者之间的协同关系——例如底盘位置的变化会直接影响机械臂可达的操作空间。
训练-推理对齐:Dream Forcing
这是论文中较为关键的训练策略。区别于以往依赖真实未来观测(Teacher Forcing)或随机加噪(Diffusion Forcing)的训练方式,ABot-M0.5 采用了"Dream Forcing"策略:模型先自行预测(而非依赖真实)一段未来视频,再以这段自身生成、可能存在偏差的视频为条件,学习动作预测。
其核心思想是让训练阶段的输入条件与推理阶段保持一致,从而缓解长时程执行中误差累积的问题。论文中的消融实验显示,去除潜在动作表征或改用纯 Teacher Forcing 训练,均会导致成功率下降及动作精度降低。
三、实验结果
论文在多个基准上进行了评测,主要结果如下(数据来自论文原文及项目仓库):
![]()
点击图片可查看完整电子表格
![]()
![]()
在真实机器人平台(Agilex Piper 机械臂)上,团队使用每任务 50 条示教数据进行微调,精细操作任务成功率约为 70%,长时程多阶段任务成功率在 60%–80% 之间,评测中优于 Fast-WAM 等对比方法。
论文同时报告了一个值得关注的局限:在完全未见过的组合任务(Composite-Unseen)设置下,成功率仅为 2.7%。这类未见组合任务恰好是通用家庭机器人所必须应对的场景,当前结果表明该方向仍有较大的改进空间。这一局限的如实披露,也为评估这项工作的实际适用边界提供了参考。
四、关于 Evo-Studio 榜单![]()
上述基准(RoboTwin 2.0、LIBERO-Plus、RoboCasa365 等)均属于Evo-Studio / VLA SOTA Leaderboard(studio.evomind-tech.com)所持续追踪的评测体系。该榜单由 EvoMind 团队与上海交通大学 MINT Lab(赵波老师团队) 联合维护,收录内容包括 LIBERO、LIBERO-Plus、CALVIN、Meta-World、RoboChallenge、RoboCasa-GR1-Tabletop、RoboCasa365、RoboTwin 2.0 等主流 VLA 模型基准,以及针对灵巧手操作的专项榜单,并支持按模型名称检索各项成绩与出处。
其定位是对已发表工作中的评测结果进行第三方汇总与呈现,而非独立组织评测,数据来源为原始论文或经第三方复现的结果。由于榜单会随新模型持续更新,本文不在此给出具体的实时名次,建议读者直接访问榜单站点查看当前收录情况。
五、小结
ABot-M0.5 针对移动操作任务提出的三级对齐方案,思路上的特点在于:没有停留在"增大模型规模"或"叠加更多数据"层面,而是先对导航与操作两类行为在时间尺度、动作空间、训练-部署一致性上的差异进行了较为系统的拆解,再针对每一层差异给出对应的结构设计。这种"问题拆解-针对性设计"的研究路径,以及论文中对局限性(如 Composite-Unseen 任务表现)的如实呈现,是这项工作值得关注的地方。
该工作的代码与技术报告已在 GitHub 仓库 amap-cvlab/ABot-Manipulation 开源,相关评测数据也可在 Evo-Studio 榜单中查证。对移动操作、世界模型方向感兴趣的读者,可以进一步查阅原始论文与项目页面获取更多细节。
Mbot具身智能实验室
让尖端科技触手可及,人人皆可探索未来
![]()
Mbot基础交流群等你加入,下方扫码联系
具身-杰西
Mbot具身-小助手
Mbot-视频号
Mbot-公众号
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.