网易首页 > 网易号 > 正文 申请入驻

Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式

0
分享至



Haojie Huang (黄浩杰) 是美国东北大学计算机科学五年级博士生,师从 Robert Platt 和 Robin Walters,研究方向为机器人操作学习与几何深度学习。他早期主要研究利用对称性提升模仿学习的样本效率,并提出 Edge Grasp Net、Fourier Transporter、Imagination Policy 等原创工作;近期聚焦 pose-free action representation 与新的操作学习范式。其成果发表于 IJRR、RSS、CoRL、ICRA、RA-L、ICLR、NeurIPS、ICML 等顶级会议和期刊,并获 CoRL 2024 Outstanding Paper Finalist、RA-L 2026 Best Paper Honorable Mention 等荣誉。曾在 Boston Dynamics AI Institute 和 Amazon Robotics 实习。

If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy.大语言模型的成功揭示了一个适用于一维序列数据的清晰Scaling Law:通过自回归训练,并采用交叉熵(cross-entropy)目标函数预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。机器人的动作轨迹同样服从一个非常复杂、且往往具有多模态特性的概率分布。

然而,将这种基于cross-entropy的概率预测范式直接扩展到机器人学习并不容易:我们应该如何定义机器人的动作分类空间,并预测一个时间窗口(temporal horizon)内的动作概率分布?核心困难在于,机器人动作本质上是高维的—— 在时间窗口中的每一个时刻,动作通常至少包含 6 或 7 个自由度(包括夹爪)。如果将每一个动作维度仅仅粗略地离散化为 10 个 bin,并将一个完整的 6 维动作视为一个 joint action token,那么其组合空间就已经达到 10⁶,也就是100 万种可能的动作;且如此粗糙的离散化本身又很难满足高精度操作的需求。如果进一步提高每个维度的离散精度,或者同时预测 temporal horizon 中多个时刻的动作,整个动作空间还会迅速膨胀。

如此巨大的 action space,再一次揭示了机器人操作学习中的一个bitter lesson:the curse of dimensionality(维度灾难)



Figure1. Comparison of different policy-learning frameworks.

Action Map Policy(AMP)定义了一种新的动作表达(action representation)。它首先将三维运动(orientation + translation)可逆地表示为3D 关键点轨迹,再将这些 3D 关键点投影到多个相机平面上。通过这种方式,原本的三维运动轨迹可以被表示为二维图像空间中的像素轨迹



  • Project Website: https://haojhuang.github.io/amp_page/
  • Paper Link: https://arxiv.org/abs/2607.10706

关键在于,AMP 并不是通过扩散模型进行降噪,也不是通过回归模型直接预测这些 2D 像素点的位置,而是将动作预测重新定义为一个像素级分类问题:模型预测每一个像素在不同时刻成为目标关键点位置的概率,从而得到每个时间步上的像素概率分布。通过这种巧妙的动作表达,AMP首次将高精度的 3D 闭环机器人操作转化为图像空间中的像素分类问题,同时仍然能够实现毫米级(小于1 mm)的三维动作精度。简单来说,AMP 做的事情,是把一个原本需要在高维连续空间中预测的 3D 动作问题,重新变成了一个我们已经非常熟悉的问题:在图像上做 classification。这个新的动作表达和操作学习范式带来了一些质的变化

  1. 输入空间和输出空间实现了高度统一。类似于 LLM 将输入与输出统一在 token space 中,AMP 将视觉观测和机器人动作统一到image space:输入是 image,输出则是定义在 image 上的 action distribution。动作不再只是一个抽象的低维向量,而成为具有明确空间语义的像素概率分布。
  2. 交叉熵(cross-entropy)目标函数天然具备建模复杂、多模态概率分布的能力。与直接回归一个确定的动作不同,分类模型可以自然地描述 “多个动作都可能是合理选择” 的情况,这对于具有高度多模态性的机器人操作尤其重要。
  3. 模型一次前向推理即可输出完整的动作概率分布。相比需要多步迭代去噪的 diffusion-based policy,AMP 可以通过一次模型推理直接得到不同时刻的动作分布,显著提高机器人推理速度;与此同时,完整的概率分布也使得从中进行action sampling变得非常自然,可以根据同一个观测采样出多个不同但合理的动作候选。

Experiment 1:模型的感知能力与多峰分布表达能力

我们先看一个非常简单、但很有意思的实验,看看这个 formulation 到底带来了什么不同?桌面上放置了四个外观完全相同的木块,实验者用激光笔点亮其中一个木块,模型需要识别这个细粒度的视觉信号,并抓取被激光指中的目标。每个木块收集 10 条 demonstration,一共只有 40 条 demo。这个实验主要测试两个能力:模型对fine-grained visual signal的感知能力,以及对multi-modal action distribution的表达能力。为了尽可能排除空间泛化等其他因素,数据采集时木块的位置变化(spatial variation)非常小,训练和测试时的场景分布基本一致。



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

Diffusion Policy



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

Action Map policy

可以看到,Diffusion Policy(DiffPo)在这个看似简单的小测试中出现了明显的类似mode collapse的问题:模型很难根据激光笔的位置,稳定地抓取被指中的木块。因为这个实验本身几乎不包含 spatial variation,因此问题并不来自模型需要泛化到新的物体位置,而更直接地暴露了模型能否捕捉这种细粒度条件信号,并正确表达对应的多峰动作分布。

换句话说,这并不是简单增加更多的数据能够解决的问题。相比之下,AMP 在这个实验中达到了 100% 的成功率,初步展示了它对细粒度视觉信号的感知能力,以及对多峰动作分布的表达能力。下面具体看一下 AMP 是怎么实现的这个新的 action representation。

Method:AMP 架构和主要设计



Figure2. Architecture of Action Map Policy. The left branches take one in-hand image and two side-view images as input. The center features a multi-view transformer that enables communication between the in-hand features and the side-view context features. The right branch consists of two decoders that generate heatmaps of keypoints across the temporal horizon.

  • AMP 的整体架构采用一套 X-Net 形状的 Encoder–Decoder 设计。X-Net 的左侧分支是 Encoder,将输入图像压缩成latent feature maps,再展开成 tokens;中间部分是Multi-view Transformer,包含in-image attention layerscross-image attention layers,用于在单张图像内部建模特征,同时学习和交换不同相机视角之间的信息;右侧分支是 Decoder,将特征重新解码成与输入图像具有相同空间分辨率的 heatmaps,用于表达不同 keypoint 在不同时刻出现在各个像素位置上的概率分布。
  • 模型训练过程不需要任何显式的 3D 轨迹监督,而是端到端地在图像空间中完成。在推理阶段,模型首先通过 argmax 选取 heatmap 中概率最高的像素位置,从而得到二维图像平面上的 keypoint 运动轨迹;随后结合相机的内参和外参,通过triangulation(三角测量)恢复对应的三维空间轨迹。换一个角度理解,AMP 并不是直接在 3D 空间里 “学 3D”,而是通过学习多个 2D 视角中的动作分布,间接获得对 3D 动作结构的理解。

Experiment 2:3D Closed-Loop 模仿学习的真机实验

AMP 在三个早餐场景任务中进行了验证:制作咖啡、烤面包和蒸鸡蛋。这些任务同时考察了模型的高精度操作能力长时序多步骤任务执行能力。例如,将咖啡胶囊准确放入咖啡机、将面包片插入狭窄的烤槽、按下按钮或拉杆,以及将蒸蛋器的盖子准确盖合,都需要较高的空间精度和稳定的闭环控制。

  • Making Coffee(制作咖啡):机器人需要依次打开咖啡机盖、放入咖啡胶囊、放置杯子,并最终按下启动按钮。
  • Toast Bread(烤面包):机器人需要将两片面包分别放入烤面包机的插槽中,并按下拉杆启动烘烤。
  • Steam Egg(蒸鸡蛋):机器人需要依次将三个鸡蛋放入蒸蛋器对应的槽位中,最后将盖子准确盖到蒸蛋器上。

这三个任务都包含多个连续的操作阶段,因此不仅测试单步动作精度,也测试模型在较长时间范围内保持任务状态并持续完成后续操作的能力。



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Make Coffee



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Toast Bread



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Steam Egg



Table 1: Real-world performance Comparison.

实验结果表明:1)AMP 在三个任务中显著优于 Diffusion Policy(DiffPo)和 ACT,成功率提升约 50%–70%。当测试场景存在较大的空间变化(spatial variation)或对操作精度要求较高时,两个 baseline 的性能都会明显下降,而 AMP 仍然保持了较强的空间泛化能力和稳定的操作精度。 2)AMP 的推理速度也明显更快。与需要迭代生成动作的方法不同,AMP 只需要一次 forward pass 就可以输出动作,单次推理约为13.80 ms;相比之下,使用 16 步 DDIM 去噪的 DiffPo 需要约93.53 ms。这意味着 AMP 在保持较强性能的同时,也更适合对实时性要求较高的闭环机器人控制。

Additional Experiments

AMP 文章中还系统分析了该方法能够达到的操作精度。实验表明,3D 动作的重建精度与输入图像的分辨率近似呈线性正相关;在 224×224 的图像分辨率下,AMP 可以达到约1 mm 的位置重建误差和 1.3° 的旋转误差。除此之外,文章还包含了大量模拟仿真实验以及详细的ablation study,用于进一步分析动作表达、模型架构和训练设计中不同组件的作用。更多实验结果和分析可以参阅原文。

相比于World Action Model(WAM),AMP 将动作推理聚焦于更加紧凑的像素级关键点表达,而不是像 WAM 那样通过生成图像或视频来表征未来状态,再通过inverse dynamics layers从视觉预测中恢复机器人动作。因此,AMP 避免了高维图像生成所带来的额外计算开销,在动作表达、计算资源需求和推理速度上都更加轻量和高效。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
送走杰伦・布朗之后,凯尔特人拒绝了所有德里克・怀特交易报价

送走杰伦・布朗之后,凯尔特人拒绝了所有德里克・怀特交易报价

夜白侃球
2026-09-09 12:14:01
阿卡苦战五盘不敌谢尔顿爆冷出局,萨巴伦卡:不介意莱巴替代自己

阿卡苦战五盘不敌谢尔顿爆冷出局,萨巴伦卡:不介意莱巴替代自己

网球之家
2026-09-09 16:49:07
菲律宾政坛出大事了!跟了莎拉18年的老部下,突然坐上证人席!

菲律宾政坛出大事了!跟了莎拉18年的老部下,突然坐上证人席!

快乐彼岸
2026-09-09 17:13:56
娃哈哈集团成被执行人

娃哈哈集团成被执行人

观察者网
2026-09-09 16:03:06
悲惨!因辅导作业,情绪失控,母女相继跳楼,双双坠亡!

悲惨!因辅导作业,情绪失控,母女相继跳楼,双双坠亡!

闲侃闲侃
2026-06-25 07:43:49
极度看衰!今晚23点30,郑钦文冲美网四强,赛前官方胜率更新

极度看衰!今晚23点30,郑钦文冲美网四强,赛前官方胜率更新

体育见习官
2026-09-09 11:41:17
上海退休人员注意!9月9日养老金调查最新进展,别被短视频误导

上海退休人员注意!9月9日养老金调查最新进展,别被短视频误导

李博世财经
2026-09-09 10:17:13
斯诺克最新战报!袁思俊救赛点追到3-3,张安达被塞尔比3-2逆转!

斯诺克最新战报!袁思俊救赛点追到3-3,张安达被塞尔比3-2逆转!

刘姚尧的文字城堡
2026-09-09 22:03:40
又倒下一个!网传合肥庐州公园,一年轻小伙子跑得太拼倒下,疑似心梗,跑友们立即伸手施救,并及时拨打急救电话

又倒下一个!网传合肥庐州公园,一年轻小伙子跑得太拼倒下,疑似心梗,跑友们立即伸手施救,并及时拨打急救电话

火山詩话
2026-09-07 11:43:30
丛明晨和娇妻近照,29岁退役,老婆是1米8美女,打野球也年入百万

丛明晨和娇妻近照,29岁退役,老婆是1米8美女,打野球也年入百万

大西体育
2026-09-09 12:18:04
实话实说,郑薇给宫鲁鸣提了4个建议!

实话实说,郑薇给宫鲁鸣提了4个建议!

体育哲人
2026-09-09 20:35:32
井柏然前任现任同框,马龙夹中间,全网等戏看却等来一场体面课

井柏然前任现任同框,马龙夹中间,全网等戏看却等来一场体面课

不太爱笑的小羊
2026-09-08 16:18:05
不可思议啊!深圳网约车司机苦等10多分钟还要求再等,拒绝后女生当场大哭,家长拦车不让走

不可思议啊!深圳网约车司机苦等10多分钟还要求再等,拒绝后女生当场大哭,家长拦车不让走

火山詩话
2026-09-09 08:27:38
2026乌克兰残局已定,结局早已写好:一旦崩溃,泽连斯基将手提现金,逃往西方

2026乌克兰残局已定,结局早已写好:一旦崩溃,泽连斯基将手提现金,逃往西方

怪味历史连连看
2026-09-09 12:16:07
涉案金额过亿 刘应成(原法名释永信)一审被判有期徒刑24年

涉案金额过亿 刘应成(原法名释永信)一审被判有期徒刑24年

每日经济新闻
2026-05-30 00:42:59
格局!亚马尔:我不会向任何人恳求金球奖 我赢得了世界杯 西甲冠军

格局!亚马尔:我不会向任何人恳求金球奖 我赢得了世界杯 西甲冠军

繁花散尽m
2026-09-08 23:19:36
深夜大涨,芯片巨头创新高!油价飙升,美联储加息突变

深夜大涨,芯片巨头创新高!油价飙升,美联储加息突变

证券时报
2026-09-09 23:06:02
大外援是日日奇?广东队作出重大决定,签下博齐克只是前菜!

大外援是日日奇?广东队作出重大决定,签下博齐克只是前菜!

绯雨儿
2026-09-09 13:15:50
如果不及时快速地解决台湾问题,有可能出现没法挽回的局面!

如果不及时快速地解决台湾问题,有可能出现没法挽回的局面!

乌克兰小静
2026-09-09 08:24:58
热搜第一!天津籍男演员疑似恋情曝光

热搜第一!天津籍男演员疑似恋情曝光

天津人
2026-09-09 15:01:16
2026-09-10 01:55:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13955文章数 142731关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

本地
艺术
房产
数码
公开课

本地新闻

宁波,中国制造的隐藏大佬

艺术要闻

贝格玛镜头下的少女,一张张看下去,我竟然忘了呼吸……

房产要闻

设计之都、中央法务区、均禾大道南侧……白云甩出3宗硬核宅地!

数码要闻

国产显示科技惊艳欧洲!京东方IFA举办IPC,生态出海战略浮出水面

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版