网易首页 > 网易号 > 正文 申请入驻

Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式

0
分享至



Haojie Huang (黄浩杰) 是美国东北大学计算机科学五年级博士生,师从 Robert Platt 和 Robin Walters,研究方向为机器人操作学习与几何深度学习。他早期主要研究利用对称性提升模仿学习的样本效率,并提出 Edge Grasp Net、Fourier Transporter、Imagination Policy 等原创工作;近期聚焦 pose-free action representation 与新的操作学习范式。其成果发表于 IJRR、RSS、CoRL、ICRA、RA-L、ICLR、NeurIPS、ICML 等顶级会议和期刊,并获 CoRL 2024 Outstanding Paper Finalist、RA-L 2026 Best Paper Honorable Mention 等荣誉。曾在 Boston Dynamics AI Institute 和 Amazon Robotics 实习。

If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy.大语言模型的成功揭示了一个适用于一维序列数据的清晰Scaling Law:通过自回归训练,并采用交叉熵(cross-entropy)目标函数预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。机器人的动作轨迹同样服从一个非常复杂、且往往具有多模态特性的概率分布。

然而,将这种基于cross-entropy的概率预测范式直接扩展到机器人学习并不容易:我们应该如何定义机器人的动作分类空间,并预测一个时间窗口(temporal horizon)内的动作概率分布?核心困难在于,机器人动作本质上是高维的—— 在时间窗口中的每一个时刻,动作通常至少包含 6 或 7 个自由度(包括夹爪)。如果将每一个动作维度仅仅粗略地离散化为 10 个 bin,并将一个完整的 6 维动作视为一个 joint action token,那么其组合空间就已经达到 10⁶,也就是100 万种可能的动作;且如此粗糙的离散化本身又很难满足高精度操作的需求。如果进一步提高每个维度的离散精度,或者同时预测 temporal horizon 中多个时刻的动作,整个动作空间还会迅速膨胀。

如此巨大的 action space,再一次揭示了机器人操作学习中的一个bitter lesson:the curse of dimensionality(维度灾难)



Figure1. Comparison of different policy-learning frameworks.

Action Map Policy(AMP)定义了一种新的动作表达(action representation)。它首先将三维运动(orientation + translation)可逆地表示为3D 关键点轨迹,再将这些 3D 关键点投影到多个相机平面上。通过这种方式,原本的三维运动轨迹可以被表示为二维图像空间中的像素轨迹



  • Project Website: https://haojhuang.github.io/amp_page/
  • Paper Link: https://arxiv.org/abs/2607.10706

关键在于,AMP 并不是通过扩散模型进行降噪,也不是通过回归模型直接预测这些 2D 像素点的位置,而是将动作预测重新定义为一个像素级分类问题:模型预测每一个像素在不同时刻成为目标关键点位置的概率,从而得到每个时间步上的像素概率分布。通过这种巧妙的动作表达,AMP首次将高精度的 3D 闭环机器人操作转化为图像空间中的像素分类问题,同时仍然能够实现毫米级(小于1 mm)的三维动作精度。简单来说,AMP 做的事情,是把一个原本需要在高维连续空间中预测的 3D 动作问题,重新变成了一个我们已经非常熟悉的问题:在图像上做 classification。这个新的动作表达和操作学习范式带来了一些质的变化

  1. 输入空间和输出空间实现了高度统一。类似于 LLM 将输入与输出统一在 token space 中,AMP 将视觉观测和机器人动作统一到image space:输入是 image,输出则是定义在 image 上的 action distribution。动作不再只是一个抽象的低维向量,而成为具有明确空间语义的像素概率分布。
  2. 交叉熵(cross-entropy)目标函数天然具备建模复杂、多模态概率分布的能力。与直接回归一个确定的动作不同,分类模型可以自然地描述 “多个动作都可能是合理选择” 的情况,这对于具有高度多模态性的机器人操作尤其重要。
  3. 模型一次前向推理即可输出完整的动作概率分布。相比需要多步迭代去噪的 diffusion-based policy,AMP 可以通过一次模型推理直接得到不同时刻的动作分布,显著提高机器人推理速度;与此同时,完整的概率分布也使得从中进行action sampling变得非常自然,可以根据同一个观测采样出多个不同但合理的动作候选。

Experiment 1:模型的感知能力与多峰分布表达能力

我们先看一个非常简单、但很有意思的实验,看看这个 formulation 到底带来了什么不同?桌面上放置了四个外观完全相同的木块,实验者用激光笔点亮其中一个木块,模型需要识别这个细粒度的视觉信号,并抓取被激光指中的目标。每个木块收集 10 条 demonstration,一共只有 40 条 demo。这个实验主要测试两个能力:模型对fine-grained visual signal的感知能力,以及对multi-modal action distribution的表达能力。为了尽可能排除空间泛化等其他因素,数据采集时木块的位置变化(spatial variation)非常小,训练和测试时的场景分布基本一致。



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

Diffusion Policy



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

Action Map policy

可以看到,Diffusion Policy(DiffPo)在这个看似简单的小测试中出现了明显的类似mode collapse的问题:模型很难根据激光笔的位置,稳定地抓取被指中的木块。因为这个实验本身几乎不包含 spatial variation,因此问题并不来自模型需要泛化到新的物体位置,而更直接地暴露了模型能否捕捉这种细粒度条件信号,并正确表达对应的多峰动作分布。

换句话说,这并不是简单增加更多的数据能够解决的问题。相比之下,AMP 在这个实验中达到了 100% 的成功率,初步展示了它对细粒度视觉信号的感知能力,以及对多峰动作分布的表达能力。下面具体看一下 AMP 是怎么实现的这个新的 action representation。

Method:AMP 架构和主要设计



Figure2. Architecture of Action Map Policy. The left branches take one in-hand image and two side-view images as input. The center features a multi-view transformer that enables communication between the in-hand features and the side-view context features. The right branch consists of two decoders that generate heatmaps of keypoints across the temporal horizon.

  • AMP 的整体架构采用一套 X-Net 形状的 Encoder–Decoder 设计。X-Net 的左侧分支是 Encoder,将输入图像压缩成latent feature maps,再展开成 tokens;中间部分是Multi-view Transformer,包含in-image attention layerscross-image attention layers,用于在单张图像内部建模特征,同时学习和交换不同相机视角之间的信息;右侧分支是 Decoder,将特征重新解码成与输入图像具有相同空间分辨率的 heatmaps,用于表达不同 keypoint 在不同时刻出现在各个像素位置上的概率分布。
  • 模型训练过程不需要任何显式的 3D 轨迹监督,而是端到端地在图像空间中完成。在推理阶段,模型首先通过 argmax 选取 heatmap 中概率最高的像素位置,从而得到二维图像平面上的 keypoint 运动轨迹;随后结合相机的内参和外参,通过triangulation(三角测量)恢复对应的三维空间轨迹。换一个角度理解,AMP 并不是直接在 3D 空间里 “学 3D”,而是通过学习多个 2D 视角中的动作分布,间接获得对 3D 动作结构的理解。

Experiment 2:3D Closed-Loop 模仿学习的真机实验

AMP 在三个早餐场景任务中进行了验证:制作咖啡、烤面包和蒸鸡蛋。这些任务同时考察了模型的高精度操作能力长时序多步骤任务执行能力。例如,将咖啡胶囊准确放入咖啡机、将面包片插入狭窄的烤槽、按下按钮或拉杆,以及将蒸蛋器的盖子准确盖合,都需要较高的空间精度和稳定的闭环控制。

  • Making Coffee(制作咖啡):机器人需要依次打开咖啡机盖、放入咖啡胶囊、放置杯子,并最终按下启动按钮。
  • Toast Bread(烤面包):机器人需要将两片面包分别放入烤面包机的插槽中,并按下拉杆启动烘烤。
  • Steam Egg(蒸鸡蛋):机器人需要依次将三个鸡蛋放入蒸蛋器对应的槽位中,最后将盖子准确盖到蒸蛋器上。

这三个任务都包含多个连续的操作阶段,因此不仅测试单步动作精度,也测试模型在较长时间范围内保持任务状态并持续完成后续操作的能力。



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Make Coffee



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Toast Bread



视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Steam Egg



Table 1: Real-world performance Comparison.

实验结果表明:1)AMP 在三个任务中显著优于 Diffusion Policy(DiffPo)和 ACT,成功率提升约 50%–70%。当测试场景存在较大的空间变化(spatial variation)或对操作精度要求较高时,两个 baseline 的性能都会明显下降,而 AMP 仍然保持了较强的空间泛化能力和稳定的操作精度。 2)AMP 的推理速度也明显更快。与需要迭代生成动作的方法不同,AMP 只需要一次 forward pass 就可以输出动作,单次推理约为13.80 ms;相比之下,使用 16 步 DDIM 去噪的 DiffPo 需要约93.53 ms。这意味着 AMP 在保持较强性能的同时,也更适合对实时性要求较高的闭环机器人控制。

Additional Experiments

AMP 文章中还系统分析了该方法能够达到的操作精度。实验表明,3D 动作的重建精度与输入图像的分辨率近似呈线性正相关;在 224×224 的图像分辨率下,AMP 可以达到约1 mm 的位置重建误差和 1.3° 的旋转误差。除此之外,文章还包含了大量模拟仿真实验以及详细的ablation study,用于进一步分析动作表达、模型架构和训练设计中不同组件的作用。更多实验结果和分析可以参阅原文。

相比于World Action Model(WAM),AMP 将动作推理聚焦于更加紧凑的像素级关键点表达,而不是像 WAM 那样通过生成图像或视频来表征未来状态,再通过inverse dynamics layers从视觉预测中恢复机器人动作。因此,AMP 避免了高维图像生成所带来的额外计算开销,在动作表达、计算资源需求和推理速度上都更加轻量和高效。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
一向装得大公无私的海牙国际刑事法院,这次彻底栽了大跟头,被81岁的杜特尔特团队抓着漏洞狠狠打脸!

一向装得大公无私的海牙国际刑事法院,这次彻底栽了大跟头,被81岁的杜特尔特团队抓着漏洞狠狠打脸!

扶苏聊历史
2026-09-09 18:10:00
突然异动!黄金、白银猛拉,概念股直线涨停

突然异动!黄金、白银猛拉,概念股直线涨停

证券时报
2026-09-09 15:26:06
妻子和19岁女儿在家,被同一男人骗了财和色,丈夫后悔外出打工

妻子和19岁女儿在家,被同一男人骗了财和色,丈夫后悔外出打工

情感艺术家
2026-09-06 06:12:16
不查不知道一查吓一跳,在杭州坐拥千万豪宅的CoCo,私下究竟多壕

不查不知道一查吓一跳,在杭州坐拥千万豪宅的CoCo,私下究竟多壕

锅锅爱历史
2026-09-02 16:50:45
上海警方通报:来沪人员梁某(男,45岁,有精神病史),已刑事立案

上海警方通报:来沪人员梁某(男,45岁,有精神病史),已刑事立案

黄河新闻网吕梁
2026-09-09 16:18:14
3.40-1.33!郑钦文冲首个美网四强,若0-2莱巴金娜,请球迷别骂她

3.40-1.33!郑钦文冲首个美网四强,若0-2莱巴金娜,请球迷别骂她

侃球熊弟
2026-09-09 01:52:41
全面反华?澳外长下令,不许澳大学和中方合作,最大输家不是中国

全面反华?澳外长下令,不许澳大学和中方合作,最大输家不是中国

像梦一场a
2026-09-09 20:04:48
马斯克告诉前女友“他需要在内战爆发前拥有一大群孩子”,曾出价4000万美元让她签署保密协议

马斯克告诉前女友“他需要在内战爆发前拥有一大群孩子”,曾出价4000万美元让她签署保密协议

金融界
2026-09-09 10:09:32
无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

梦史
2026-08-29 06:21:20
孙千表示拍完《早春晴朗》深陷失恋感,坦言桃桃与自己很像,井柏然暖心一旁逗趣安慰

孙千表示拍完《早春晴朗》深陷失恋感,坦言桃桃与自己很像,井柏然暖心一旁逗趣安慰

情感大头说说
2026-09-10 00:58:50
教育部部长怀进鹏发文,教育或将大洗牌,网友:缩短学制 普及高中

教育部部长怀进鹏发文,教育或将大洗牌,网友:缩短学制 普及高中

混沌录
2026-09-09 10:11:27
1500万打赏换不来一夜陪睡,榜一大哥反手把女主播送进监狱!他还是9家企业法人,有老婆孩子

1500万打赏换不来一夜陪睡,榜一大哥反手把女主播送进监狱!他还是9家企业法人,有老婆孩子

听心堂
2026-08-16 12:47:15
央视直播澳门冠军赛9月10日赛程,陈幸同对米特兰姆,周启豪战邱党

央视直播澳门冠军赛9月10日赛程,陈幸同对米特兰姆,周启豪战邱党

乒乓球球
2026-09-09 22:28:01
“先别换电视!”用了4年的电视卡成PPT,他让Claude来“修”:不Root、不卸载,最后竟“比刚买时还快”!

“先别换电视!”用了4年的电视卡成PPT,他让Claude来“修”:不Root、不卸载,最后竟“比刚买时还快”!

CSDN
2026-09-07 20:12:01
政斗要成军变?17万菲军开始站队?莎拉拿出后手,让马科斯冒冷汗

政斗要成军变?17万菲军开始站队?莎拉拿出后手,让马科斯冒冷汗

起喜电影
2026-09-09 06:07:53
北京二手房成交量创近五年新高

北京二手房成交量创近五年新高

第一财经资讯
2026-09-09 19:36:06
回溯刘嘉玲 90 年被绑旧闻,不雅照轰动全港,当晚究竟经历了什么

回溯刘嘉玲 90 年被绑旧闻,不雅照轰动全港,当晚究竟经历了什么

搞笑娱乐笑话
2026-09-08 13:54:55
广安市政府党组成员、副市长肖伟华,任上被查

广安市政府党组成员、副市长肖伟华,任上被查

封面新闻
2026-09-08 20:19:11
就煮三回,肺部老痰就通开了!白痰黄痰一抹而空,嗓子好舒服!

就煮三回,肺部老痰就通开了!白痰黄痰一抹而空,嗓子好舒服!

小谈食刻美食
2026-09-08 08:59:43
2026-09-10 03:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13955文章数 142731关注度
往期回顾 全部

科技要闻

苹果首款折叠屏iPhone Duo发布,15999元起

头条要闻

苹果发布首款折叠屏iPhone Duo 起售价1999美元

头条要闻

苹果发布首款折叠屏iPhone Duo 起售价1999美元

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

亲子
家居
旅游
艺术
教育

亲子要闻

我不放弃,也不害怕!#彩虹糖裴曼伊#看看世界有多大#熊出没

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

看过无数雪山,唯独卡瓦格博,藏着最动人的千年爱情与守护故事!

艺术要闻

贝格玛镜头下的少女,一张张看下去,我竟然忘了呼吸……

教育要闻

今年最惨的6个专业,平均月薪跌破4000元,就业率低得离谱!

无障碍浏览 进入关怀版