![]()
视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。
这也是为什么真机强化学习如此重要:预训练和模仿学习赋予机器人一个不错的起点,而强化学习让它能够在真实环境中继续试错,适应具体物体、视角和接触动力学。但真机试错的成本远高于仿真。每一次失败都会消耗设备时间、实验人员精力,甚至破坏任务现场。
因此,真机强化学习面对的核心问题不是能否学习,而是:如何用尽可能少的真实交互,让策略尽快学会成功?
一个自然的答案是让人类参与。模型探索错误方向时,人类可以立即接管并完成纠正。然而,对于采用流匹配(flow matching)的 VLA,新的矛盾随之出现:人类给出的是机器人动作,轻量强化学习优化的却是初始噪声。人类知道机械臂应该怎样移动,却无法直接告诉模型应该选择哪一个噪声。人类动作与噪声空间之间,缺少一个可靠的接口。
来自微软亚洲研究院、悉尼科技大学和清华大学的研究者提出了 UniSteer。它通过动作到噪声的近似反演,将人类纠正转换成噪声监督,使监督学习和强化学习能够共同更新同一个轻量 noise actor,而预训练 VLA 的动作解码器始终保持冻结。
为了展示这种方法在高精度任务上的潜力,研究者让机械臂挑战了一项颇具难度的手工任务:拼豆。
机械臂需要逐颗夹取细小的聚乙烯中空颗粒,再将其准确放到带有柱状凸起的拼豆板上。力度过大,拼豆可能弹飞;姿态稍有偏差,拼豆就无法顺利套入凸起;释放时稍有碰撞,还可能推倒已经放好的颗粒。
![]()
下面是 UniSteer 微调后的 VLA 完成拼豆任务的视频。
![]()
视频链接:https://mp.weixin.qq.com/s/flVi1eIIfy02ytPpTu9_Ew
作者已在 arXiv 发布论文预印本,并开源训练代码。
![]()
- 论文标题:UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation
- 论文链接:https://arxiv.org/abs/2605.10821
- 代码链接:https://github.com/microsoft/UniSteer
噪声空间微调足够轻量,但探索仍然太昂贵
目前不少 VLA 使用流匹配来生成连续动作。给定视觉观测、机器人状态和语言指令,模型先采样一个高斯噪声,再通过多步去噪,将它逐渐变换为一段机器人动作。
如果直接对整个 VLA 做在线强化学习,不仅计算代价高,还需要让梯度穿过多步动作生成过程,训练容易变得不稳定。噪声空间强化学习提供了一条更轻量的路线:冻结预训练 VLA,只训练一个小型 noise actor,由它根据当前状态选择初始噪声,再交给冻结的 VLA 解码成动作。
其执行过程可以写成:
![]()
![]()
这种设计有两个直接优势。其一,只更新小型 actor,训练成本显著降低;其二,所有动作仍由预训练 VLA 解码,因此不会轻易偏离模型原有的动作先验。
但轻量并不等于高效。当初始策略成功率很低、奖励又只在任务完成时出现,noise actor 仍需要依靠自主试错寻找少量成功轨迹。如果机械臂始终以错误姿态接近物体,它就很难获得任何正奖励,更谈不上从奖励中学习。
![]()
这就把问题收敛为一个关键技术问题:能否找到一个噪声,使冻结的 VLA 恰好生成接近人类纠正的动作?
![]()
动作无法直接监督 noise actor,UniSteer 选择反演整个生成过程
UniSteer 的核心思路并不复杂:既然冻结的 VLA 定义了从噪声到动作的映射,就沿着这条路径反向寻找产生人类动作的初始噪声。
![]()
![]()
在连续时间下,如果速度场满足论文给出的连续性与 Lipschitz 条件,这个从噪声到动作的映射是双射:每个动作都存在唯一的初始噪声与之对应。真正的困难在于,实际模型采用离散的 Euler 步完成解码,而单步逆映射仍然依赖未知的输入。
定义一次前向更新为:
![]()
![]()
![]()
同一个噪声接口,如何同时接住人类纠正与强化学习?
得到目标噪声之后,人类指导终于可以直接进入 noise actor 的训练。
![]()
![]()
另一方面也进入强化学习缓冲区,帮助 critic 学习这些更有价值的状态 — 噪声组合。随后,actor 再根据 critic 给出的价值信号继续优化:
![]()
因此,人类纠正和强化学习不再分别修改动作模型的不同部分,而是通过同一个噪声接口更新同一个 actor。监督学习先把 actor 拉向人类指出的有希望区域,强化学习再利用任务奖励,在这些区域附近继续探索和巩固。
![]()
平均 66 分钟从 20% 到 90%,提升来自更有效的探索
研究者在 AgileX Piper 机械臂上测试了拿起勺子、堆叠积木、插入方块和折叠毛巾四项真机任务,覆盖抓取放置、精密接触和可变形物体操作。
![]()
![]()
经过平均 66 分钟在线微调,UniSteer 将四项任务的平均成功率从 20% 提升到 90%。作为对比,只做噪声空间强化学习、不使用人类指导的 DSRL 达到 55%;在动作空间聚合人类示范的 DAgger 达到 60%。
为了检验模型是否只是在重复示范,研究者还专门设置了分布外(OOD)初始位置。初始策略在三项任务的 OOD 测试中成功率均为 0%。经过 UniSteer 微调后,三项任务的 OOD 成功率全部达到 100%。相比之下,DSRL 在三项 OOD 测试中分别达到 0%、0% 和 25%,DAgger 则分别为 75%、100% 和 25%。
![]()
相比于 DAgger 这样经典的人工纠错类算法,UniSteer 所需要的人力投入更少。在对比实验中,DAgger 每轮固定收集 8 条纯人工轨迹;而 UniSteer 在每轮人工轨迹更少的情况下,却能取得很好的效果。而 UniSteer 使用的纯模型轨迹也少于 DSRL 基线,这说明它的提升并非来自采得更多,而是来自更有效的探索。
![]()
这个结果的意义不只在于最终成功率更高,更在于提升来得更快。DSRL 完全依赖自主探索,初始策略越弱,越难收集到成功轨迹;DAgger 虽然能较快利用人工动作,却可能在连续的动作空间监督中覆盖此前学到的行为。UniSteer 则先借助少量纠正找到更有希望的噪声区域,再通过奖励驱动的优化保留和扩展这些能力。
固定点反演的价值,不只是「能够反演」
动作到噪声并非只有一种实现方式。研究者还比较了两种替代方案:一种把噪声本身当作优化变量,通过梯度搜索能够重建人类动作的噪声;另一种不显式恢复目标噪声,而是把 actor 输出送入冻结解码器,再从动作重建误差反向传播到 actor。
实验显示,固定点反演在速度、重建精度和最终成功率之间取得了更好的平衡。在拿勺子任务的 8 条测试轨迹上,固定点反演总耗时 73.26 秒并实现 8/8 成功;基于优化的反演耗时 208.04 秒,仅实现 3/8 成功。插方块任务中,两者分别为 40.42 秒、8/8 成功和 80.96 秒、4/8 成功。
直接动作监督虽然也能取得较高成功率,却需要让梯度穿过整个多步解码链。在拿勺子和插方块任务中,其训练耗时分别达到 193.22 秒和 90.43 秒,明显高于固定点反演方案。
固定点反演真正重要的地方因此不只是「找到一个噪声」,而是以较低成本找到与冻结 VLA 一致的噪声监督目标。它既避免反复优化单个噪声,也避免每次 actor 更新都穿过完整动作生成过程。
结语
VLA 已经为机器人提供了强大的动作先验,但从「大致会做」走向「稳定做好」,仍然离不开真实环境中的适应。难点在于,真机交互昂贵,纯强化学习探索缓慢,而人类纠正与噪声空间优化又使用两种不同的表示。
UniSteer 给出的答案,是把人类动作反演为初始噪声,让监督学习与强化学习在同一个轻量 noise actor 上汇合。人类纠正负责指出更有希望的探索区域,强化学习负责根据真实任务奖励继续优化,冻结的 VLA 则始终提供动作先验。
从平均 66 分钟内将四项任务的成功率由 20% 提升至 90%,到仅用两条完整演示支持机械臂逐颗完成微软 Logo 拼豆,UniSteer 展示了一条颇具现实意义的路线:不必全量更新庞大的 VLA,也不必让机器人从稀疏奖励中盲目试错,而是让人类在关键时刻给出的纠正,直接成为噪声空间中可学习的方向。
随着 VLA 逐渐进入更精密、更长程和更复杂的真实任务,如何把有限的人类参与转化为高效、稳定的策略改进,将成为机器人后训练越来越重要的问题。UniSteer 为这一问题提供了一个简洁而统一的接口。
作者介绍
论文由悉尼科技大学、清华大学与微软亚洲研究院联合完成。悉尼科技大学 VAIL 实验室的卢俊杰与清华大学自动化系的秦馨瑶为共同第一作者;微软亚洲研究院的张楚珩与王开新为共同通讯作者;微软亚洲研究院赵立担任项目负责人。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.