网易首页 > 网易号 > 正文 申请入驻

VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错

0
分享至





视频链接:https://mp.weixin.qq.com/s/rfSPbtc2_fRpggXeBPPC3Q

机器人抓住积木,正准备往碗里放。就在这时,有人突然把碗挪走了。

人会本能地停一下、看一眼,再重新对准;但不少 VLA 机器人不会。它明明还在接收相机画面,手上却继续执行几百毫秒前生成的旧动作,最后把积木放进空气里。

这不是模型「没看见」,而是它在这段时间里,根本没被允许重新思考。

浙江大学 ACES 实验室 OmniAI 团队与阿里巴巴达摩院的最新工作VLA-Corrector,盯住了这个长期被 action chunk 掩盖的问题:VLA 一次预测一串动作确实高效,但从开始执行到下一次推理之间,也出现了一块危险的开环盲区

  • 论文:VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
  • 作者:Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang
  • 单位:Zhejiang University;Alibaba DAMO Academy
  • 论文链接:https://arxiv.org/abs/2607.01804
  • 项目主页:https://zju-omniai.github.io/vla-corrector/
  • 代码:https://github.com/ZJU-OmniAI/vla-corrector

他们给出的答案很直接:不必逼大模型每一步都重算,也别让机器人闭着眼把整段动作做完。给 VLA 加一个约 40M 参数的轻量级 Corrector,让它知道什么时候该继续,什么时候必须停手纠错。



长 action horizon 与严格闭环执行的对比

VLA 明明一直睁着眼,为什么还像没看见?

现在主流的生成式 VLA,常用 action chunk 来摊薄推理成本:模型看一次画面,一口气生成未来一段动作;机器人再从中连续执行前 H 步。H 越大,调用模型的次数越少,动作也更连贯。

代价同样明显。抓取时打滑、插入时偏了两毫米,或者目标被人移动,后面的动作就已经「过期」了。但只要 horizon 还没结束,机器人仍会照着旧计划往下做。小偏差很快滚成大错误,等下一次推理终于到来,状态可能已经偏到救不回来了。

把 H 设成 1,当然可以步步闭环,却等于每个控制步都调用一次 VLA。论文的 horizon sweep 也把这笔账算得很清楚:以 π0.5 为例,拉长 horizon 能把 policy call 降低约 4 倍,但成功率会从约 64% 掉到 49% 以下。

所以,问题并不是再猜一个「最佳 H」。真正该问的是:当前这段动作,什么时候已经不值得信了?

不要一直重规划,

只在动作失效的那一刻接管

VLA-Corrector 没有改动 VLA 主干权重,而是在推理链路外加了一条「监测—打断—纠正」的旁路。

第一步是监测。Latent-space Vision Monitor(LVM)学习一个很局部的问题:执行这个动作后,视觉特征接下来应该往哪个方向变化?在线运行时,它不断比较「预期变化」和相机里「真实发生的变化」。模型不是直接预测像素,而是在信息密度高的 latent space 中预测视觉动态残差。这样有助于减少静态背景,光照的干扰,让模型优先关注对执行任务而言重要的动态部分,降低学习难度的同时还能让预测更加准确。

第二步是打断。如果这种偏差持续出现,而非单帧抖动,系统立刻清空队列中尚未执行的 stale actions。动态阈值、迟滞机制和连续步检查,保证它不会一有风吹草动就停机。

第三步才是纠正。简单地再问一次 VLA,可能只会得到另一段同样出不去的动作。为此,Online Gradient Guidance(OGG)会把刚才检测到的视觉偏差变成梯度信号,只引导中断后的那一次恢复推理,把新动作往更可恢复的方向推。



VLA-Corrector:监测、打断与纠正

这套机制最终得到的不是另一个固定 horizon,而是事件触发的自适应 horizon:搬运平稳时,大步往前走;到了抓取、对齐、插入这些容易出错的阶段,随时准备切回短视野纠错。实验中,83.7% 的截断恰好发生在这些关键阶段。

换句话说,它不是在开环和闭环之间二选一,而是把闭环反馈用在了最值钱的时刻。

成功率涨了,调用次数反而还能降

在 MetaWorld 上,给 π0.5 加入 VLA-Corrector 后,平均成功率从48.70% 提升到 64.35%;在 Very Hard 任务上,提升达到24 个百分点

更有意思的是,它并不是靠疯狂增加推理次数换来的。SmolVLA 在 horizon 10 下,成功率从61.90% 提升到 73.00%,平均 policy call 却从19.27 次降到 15.64 次。原因不难理解:及时扔掉过期动作,远比在失败轨迹上继续浪费整段 chunk 划算。

真实 AgileX PiPER 机械臂上的结果更直观。九项任务的平均成功率从55.6% 提升到 73.3%;在人为移动物体或目标的扰动恢复任务中,成功率从40.0% 跃升到 68.3%。而在 LIBERO 上,加入 Corrector 的 few-shot 模型达到97.8%,还超过了 fully fine-tuned baseline 的 96.95%。



VLA-Corrector 的真实机械臂结果

这项工作真正值得带走的 insight

过去我们常把 VLA 的可靠性理解成「第一次就预测出完美动作」。但机器人进入物理世界后,动作会反过来改变环境,计划也会随时过期。一个永远不犯错的长动作块并不现实,真正重要的是:系统能不能尽早知道自己已经走偏,并保留打断自己的权力。

VLA-Corrector 给出了一种很有启发的系统分工:大模型负责提出计划,小模型负责审计计划,执行层拥有随时叫停的权力。这可能比一味堆大 backbone 更接近具身智能的可靠落地。

它当然不是万能恢复器。OGG 仍受基础策略能力上限约束。但VLA-Corrector真正的核心在于它能有效抑制错误在开环盲区中被放大,大幅降低VLA policy从错误中恢复的难度。它改变了问题的解法:不再要求 VLA 时时严格闭环,而是让系统在该闭环的瞬间,真的闭上这个环。

一句话概括:机器人未必需要永远不出错,但它必须学会不把错误继续做完。

作者介绍

本工作由浙江大学 OmniAI 团队与阿里巴巴达摩院联合完成,第一作者是浙大准研一的硕士研究生潘翼,研究聚焦 action-chunked VLA 的开环盲区与真实机器人纠错,通讯作者为浙大百人计划研究员张文祺。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
看完《醒来》,再看王凯新剧《交锋》,我想说:没对比就没有伤害

看完《醒来》,再看王凯新剧《交锋》,我想说:没对比就没有伤害

小椰的奶奶
2026-09-12 00:57:05
生吃解毒,熟吃润肺!大量上市,10元5斤,每天吃一点,好处不少

生吃解毒,熟吃润肺!大量上市,10元5斤,每天吃一点,好处不少

阿天爱旅行
2026-09-11 20:12:31
暴跌来袭!今晚,全球资金屏息等待。。

暴跌来袭!今晚,全球资金屏息等待。。

格隆汇
2026-09-11 15:19:04
40万亿美债压顶,美国终于想明白了:把中国踢出美元体系等于自杀

40万亿美债压顶,美国终于想明白了:把中国踢出美元体系等于自杀

麓谷隐士
2026-09-11 00:05:07
开盘,暴涨超234%!中一签,大赚16万元!A股龙头狂飙

开盘,暴涨超234%!中一签,大赚16万元!A股龙头狂飙

券商中国
2026-09-11 09:46:37
三星发文讥讽苹果iPhone Duo是“热别人剩下的剩菜”

三星发文讥讽苹果iPhone Duo是“热别人剩下的剩菜”

cnBeta.COM
2026-09-10 06:20:06
心理学发现一个神准的规律:儿子越有出息,父亲越不爱吭声,父亲越强势,儿子越没本事,你对照一下身边是不是这样

心理学发现一个神准的规律:儿子越有出息,父亲越不爱吭声,父亲越强势,儿子越没本事,你对照一下身边是不是这样

心理观察局
2026-09-10 06:30:04
哈佛大学:多吃含类黄酮的食物,或能保护大脑,远离老年痴呆

哈佛大学:多吃含类黄酮的食物,或能保护大脑,远离老年痴呆

奇妙的本草
2026-09-09 12:19:26
远东七百万平方公里,中国该怎么看?

远东七百万平方公里,中国该怎么看?

石辰搞笑日常
2026-09-11 18:15:42
准备战斗!中美终极对决提前到来,美国放大招了

准备战斗!中美终极对决提前到来,美国放大招了

兵国大事
2026-09-11 01:10:05
从“性价比”到“定义权”:五年砸下1055亿,小米终于亮出了底牌

从“性价比”到“定义权”:五年砸下1055亿,小米终于亮出了底牌

智谷趋势
2026-09-10 11:39:50
6-2!丁俊晖三连鞭横扫威尔逊进英格兰公开赛四强,世界冠军遭遇三连败

6-2!丁俊晖三连鞭横扫威尔逊进英格兰公开赛四强,世界冠军遭遇三连败

世界体坛观察家
2026-09-11 22:31:44
美英民调承认了:西方掀起“中国热潮”,最大的原因在中国自己身上

美英民调承认了:西方掀起“中国热潮”,最大的原因在中国自己身上

小影的娱乐
2026-09-11 00:59:15
伊朗战争,为何让印度彻底老实了呢?真实原因开始浮出水面

伊朗战争,为何让印度彻底老实了呢?真实原因开始浮出水面

农夫史记
2026-09-10 20:11:43
涨1000元还被秒抢?iPhone 18 Pro明晚预售:预约破350万,凭什么

涨1000元还被秒抢?iPhone 18 Pro明晚预售:预约破350万,凭什么

泡泡网
2026-09-11 15:51:14
再见了刘翔,再见了樊振东,中国越来越不需要金牌,将迎来新时代

再见了刘翔,再见了樊振东,中国越来越不需要金牌,将迎来新时代

米果说识
2026-09-11 17:27:22
参选消息落地了,特朗普沉默了。 9月5日,亨特·拜登高调宣布:“我要参加2028年大选,致力于成为最遵守法律的总统。”

参选消息落地了,特朗普沉默了。 9月5日,亨特·拜登高调宣布:“我要参加2028年大选,致力于成为最遵守法律的总统。”

扶苏聊历史
2026-09-10 17:49:17
哈哈哈!iphone Duo名场面,这个手指也太长了吧!?

哈哈哈!iphone Duo名场面,这个手指也太长了吧!?

LOGO研究所
2026-09-11 09:09:02
刘亦菲风波升级!圈内大佬爆料她被打脸,和干爹关系曝光又有新瓜

刘亦菲风波升级!圈内大佬爆料她被打脸,和干爹关系曝光又有新瓜

观察鉴娱
2026-09-11 11:10:27
中国各地为啥一夜之间多出这么多零食店,评论区一针见血!

中国各地为啥一夜之间多出这么多零食店,评论区一针见血!

另子维爱读史
2026-09-10 10:54:11
2026-09-12 01:31:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13971文章数 142733关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

中方赴印代表团规模有多大 外交部回应

头条要闻

中方赴印代表团规模有多大 外交部回应

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

数码
家居
健康
本地
公开课

数码要闻

小空间观影优选!哈趣 Q1 Pro 高亮版,云台高亮配哈曼音响

家居要闻

2026建博会(广州) 公装联探展交流活动

手脚发麻口齿不清?也可能是中风!

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版