网易首页 > 网易号 > 正文 申请入驻

VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错

0
分享至





视频链接:https://mp.weixin.qq.com/s/rfSPbtc2_fRpggXeBPPC3Q

机器人抓住积木,正准备往碗里放。就在这时,有人突然把碗挪走了。

人会本能地停一下、看一眼,再重新对准;但不少 VLA 机器人不会。它明明还在接收相机画面,手上却继续执行几百毫秒前生成的旧动作,最后把积木放进空气里。

这不是模型「没看见」,而是它在这段时间里,根本没被允许重新思考。

浙江大学 ACES 实验室 OmniAI 团队与阿里巴巴达摩院的最新工作VLA-Corrector,盯住了这个长期被 action chunk 掩盖的问题:VLA 一次预测一串动作确实高效,但从开始执行到下一次推理之间,也出现了一块危险的开环盲区

  • 论文:VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
  • 作者:Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang
  • 单位:Zhejiang University;Alibaba DAMO Academy
  • 论文链接:https://arxiv.org/abs/2607.01804
  • 项目主页:https://zju-omniai.github.io/vla-corrector/
  • 代码:https://github.com/ZJU-OmniAI/vla-corrector

他们给出的答案很直接:不必逼大模型每一步都重算,也别让机器人闭着眼把整段动作做完。给 VLA 加一个约 40M 参数的轻量级 Corrector,让它知道什么时候该继续,什么时候必须停手纠错。



长 action horizon 与严格闭环执行的对比

VLA 明明一直睁着眼,为什么还像没看见?

现在主流的生成式 VLA,常用 action chunk 来摊薄推理成本:模型看一次画面,一口气生成未来一段动作;机器人再从中连续执行前 H 步。H 越大,调用模型的次数越少,动作也更连贯。

代价同样明显。抓取时打滑、插入时偏了两毫米,或者目标被人移动,后面的动作就已经「过期」了。但只要 horizon 还没结束,机器人仍会照着旧计划往下做。小偏差很快滚成大错误,等下一次推理终于到来,状态可能已经偏到救不回来了。

把 H 设成 1,当然可以步步闭环,却等于每个控制步都调用一次 VLA。论文的 horizon sweep 也把这笔账算得很清楚:以 π0.5 为例,拉长 horizon 能把 policy call 降低约 4 倍,但成功率会从约 64% 掉到 49% 以下。

所以,问题并不是再猜一个「最佳 H」。真正该问的是:当前这段动作,什么时候已经不值得信了?

不要一直重规划,

只在动作失效的那一刻接管

VLA-Corrector 没有改动 VLA 主干权重,而是在推理链路外加了一条「监测—打断—纠正」的旁路。

第一步是监测。Latent-space Vision Monitor(LVM)学习一个很局部的问题:执行这个动作后,视觉特征接下来应该往哪个方向变化?在线运行时,它不断比较「预期变化」和相机里「真实发生的变化」。模型不是直接预测像素,而是在信息密度高的 latent space 中预测视觉动态残差。这样有助于减少静态背景,光照的干扰,让模型优先关注对执行任务而言重要的动态部分,降低学习难度的同时还能让预测更加准确。

第二步是打断。如果这种偏差持续出现,而非单帧抖动,系统立刻清空队列中尚未执行的 stale actions。动态阈值、迟滞机制和连续步检查,保证它不会一有风吹草动就停机。

第三步才是纠正。简单地再问一次 VLA,可能只会得到另一段同样出不去的动作。为此,Online Gradient Guidance(OGG)会把刚才检测到的视觉偏差变成梯度信号,只引导中断后的那一次恢复推理,把新动作往更可恢复的方向推。



VLA-Corrector:监测、打断与纠正

这套机制最终得到的不是另一个固定 horizon,而是事件触发的自适应 horizon:搬运平稳时,大步往前走;到了抓取、对齐、插入这些容易出错的阶段,随时准备切回短视野纠错。实验中,83.7% 的截断恰好发生在这些关键阶段。

换句话说,它不是在开环和闭环之间二选一,而是把闭环反馈用在了最值钱的时刻。

成功率涨了,调用次数反而还能降

在 MetaWorld 上,给 π0.5 加入 VLA-Corrector 后,平均成功率从48.70% 提升到 64.35%;在 Very Hard 任务上,提升达到24 个百分点

更有意思的是,它并不是靠疯狂增加推理次数换来的。SmolVLA 在 horizon 10 下,成功率从61.90% 提升到 73.00%,平均 policy call 却从19.27 次降到 15.64 次。原因不难理解:及时扔掉过期动作,远比在失败轨迹上继续浪费整段 chunk 划算。

真实 AgileX PiPER 机械臂上的结果更直观。九项任务的平均成功率从55.6% 提升到 73.3%;在人为移动物体或目标的扰动恢复任务中,成功率从40.0% 跃升到 68.3%。而在 LIBERO 上,加入 Corrector 的 few-shot 模型达到97.8%,还超过了 fully fine-tuned baseline 的 96.95%。



VLA-Corrector 的真实机械臂结果

这项工作真正值得带走的 insight

过去我们常把 VLA 的可靠性理解成「第一次就预测出完美动作」。但机器人进入物理世界后,动作会反过来改变环境,计划也会随时过期。一个永远不犯错的长动作块并不现实,真正重要的是:系统能不能尽早知道自己已经走偏,并保留打断自己的权力。

VLA-Corrector 给出了一种很有启发的系统分工:大模型负责提出计划,小模型负责审计计划,执行层拥有随时叫停的权力。这可能比一味堆大 backbone 更接近具身智能的可靠落地。

它当然不是万能恢复器。OGG 仍受基础策略能力上限约束。但VLA-Corrector真正的核心在于它能有效抑制错误在开环盲区中被放大,大幅降低VLA policy从错误中恢复的难度。它改变了问题的解法:不再要求 VLA 时时严格闭环,而是让系统在该闭环的瞬间,真的闭上这个环。

一句话概括:机器人未必需要永远不出错,但它必须学会不把错误继续做完。

作者介绍

本工作由浙江大学 OmniAI 团队与阿里巴巴达摩院联合完成,第一作者是浙大准研一的硕士研究生潘翼,研究聚焦 action-chunked VLA 的开环盲区与真实机器人纠错,通讯作者为浙大百人计划研究员张文祺。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
申花需要送走的,岂止是一个米内罗

申花需要送走的,岂止是一个米内罗

合赞历史
2026-09-11 15:19:26
梅西一走,阿根廷全乱了?

梅西一走,阿根廷全乱了?

五星体育
2026-09-11 17:09:46
指控4岁男童摸臀事件女生,迎来最大“噩耗”!举报邮件内容全曝光!

指控4岁男童摸臀事件女生,迎来最大“噩耗”!举报邮件内容全曝光!

叨唠
2026-09-11 00:12:54
一个奇怪的社会现象,凡是有退休金的老人,都不愿意和儿女住一起

一个奇怪的社会现象,凡是有退休金的老人,都不愿意和儿女住一起

大熊欢乐坊
2026-09-10 04:47:51
糯康临死前道出实情:金三角毒枭不怕云南武警的枪口,他们内心真正忌惮的是那道30年没人敢动的密令

糯康临死前道出实情:金三角毒枭不怕云南武警的枪口,他们内心真正忌惮的是那道30年没人敢动的密令

磊子讲史
2026-09-11 16:21:43
1100吨炸药4.1级地震!以军炸平真主党2公里地下堡垒,举国震动

1100吨炸药4.1级地震!以军炸平真主党2公里地下堡垒,举国震动

恋人眼中的女孩
2026-09-11 14:55:06
章若楠回应被夸漂亮,直言大家卸了妆都长一样,自己也是被包装过

章若楠回应被夸漂亮,直言大家卸了妆都长一样,自己也是被包装过

芊手若
2026-09-11 14:22:08
澳门冠军赛:等待4年的复仇!单局3-8逆战定乾坤,陈熠3-1世界第41

澳门冠军赛:等待4年的复仇!单局3-8逆战定乾坤,陈熠3-1世界第41

钉钉陌上花开
2026-09-11 11:48:08
重庆一初二女生在楼道里遭殴打,嫌疑人已被抓获,公安局长通宵审问,刑事拘留2人行政拘留3人

重庆一初二女生在楼道里遭殴打,嫌疑人已被抓获,公安局长通宵审问,刑事拘留2人行政拘留3人

扬子晚报
2026-09-10 15:32:19
创始人夫妇失联!千叶珠宝被曝拖欠工资,多平台在售产品下架

创始人夫妇失联!千叶珠宝被曝拖欠工资,多平台在售产品下架

南方都市报
2026-09-11 16:51:18
百亿资金灰飞烟灭!把公司108个美女当作后宫,丁宁到底有多狠?

百亿资金灰飞烟灭!把公司108个美女当作后宫,丁宁到底有多狠?

潋滟晴方DAY
2026-09-02 15:24:52
白露后,10斤莲藕不如一斤它,正大量上市,润肠健脾胃,滋养润肺

白露后,10斤莲藕不如一斤它,正大量上市,润肠健脾胃,滋养润肺

华庭讲美食
2026-09-11 08:27:18
75岁王石现身HYROX北京站参赛,田朴珺到场支持

75岁王石现身HYROX北京站参赛,田朴珺到场支持

新浪财经
2026-09-11 13:35:24
蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

背包旅行
2026-08-29 15:43:56
后续!被取消资助女生卸掉浓妆、换掉苹果17,捐赠人又给她1500

后续!被取消资助女生卸掉浓妆、换掉苹果17,捐赠人又给她1500

无人倾听无人倾听
2026-09-11 02:24:41
盐碱地上,有些人的认知,确实配得上他们的困难!并且很配

盐碱地上,有些人的认知,确实配得上他们的困难!并且很配

走读新生
2026-09-09 09:55:41
64万罚单刚落地!曹云金不再忍耐,现场给郭德纲倒油,句句直戳心窝

64万罚单刚落地!曹云金不再忍耐,现场给郭德纲倒油,句句直戳心窝

观星赏月
2026-09-11 10:57:43
青岛货轮火灾事故已致25人遇难,涉事货轮为散货船,悬挂利比里亚国旗,已抵达青岛10天

青岛货轮火灾事故已致25人遇难,涉事货轮为散货船,悬挂利比里亚国旗,已抵达青岛10天

上观新闻
2026-09-11 06:45:41
中央5台直播乒乓球时间安排:9月11日CCTV5节目安排、CCTV5 节目列表!

中央5台直播乒乓球时间安排:9月11日CCTV5节目安排、CCTV5 节目列表!

念而不见e
2026-09-11 09:18:17
铁人客场虫,徐正源不怕对攻,津门虎若想赢球,盯着李浩然这路攻

铁人客场虫,徐正源不怕对攻,津门虎若想赢球,盯着李浩然这路攻

替补席看球
2026-09-11 15:50:54
2026-09-11 17:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13971文章数 142732关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
房产
旅游
游戏
家居

艺术要闻

梅尔尼科夫:全山石、苏高礼、林岗等的老师

房产要闻

时隔7年,绿地海南再拿地!

旅游要闻

文化中国行·长江文化探访丨龙兴古镇焕新引多元业态 将打造古装短视频拍摄基地

军师 落凤坡到了 《卧龙2》真主角庞统形象公布

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版