网易首页 > 网易号 > 正文 申请入驻

机器人伸手时,杯子被挪走了:LIBERO-MAX用22.4万次仿真检验动态可靠性

0
分享至



设想这样一个场景:你让机器人把桌上的杯子收进托盘。它已经看到了杯子,机械臂正朝杯子伸过去。这时,旁边的人顺手把杯子挪开了几厘米。

对人来说,接着调整一下手的位置就好。对机器人来说,事情可能复杂得多:它之前看到的是旧位置,已经生成的动作也指向旧位置。如果继续执行,手就可能伸向一块空桌面。它能及时看到变化、调整动作,最后把杯子收好吗?

这个小插曲,指向了机器人走进真实生活时必须面对的问题:环境会在机器人行动过程中改变,而任务还需要继续完成。

机器人如何接受一场「考试」?

近年来,机器人开始使用视觉语言动作模型(VLA):输入摄像头画面和「把杯子放进托盘」这样的指令,模型便生成控制机械臂的动作。一些模型还引入世界预测机制,尝试利用对后续场景的预测帮助行动。

判断这些模型做得好不好,需要一套共同的考试题。机器人评测基准提供标准化任务和仿真环境,让不同模型在相同条件下接受测试,再比较谁能完成更多任务。

已有很多鲁棒性评测会在任务开始前改变条件,例如换一个杯子位置、调整光照或改变视角。机器人从第一眼起,看到的就是调整后的场景。

但「杯子一开始就在另一边」和「手伸到一半,杯子才被挪走」,对机器人提出了不同要求。后一种情况下,机器人已经根据旧画面采取行动,还可能有一串尚未执行的动作。它需要在已有的执行过程上,继续应对新的情况。

围绕这一问题,来自Stanford、CMU、MIT、UIUC 和 UT Austin等机构的研究者提出了LIBERO-MAX,将执行过程中的环境变化变成可重复、可比较的测试。

该工作已入选NeurIPS26 Robotics World Modeling Workshop 口头报告(Oral)。Yunbei Zhang与Zijian Jin为共同第一作者,合作作者包括 UT Austin 教授Peter Stone、Stanford 教授Marco Pavone、MIT 博士后Weirui Ye和 NTU 助理教授Jianfei Yang。



  • 论文标题:LIBERO-MAX: Do Robot Policies Adapt When the World Changes?
  • 作者:Yunbei Zhang*、Zijian Jin*、Yuanzhe Liu、Janet Wang、Xilun Zhang、Yuyou Zhang、Zhenyu Zhang、Daoan Zhang、Shuaicheng Niu、Gen Li、Jianfei Yang、Jihun Hamm、Ismini Lourentzou、Weirui Ye、Bo Liu、Peter Stone、Marco Pavone
  • 论文链接:https://arxiv.org/abs/2609.36518
  • 代码链接:https://github.com/liberomax/LIBERO-MAX
  • 项目主页:https://liberomax.github.io/

同一个机器人,两种后续

回到抓杯子的故事。假如机器人最终失败了,怎么判断是杯子被挪走造成的,还是它本来就抓不好?

LIBERO-MAX 为同一个任务安排两次执行。两次执行共享初始状态、指令、模型随机种子,以及变化发生前的全部动作。到了同一个关键时刻,再让它们经历不同的后续:

  • Base:不额外加入中途变化,机器人继续执行。

  • Dynamic:加入一次环境变化,例如移动目标物体,机器人继续尝试完成任务。

如果机器人在 Base 中成功、在 Dynamic 中失败,就能识别出这次变化破坏了一个原本能够完成的任务。即使两次都失败,也会保留在结果中,帮助区分原有能力不足和中途变化带来的影响。

这套设计以 LIBERO-Plus 和 LIBERO-PRO 的任务为基础,构建了8,000 组配对案例、8 类执行中途的变化:目标移动、容器移动、相机视角改变、传感器噪声、光照切换、视觉主题变化、干扰物增加和障碍物插入。



图 1|两次执行在变化前保持一致,再比较加入变化后的任务完成情况。八类事件覆盖物体位置、视觉观测、外观与杂物,以及路径约束。

一次中途变化,影响到底有多大?

研究团队评测了 14 种当前机器人策略,涵盖 VLA、混合架构和世界动作模型(WAM),均使用各自发布的推理配置。每个策略完成 16,000 次执行,主评测累计22.4 万次仿真。

结果显示:所有受测策略的成功率都下降了,降幅为 11.0–25.7 个百分点。



图 2|每一行代表一个策略。空心圆是没有新增中途事件的成功率,实心方块是加入变化后的成功率。所有策略都出现下降。

即使是动态条件下表现最好的 MolmoAct2 和 π₀.₅,成功率也分别只有 66.9%和 65.7%,丢失了不少原本能够完成的任务。对于其中一个受测策略,超过一半的原有成功案例在变化后转为失败。

配对评测因此提供了两种信息:变化后还能完成多少任务,以及哪些原本能够完成的任务被变化打断。

不同类型模型的排名也相互交错,没有一个模型家族始终占优。当前受测的世界动作模型同样需要面对执行中途的变化,世界预测能力能否转化为可靠行动,还需要通过实际任务检验。

杯子移动、视角变化,为什么尤其难?

八类变化带来的损失并不相同。目标或容器移动,以及相机和传感器变化,造成了更明显的共同困难;光照和视觉主题变化通常影响较小。

这与抓杯子的故事形成了直观联系:杯子换了位置,原来的伸手目标需要调整;托盘移动了,放置位置需要更新;摄像头视角改变了,机器人又要从新的画面中理解自己与物体的关系。



图 3|每个圆点代表一个策略的表现变化。按事件拆解结果,可以看清模型在哪些变化下更容易失败。

这种拆解让研究者能够进一步定位问题:应该改进视觉识别、目标更新,还是动作规划?模型改进之后,也可以用同一类事件检查效果。

让机器人多看几次,能解决吗?

一个自然的想法是:环境可能变化,那就让机器人更频繁地看画面、重新生成动作。

机器人策略常常一次预测一串动作,再执行若干步后获取新观测。这样可以减少模型调用,但变化发生时,依据旧画面生成的动作可能仍在执行。

研究团队在同一组 800 个配对案例上,测试了 4 个策略、18 种有效的动作执行间隔。调整间隔确实会改变表现,但所有测试设置下,变化后的成功率仍低于对应的 Base。更频繁的反馈,并未自动消除这道差距。

相机对照实验还发现,同样的视角变化,在第一帧就出现与执行到一半才出现,结果也不同。三个被测策略在中途变化条件下,都比从起点就使用改变后的视角更容易成功。

这说明,评测还需要关注机器人已经走到了哪里、此前执行过哪些动作。面对同样的新画面,不同的执行历史也会影响后续结果。

找到问题之后,能追回多少成功率?

LIBERO-MAX 还可以用来检验针对性的改进。

研究团队选取 300 个固定的传感器噪声案例,在 X-VLA 前加入图像质量检测模块:发现当前图像质量较差时,先修复、去噪,再交给策略处理。策略无需重新训练,检测模块也不会提前收到「变化已经发生」的通知。



表 1|比较原始观测、始终修复和按图像质量触发修复三种处理方式。

按质量触发修复后,变化后的成功率从40.7% 升至 47.7%,提高 7.0 个百分点,Base 成功率基本保持。始终修复也带来了 6.7 个百分点的提升。

这个小规模实验表明,针对特定变化采取补偿措施,能够挽回一部分失败。配对评测则可以同时检查:它改善了多少受扰动任务,以及是否影响原本能够完成的任务。

让「世界变了,还能做完吗」成为机器人评测的核心问题

LIBERO-MAX 提供评测代码、固定案例清单和配对诊断,还提供包含 800 组案例的 Lite 版本,将执行数量降到完整版本的十分之一,方便研究者先做快速验证,再开展完整评测。

机器人进入家庭、办公室或工厂后,环境变化会伴随任务执行不断发生。LIBERO-MAX 希望为变化检测、动作调整、重新规划和自主恢复提供可复现的测试平台,让模型改进能够接受同一套动态环境考验。

回到开头那个被挪走的杯子:可靠的机器人,需要在情况改变之后,仍然把它收进托盘。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人民日报:尊界V800刹车踏板支架断裂事件,有一点毋庸置疑,一辆汽车的刹车踏板,绝不应该在驾驶中出现“断裂”

人民日报:尊界V800刹车踏板支架断裂事件,有一点毋庸置疑,一辆汽车的刹车踏板,绝不应该在驾驶中出现“断裂”

台州交通广播
2026-10-11 10:54:28
文旅部:坚决拥护党中央决定

文旅部:坚决拥护党中央决定

新京报
2026-10-11 09:09:30
国际油价18年间跌了55美元,国内油价却从5.44元涨到8.58元?

国际油价18年间跌了55美元,国内油价却从5.44元涨到8.58元?

爆角追踪
2026-10-10 23:30:31
14亿老百姓的疑问:大数据全覆盖的时代,为什么医院的检查结果,永远不能通用?

14亿老百姓的疑问:大数据全覆盖的时代,为什么医院的检查结果,永远不能通用?

青苹果sht
2026-10-10 06:01:13
人社部:坚持应保尽保,现在还有一些人没参保,将通过数据找人等措施把人找到

人社部:坚持应保尽保,现在还有一些人没参保,将通过数据找人等措施把人找到

界面新闻
2026-10-11 13:22:54
形势严重!这5个行业,工资都发不下来了!

形势严重!这5个行业,工资都发不下来了!

职场资深秘书
2026-10-11 11:17:52
为所欲为!新疆发布质疑刹车文章竟也消失!速成车引发民愤!国家终于出手整治了!

为所欲为!新疆发布质疑刹车文章竟也消失!速成车引发民愤!国家终于出手整治了!

魔都囡
2026-10-11 03:18:24
尊界刹车踏板三连断:聊天记录曝出,供应商给的是3000N,设计做了让步

尊界刹车踏板三连断:聊天记录曝出,供应商给的是3000N,设计做了让步

互联网大观
2026-10-09 19:29:12
哈哈哈王嘉尔问奔驰要车,奔驰用他的梗怼他

哈哈哈王嘉尔问奔驰要车,奔驰用他的梗怼他

乡野小珥
2026-10-11 01:40:33
8000万新援处子球,亚马尔13战狂造20球,巴萨3-0赫塔费豪取9连胜

8000万新援处子球,亚马尔13战狂造20球,巴萨3-0赫塔费豪取9连胜

钉钉陌上花开
2026-10-11 03:26:42
永州周晓芬局长:从中专生到正处局长,一段励志履历,一场人生崩塌

永州周晓芬局长:从中专生到正处局长,一段励志履历,一场人生崩塌

十为先生
2026-10-11 12:06:24
雅思官方:10月10日中国大陆地区雅思纸笔和机考全部取消,系英国方面雅思考试系统出现技术问题

雅思官方:10月10日中国大陆地区雅思纸笔和机考全部取消,系英国方面雅思考试系统出现技术问题

和讯网
2026-10-10 15:07:43
尊界踏板三连断背后:供应商给3000N,设计却做了让步

尊界踏板三连断背后:供应商给3000N,设计却做了让步

砼话里都是骗人的
2026-10-11 12:01:04
懂车帝全网下架,一切都结束了

懂车帝全网下架,一切都结束了

互联网品牌官
2026-10-10 11:49:01
就连小小竹知了都容不下,更别说刹车断裂视频了

就连小小竹知了都容不下,更别说刹车断裂视频了

神不隆通
2026-10-10 13:58:33
河南安阳一女子往麻辣烫放头发骗退款被监控拍下,店家:感觉她做这个事特别自然,不像是第一次

河南安阳一女子往麻辣烫放头发骗退款被监控拍下,店家:感觉她做这个事特别自然,不像是第一次

潇湘晨报
2026-10-11 11:58:09
网传人社部要把未参保的人员找到并动员参保,网友说:更该主动把失业人员找到,动员他们领失业金!

网传人社部要把未参保的人员找到并动员参保,网友说:更该主动把失业人员找到,动员他们领失业金!

黯泉
2026-10-11 12:17:36
百万粉丝博主实锤女友出轨多男,“捉奸”细节太劲爆,当场崩溃

百万粉丝博主实锤女友出轨多男,“捉奸”细节太劲爆,当场崩溃

往史过眼云烟
2026-10-10 12:06:25
大使馆紧急发声!中国公民做好防范,确诊病例超8000例,无特效药

大使馆紧急发声!中国公民做好防范,确诊病例超8000例,无特效药

霁寒飘雪
2026-10-10 12:12:46
人社部:要把未参保人员找到动员参保

人社部:要把未参保人员找到动员参保

第一财经资讯
2026-10-10 22:36:48
2026-10-11 16:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14173文章数 142748关注度
往期回顾 全部

科技要闻

卸任CEO后,苹果董事长库克再度到访中国

头条要闻

特朗普建议换总统后 马斯克跟帖痛批:泽连斯基太过分

头条要闻

特朗普建议换总统后 马斯克跟帖痛批:泽连斯基太过分

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

红旗天工07上市 限时16.79万起 硬核通关巴音布鲁克

态度原创

手机
本地
数码
公开课
军事航空

手机要闻

团战不怕460!一加16首发自研电竞网络芯片G3、抗干扰电竞天线

本地新闻

踏访沙县第一村,寻国民小吃本源

数码要闻

2K游戏新主力!微星RTX 5060 Ti 8G GAMING TRIO OC显卡图赏

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

沙特利雅得机场遭袭致12死309伤 中国大使馆紧急提醒

无障碍浏览 进入关怀版