网易首页 > 网易号 > 正文 申请入驻

机器人伸手时,杯子被挪走了:LIBERO-MAX用22.4万次仿真检验动态可靠性

0
分享至



设想这样一个场景:你让机器人把桌上的杯子收进托盘。它已经看到了杯子,机械臂正朝杯子伸过去。这时,旁边的人顺手把杯子挪开了几厘米。

对人来说,接着调整一下手的位置就好。对机器人来说,事情可能复杂得多:它之前看到的是旧位置,已经生成的动作也指向旧位置。如果继续执行,手就可能伸向一块空桌面。它能及时看到变化、调整动作,最后把杯子收好吗?

这个小插曲,指向了机器人走进真实生活时必须面对的问题:环境会在机器人行动过程中改变,而任务还需要继续完成。

机器人如何接受一场「考试」?

近年来,机器人开始使用视觉语言动作模型(VLA):输入摄像头画面和「把杯子放进托盘」这样的指令,模型便生成控制机械臂的动作。一些模型还引入世界预测机制,尝试利用对后续场景的预测帮助行动。

判断这些模型做得好不好,需要一套共同的考试题。机器人评测基准提供标准化任务和仿真环境,让不同模型在相同条件下接受测试,再比较谁能完成更多任务。

已有很多鲁棒性评测会在任务开始前改变条件,例如换一个杯子位置、调整光照或改变视角。机器人从第一眼起,看到的就是调整后的场景。

但「杯子一开始就在另一边」和「手伸到一半,杯子才被挪走」,对机器人提出了不同要求。后一种情况下,机器人已经根据旧画面采取行动,还可能有一串尚未执行的动作。它需要在已有的执行过程上,继续应对新的情况。

围绕这一问题,来自Stanford、CMU、MIT、UIUC 和 UT Austin等机构的研究者提出了LIBERO-MAX,将执行过程中的环境变化变成可重复、可比较的测试。

该工作已入选NeurIPS26 Robotics World Modeling Workshop 口头报告(Oral)。Yunbei Zhang与Zijian Jin为共同第一作者,合作作者包括 UT Austin 教授Peter Stone、Stanford 教授Marco Pavone、MIT 博士后Weirui Ye和 NTU 助理教授Jianfei Yang。



  • 论文标题:LIBERO-MAX: Do Robot Policies Adapt When the World Changes?
  • 作者:Yunbei Zhang*、Zijian Jin*、Yuanzhe Liu、Janet Wang、Xilun Zhang、Yuyou Zhang、Zhenyu Zhang、Daoan Zhang、Shuaicheng Niu、Gen Li、Jianfei Yang、Jihun Hamm、Ismini Lourentzou、Weirui Ye、Bo Liu、Peter Stone、Marco Pavone
  • 论文链接:https://arxiv.org/abs/2609.36518
  • 代码链接:https://github.com/liberomax/LIBERO-MAX
  • 项目主页:https://liberomax.github.io/

同一个机器人,两种后续

回到抓杯子的故事。假如机器人最终失败了,怎么判断是杯子被挪走造成的,还是它本来就抓不好?

LIBERO-MAX 为同一个任务安排两次执行。两次执行共享初始状态、指令、模型随机种子,以及变化发生前的全部动作。到了同一个关键时刻,再让它们经历不同的后续:

  • Base:不额外加入中途变化,机器人继续执行。

  • Dynamic:加入一次环境变化,例如移动目标物体,机器人继续尝试完成任务。

如果机器人在 Base 中成功、在 Dynamic 中失败,就能识别出这次变化破坏了一个原本能够完成的任务。即使两次都失败,也会保留在结果中,帮助区分原有能力不足和中途变化带来的影响。

这套设计以 LIBERO-Plus 和 LIBERO-PRO 的任务为基础,构建了8,000 组配对案例、8 类执行中途的变化:目标移动、容器移动、相机视角改变、传感器噪声、光照切换、视觉主题变化、干扰物增加和障碍物插入。



图 1|两次执行在变化前保持一致,再比较加入变化后的任务完成情况。八类事件覆盖物体位置、视觉观测、外观与杂物,以及路径约束。

一次中途变化,影响到底有多大?

研究团队评测了 14 种当前机器人策略,涵盖 VLA、混合架构和世界动作模型(WAM),均使用各自发布的推理配置。每个策略完成 16,000 次执行,主评测累计22.4 万次仿真。

结果显示:所有受测策略的成功率都下降了,降幅为 11.0–25.7 个百分点。



图 2|每一行代表一个策略。空心圆是没有新增中途事件的成功率,实心方块是加入变化后的成功率。所有策略都出现下降。

即使是动态条件下表现最好的 MolmoAct2 和 π₀.₅,成功率也分别只有 66.9%和 65.7%,丢失了不少原本能够完成的任务。对于其中一个受测策略,超过一半的原有成功案例在变化后转为失败。

配对评测因此提供了两种信息:变化后还能完成多少任务,以及哪些原本能够完成的任务被变化打断。

不同类型模型的排名也相互交错,没有一个模型家族始终占优。当前受测的世界动作模型同样需要面对执行中途的变化,世界预测能力能否转化为可靠行动,还需要通过实际任务检验。

杯子移动、视角变化,为什么尤其难?

八类变化带来的损失并不相同。目标或容器移动,以及相机和传感器变化,造成了更明显的共同困难;光照和视觉主题变化通常影响较小。

这与抓杯子的故事形成了直观联系:杯子换了位置,原来的伸手目标需要调整;托盘移动了,放置位置需要更新;摄像头视角改变了,机器人又要从新的画面中理解自己与物体的关系。



图 3|每个圆点代表一个策略的表现变化。按事件拆解结果,可以看清模型在哪些变化下更容易失败。

这种拆解让研究者能够进一步定位问题:应该改进视觉识别、目标更新,还是动作规划?模型改进之后,也可以用同一类事件检查效果。

让机器人多看几次,能解决吗?

一个自然的想法是:环境可能变化,那就让机器人更频繁地看画面、重新生成动作。

机器人策略常常一次预测一串动作,再执行若干步后获取新观测。这样可以减少模型调用,但变化发生时,依据旧画面生成的动作可能仍在执行。

研究团队在同一组 800 个配对案例上,测试了 4 个策略、18 种有效的动作执行间隔。调整间隔确实会改变表现,但所有测试设置下,变化后的成功率仍低于对应的 Base。更频繁的反馈,并未自动消除这道差距。

相机对照实验还发现,同样的视角变化,在第一帧就出现与执行到一半才出现,结果也不同。三个被测策略在中途变化条件下,都比从起点就使用改变后的视角更容易成功。

这说明,评测还需要关注机器人已经走到了哪里、此前执行过哪些动作。面对同样的新画面,不同的执行历史也会影响后续结果。

找到问题之后,能追回多少成功率?

LIBERO-MAX 还可以用来检验针对性的改进。

研究团队选取 300 个固定的传感器噪声案例,在 X-VLA 前加入图像质量检测模块:发现当前图像质量较差时,先修复、去噪,再交给策略处理。策略无需重新训练,检测模块也不会提前收到「变化已经发生」的通知。



表 1|比较原始观测、始终修复和按图像质量触发修复三种处理方式。

按质量触发修复后,变化后的成功率从40.7% 升至 47.7%,提高 7.0 个百分点,Base 成功率基本保持。始终修复也带来了 6.7 个百分点的提升。

这个小规模实验表明,针对特定变化采取补偿措施,能够挽回一部分失败。配对评测则可以同时检查:它改善了多少受扰动任务,以及是否影响原本能够完成的任务。

让「世界变了,还能做完吗」成为机器人评测的核心问题

LIBERO-MAX 提供评测代码、固定案例清单和配对诊断,还提供包含 800 组案例的 Lite 版本,将执行数量降到完整版本的十分之一,方便研究者先做快速验证,再开展完整评测。

机器人进入家庭、办公室或工厂后,环境变化会伴随任务执行不断发生。LIBERO-MAX 希望为变化检测、动作调整、重新规划和自主恢复提供可复现的测试平台,让模型改进能够接受同一套动态环境考验。

回到开头那个被挪走的杯子:可靠的机器人,需要在情况改变之后,仍然把它收进托盘。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
救不了!死亡人数飙升4242人,使馆罕见措辞:中国公民尽快撤离!

救不了!死亡人数飙升4242人,使馆罕见措辞:中国公民尽快撤离!

史智文道
2026-10-11 14:17:31
一个月吃不超过3次西地那非,连吃一年,身体到底会咋样?

一个月吃不超过3次西地那非,连吃一年,身体到底会咋样?

牛锅巴小钒
2026-10-10 09:26:48
皇马跌宕险胜黄潜,赛后3大核心疑问:迪奥曼德得到验证;穆帅换下阿诺德,是为了维尼修斯!

皇马跌宕险胜黄潜,赛后3大核心疑问:迪奥曼德得到验证;穆帅换下阿诺德,是为了维尼修斯!

福酱的小时光
2026-10-11 08:03:41
国乒报警抓人了!没想到3人都是女生,真是王楚钦、孙颖莎粉丝吗

国乒报警抓人了!没想到3人都是女生,真是王楚钦、孙颖莎粉丝吗

曹说体育
2026-10-11 14:11:33
好消息!四川养老金上调落地!7-9月差额补发,不用主动申请

好消息!四川养老金上调落地!7-9月差额补发,不用主动申请

李博世财经
2026-10-10 16:54:57
俄媒:“风暴阴影”袭击致20名俄军官死亡,创已知单次最多

俄媒:“风暴阴影”袭击致20名俄军官死亡,创已知单次最多

桂系007
2026-10-10 09:25:31
“只要你孩子敢上学,我就举报!”外地家长钻空子,气坏江苏网友!

“只要你孩子敢上学,我就举报!”外地家长钻空子,气坏江苏网友!

林林先生
2026-10-09 14:48:45
独家:乌军新帅上任两个半月

独家:乌军新帅上任两个半月

YY团长
2026-10-09 07:19:10
从4万跌到1万2!佛山千灯湖神话破灭,掏空家底的广州客亏惨了

从4万跌到1万2!佛山千灯湖神话破灭,掏空家底的广州客亏惨了

靓仔情感
2026-10-10 12:59:30
“这拿筷子姿势,太恶心了”,一段母女吃饭视频火了,又一个贫民窟的小公主

“这拿筷子姿势,太恶心了”,一段母女吃饭视频火了,又一个贫民窟的小公主

蝴蝶花雨话教育
2026-10-06 11:47:56
都说退休老师月薪上万,真实情况:中级教师大多拿不到这个数

都说退休老师月薪上万,真实情况:中级教师大多拿不到这个数

金哥说新能源车
2026-10-10 08:54:03
伊朗这一仗打完,中美至少50年内不会开战,理由就三条:其一,美国已经看清了,连被封锁40年的伊朗都拿不下,它拿什么跟中国打?

伊朗这一仗打完,中美至少50年内不会开战,理由就三条:其一,美国已经看清了,连被封锁40年的伊朗都拿不下,它拿什么跟中国打?

扶苏聊历史
2026-10-09 11:50:53
张丹峰失业三年带继子回铁岭老家吃街边东北菜

张丹峰失业三年带继子回铁岭老家吃街边东北菜

可乐谈情感
2026-10-09 17:47:43
郭德纲风波处罚刚落地!41岁岳云鹏再传坏消息,被起诉仅冰山一角

郭德纲风波处罚刚落地!41岁岳云鹏再传坏消息,被起诉仅冰山一角

阿伧说事
2026-10-11 08:51:57
舅舅借住我的空房子说周转几天,我好心答应了,过了几年他拿着写着我名字的房本找上门,我当场愣住了

舅舅借住我的空房子说周转几天,我好心答应了,过了几年他拿着写着我名字的房本找上门,我当场愣住了

橙心故事说
2026-10-11 10:10:31
35页PPT疯传:洛阳女子1女谈3男,每天卡时间,都已谈婚论嫁

35页PPT疯传:洛阳女子1女谈3男,每天卡时间,都已谈婚论嫁

烈史
2026-05-30 13:23:41
触目惊心!陕西女教师案:5人背景强硬、串通毁证,正义不容遮掩

触目惊心!陕西女教师案:5人背景强硬、串通毁证,正义不容遮掩

奇思妙想草叶君
2026-04-03 21:18:12
王仁君拿飞天奖后续!金灿荣点评:演青年毛主席很像,有文化的好演员啊

王仁君拿飞天奖后续!金灿荣点评:演青年毛主席很像,有文化的好演员啊

小徐讲八卦
2026-10-11 07:03:13
触目惊心!四川网红落网,网传把8人送到缅甸,一个人头能拿12万

触目惊心!四川网红落网,网传把8人送到缅甸,一个人头能拿12万

阅微札记
2026-10-10 09:54:32
罗永浩“开撕”某汽车大V!

罗永浩“开撕”某汽车大V!

电动内参
2026-08-27 20:41:28
2026-10-11 15:48:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14173文章数 142748关注度
往期回顾 全部

科技要闻

卸任CEO后,苹果董事长库克再度到访中国

头条要闻

特朗普建议换总统后 马斯克跟帖痛批:泽连斯基太过分

头条要闻

特朗普建议换总统后 马斯克跟帖痛批:泽连斯基太过分

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

红旗天工07上市 限时16.79万起 硬核通关巴音布鲁克

态度原创

家居
艺术
亲子
手机
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

中国当代画家,区础坚作品选(二)

亲子要闻

艺人江语晨透露女儿患有ADHD和妥瑞氏症,每天都要想办法帮她“放电”;医生提醒:干预需分龄,别随意给孩子贴标签

手机要闻

团战不怕460!一加16首发自研电竞网络芯片G3、抗干扰电竞天线

军事要闻

沙特利雅得机场遭袭致12死309伤 中国大使馆紧急提醒

无障碍浏览 进入关怀版