网易首页 > 网易号 > 正文 申请入驻

机器人运动会散场后,自变量给机器人建了一座「虚拟训练场」

0
分享至

我已经被机器人刷屏一周了。

机器人刷新了人类百米纪录、「原地起飞」近三米、「害羞跑」的姿势火到海外、赛博张三丰腾空外摆 540°…….


今年的世界人形机器人运动会更热闹了,来自六大洲 16 个国家的 666 支队伍,带着 2056 台机器人来到北京,比赛也从田径、武术等项目,一路延伸到家庭、酒店、工业和应急救援等真实场景。

不过机器人在赛场上的翻车,大家笑笑就过去了。而机器人真正进入家庭后,可能就是打翻水杯、撞倒家具,或者把刚收好的衣服重新扯到地上,那就笑不出来了。

真实的世界里没有固定的跑道和统一摆放的道具,杯子被人挪了一点,桌面多出一块抹布,原本训练好的动作就可能失效。

把机器人这些试错搬进虚拟世界,正是当下世界模型想做的事。它试图还原一个符合物理规律的环境,让机器人真正在动手前先预演:手往左偏一点会不会抓空,夹爪提前闭合会不会碰倒杯子。

但实际上不少世界模型无法实现可靠的「虚拟测试」。它们可能看懂了画面,却没有真正听从动作。推演时间一长,物体和位置开始漂移。虚拟世界里表现更好的策略,到了真机上也未必奏效。

就在机器人开始从竞技场走向真实场景时,自变量机器人发布了自回归世界模型 WALL-SS。


WALL-SS 构建的这座「虚拟训练场」终于突破了世界模型的瓶颈,动作能否真正改变结果,长任务中能否保持连贯,虚拟成绩能否经得起真机检验,都有了新的解法和答案。

它可以推演持续60秒的倒水和物品整理任务,来测试不同动作的结果:按照不同的方式抓水杯,是抓空、碰倒水杯,还是成功抓起?

研究团队还把多套机器人策略分别放进 WALL-SS 和真实世界测试,在虚拟世界里执行效果很好的动作策略,搬到物理世界往往也有好的结果。

这就有意思了,机器人做的「梦」,开始能够用来练习和筛选真实动作。

相关
项目主页:
http://x2robot.com/pages/ss
论文链接:
https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf
Github 链接:
https://github.com/X-Square-Robot/wall-ss

机器人「做梦」的方式,会决定现实里是否翻车

世界模型是目前具身智能最受关注的方向之一。

它可以理解成机器人脑中的预演系统。给它当前画面和一组准备执行的动作,它会预测接下来会发生什么。

机械臂向左移动 1 厘米,杯子会被抓住还是被碰倒?抽屉已经打开,下一步应该继续取东西,还是先调整手腕角度?机器人可以比较多个未来,再决定采用哪条动作路径。


机器人公司也可以把不同版本的动作策略放进世界模型测试。表现更好的版本再上真机,省下在真实世界测试动作效果的昂贵成本。

问题是,很多世界模型很多时候更像一位过分乐观的导演。

机器人训练数据通常以成功示范为主。如果模型看到的大部分夹爪闭合动作,后面都跟着物体被拿起,它就容易走捷径:只要夹爪闭合,物体就应该被抓起来。

即使夹爪与物体之间还有明显空隙,生成画面里的物体也可能主动贴进夹爪。论文把这类现象称为类似「磁铁式抓取」的错误。


这类偏差在跑步、跳舞等大动作里未必显眼,到了精细操作中却会直接决定成败。夹爪与杯把差几毫米,机器人可能抓空。插头角度偏了一点,也很难顺利插入接口。

机器人从「会做」走到「做成」,往往就卡在最后几毫米。

世界模型如果直接把这几毫米抹平,给出的未来越流畅,机器人越容易高估一套动作的可靠性。

推演时间一长,还会出现新的麻烦。

世界模型生成完一段画面后,还要把它作为下一段预测的依据。前面一点小误差,会在后续不断累积。物体可能慢慢偏离原位,夹爪与杯子的接触关系也会发生变化。

只保留最近几帧,模型会忘记之前做过什么,但要是保留全部历史,计算量和显存占用又会持续增长。

视频看起来逼真,不代表模型选出的策略真的更好。机器人研发需要知道,虚拟测试里的优胜者,到了真机上能不能继续领先。

世界模型需要让不同动作确实通向不同结果,流畅画面只完成了最表面的一步。

机器人怎么动,未来就该怎么变

WALL-SS 预测接下来几秒的画面时,会先搭出一版「低清预览」。

在这版预览里,模型先确定大方向:机械臂往哪里走,物体大概会怎么移动。随后,它把同一段画面一层层调清,补上物体轮廓、夹爪开合和接触位置。

论文把这种从大轮廓到小细节的层级叫做「尺度」。已经生成的画面和发生过的动作,会成为下一段预测的历史,这就是「下一尺度自回归」。

画面每清晰一些,动作也会再影响一次未来。

手臂往左还是往右,会先改变低清画面里的运动方向。夹爪何时闭合,会继续影响清晰画面里有没有碰到杯子。

一小段未来生成完成后,它会连同已经发生的动作一起进入记忆,成为模型继续往后推演的依据。

过去一些世界模型更像在开拍前看一眼动作要求,但后面它还是容易依赖任务描述和视觉经验,把剩下的剧情把剧情自己脑补出来。

WALL-SS 把动作和画面放在同一条时间线上。哪只夹爪在什么时候移动到哪里,头部相机和腕部相机应该看到什么变化,都要相互对得上。


同一张初始画面配上不同动作后,模型会生成不同未来。夹爪偏离物体时,它需要表现抓空。路径碰到障碍物时,它也不能直接跳到任务成功的结局。

结果怎么验证呢,WALL-SS 会固定初始画面,只换一条动作轨迹,看未来有没有跟着改变。模型如果只改变画面细节、始终生成同一个成功结局,很难在这项测试中获得高分。

WALL-SS 在这项评测中得到 0.290,Cosmos3 为 0.044,其他模型则是0分。这项指标衡量模型对动作变化的敏感程度。两者之间的差距表明,WALL-SS 更愿意按照输入动作改变后续画面。

模型愿意随着动作改变画面还不够。生成画面里的机械臂,也要真正走在给定路线上。

在衡量这件事的「轨迹精度」上,WALL-SS 得到 0.539,是全部对比模型中的最高分。它的视觉骨干 InfinityStar 得分为 0.251。换成人话,虚拟机械臂既「听见」了动作指令,也更能沿着指令指定的路线移动。


固定初始画面,只改变动作条件,三组分支会生成不同轨迹和不同未来。蓝线是给定动作,橙线是生成画面中实际出现的轨迹.

这些能力也来自一批过去容易被丢掉的数据。

研究团队保留了抓空、滑落、碰撞、重新抓取、人工接管和失败恢复等过程。其中一种采集方式,是先保留机器人发生错误的动作,再回到接近出错前的状态,由操作员执行一套纠正动作。

如果训练数据里没有失败,世界模型很容易把「任务目标」误当成「必然结局」。

做一分钟家务,机器人怎么才能不「断片」

上面说的这些,只能保证机器人没有从第一步开始跑偏。

而家庭任务往往包含多个连续步骤,打开抽屉、拿起物品、放进抽屉、再把抽屉关上,可能持续几十秒。机器人还要记住抽屉是否已经打开,物品目前在桌面还是手里。

WALL-SS 没有让模型把每一帧都永远背下来。它会让记忆随着时间自动变得“模糊”。

刚刚发生的动作保留更多细节:机器人几秒前有没有碰到杯子,夹爪是否已经闭合,都需要精确记住。


更早的历史会被压缩。模型不必一直保存几十秒前每一帧的细节,只要记住桌上有哪些物体、它们大致在哪里、任务已经进行到哪一步。

最初的观察画面会被保留下来,作为场景和物体身份的锚点。视觉历史被压缩时,对应的动作历史也会一起压缩。

这就是「尺度压缩的长时间跨度记忆」,它像一份会自动整理的工作记录,刚刚发生的事情才保留详尽细节,更久以前的事情只留下摘要。

模型不需要记住过去的每个像素,它只要了解哪些变化还会影响下一步。

即便如此,预测画面的过程中仍不可避免地积累小的误差。机器人需要学会自己纠正误差。为此 WALL-SS 拿出了「逐尺度梦境强迫」的大招。训练时,研究团队会给历史信息加入扰动,要求基于有误差的信息,预测正确的未来。

这相当于让机器人平时就在「有小错误的梦」里继续往下走,学会别把一个小错滚成整段任务崩溃。

在长时测试中,WALL-SS 连续推演了 60 秒,轨迹误差、片段衔接、物体状态和视觉质量,都比对照模型更稳定。

其中倒水任务包含接近水瓶、抓握、抬起、倾倒和放回等阶段。在 60 秒推演中,机械臂逐帧轨迹误差保持在画面对角线的 0.5% 以下。


上方记录从接近水瓶、抓取、倒水到放回的连续过程,下方比较生成轨迹与给定轨迹

只保留最近片段的版本,在 20 至 30 秒后开始明显恶化。去掉梦境强迫后,长期状态一致性也会持续下降。

这就能验证一项持续 1 分钟的操作里,机器人仍能记得自己做过什么,能够稳定地推演未来。

虚拟成绩,能不能替真机筛策略

不过就算动作对了,记忆也没断片,虚拟世界仍然可能和现实存在偏差。

你想如果一个机师只做过模拟飞行,你敢坐他的飞机吗?

而 WALL-SS 则想了一个办法,是给自己的预测安排两位长期在线的「裁判」。

在相同动作条件下,模型会生成多条未来支线。一个裁判会检查动作,比如画面里的机械臂是否按照给定方向移动,物体是否产生了对应变化。

另一个裁判负责审核长期一致性,看机器人和物体的状态有没有漂移,前后片段能否接上,多个摄像头看到的世界是否一致。

最后模型会根据评分调整下一次生成不同未来的概率,这套过程叫「视觉动力学的在线策略对齐」。


简单来说就是用来专门优化视觉世界的变化规律。机器人控制器不会收到任务成功率奖励。参考模型约束和真实轨迹回放也会同时加入,防止模型为了获得高分而牺牲原有画面质量。

对齐之后,动作跟随从 0.264 提升至 0.290,轨迹精度从 0.512 提升至 0.539,跨片段边界误差从 0.118 降至 0.104。动作与轨迹更贴近指令,前后视频也更容易接上,画面质量基本没有变化。

我们直接看看论文里虚拟测试和真机测试的对比。

研究团队选取 5 个不同训练阶段的 WALL-WM 策略,在 6 项任务、20 组匹配初始状态下,分别进入 WALL-SS 和真实机器人执行,共得到 600 对闭环结果。

600 对实验中,有 527 对的最终成败一致。WALL-SS 在虚拟世界里选出的较好版本,有 89% 的优劣关系与真机测试相同。

如果把 30 个「任务与策略版本」组合的成功率放在一起比较,虚拟结果和真机结果的相关系数为 0.926,平均绝对误差为 0.062。

这个 0.926 衡量虚拟与真实结果的整体变化趋势,不能理解成单次预测有 92.6% 的命中率。


左图比较虚拟与真机成功率,数据越接近对角线,代表两者越一致。右图比较 6 项任务中 5 个策略版本的虚拟与真机成.

世界模型无需彻底取代真机测试,它只要能先筛掉较差的版本,就已经可以省下大量现实试错。

WALL-SS 还在同一套系统中加入了动作专家。

外部动作给定时,视觉生成器负责预测「这样做会发生什么」。需要模型自主行动时,动作专家可以根据当前状态生成下一段控制指令。两个部分共享已经确认的世界状态和动作接口。

动作专家可以直接控制真实机器人。在论文的桌面双臂任务中,WALL-SS 的平均任务进度得分为 69.1。作为对比,π 0.5 为 49.6,DreamZero 为 44.1,LingBot-VA 为 34.0。

模拟器负责预演,动作专家负责执行。两者在同一份世界状态上来回接力,形成「提出动作—预演结果—继续行动」的闭环。

WALL-SS 主要作用在机器人认知和训练这一侧:怎样预演动作、记住长任务、评测策略。真正拧紧一颗螺丝、把插头稳定送进接口,还依赖关节精度、灵巧手、触觉和力控。

世界模型可以提前发现哪条动作更可能失败,也能减少较差策略直接上真机的次数。末端执行器能否稳定落位,仍取决于整套软硬件的配合。

具身智能的「ChatGPT 时刻」,看谁能更快走进现实

前几年,人们还在关注机器人能不能站稳、跑起来。今年的赛场开始把衣物整理、家庭清洁、酒店服务和应急救援放进长流程任务。

当机器人从舞台演示走向真实服务,行业判断技术的方式也会改变。一个成功 Demo 只是一张入场券。机器人能否重复完成任务,换个环境是否还能工作,模型每次更新要花多少真机成本,都会变得更重要。

下一轮具身智能竞争,会看谁能让机器人学得更便宜、测得更可靠,并走进更多陌生环境。


WALL-SS 给我们提供了一种具体的解法:动作必须真正改变预测结果,长任务中不能轻易失忆,虚拟策略排名还要接受真机验证。

当世界模型能预测真机策略的相对优劣,它就开始从内容生成能力变成研发系统的一部分。

这会改变世界模型在机器人公司里的位置。失败和纠正数据先帮助模型认识现实的边界。随后,虚拟环境批量筛选策略,少量真机结果再回来检查和修正这个虚拟世界。

虚拟训练场由此兼任练习场、考场和校准台。真机数量决定数据入口,每一小时真机数据能换来多少轮模型迭代,也会影响研发速度。

真机需要占用设备、布置场景,还要有人处理失败后的复位。涉及碰撞、液体或易碎物品时,测试本身也有风险。

世界模型可以先承担大规模初筛。真机只需要验证虚拟考场里更有希望的候选策略。

这有点像汽车碰撞仿真。它不会取消最后的实车测试,却能减少为了筛选设计而撞掉的真车。

世界模型与 VLA 可以分工协作。VLA 负责根据视觉和语言生成动作,世界模型负责提前演一遍「这样做会发生什么」。一个负责出主意,一个负责看后果。

真机产生的成功、失败和人工接管数据,还能继续回流。世界模型变得更准后,又可以测试更多策略,再把更好的版本送回真机。

前段时间,自变量在一次物流分拣直播中,让搭载 WALL-B 的双臂机器人使用标准夹爪,处理纸箱、软袋、圆柱形快件和泡沫封装生鲜件等随机包裹。它完成了 1911 件有效分拣,准确率超过 98%。


以后 WALL-SS 会让机器人走向工位之前准备更充分,它先在虚拟世界里检查它会不会抓空、碰撞,或者在连续作业中逐渐跑偏。对按吞吐量和停机时间计算成本的仓库,这类虚拟筛选有机会减少设备占用和现场复位。

这样一来,用户或者企业就可以尽量避免成为最早一轮试错的「小白鼠」,倒水、递物和收纳等动作,也有机会在执行前先比较不同后果。

王兴兴最近谈到他理解的具身智能「ChatGPT 时刻」:机器人能够在约 80% 的陌生场景中,只靠语言或文字指令,完成约 80% 的任务。对于这个时刻,他判断快则 2 至 3 年,慢则 5 年甚至 10 年。

当然 WALL-SS 还没有把机器人直接带到这个阶段,这篇论文的真机实验主要集中在桌面双臂任务,验证的连续推演时长为 60 秒,但自变量至少提供了一个抵达「ChatGPT 时刻」更现实的方向。

等到机器人真正走进家门,少摔一次杯子,比多拿一块金牌要重要得多。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
女子频繁约情夫酒店开房,2024年情夫嫌身体吃不消,带3瓶药赴约将她杀死

女子频繁约情夫酒店开房,2024年情夫嫌身体吃不消,带3瓶药赴约将她杀死

汉史趣闻
2026-09-11 14:56:30
这场臭气熏天的裸奔,辟谣后续来了!

这场臭气熏天的裸奔,辟谣后续来了!

胖胖说他不胖
2026-09-11 10:25:19
私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

潋滟晴方DAY
2026-09-09 19:24:21
我75岁,存款300多万,血的教训告诫我:再亲的亲人也要留个心眼

我75岁,存款300多万,血的教训告诫我:再亲的亲人也要留个心眼

千秋文化
2026-06-12 20:21:36
官方实锤!姚月茂资助贫困生疑似编造:账号禁止关注,没有一个学生替他发声,摊上大事了,详细细节披露。

官方实锤!姚月茂资助贫困生疑似编造:账号禁止关注,没有一个学生替他发声,摊上大事了,详细细节披露。

李晚书
2026-09-11 17:00:37
59300元班费一学期花剩871元!深圳一初中家长曝光明细引争议,网友:千万不要让孩子去穷人多的学校

59300元班费一学期花剩871元!深圳一初中家长曝光明细引争议,网友:千万不要让孩子去穷人多的学校

火山詩话
2026-09-12 06:57:43
《廊桥遗梦》早就说透了:两个已婚的人彼此动了心,最差劲的做法是挑明,最傻的做法是逃避,真正聪明的人只做这两件事

《廊桥遗梦》早就说透了:两个已婚的人彼此动了心,最差劲的做法是挑明,最傻的做法是逃避,真正聪明的人只做这两件事

心理观察局
2026-09-12 06:52:08
越扒越有!安置风波大结局,官媒曝刘翔现状,估计和你想的不一样

越扒越有!安置风波大结局,官媒曝刘翔现状,估计和你想的不一样

笑饮孤鸿非
2026-09-12 04:26:46
像耿彦波这样的官员,为何没能得到进一步提拔?

像耿彦波这样的官员,为何没能得到进一步提拔?

起喜电影
2026-09-12 00:18:06
特别玄的一条:只要你睡过一个人,你们俩这辈子就挂上了

特别玄的一条:只要你睡过一个人,你们俩这辈子就挂上了

大熊欢乐坊
2026-09-07 18:20:10
前央视主持人欧阳夏丹近况:49岁单身无儿女,定居北京与狗为伴

前央视主持人欧阳夏丹近况:49岁单身无儿女,定居北京与狗为伴

独步天涯
2026-09-11 14:54:18
不查不知道,一查吓一跳,43岁刘翔家底竟然这么厚,难怪底气十足

不查不知道,一查吓一跳,43岁刘翔家底竟然这么厚,难怪底气十足

历史点行
2026-09-11 13:03:14
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
狗的哪个部位最脆弱?训狗师傅告诉你:遇到恶犬扑来,千万别用脚踢,那样会让疯狗越咬越狠,记住以下几点,三两招就能制服疯狗!

狗的哪个部位最脆弱?训狗师傅告诉你:遇到恶犬扑来,千万别用脚踢,那样会让疯狗越咬越狠,记住以下几点,三两招就能制服疯狗!

扶苏聊历史
2026-09-11 16:53:42
中东迎来最惨烈一夜:美军基地突遭导弹洗劫,9架战机当场被炸毁

中东迎来最惨烈一夜:美军基地突遭导弹洗劫,9架战机当场被炸毁

战域笔墨
2026-09-11 10:38:27
说真的,如果没有中美金融战,房地产就是国家下的一盘完美大棋

说真的,如果没有中美金融战,房地产就是国家下的一盘完美大棋

坠入二次元的海洋
2026-09-06 03:18:53
美丽的御姐:那不是气场,是我在路径中为你留下的固定节拍

美丽的御姐:那不是气场,是我在路径中为你留下的固定节拍

疾跑的小蜗牛
2026-08-23 19:29:43
刷新梅西纪录,马斯坦托诺成为五大联赛最年轻戴帽的阿根廷球员

刷新梅西纪录,马斯坦托诺成为五大联赛最年轻戴帽的阿根廷球员

懂球帝
2026-09-12 06:54:06
停止资助反被威胁催捐事件当事人被刑拘:自导自演身份成谜,影响恶劣骗取流量

停止资助反被威胁催捐事件当事人被刑拘:自导自演身份成谜,影响恶劣骗取流量

Mr王的饭后茶
2026-09-11 18:28:32
“身材高挑匀称就是不体面!”接娃宝妈被拍,网友:给自己贴个膜就出门了?

“身材高挑匀称就是不体面!”接娃宝妈被拍,网友:给自己贴个膜就出门了?

林林先生
2026-09-08 10:48:39
2026-09-12 08:56:49
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6802文章数 26908关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

老板娘深夜被镇干部推入厕所反锁门强奸 男方:小误会

头条要闻

老板娘深夜被镇干部推入厕所反锁门强奸 男方:小误会

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
本地
时尚
手机
亲子

艺术要闻

《步辇图》最大骗局:全程没有文成公主,却骗了所有中国人 1300 年

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

女友BELLA+封面 | Fort&Peat:长日无尽

手机要闻

苹果宣布为iPhone 14、15及16系列老用户延长一年卫星通信免费使用期

亲子要闻

高龄备孕卵泡不好可以调养吗?卵巢功能下降怎么办能怀孕吗?

无障碍浏览 进入关怀版