网易首页 > 网易号 > 正文 申请入驻

机器人开始学会“三思而后行”?这家公司将世界模型接入灵巧操作,任务成功率提高至75%

0
分享至



机器人家务到底做得怎么样了,距离真正解放我们的双手还有多远?拧灯泡、撕厨房纸、抽出叠放纸杯,对人类轻而易举,但在具身智能领域,如何让机器稳定完成这些看似简单的操作,一直是个难题。

过去几年,机器人基础模型逐渐从针对单项任务训练,转向利用视觉、语言和动作数据学习通用策略。视觉语言动作模型(VLA)可以根据画面和指令输出动作,世界模型则尝试预测动作执行后环境将如何变化。

但如果机器人最终要进入工位、厨房和家庭,它需要追赶的或许不只是人类“完成动作”的能力。人类已经积累了海量与现实世界交互的经验,从怎么看物体、怎样用手,到接触失败后如何调整。如何让模型、训练数据和机器人本体都围绕这些经验共同演进,正在成为具身智能的一条重要路线。

9 月 10 日,生数科技联合创始人、首席执行官(CEO)骆怡航在 2026 外滩大会发布 Motus2。该模型由生数科技研究团队与清华大学共同完成,面向高自由度灵巧操作,已在采用 WUJI Hand 2、Sharpa Wave 等灵巧手的双臂机器人上测试。



Motus2 给出的技术路线,正可从人与模型、数据和硬件关系理解。它用共享模型连接动作生成、后果预测和价值评估,从约 13 万小时人类第一视角视频中提取操作先验,再用机器人轨迹完成本体适配。在执行端,双目视觉、工作记忆和触觉传感分别补充深度、历史与接触信息。

其核心变化,是让机器人在行动前“多想一步”,并把想象结果变成学习信号。前代 Motus 已联合建模视频与动作,Motus2 再加入价值模型,提出动作、预测后果并判断其是否接近目标。反馈既筛选当次动作,也用于更新策略。

给动作后果打分

如果想让机器人自主完成任务,那么首先需要回答一个问题:根据当前观测和任务指令,下一步应该执行什么动作。

工业机器人通常依赖预设轨迹、状态机或人工设计的规划器,在工位、物体位置和流程高度确定时稳定有效。一旦物体形态、摆放方式或任务指令发生变化,规则与轨迹往往需要重新设计。

近年来,模仿学习和视觉语言动作模型从示范数据中学习“观测—动作”映射,提高了任务泛化能力。但这类方法更擅长复现已有行为,通常缺少对动作后果及其任务价值的显式判断。

世界模型由此提供另一种思路。它不急于把动作送给真实机器人,而是根据当前观测和候选动作,先预测未来几帧环境可能发生什么变化。近年来,DreamDojo、Ctrl-World 等研究都在探索动作条件世界模型,机器人因此获得一个近似的内部模拟器。

此前,生数科技发布的 Motus 已在统一潜在动作世界模型中连接视频预测和动作生成。它既可作为世界动作模型(WAM),根据语言指令、当前观测和视觉历史生成动作,也可作为动作条件世界模型(AC-WM),在给定动作后预测未来视觉状态,分别回答“下一步做什么”和“执行后会发生什么”。

不过,“能想象未来”仍不等于“知道哪个未来更好”。机器人还需要依据人类设定的任务目标,在多个可能结果中判断哪一种更值得执行。

为此,Motus2 在这套结构中增加了价值模型(VM):类似人类在行动前权衡不同选择及其后果的思维,机器人需要根据动作及其结果评估任务进展,通过价值模型判断“这个结果是否更接近目标”。


图|Motus2 整体架构

但要让同一个模型兼顾动作、预测和评价,还必须确保三类信息按照真实行动顺序流动,不能让机器人在训练时“偷看答案”。

假如模型在生成动作时读取到了执行这个动作以后才出现的画面,相当于利用了现实部署时不存在的未来信息,训练结果则难以在实际部署中复现。

因此 Motus2 采用动作优先(Action-first)的信息流,让动作只读取此前信息,未来视频读取动作,价值评估再读取动作和预测结果,以保证动作生成过程符合真实部署时的因果顺序。

在此基础上,预测和评价结果进入两条路径。一条用于推理阶段的当次动作选择,另一条用于训练阶段的长期策略更新。

具体而言,在推理阶段,模型通过 Best-of-N 规划生成多个候选动作,分别预测其后果并评分,再选择较优方案执行。完成一个动作片段后,机器人重新获取真实环境中的观测,随后开始下一轮规划。这种方式仅改变本次动作选择,但不会更新参数。

第二种发生在训练阶段。Motus2 通过引入基于模型的强化学习(MBRL),可以将模拟器预测的未来和评估器给出的价值转化为策略更新信号:高价值方案得到更强引导,低价值动作逐渐减少。这意味着,世界模型预测出的未来不再只用于展示,也能反过来影响动作策略,使模型以后更容易生成有利于完成任务的方案。

另外,区别于主要依赖高质量成功示范进行行为克隆的训练方式,失败数据在此体系中也获得了新的用途。例如,经过筛选的成功示范可以直接监督动作学习;失败和次优轨迹虽然不适合作为模仿目标,却可以用于学习动作导致的环境变化,并为价值模型提供“哪些结果偏离任务目标”的判断依据,间接参与策略优化。

研究团队在放置手机和多指操作两项真机任务中,分别进行了每项 20 次闭环测试。基础策略的平均成功率为 65%,单独加入规划后达到 67.5%,单独加入 MBRL 后达到 72.5%,同时使用两种机制后达到 75%。

从对照结果看,推理时规划使成功率提高了 2.5 个百分点,MBRL 带来的提升为 7.5 个百分点。二者结合后较基础策略共提高 10 个百分点,说明在这两项任务中,更新策略产生的作用更明显,而规划可以在此基础上进一步改善当次动作选择。

如何学习 13 万小时的数据

在搭好了行动、预测和评价框架后,下一道门槛是数据。

灵巧手单手可有 20 个以上自由度,遥操作采集既需要设备、操作者和标定,也要承担磨损与安全成本。因此,如何获得足够丰富的操作数据,并将其扩展至不同任务和机器人本体,成为训练灵巧操作模型的一大难题。

目前,业内常见的数据扩展路径包括大规模机器人遥操作、仿真生成与从人类视频中提取先验。其中,机器人数据最接近部署本体,却昂贵且覆盖有限;仿真便于批量试错,但接触、材质和传感噪声与现实仍有差距。互联网或第一视角视频规模更大,却通常缺少可直接执行的机器人动作标签。

为缓解高质量机器人数据稀缺、不同数据源又难以直接对齐的问题,Motus2 采用了分层的数据扩展路径,先从人类第一视角视频中学习操作经验,再逐步迁移到机器人。

其数据体系包含约 13 万小时原始录像,训练依次使用单目视频、同步双目视频与人类动作,最后加入机器人轨迹和人机对应数据。


图|人类数据金字塔

论文披露的第一视角语料约 13 万小时,其中超过 11 万小时为单目数据,覆盖多种物体、场景和人类操作行为,帮助模型学习较广泛的视觉知识及状态变化。

第二阶段引入约 1.74 万小时同步双目素材。左右视角不仅增加画面数量,更提供视差形成的隐式深度线索,并支持更准确的三维手部姿态估计,使模型进一步学习手与物体之间较细粒度的空间关系。

不过,由于人手与灵巧手在关节数量、尺寸、活动范围和控制接口上并不一致,,若把人类姿态生硬映射到机器人关节,轻则动作变形,重则产生自碰撞或无法形成有效抓握。

为跨越这道“本体鸿沟”,Motus2 使用数十小时人机对齐数据,以及包含机器人轨迹在内、总计超过 100 小时的中间训练数据。此后,模型还要通过目标任务数据完成后训练,才能把人类操作经验转化为特定机器人可以执行的动作。

五项真机任务中,仅经人类数据预训练的模型平均成功率为 51%,加入机器人域中间训练后升至 84%。放置小球和贴合橡皮为 100%,拧灯泡 90%,多指操作 70%,放置手机 60%。人类视频提供操作先验,机器人数据仍负责动作落地。



此外,团队还用 2,000 至 20,000 小时双目数据比较人类动作预测误差。数据增加时,最优误差持续下降,并在测量范围内与数据时长的对数近似线性。但该指标是留出集上的人类动作预测,并非真机成功率,也不能推出扩张会无限保持同样收益。

因此,“以人为牵引”并不等于让机器人照搬人。更准确的说法是,先用人的视角和动作扩大模型对物理交互的认识,再用少量但更昂贵的对齐数据、机器人轨迹和目标任务数据逐级校正。数据路径要与模型接口匹配,而能否迁移又受到硬件形态约束,模型、数据与硬件在这里形成了相互制约的三角。

补全记忆与触觉

完成本体适配后,机器人仍不等于拥有人的操作能力。有些任务依赖已经发生的历史信息,另一些则取决于手指与物体间的实时接触,仅凭当前画面难以准确判断。

一般而言,业内会选择以扩大视觉上下文、压缩历史为记忆标记,或引入力觉和触觉传感来补足信息。但前者将面临历史完整度与计算量的取舍,后者则要处理采样频率、噪声、传感器形态和模型融合成本。

为此,Motus2 分别引入工作记忆与触觉专家,使机器人能够调用此前观测,并根据最新触觉反馈调整动作。

寻找隐藏方块时,机器人先要记住方块进入哪只杯子,再经历杯子移动和遮挡。固定滑动窗口开销不随任务时长增长,但早期线索会被逐出上下文。Motus2 比较了保留完整历史的全局自回归,以及把中间历史压缩成标记的混合记忆。

测试结果显示,在寻找隐藏方块和依据历史提示按键两项测试中,全局自回归在仿真环境中的平均成功率为 78%,混合记忆为 52%。转移到真机后,两者分别为 57.5% 和 25%。这意味着,在两项测试中,直接读取完整历史比压缩历史信息更有利于完成任务。

这些结果也反映出记忆方式需要在信息完整度与运行成本之间取舍。完整历史能够保留更多线索,也会增加上下文长度和计算开销。同时,真机成功率低于仿真结果,表明真实环境中的视觉变化、遮挡和执行误差仍会影响历史信息的调用。


图|Motus2 九项真机演示

触觉处理的是另一种不可见信息。抽取叠放纸杯时,夹得太松会滑落,太紧则可能带出下层纸杯。撕纸时,双手的受力位置和方向持续变化。摄像头通常要等物体发生明显位移后才能确认失误,指尖传感器却能更早捕捉接触力和形变。

若让完整策略模型随每次触觉更新重新推理,高频传感会带来延迟。因此,Motus2 沿用 T-Rex 的触觉响应思路,设置轻量触觉专家,主模型生成动作片段并缓存特征,每个短片段执行前,专家读取最新触觉,对尚未执行的动作作最后修正。

这一分工体现了模型与硬件的协同。主干负责较低频的全局语义和动作规划,触觉专家处理高频、局部的接触变化。训练时还预测动作后的真实力信号,帮助模型学习接触如何演化,部署时则只输出修正后的动作,避免每一步都重新运行大模型。

在抽取纸杯和撕纸两项任务中,加入触觉后平均成功率从 60% 升至 72.5%。其中抽取纸杯由 65% 升至 75%,撕纸由 55% 升至 70%。这组消融实验支持了触觉对精细接触操作的作用,但范围仍限于两项任务与特定平台,不能视作对所有材料和操作的普遍结论。

上述测试使用了单手 20 自由度的 WUJI Hand 2 和单手 22 自由度的 Sharpa Wave 等平台。


图|生数科技提出的通用世界模型五级演进路线

此外,生数科技还提出了通用世界模型(GWM)五级路线,以描述通用世界模型从生成环境走向自主行动的能力演进。五级路线依次为 L1“生成世界”、L2“与世界交互”、L3“在世界中行动”、L4“自主世界智能体”和 L5“世界组织者”。

按此框架,Motus2 已掌握 L3“在世界中行动”的关键能力:既能理解当前状态,也能预判行动后的未来,还能生成可执行的真实机器人动作。更进一步,它把 Evaluation 与 Feedback 明确接入闭环,形成“行动 → 预测 → 评估 → 反馈 → 再学习”的循环。

由此,这一机制初步展现出类似 RSI(Recursive Self-Improvement,递归自我改进)的特征:模型会借助自身对世界的预测和评估结果,反向优化行动策略。

世界模型开始拥有一定的自我演进能力,也是生数为从 L3 迈向 L4“自主世界智能体”的一次重要探索。

值得注意的是,Motus2 始终“以人为牵引”进行技术迭代,进一步印证了人类经验在机器人能力演进中的重要性。未来,若要继续迈向长期自主决策,仍需更可靠的预测、跨本体评测和规模化触觉采集,也取决于模型、数据与硬件能否协同演进。

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
广州一村村民共分到1152套精装房,最大户型175平,房间和客厅都有空调

广州一村村民共分到1152套精装房,最大户型175平,房间和客厅都有空调

林子说事
2026-09-14 11:19:26
男按摩师给我按到一半突然停下,红着脸说:对不起,我有点心动了

男按摩师给我按到一半突然停下,红着脸说:对不起,我有点心动了

千秋历史
2026-09-14 20:11:24
美媒集体震惊:这次访华,才真正见识到中国温度!

美媒集体震惊:这次访华,才真正见识到中国温度!

福建睿平
2026-05-18 11:56:20
亚运会2将成大赢家!崔永熙与李悦洲全能输出,未来可锁死轮换!

亚运会2将成大赢家!崔永熙与李悦洲全能输出,未来可锁死轮换!

篮球资讯达人
2026-09-14 14:28:24
恐怕连刘强东都没想到,如今32岁的章泽天,在何超琼的提携与支持下,竟迎来了自己的高光时刻

恐怕连刘强东都没想到,如今32岁的章泽天,在何超琼的提携与支持下,竟迎来了自己的高光时刻

人生录
2026-09-14 00:05:21
新款保时捷卡宴“黄金版”,金色大尺寸轮毂很亮眼,动感又帅气

新款保时捷卡宴“黄金版”,金色大尺寸轮毂很亮眼,动感又帅气

音乐时光的娱乐
2026-09-13 16:29:49
青岛副市长高健落马:一鹤奋飞三十二载,一念失守坠于须臾

青岛副市长高健落马:一鹤奋飞三十二载,一念失守坠于须臾

十为先生
2026-09-14 18:23:43
突发!苹果不卖了

突发!苹果不卖了

互联网品牌官
2026-09-14 12:32:18
督察组暗访灯配城:部分门店CCC标志随意贴,实为“三无”灯具

督察组暗访灯配城:部分门店CCC标志随意贴,实为“三无”灯具

极目新闻
2026-09-13 19:35:40
冯绍峰被小区工作人员吐槽!买房是倪妮,装修林允,住的是赵丽颖

冯绍峰被小区工作人员吐槽!买房是倪妮,装修林允,住的是赵丽颖

八星人
2026-09-12 16:49:26
出川抗战后,48岁刘湘随即身亡,蒋介石:立即枪杀他的盟友韩复榘

出川抗战后,48岁刘湘随即身亡,蒋介石:立即枪杀他的盟友韩复榘

史笔似尘钩
2026-09-13 21:39:20
山东大姐这事干的漂亮!被美国FBI悬赏!赏金1.5亿超过3个本拉登

山东大姐这事干的漂亮!被美国FBI悬赏!赏金1.5亿超过3个本拉登

马尔科故事会
2025-03-27 15:21:29
“谁给的权力开我的门”!深圳一业主空置房,被物业擅自打开堆杂物,最新:现场负责人,拟被降职降薪

“谁给的权力开我的门”!深圳一业主空置房,被物业擅自打开堆杂物,最新:现场负责人,拟被降职降薪

南方都市报
2026-09-14 20:52:48
主帅年仅33岁!英超头号炮火队出炉:4轮轰13球 13队进球不足其1/2

主帅年仅33岁!英超头号炮火队出炉:4轮轰13球 13队进球不足其1/2

风过乡
2026-09-14 08:59:01
大快人心!被摸臀女子再遇麻烦,马来亚大学表态,留学退路或断送

大快人心!被摸臀女子再遇麻烦,马来亚大学表态,留学退路或断送

史之韵
2026-09-11 19:38:40
世界领先!石油可能要变“白菜价”?中国新技术让国力再次飙升!

世界领先!石油可能要变“白菜价”?中国新技术让国力再次飙升!

小蜜情感说
2026-09-06 12:47:12
耗时11个月审判,尹锡悦拿到一审无罪判决!直接当庭质问检察组

耗时11个月审判,尹锡悦拿到一审无罪判决!直接当庭质问检察组

有范又有料
2026-09-14 11:17:45
两性专家说:做老婆的,别管男人跟谁睡,他出去了,不在你身边,你管他干什么?只要不要损害这个家庭的经济利益,就不要生闲气

两性专家说:做老婆的,别管男人跟谁睡,他出去了,不在你身边,你管他干什么?只要不要损害这个家庭的经济利益,就不要生闲气

心理观察局
2026-09-11 06:59:05
哈兰德:曼联从我出生起就是死敌,但我和曼联球迷朋友也互相尊重

哈兰德:曼联从我出生起就是死敌,但我和曼联球迷朋友也互相尊重

懂球帝
2026-09-14 10:08:07
特朗普女婿库什纳抨击乌克兰不愿投降,声称乌克兰妥协就可以结束战争

特朗普女婿库什纳抨击乌克兰不愿投降,声称乌克兰妥协就可以结束战争

山河路口
2026-09-13 20:42:27
2026-09-14 22:23:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17242文章数 515213关注度
往期回顾 全部

科技要闻

时隔近9年,特斯拉新款Roadster拟十一发布

头条要闻

多人医保被登记为"死亡" 当地医保局:每天都有人找来

头条要闻

多人医保被登记为"死亡" 当地医保局:每天都有人找来

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹采访视频曝光,原来早有预兆

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

健康
艺术
本地
教育
军事航空

耳石症vs颈椎病,头晕的原因差太多

艺术要闻

著名油画家 马一平风景油画欣赏

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

教育要闻

初三家长最容易做错的三件事

军事要闻

24小时内58次空袭 也门冲突快速升级

无障碍浏览 进入关怀版