网易首页 > 网易号 > 正文 申请入驻

清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

0
分享至

田晏林 发自 凹非寺
量子位 | 公众号 QbitAI

好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!

而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。

出手的是一家中国机器人公司——清华唯一持股的嫡系具身公司,星动纪元。

近日,星动纪元自研的世界动作模型VPP2,一举登顶RoboDojo仿真榜单。

综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。



关键是,这场比赛还真不好打。

RoboDojo号称具身智能界的「珠穆朗玛峰」,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。

它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?

总之,想靠刷熟练度蒙混过关,没那么容易。

结果呢?

星动纪元VPP2不仅拿下综合第一,在泛化能力、精细操作、记忆能力三个维度上,也拔得头筹。



据说,这次VPP2没有额外加数据,也没用Agent RSI等增强手段,仅靠「标准数据集」,就把一众高手给卷了下去。

这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。

不是,哥们儿,这么夯的模型到底是怎么练出来的啊???

我们往技术路线里扒了扒,你别说,VPP2这次的突破,还真有点东西。

它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。

VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。

从预测到行动,两种泛化能力一起提升。

从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。

世界动作模型WAM,卷出一个新冠军

具身智能行业有个挺尴尬的现象。

机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?

还真不好回答。

比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。

更别提那些需要连续执行多个步骤的任务了。



这也是为什么,RoboDojo这套评测值得关注。

它的目标是为具身智能建立统一、可复现的评测标准,仿真测试包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。

说白了,就是把机器人拉出舒适区。

传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。

RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。

而VPP2这次交出的成绩单,相当亮眼。

平均成功率32.26%、平均得分39.26分,两个指标均位居榜首。

作为对比,在RoboDojo仿真基准的后训练评测中,GPT-6-Astra的平均成功率为22.48%,平均得分28.97分。

而VPP2分别领先9.78个百分点和10.29分。


论文截图,基线模型数据取自官方排行榜

这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。

两项指标均综合了五大能力维度的测试结果。

换句话说,VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。

而且,这种领先并不局限于综合成绩。

拆开五项能力维度来看,VPP2在泛化、精准操作、记忆三个维度上,同样拿下第一。

这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。

综合成绩领先,关键能力也能打。



不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。

VPP2在仿真里展现出的泛化能力,到了真机上还能成立吗?

星动纪元也做了实验。

这次,团队直接把VPP2部署到真实ALOHA双臂机器人上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。

也就是说,无需针对这些测试任务进行额外微调,机器人就得直接上手。

结果,VPP2再次交出领先成绩:平均成功率58.5%,高于π0.5的40%。



在10类任务里,VPP2拿下了9类最佳成绩。

这下有意思了。

榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。

两份成绩单摆在一起,VPP2的技术优势就更值得深挖了。

要知道,VPP2走的是世界动作模型(WAM)路线。

这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。

但这条路线长期存在一个问题:视频预测得漂亮,不代表机器人真的会干活。

VPP2这次,偏偏就冲着这个问题去了。

从预测泛化到行动泛化,VPP2怎么做到的?

想理解VPP2的突破,先来看一个简单任务:让机器人把桌上的杯子放进盒子里。

对人类来说,伸手抓住、抬起来、放进去,几乎不用思考。

但机器人得判断杯子的位置、机械臂的运动轨迹、夹爪何时闭合,还要预测整个操作过程中,物理世界会发生什么变化。任何一步出了偏差,都可能翻车。

现有的世界动作模型(WAM),恰恰容易在这里出问题。

一方面,普通视频模型擅长生成画面,但画面看着合理,和符合真实物理规律是两回事。

比如要求抓左边的杯子,模型却预测抓起右边那个。视频照样能生成,机器人执行时却会直接跑偏。

另一方面,直接把动作学习加入视频模型,还可能损伤原本的泛化能力。

结果动作学会了,机器人换个环境却不会做了。

VPP2提出了一个很直接的判断:视频预测的质量,决定了动作的上限。



基于这一思路,星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。

星动纪元为此设计了一套三阶段训练策略:

  • 第一阶段,事件级视频继续预训练,让模型学会预测完整操作过程。
  • 第二阶段,固定时长视频后训练与蒸馏,让预测能力跟得上机器人实时执行的速度。
  • 第三阶段,动作专家训练,将视频预测转化为具体动作,同时尽量保住原有的泛化能力。



三个阶段层层递进,最终指向两个核心突破:预测能泛化,行动也能泛化。

第一个突破:让视频预测具备泛化能力

VPP2首先要解决的,是机器人能否准确预测陌生任务中的物理变化。

星动纪元以阿里开源的Wan2.1-I2V-14B为基础,整合机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。

不过,真正有意思的是它对数据的处理。

团队没有简单地把视频一股脑喂给模型,而是先将操作过程切分成语义完整的片段,再配上详细描述。

比如,不能只告诉模型「把杯子放进盒子」,还要明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。

因为同一句模糊指令,可能对应无数种动作轨迹。

模型如果连操作对象都没搞清楚,自然很难准确预测未来。

VPP2索性把任务描述得更细,让语言指令和物理操作形成更稳定的对应关系。



更关键的一步,是事件级视频预测训练。

传统短时预测关注接下来几帧会发生什么,而VPP2直接让模型学习一次完整操作从开始到结束的变化。

从机械臂靠近杯子,到抓住杯子,再到放进盒子,模型要理解的是一整件事如何发生。

这样一来,面对新的物体、位置甚至操作任务,它才更有机会预测合理的物理变化。

在机器人操作视频的指令遵循测试中,14B参数的VPP2达到90%的成功率,而64B参数的Cosmos3模型为78%。



14B打赢64B。

这也说明,在物理操作预测中,参数规模并非唯一的胜负手,能否真正理解操作过程同样重要。

不过,预测得再准,机器人动不起来,也白搭。

第二个突破:让预测泛化变成行动泛化

这里有两道坎,一是速度,二是如何在学会动作的同时,保住视频模型原有的泛化能力。

第一道坎很好理解。如果让机器人干活,每个动作发生前都要花几秒生成视频,那么再强的预测能力也很难派上用场。

星动纪元选择先给预测模型提速。

团队将事件级预测模型进一步调整为固定8秒的视频片段预测,再通过一致性蒸馏,将多步计算压缩为单步生成。

最终,预测未来8秒的视觉变化,计算耗时约0.12秒。

第二道坎,稍微棘手一些。

前面好不容易让视频模型学会了预测陌生任务,结果加入动作训练后,模型反而只会执行熟悉的操作。

动作能力长出来了,泛化能力却丢了?VPP2要做的,就是同时跨过这两道坎。



VPP2引入一个0.9B参数的扩散Transformer(Action DiT),采用MoT架构,学习如何根据预测的未来状态生成机器人动作。

但星动纪元没有直接将视频预测模型(Video DiT)和动作专家一起从头训练。

在动作训练初期,视频模型的基础参数被冻结,仅通过LoRA进行适配,尽量避免动作训练破坏已有的预测泛化能力。

相当于先让机器人理解物理世界怎么变化,再训练它如何把这种「理解」转化为「动作」。

两种能力分阶段生长,又相互配合。

最终,视频预测约耗时0.12秒,动作专家约耗时0.1秒,整体动作片段生成延迟约为0.22秒。



当然,架构再漂亮,也得看最终效果。

前面提到的ALOHA真实机器人零样本测试,已经展现出VPP2将预测能力转化为陌生任务操作的潜力。

另外两套泛化测试,则进一步验证了这条路线。

LIBERO-Pro考察物体位置、任务要求变化后的操作能力,VPP2取得45.0%的总体成功率,其他基线模型最高为11.0%。

LIBERO-OOD则考察组合泛化,将熟悉的物体、布局和任务目标重新组合,形成此前没见过的新任务。

VPP2的总体成功率达到63.9%。



把这些结果放在一起看,VPP2的技术思路就清楚了。

先通过多源数据、详细任务描述和事件级预测训练,让模型更准确地预测物理变化。

再通过蒸馏加速、分阶段动作学习,将这种预测能力转化为实际操作,同时尽量保留原有的泛化能力。

具身智能的性能上限,显然还没到只能靠规模硬堆的地步。

VPP2再次说明,优化数据管线、调整训练范式,这些看似朴素的工程方法,仍然有机会带来可观的模型性能提升。

从GPT到WAM,物理AI正在形成新范式

预测能泛化,行动也能泛化,是VPP2作为世界动作模型WAM,最值得关注的核心突破。

但真实任务往往更加复杂。机器人不仅要知道怎么做,还得判断先做什么、后做什么。

这就需要更高层的认知与规划能力参与进来。

星动纪元这里贡献了一个思路:GPT负责想,VPP2负责做。

前者负责理解、推理和规划,把复杂任务拆解成明确步骤;后者负责预测物理世界如何变化,再将规划转化为具体动作。

这一思路,在VPP2论文中已经有了初步的实验支撑。

团队实际采用的是VLM高层规划器,由其负责语义理解、记忆和任务拆解,再将明确的子任务交给VPP2执行。

结果相当直观。在RoboDojo选定的长程任务测试中,引入VLM子任务规划后,平均成功率从27.6%提升至57.6%。

这意味着,机器人要完成复杂任务,光有强大的动作能力还不够。高层规划与底层执行能否配合,同样影响任务完成效果。

顺着这条思路往后看,GPT+VPP2有望形成一种新的物理AI技术范式:通用认知+通用物理执行。

GPT等通用模型负责理解意图、推理和规划,VPP2这样的WAM负责预测物理变化、生成动作,再通过执行反馈持续调整。

从认知、规划、预测,到执行、反馈,一套完整的物理AI闭环逐渐清晰。

而这,也让WAM的价值有了更大的想象空间。

模型能力要通过本体与物理世界交互,真实使用又会暴露失败、产生反馈,推动模型和硬件继续改进。

星动纪元同时做大脑、本体和灵巧手,「深全栈」的战略可以在这一逻辑中得到解释:公司试图掌握的不仅是训练环节,也包括能力落地与反馈回流的环节。

u1s1,技术路线再漂亮,最终还是得去真实世界里干活。

星动纪元在这方面,已与中国邮政、顺丰等企业开展合作,在全国5个省市、10余个物流中心常态化运营。



物流场景中的货物尺寸、摆放位置、作业流程都可能发生变化。同样一套操作,换个仓库,机器人可能就得重新适应。

这也对机器人的泛化能力提出了更高要求。

模型能否把学过的本事迁移到陌生任务中,直接关系到未来跨场景部署的效率和成本。

当然,已有物流业务的商业化进展,并不意味着VPP2已经实现规模化部署。模型能否在更多真实场景中长期稳定运行,还需要进一步验证。

但VPP2这次的成绩,已经释放出一个值得关注的信号。

世界动作模型的竞争,正在从预测未来,进一步走向把预测转化为通用行动。

回头再看RoboDojo登顶,值得关注的也就不只是一个第一名了。

从仿真到真机,从预测泛化到行动泛化,VPP2的一系列实验结果表明:视频预测与动作学习的分阶段训练,确实能够提升机器人在陌生任务中的操作能力。

而随着GPT等通用认知模型与WAM进一步结合,物理AI也有望形成更完整的能力体系。

说到底,具身智能下一轮比拼的,就是机器人能否把学到的本事,带进更多陌生场景。

预测得准,还要做得到。这才是世界动作模型真正走向物理世界的关键。

PS:VPP2现已开源,感兴趣的朋友可以上手试试,复现一下论文结果。

要是真跑出什么惊喜,记得回来跟我们唠唠~

1.开源代码
:https://github.com/roboterax/video-prediction-policy-2
2.项目主页:
https://robert-gyj.github.io/video-prediction-policy-2



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
今年冬天要变天了!厄尔尼诺增强到罕见程度,寒潮可能杀个回马枪

今年冬天要变天了!厄尔尼诺增强到罕见程度,寒潮可能杀个回马枪

浩渺青史
2026-10-10 01:08:39
罕见!各地密集成立新国企,6万亿大市场浮出水面

罕见!各地密集成立新国企,6万亿大市场浮出水面

前瞻网
2026-10-09 11:08:11
37名船工帮3万红军渡金沙江,渡江后毛主席为何特意下令:工钱补发,一个不能少

37名船工帮3万红军渡金沙江,渡江后毛主席为何特意下令:工钱补发,一个不能少

纪史行者
2026-10-10 03:20:10
国乒女单不敌日本!10日赛程公布:张本美和难度大,陈幸同出击

国乒女单不敌日本!10日赛程公布:张本美和难度大,陈幸同出击

郭夷包工头
2026-10-10 00:31:16
吴奇隆因举旗被取消活动,网友质疑其立场,吴奇隆:不赚钱也这样

吴奇隆因举旗被取消活动,网友质疑其立场,吴奇隆:不赚钱也这样

蜜桔娱乐
2026-10-07 09:55:52
一份被嘲笑的“九宫格早餐”火了:家长假装精致,连塞牙缝都不够 ,孩子还能怎样成长?

一份被嘲笑的“九宫格早餐”火了:家长假装精致,连塞牙缝都不够 ,孩子还能怎样成长?

蝴蝶花雨话教育
2026-10-07 21:31:17
“穷人”的人脉有多离谱?网友:我爸托人,给找了个夜班快递分拣

“穷人”的人脉有多离谱?网友:我爸托人,给找了个夜班快递分拣

另子维爱读史
2026-10-04 21:22:12
李显龙直言不讳地告诫国民:每一个新加坡人都必须明白,本国坚决不承认“华人国家”身份,背后藏着的是全亚洲最为惊心动魄的生存考量

李显龙直言不讳地告诫国民:每一个新加坡人都必须明白,本国坚决不承认“华人国家”身份,背后藏着的是全亚洲最为惊心动魄的生存考量

橙色书卷
2026-07-16 21:35:45
畸形的基本盘:一边在批评蔡康永,一边在支持下一个蔡康永!

畸形的基本盘:一边在批评蔡康永,一边在支持下一个蔡康永!

梦归秋辰
2026-10-08 09:51:55
外网热议短跑选手出身的女警官钱雪颖:她应该参加世界特警挑战赛

外网热议短跑选手出身的女警官钱雪颖:她应该参加世界特警挑战赛

杨华评论
2026-10-09 14:52:23
官媒痛批“衣不遮体”!演唱会成遮羞布,这几位女星“越露越多”

官媒痛批“衣不遮体”!演唱会成遮羞布,这几位女星“越露越多”

孤芳自赏的小李
2026-08-29 19:52:12
看完利雅得胜利3-0迪里耶,不得不承认5个事实,C罗轰生涯980球!

看完利雅得胜利3-0迪里耶,不得不承认5个事实,C罗轰生涯980球!

田先生篮球
2026-10-10 08:26:42
话里有话?侯英超点破孙颖莎爆冷真相!

话里有话?侯英超点破孙颖莎爆冷真相!

乒乓乐园
2026-10-10 08:03:43
尊界回应制动踏板3次断裂测试:设计问题甩锅国标,不召回仅免费升级,新华社连夜删帖,评论一边倒

尊界回应制动踏板3次断裂测试:设计问题甩锅国标,不召回仅免费升级,新华社连夜删帖,评论一边倒

李晚书
2026-10-09 07:52:18
没人要的垃圾股,3年暴涨150倍!读懂丁磊的逆势重生逻辑

没人要的垃圾股,3年暴涨150倍!读懂丁磊的逆势重生逻辑

流苏晚晴
2026-10-09 19:39:08
男子土豆当主食,半年瘦25斤!营养专家:土豆是被严重低估的食材

男子土豆当主食,半年瘦25斤!营养专家:土豆是被严重低估的食材

药师方健
2026-10-02 22:19:37
某些无良媒体,你丫还有点良知和节操吗?

某些无良媒体,你丫还有点良知和节操吗?

涛哥锐评
2026-10-06 20:56:04
重磅利好!中共中央、国务院发文

重磅利好!中共中央、国务院发文

21世纪经济报道
2026-10-09 23:57:27
2026年度全球前2%顶尖科学家榜单中国内地高校上榜人数统计一览!

2026年度全球前2%顶尖科学家榜单中国内地高校上榜人数统计一览!

谁为锦年织彩衣
2026-10-10 07:05:08
尊界事件:放下站队思维,少些立场预判 | 新京报快评

尊界事件:放下站队思维,少些立场预判 | 新京报快评

新京报
2026-10-09 18:13:26
2026-10-10 09:20:49
量子位 incentive-icons
量子位
追踪人工智能动态
13460文章数 176581关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

因官方报备要求太严格 团体直接放生两万条鲮鱼

头条要闻

因官方报备要求太严格 团体直接放生两万条鲮鱼

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

时隔12年,公募基金运作办法修订

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

家居
亲子
游戏
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

带着情绪睡觉很危险,太逗了

《使命召唤:现代战争4》DMZ于10月20日向数字版预购玩家开放

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美乌将举行新一轮会谈

无障碍浏览 进入关怀版