网易首页 > 网易号 > 正文 申请入驻

清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

0
分享至

田晏林 发自 凹非寺
量子位 | 公众号 QbitAI

好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!

而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。

出手的是一家中国机器人公司——清华唯一持股的嫡系具身公司,星动纪元。

近日,星动纪元自研的世界动作模型VPP2,一举登顶RoboDojo仿真榜单。

综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。



关键是,这场比赛还真不好打。

RoboDojo号称具身智能界的「珠穆朗玛峰」,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。

它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?

总之,想靠刷熟练度蒙混过关,没那么容易。

结果呢?

星动纪元VPP2不仅拿下综合第一,在泛化能力、精细操作、记忆能力三个维度上,也拔得头筹。



据说,这次VPP2没有额外加数据,也没用Agent RSI等增强手段,仅靠「标准数据集」,就把一众高手给卷了下去。

这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。

不是,哥们儿,这么夯的模型到底是怎么练出来的啊???

我们往技术路线里扒了扒,你别说,VPP2这次的突破,还真有点东西。

它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。

VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。

从预测到行动,两种泛化能力一起提升。

从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。

世界动作模型WAM,卷出一个新冠军

具身智能行业有个挺尴尬的现象。

机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?

还真不好回答。

比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。

更别提那些需要连续执行多个步骤的任务了。



这也是为什么,RoboDojo这套评测值得关注。

它的目标是为具身智能建立统一、可复现的评测标准,仿真测试包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。

说白了,就是把机器人拉出舒适区。

传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。

RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。

而VPP2这次交出的成绩单,相当亮眼。

平均成功率32.26%、平均得分39.26分,两个指标均位居榜首。

作为对比,在RoboDojo仿真基准的后训练评测中,GPT-6-Astra的平均成功率为22.48%,平均得分28.97分。

而VPP2分别领先9.78个百分点和10.29分。


论文截图,基线模型数据取自官方排行榜

这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。

两项指标均综合了五大能力维度的测试结果。

换句话说,VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。

而且,这种领先并不局限于综合成绩。

拆开五项能力维度来看,VPP2在泛化、精准操作、记忆三个维度上,同样拿下第一。

这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。

综合成绩领先,关键能力也能打。



不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。

VPP2在仿真里展现出的泛化能力,到了真机上还能成立吗?

星动纪元也做了实验。

这次,团队直接把VPP2部署到真实ALOHA双臂机器人上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。

也就是说,无需针对这些测试任务进行额外微调,机器人就得直接上手。

结果,VPP2再次交出领先成绩:平均成功率58.5%,高于π0.5的40%。



在10类任务里,VPP2拿下了9类最佳成绩。

这下有意思了。

榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。

两份成绩单摆在一起,VPP2的技术优势就更值得深挖了。

要知道,VPP2走的是世界动作模型(WAM)路线。

这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。

但这条路线长期存在一个问题:视频预测得漂亮,不代表机器人真的会干活。

VPP2这次,偏偏就冲着这个问题去了。

从预测泛化到行动泛化,VPP2怎么做到的?

想理解VPP2的突破,先来看一个简单任务:让机器人把桌上的杯子放进盒子里。

对人类来说,伸手抓住、抬起来、放进去,几乎不用思考。

但机器人得判断杯子的位置、机械臂的运动轨迹、夹爪何时闭合,还要预测整个操作过程中,物理世界会发生什么变化。任何一步出了偏差,都可能翻车。

现有的世界动作模型(WAM),恰恰容易在这里出问题。

一方面,普通视频模型擅长生成画面,但画面看着合理,和符合真实物理规律是两回事。

比如要求抓左边的杯子,模型却预测抓起右边那个。视频照样能生成,机器人执行时却会直接跑偏。

另一方面,直接把动作学习加入视频模型,还可能损伤原本的泛化能力。

结果动作学会了,机器人换个环境却不会做了。

VPP2提出了一个很直接的判断:视频预测的质量,决定了动作的上限。



基于这一思路,星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。

星动纪元为此设计了一套三阶段训练策略:

  • 第一阶段,事件级视频继续预训练,让模型学会预测完整操作过程。
  • 第二阶段,固定时长视频后训练与蒸馏,让预测能力跟得上机器人实时执行的速度。
  • 第三阶段,动作专家训练,将视频预测转化为具体动作,同时尽量保住原有的泛化能力。



三个阶段层层递进,最终指向两个核心突破:预测能泛化,行动也能泛化。

第一个突破:让视频预测具备泛化能力

VPP2首先要解决的,是机器人能否准确预测陌生任务中的物理变化。

星动纪元以阿里开源的Wan2.1-I2V-14B为基础,整合机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。

不过,真正有意思的是它对数据的处理。

团队没有简单地把视频一股脑喂给模型,而是先将操作过程切分成语义完整的片段,再配上详细描述。

比如,不能只告诉模型「把杯子放进盒子」,还要明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。

因为同一句模糊指令,可能对应无数种动作轨迹。

模型如果连操作对象都没搞清楚,自然很难准确预测未来。

VPP2索性把任务描述得更细,让语言指令和物理操作形成更稳定的对应关系。



更关键的一步,是事件级视频预测训练。

传统短时预测关注接下来几帧会发生什么,而VPP2直接让模型学习一次完整操作从开始到结束的变化。

从机械臂靠近杯子,到抓住杯子,再到放进盒子,模型要理解的是一整件事如何发生。

这样一来,面对新的物体、位置甚至操作任务,它才更有机会预测合理的物理变化。

在机器人操作视频的指令遵循测试中,14B参数的VPP2达到90%的成功率,而64B参数的Cosmos3模型为78%。



14B打赢64B。

这也说明,在物理操作预测中,参数规模并非唯一的胜负手,能否真正理解操作过程同样重要。

不过,预测得再准,机器人动不起来,也白搭。

第二个突破:让预测泛化变成行动泛化

这里有两道坎,一是速度,二是如何在学会动作的同时,保住视频模型原有的泛化能力。

第一道坎很好理解。如果让机器人干活,每个动作发生前都要花几秒生成视频,那么再强的预测能力也很难派上用场。

星动纪元选择先给预测模型提速。

团队将事件级预测模型进一步调整为固定8秒的视频片段预测,再通过一致性蒸馏,将多步计算压缩为单步生成。

最终,预测未来8秒的视觉变化,计算耗时约0.12秒。

第二道坎,稍微棘手一些。

前面好不容易让视频模型学会了预测陌生任务,结果加入动作训练后,模型反而只会执行熟悉的操作。

动作能力长出来了,泛化能力却丢了?VPP2要做的,就是同时跨过这两道坎。



VPP2引入一个0.9B参数的扩散Transformer(Action DiT),采用MoT架构,学习如何根据预测的未来状态生成机器人动作。

但星动纪元没有直接将视频预测模型(Video DiT)和动作专家一起从头训练。

在动作训练初期,视频模型的基础参数被冻结,仅通过LoRA进行适配,尽量避免动作训练破坏已有的预测泛化能力。

相当于先让机器人理解物理世界怎么变化,再训练它如何把这种「理解」转化为「动作」。

两种能力分阶段生长,又相互配合。

最终,视频预测约耗时0.12秒,动作专家约耗时0.1秒,整体动作片段生成延迟约为0.22秒。



当然,架构再漂亮,也得看最终效果。

前面提到的ALOHA真实机器人零样本测试,已经展现出VPP2将预测能力转化为陌生任务操作的潜力。

另外两套泛化测试,则进一步验证了这条路线。

LIBERO-Pro考察物体位置、任务要求变化后的操作能力,VPP2取得45.0%的总体成功率,其他基线模型最高为11.0%。

LIBERO-OOD则考察组合泛化,将熟悉的物体、布局和任务目标重新组合,形成此前没见过的新任务。

VPP2的总体成功率达到63.9%。



把这些结果放在一起看,VPP2的技术思路就清楚了。

先通过多源数据、详细任务描述和事件级预测训练,让模型更准确地预测物理变化。

再通过蒸馏加速、分阶段动作学习,将这种预测能力转化为实际操作,同时尽量保留原有的泛化能力。

具身智能的性能上限,显然还没到只能靠规模硬堆的地步。

VPP2再次说明,优化数据管线、调整训练范式,这些看似朴素的工程方法,仍然有机会带来可观的模型性能提升。

从GPT到WAM,物理AI正在形成新范式

预测能泛化,行动也能泛化,是VPP2作为世界动作模型WAM,最值得关注的核心突破。

但真实任务往往更加复杂。机器人不仅要知道怎么做,还得判断先做什么、后做什么。

这就需要更高层的认知与规划能力参与进来。

星动纪元这里贡献了一个思路:GPT负责想,VPP2负责做。

前者负责理解、推理和规划,把复杂任务拆解成明确步骤;后者负责预测物理世界如何变化,再将规划转化为具体动作。

这一思路,在VPP2论文中已经有了初步的实验支撑。

团队实际采用的是VLM高层规划器,由其负责语义理解、记忆和任务拆解,再将明确的子任务交给VPP2执行。

结果相当直观。在RoboDojo选定的长程任务测试中,引入VLM子任务规划后,平均成功率从27.6%提升至57.6%。

这意味着,机器人要完成复杂任务,光有强大的动作能力还不够。高层规划与底层执行能否配合,同样影响任务完成效果。

顺着这条思路往后看,GPT+VPP2有望形成一种新的物理AI技术范式:通用认知+通用物理执行。

GPT等通用模型负责理解意图、推理和规划,VPP2这样的WAM负责预测物理变化、生成动作,再通过执行反馈持续调整。

从认知、规划、预测,到执行、反馈,一套完整的物理AI闭环逐渐清晰。

而这,也让WAM的价值有了更大的想象空间。

模型能力要通过本体与物理世界交互,真实使用又会暴露失败、产生反馈,推动模型和硬件继续改进。

星动纪元同时做大脑、本体和灵巧手,「深全栈」的战略可以在这一逻辑中得到解释:公司试图掌握的不仅是训练环节,也包括能力落地与反馈回流的环节。

u1s1,技术路线再漂亮,最终还是得去真实世界里干活。

星动纪元在这方面,已与中国邮政、顺丰等企业开展合作,在全国5个省市、10余个物流中心常态化运营。



物流场景中的货物尺寸、摆放位置、作业流程都可能发生变化。同样一套操作,换个仓库,机器人可能就得重新适应。

这也对机器人的泛化能力提出了更高要求。

模型能否把学过的本事迁移到陌生任务中,直接关系到未来跨场景部署的效率和成本。

当然,已有物流业务的商业化进展,并不意味着VPP2已经实现规模化部署。模型能否在更多真实场景中长期稳定运行,还需要进一步验证。

但VPP2这次的成绩,已经释放出一个值得关注的信号。

世界动作模型的竞争,正在从预测未来,进一步走向把预测转化为通用行动。

回头再看RoboDojo登顶,值得关注的也就不只是一个第一名了。

从仿真到真机,从预测泛化到行动泛化,VPP2的一系列实验结果表明:视频预测与动作学习的分阶段训练,确实能够提升机器人在陌生任务中的操作能力。

而随着GPT等通用认知模型与WAM进一步结合,物理AI也有望形成更完整的能力体系。

说到底,具身智能下一轮比拼的,就是机器人能否把学到的本事,带进更多陌生场景。

预测得准,还要做得到。这才是世界动作模型真正走向物理世界的关键。

PS:VPP2现已开源,感兴趣的朋友可以上手试试,复现一下论文结果。

要是真跑出什么惊喜,记得回来跟我们唠唠~

1.开源代码
:https://github.com/roboterax/video-prediction-policy-2
2.项目主页:
https://robert-gyj.github.io/video-prediction-policy-2



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
德国总理默茨称,如果自己是记者,他会呼吁大家不要辱骂德国政府

德国总理默茨称,如果自己是记者,他会呼吁大家不要辱骂德国政府

尘世闲云
2026-10-08 18:35:27
尊界和懂车帝就“踏板断裂”事件作出回应,尊界所提适用标准或犯“乌龙”

尊界和懂车帝就“踏板断裂”事件作出回应,尊界所提适用标准或犯“乌龙”

财闻
2026-10-09 00:20:59
快讯!蔡康永竟然跑到日本去了!

快讯!蔡康永竟然跑到日本去了!

故事终将光明磊落
2026-10-09 14:44:39
中国真正严重过剩的,根本不是工业品,也不是劳动力!

中国真正严重过剩的,根本不是工业品,也不是劳动力!

流苏晚晴
2026-10-08 18:27:54
没想到,负债累累的前夫黄有龙,竟给50岁赵薇留下“一手好牌”

没想到,负债累累的前夫黄有龙,竟给50岁赵薇留下“一手好牌”

妙知
2026-10-03 13:49:21
过分了!中国球员被美国强制拘留,或面临被遣返,篮协真该出手了

过分了!中国球员被美国强制拘留,或面临被遣返,篮协真该出手了

宗介说体育
2026-10-09 15:43:30
双色球26115期:“井喷”15注头奖,很多人以为一等奖都是500万

双色球26115期:“井喷”15注头奖,很多人以为一等奖都是500万

有态度的网友624
2026-10-09 09:06:52
同学聚会我没人理,当县长的好友进来直接走向我:这个位置得给你

同学聚会我没人理,当县长的好友进来直接走向我:这个位置得给你

白云故事
2025-07-12 17:10:03
同享福不共苦?张艺谋身体状况曝光,陈婷亲手取消张艺谋妻子认证

同享福不共苦?张艺谋身体状况曝光,陈婷亲手取消张艺谋妻子认证

阿废冷眼观察所
2026-10-09 15:15:09
男子炒股10年倾家荡产,如今妻子病重急需用钱,打开电脑后他傻眼

男子炒股10年倾家荡产,如今妻子病重急需用钱,打开电脑后他傻眼

罪案洞察者
2025-09-02 11:30:12
中共中央政治局委员、中央外办主任王毅会见太平洋岛国政治家联合考察团

中共中央政治局委员、中央外办主任王毅会见太平洋岛国政治家联合考察团

政知新媒体
2026-10-09 16:49:11
穆帅:姆巴佩就是骑了一下车,却被说得好像在参加环瑞士自行车赛

穆帅:姆巴佩就是骑了一下车,却被说得好像在参加环瑞士自行车赛

懂球帝
2026-10-09 16:25:18
爱泼斯坦案举报人上吊自杀!生前曾指证美商务部长

爱泼斯坦案举报人上吊自杀!生前曾指证美商务部长

环球时报国际
2026-10-09 08:03:44
断送补给47天 ,仁爱礁57号舰上菲军支撑不住了,开始有人紧急就医

断送补给47天 ,仁爱礁57号舰上菲军支撑不住了,开始有人紧急就医

光电科技君
2026-10-08 21:18:42
杜兰特:很高兴能在中国赛迎来欧文的复出之战 期待与他同场竞技

杜兰特:很高兴能在中国赛迎来欧文的复出之战 期待与他同场竞技

北青网-北京青年报
2026-10-09 09:05:14
“乡下父母全是这样被骗的”,中职女孩穿廉价警服,过来人说实话

“乡下父母全是这样被骗的”,中职女孩穿廉价警服,过来人说实话

番外行
2026-10-09 09:40:45
真是把“贪”字刻脑门上了!男子花钱与陪酒的公主开房,一次不够要求再来一次,公主妥协答应后,男子又得寸进尺!

真是把“贪”字刻脑门上了!男子花钱与陪酒的公主开房,一次不够要求再来一次,公主妥协答应后,男子又得寸进尺!

王老师你还好吗
2026-10-09 03:12:24
两家孩子:一个严格禁手机,一个随便玩,五年之后,差距一目了然

两家孩子:一个严格禁手机,一个随便玩,五年之后,差距一目了然

育儿教育日记
2026-10-08 00:45:57
刘丁硕疑似质疑中国乒协:我们花钱挨骂!赢了是球迷,输了就成饭圈了

刘丁硕疑似质疑中国乒协:我们花钱挨骂!赢了是球迷,输了就成饭圈了

念洲
2026-10-09 11:34:16
乌克兰抓住把柄了!韩国竟然秘密向俄罗斯运送燃料

乌克兰抓住把柄了!韩国竟然秘密向俄罗斯运送燃料

独舞独舞
2026-10-09 09:30:30
2026-10-09 22:03:00
量子位 incentive-icons
量子位
追踪人工智能动态
13460文章数 176581关注度
往期回顾 全部

科技要闻

华为小米手机同日涨价,最高涨1000元

头条要闻

新人结婚主持人发现礼炮塞满纸钱和骂人纸条 新郎发声

头条要闻

新人结婚主持人发现礼炮塞满纸钱和骂人纸条 新郎发声

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

时隔12年,公募基金运作办法修订

汽车要闻

舒适体验全面升级/四驱版续航超700km 理想i6将于10月28日上市

态度原创

艺术
亲子
家居
本地
公开课

艺术要闻

巴斯奇亚24岁画的《古代科学家》,7697.5万!

亲子要闻

怪有意思的!为啥胎梦里面,蛇出场的频率这么高?网友:涨见识了

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

转型再出发 奋勇打头阵

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版