网易首页 > 网易号 > 正文 申请入驻

具身智能“高考”难疯了!人类100分,最强模型12.8

0
分享至

通用机器人这座山,到底有多高?

过去一年,VLA、机器人基础模型、世界模型轮番登场。

一个个demo看起来越来越丝滑:叠碗、插管、收纳、倒水、整理桌面,机器人似乎终于开始听懂人话、理解世界、动手干活。

但问题是:这些模型到底谁更强?强在哪里?能不能从仿真走到真实世界?离真正的通用操作机器人,还有多远?

现在,一个新的“登山路线图”来了。

曾推出RoboTwin系列基准的原班团队,又带来了RoboDojo:一个统一的仿真+真实世界机器人操作评测基准。

Website: https://robodojo-benchmark.com/
arXiv: https://arxiv.org/abs/2607.04434
Leaderboard: https://robodojo-benchmark.com/LeaderBoard
Benchmark code: https://github.com/RoboDojo-Benchmark/RoboDojo
XPolicyLab code: https://github.com/XPolicyLab/XPolicyLab
Community: https://robodojo-benchmark.com/community

它不只是又一个benchmark,而更像是给具身智能立了一座“珠峰”:

42个仿真任务,18个真实机器人任务,30个主流机器人策略同台竞技,覆盖泛化、记忆、精细操作、长程执行、开放语义理解五大能力。

结果很直接,也很残酷:

当前最强通用机器人策略,在仿真平均成功率也只有8.80%。到了真实世界,最好模型平均成功率也只有12.8%

而人类专家呢?仿真里是76.03%,真实世界是100%

机器人基础模型们看起来已经开始攀登具身珠峰,但RoboDojo的榜单显示:它们大多还在山脚适应高反。

先看任务设计:这座山为什么难?

RoboDojo的难点,不在于简单堆任务数量,而在于它把机器人操作能力拆成了一组更接近真实世界的“登山关卡”


在仿真环境中,RoboDojo设计了42个任务,围绕五个核心能力展开:

  • Generalization,看模型能不能适应新背景、新光照、新物体和复杂杂乱场景。

  • Memory,看模型能不能记住之前看到的信息,并在后续动作中用上。

  • Precision,看模型能不能完成插入、对齐、精确接触等高精度操作。

  • Long-Horizon,看模型能不能完成多步骤、强依赖、误差会累积的任务。

  • Open,看模型能不能理解没见过的开放语义指令,并把语言目标变成动作。


这些任务不是简单的pick-and-place变体。

比如在泛化任务中,桌面杂物最多可随机到25个,背景、光照、物体外观和布局都会变化;

记忆任务中,机器人需要记住传送带上曾经出现又消失的物体,再从后续候选物中选出匹配目标;

精细操作任务中,机器人要完成插管、对齐、插入等高容错要求动作,稍微偏一点就会失败。

长程任务则更接近真实家务:机器人不是做一个动作,而是要连续完成多个子步骤。拿起、移动、交接、对齐、放置,每一步都可能引入误差,而误差会一路累积到最后。

但RoboDojo没有停在仿真里。

真正让这座“具身珠峰”变高的,是它还把评测搬到了真实机器人上。


RoboDojo设计了18个真实世界任务,覆盖ARX X5、Piper、Piper X三种双臂机器人平台,每个平台各6个任务。

这些任务不是仿真任务的一一复刻,而是专门用来考察机器人在真实物理世界中的部署能力。

比如ARX X5上有盖积木、做面包、制作食物、装水果并倒出、保险箱收纳、插管等任务;Piper上有堆叠并盖住积木、填笔筒、把物体放进篮子、插充电器、叠碗、扶正瓶子等任务;Piper X上则包括物体分类、拆乐高、挂杯子、把物品装进背包、清扫积木、盖笔帽等任务。

这些任务听起来都很日常,但对机器人来说并不简单。

因为真实世界里每一步都带着物理不确定性:物体可能滑动,夹爪可能没夹稳,机械臂可能有微小延迟,相机可能有噪声,接触瞬间可能把目标推偏。

更重要的是,RoboDojo-RealEval对真机评测做了标准化:统一硬件配置、工作空间布局、光照条件、场景复位流程、评测协议和部署接口。

每次测试前,评测人员会根据预设布局复现场景;每个trial还会由三名评审双盲打分,既看最终成功,也看中间步骤完成情况。


也就是说,RoboDojo的真机部分不是“拍几个demo视频”,而是把真实机器人操作变成了一套可复现、可比较、可远程接入的标准化考试

换句话说,RoboDojo不是只在仿真里问机器人“你会不会做题”,还在真实世界里追问:换一台机器人还稳不稳?真实接触来了会不会抖?物体偏一点还能不能修正?任务做到一半出错会不会恢复?离开仿真训练场,还能不能继续爬山?

这才是“具身珠峰”的真正含义:不是单点能力登顶,而是仿真诊断和真实部署两条路线都不能掉链子

榜单一出,差距摆上桌面

RoboDojo最核心的部分,是它的公开排行榜。

这也是它和很多“自家模型自家测”的评测不同之处:

RoboDojo由全学术机构联盟发起和维护,背后没有商业模型方利益绑定,榜单治理则由公益性组织AI MMLab Club基金会负责。

换句话说,这座“具身珠峰”不是某家公司给自己修的观景台,而是面向整个社区开放的一条公共登山路线

在仿真榜单中,团队集成并评测了30个代表性机器人操作策略,包括Hy-Embodied-0.5-VLA、Spatial Forcing、π0.5、X-VLA、GR00T-N1.7、π0、OpenVLA-OFT等。


榜单第一是Hy-Embodied-0.5-VLA,平均分13.07,平均成功率8.80%。

紧随其后的是Spatial Forcing、π0.5、X-VLA等模型,但整体表现依然处在很低区间。

即便是领先模型,在五大能力维度上也没有一个真正“全能”。

有的模型泛化更强,有的精细操作更稳,有的长程任务能多推进几步,但一旦拉到完整榜单上看,短板就非常明显。

RoboDojo的一个关键信息是:今天的机器人模型不是不会动,而是不够稳;不是完全不会做任务,而是很难稳定做完任务

很多策略可以完成部分步骤,但最终成功率很低。

比如长程任务里,机器人可能已经拿起物体、移动到目标附近,却在最后对齐、插入、放置或恢复阶段失败。

这也是具身智能和纯语言、纯视觉任务最大的不同:在物理世界里,差一点就是失败。

真实世界榜单更扎心

如果说仿真还是“训练场”,真实机器人就是“珠峰实地”。

真实世界榜单里,表现最好的模型是π0.5,总体成功率12.8%,平均分22.9。


头部梯队包括InternVLA-A1、GalaxeaVLA、Xiaomi-Robotics-0、X-VLA等,但整体成功率依然只有个位数到十几个百分点。

这说明一个非常关键的问题:仿真里相对靠前,不代表真实世界里一定稳。

真实机器人会引入额外困难:相机噪声、标定误差、机械臂延迟、接触不稳定、动作抖动、安全边界、物体初始位置微小偏差。这些东西在demo视频里常常看不见,但在标准化评测中会集中暴露。

RoboDojo的意义也在这里:它不是只问“机器人有没有做成功”,而是在问:

这个策略能否在仿真中通过全面性考察,同时在现实世界中能够直面挑战?


为什么说这是“具身珠峰”


从结果看,RoboDojo暴露出一个很现实的判断:当前机器人基础模型的能力增长并不均衡。

有些模型可以更好地识别目标,有些模型可以更顺畅地执行动作,有些模型在长程任务中能推进更多步骤。

但真正的通用机器人,不能只在某一个能力维度上强。

它既要看得懂,也要记得住;既要规划对,也要手上准;既要能处理熟悉任务,也要能理解开放指令;既要在仿真里跑通,也要在真实机械臂上稳定执行。

而RoboDojo的实验结果显示,今天的模型在这些维度上仍然存在明显短板。

最典型的是Open任务。即使最强模型,在开放语义任务上的成功率也只有约1.67%

这意味着,当前机器人基础模型距离真正“听懂人话并可靠干活”还有明显距离。

它们可以在熟悉任务上模仿,但面对新目标、新语义、新组合时,语义理解、视觉定位、技能选择和动作执行这条链路仍然很脆。

这正是具身珠峰的难点:不是单点能力登顶,而是所有能力都不能掉链子。

不只是评测,还是一套基础设施

RoboDojo还有两个重要组成部分。

一个是异构并行仿真

传统仿真并行往往是在复制同一个场景,只改初始位置;RoboDojo支持不同任务、不同物体、不同布局同时跑,大幅提升评测效率。

另一个是XPolicyLab

它相当于RoboDojo背后的“统一接入层”,专门用来解决机器人策略评测中一个很现实的问题:不同模型往往有不同的数据格式、预处理流程、训练脚本、动作表示和部署环境,想放到同一张榜单上公平比较,工程成本非常高。


XPolicyLab做的事情,就是把这些外部流程标准化。

它提供统一的数据转换、训练模板、部署流程和评测脚本,同时保留各个策略本身的模型结构和实现方式。

这样,不同机器人策略只要接入统一的observation-action接口,就能在RoboDojo的仿真环境和RoboDojo-RealEval真机平台上运行。

这次论文中,团队已经通过XPolicyLab集成了30个代表性机器人操作模型。

对于研究者来说,这意味着模型可以“一次接入,多处评测”:先在仿真中快速迭代、诊断能力短板,再部署到真实机器人上接受标准化测试。

也因此,RoboDojo不只是论文里的静态benchmark,而是一个可持续更新的具身智能竞技场

模型可以不断上榜,任务可以持续扩展,真实机器人评测也可以远程接入。

对于机器人基础模型领域来说,这很重要。

因为在通往通用操作机器人的路上,大家不仅需要更大的模型、更酷的demo,也需要一套能反复衡量进步的“海拔尺”。

具身智能,终于有了更高的山


过去,机器人领域常常被demo驱动。

一个模型能完成几个漂亮任务,很容易让人产生“通用机器人快来了”的错觉。

但RoboDojo给出的结论更冷静:当前模型确实在进步,但距离可靠、泛化、可部署的通用机器人操作,还差得很远。

这并不是坏消息。

恰恰相反,RoboDojo把问题摆清楚了:谁能泛化,谁会遗忘,谁动作抖,谁只会做一半,谁在真实世界掉队,谁能在榜单上往上爬。

具身智能终于不只是比拼宣传片,而是开始比拼标准化赛道上的真实成绩。

这座“具身珠峰”已经立起来了。接下来,就看谁先登顶了。

项目负责人介绍


陈天行,香港大学MMLab直博生,师从罗平教授。

在ICML、CVPR、ICLR、RSS等领域顶会发表论文十余篇,获多项顶会研讨会最佳论文奖、多项顶会学术竞赛冠亚军。

获红杉中国与《麻省理工科技评论》中国评选AI25(25岁以下AI创新青年先锋)、深圳大学特奖(学生最高荣誉)、CCF优秀大学生(全国99人)。

RoboTwin 2.0第一作者、头部具身开源社区Lumina创始人,开源项目累计获得GitHub近两万星。


陈越,北京大学硕士研究生,主要研究方向为三维视觉表征与机器人仿真。

迄今已发表CCF A类、CAAI A类高水平论文10余篇,多篇成果以Oral、Spotlight形式收录,相关工作获CVPR、IROS等国际会议研讨会最佳论文奖项。曾获评国家奖学金、北京大学三好学生荣誉。

未来扩展

RoboDojo团队后续还会持续输出灵巧操作、移动操作、触觉操作、人型全身操作等评测,欢迎大家持续关注。


文章来源:量子位。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
三观炸裂!翟欣欣出轨聊天记录流出,尺度大到咂舌,判12年都嫌少

三观炸裂!翟欣欣出轨聊天记录流出,尺度大到咂舌,判12年都嫌少

有范又有料
2025-09-29 14:21:11
民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

百科密码
2026-08-31 10:02:15
来不及了?中方接到消息,美国舍弃常规手段,要跟中国打不对等仗

来不及了?中方接到消息,美国舍弃常规手段,要跟中国打不对等仗

潘殤旅行浪子
2026-09-01 19:52:19
条件不匹配就别硬演特务头子!把黄觉和程煜、冯恩鹤放一块对比,差距真的太明显了

条件不匹配就别硬演特务头子!把黄觉和程煜、冯恩鹤放一块对比,差距真的太明显了

小椰的奶奶
2026-08-31 12:37:31
简约素净尽显高级,肯豆亮相威尼斯电影节机场氛围感拉满

简约素净尽显高级,肯豆亮相威尼斯电影节机场氛围感拉满

墨薷桃桃
2026-09-02 22:53:53
碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

赶鸭子上架
2026-09-02 12:37:08
谷爱凌亲身落场回应与孙宇晨绯闻 骷髅头表情回应「This is news to me」

谷爱凌亲身落场回应与孙宇晨绯闻 骷髅头表情回应「This is news to me」

新浪财经
2026-09-01 22:33:00
“词元通缩”发酵!Token支出指数创下历史新低 自峰值已腰斩

“词元通缩”发酵!Token支出指数创下历史新低 自峰值已腰斩

财联社
2026-09-02 16:16:24
景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

背包旅行
2026-08-31 10:01:31
韩国光州双年展恢复“台湾馆”名称,大陆艺术家集体撤展,国台办:台湾参与国际活动,必须按照一个中国原则来处理

韩国光州双年展恢复“台湾馆”名称,大陆艺术家集体撤展,国台办:台湾参与国际活动,必须按照一个中国原则来处理

政知新媒体
2026-09-02 13:03:33
英超转会窗关闭!头号夺冠热门诞生,总身价14.1亿,比曼城还豪华

英超转会窗关闭!头号夺冠热门诞生,总身价14.1亿,比曼城还豪华

小火箭爱体育
2026-09-02 11:30:29
40辆乌军发射车一锅端,泽连斯基没想到,竟是乌民众给俄报的信?

40辆乌军发射车一锅端,泽连斯基没想到,竟是乌民众给俄报的信?

浯江孤舟
2026-09-02 09:13:46
王菲母女三人包厢抽烟:养孩子,从来没有标准答案

王菲母女三人包厢抽烟:养孩子,从来没有标准答案

乡野异闻录
2026-09-02 12:09:14
拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

旧窗老街
2026-02-23 01:50:19
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

背包旅行
2026-09-01 11:59:13
孙宇晨向胡锡进开炮了

孙宇晨向胡锡进开炮了

凤眼论
2026-09-01 17:51:39
AI色情短剧平台化!50元包月,现未成年人内容与脱衣教程

AI色情短剧平台化!50元包月,现未成年人内容与脱衣教程

南方都市报
2026-09-01 09:48:15
大量美军死伤!伊朗发起猛烈反击,特朗普:把他们从地球上抹去

大量美军死伤!伊朗发起猛烈反击,特朗普:把他们从地球上抹去

大国之翼
2026-09-02 06:31:38
孙艺珍玄彬一家度假被偶遇,她这裤子真是瞎穿,难怪孔孝真说她土

孙艺珍玄彬一家度假被偶遇,她这裤子真是瞎穿,难怪孔孝真说她土

八怪娱
2026-09-02 16:04:34
核战争打不得,这一点芬兰总统提不提醒都得注意

核战争打不得,这一点芬兰总统提不提醒都得注意

新民周刊
2026-09-02 09:11:51
2026-09-03 01:03:00
算法与数学之美 incentive-icons
算法与数学之美
分享知识,交流思想
5743文章数 64625关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

星宇股份的麻烦,才刚开始

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

手机
旅游
家居
数码
军事航空

手机要闻

三天连着!OPPO、荣耀、vivo齐发布新款系统,到底谁会是最终选择?

旅游要闻

张昌平畅想AI数字漫游:从盘龙城直达三星堆 铸造青铜大立人|名人大讲堂

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

3497元!华为WATCH D3发布:血压监测再升级 运动前后都能测

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版