网易首页 > 网易号 > 正文 申请入驻

横扫四榜,DM0.5 凭什么面面俱到?

0
分享至


单科冠军不够,具身智能落地需要没有结构性短板的底座

作者丨邓哲敏

编辑丨齐铖湧

一个模型同时占据四个能力子榜单的榜首,这在具身智能行业里不多见。

RoboColiseum 是由智元机器人发起,联合高校、科研机构、开源社区及机器人企业共同建设的评测平台,它把评测拆成四个维度:指令跟随、空间理解、扰动适应、通用操作。参评者只要在任何一个维度上有结构性短板,就会在对应的子榜上掉下来。

而原力灵机的通用具身基础模型 DM0.5 在四个子榜上全部排名第一,且目前是唯一做到这一点的模型。


AI科技评论想知道,这张成绩单有多可信?DM0.5 又凭什么霸榜?

01


一把可信的尺子

演示效果和真实场景之间存在差距,这在机器人行业早不是什么新鲜事。普通商品尚有卖家秀与买家秀之别,遑论技术尚未成熟的具身智能。因此,模型越是层出不穷,行业就越需要可信赖、细颗粒的公共标尺,帮助挑选出真正的强者。

然而现实并不乐观,AI科技评论观察到,具身评测行业长期存在几个痛点,让分数的可信度打了折扣。

第一个痛点,是仿真跑分高、真机落地差。仿真环境里的物理参数、视觉渲染和真实世界相差甚远,模型在仿真里得了高分,搬到真机上可能是一塌糊涂。市面上大部分仿真评测基准并没有做系统的真机-仿真对比实验,更没有公开结果。

针对 Sim2Real 的一致性问题,RoboColiseum 负责人吴墨告诉AI科技评论,平台通过空间智能技术在仿真环境中高保真重建真实世界,配合激光雷达还原几何信息,再对物体的质量、重心、碰撞几何、动静摩擦力、转动惯量,以及机器人本体的相机内外参、刚度阻尼、末端控制响应等物理参数逐项校准。最终验证结果显示,仿真与真机的模型表现一致性达到89.5%,单个任务的成功率差异均小于10%

第二个痛点,是评测基准生命周期短。具身模型迭代太快,一套榜单推出后半年,头部模型就把分数堆满了,无法再区分好坏。“刷榜”现象在大语言模型领域早有端倪,原本被设计为终身学习的 LIBERO,从发布到被刷穿,只坚持了不到三年。

RoboColiseum 现有 78 个评测任务、超过 3000 个泛化 case,训练集和评测集完全隔离,评测集对每个任务都做了充分的泛化配置,让轨迹回放类方案彻底失效。

第三个痛点,是单点能力强不代表真实场景好用。行业里不少评测基准的设计,本质上是在考一道题——把模型在某个原子能力上压榨到极限,然后把这个数字当成模型能力的代理指标。这种评测逻辑在能力单一、任务简单的早期阶段是够用的。但问题在于,真实场景的任务几乎没有一个是单科题。工厂里的分拣机器人,要同时听懂调度指令、判断传送带上包裹的空间位置、应对随机摆放姿态的干扰,最后把一系列原子动作组合成完整的操作流程。单点能力强的模型进了真实场景,这边表现不错,那边掉链子,整体任务完成率依然惨淡。

而 RoboColiseum 围绕四个维度展开评测,分别对应机器人在真实世界中完成任务所需要的能力分层:指令是基础,空间是认知,扰动是鲁棒,操作是落地。从语义到物理,从感知到执行,构成了一套相对完整的考察链条。

02


四榜同时第一,远比单项第一难

在四大子榜单上,原力灵机 DM0.5 以指令跟随 0.8444、空间理解 0.6146、扰动适应 0.7344、通用操作 0.6370 的成绩,全部排名第一。

四榜同时第一比单项第一难得多,因为这四个维度考的是不同层次的能力,彼此之间并不互相加持。一个记忆能力超强的模型,未必能在空间理解上占优;擅长执行精细操作的模型,未必在扰动适应上稳得住。四个子榜,相当于对模型做了四次独立考核,任何一个短板都会直接体现在对应的排名上,无法被其他维度的优势掩盖。这也是为什么行业里单项能力突出的模型并不少见,但能同时在多个维度维持领先的模型极少。

我们仔细研究了 DM0.5 的架构和数据源,每个维度上都有具体的技术支撑。

指令跟随方面,DM0.5 在预训练阶段设计了具身思维链: 动作生成之前,模型要先走完一套内部推理流程——目标物体在哪、上一步干了什么、这步该不该结束、不这么干会怎样。11 项推理任务覆盖任务规划和动作生成两个层面,逼模型理解“指令×本体×环境”三方的关系,而不是背答案。这一层预训练能力沉淀下来之后,DM0.5 展现出 zero-shot 级别的泛化——在没有见过的任务配置上,仍然能应对多样的动作组合和语言条件约束。

空间理解方面,DM0.5 的预训练数据包含 10 万小时 Egocentric 视频,并基于这些数据支持毫米级精度的 3D 空间标注生成。这意味着模型在预训练阶段就在大规模地学习从第一视角理解三维空间,而不是事后用有限的机器人操作数据“打补丁”。

我们注意到,原力灵机与天津大学、清华大学合作的论文《GeoVLA: Empowering 3D Representations in Vision-Language-Action Models》入选 IROS 2026 认知机器人最佳论文奖提名,核心工作正是把三维几何表征显式引入 VLA 模型的决策过程——让模型不只在二维图像空间里做判断,而是在具有深度、距离和几何关系的三维世界里理解场景。


扰动适应和工业落地最直接相关,这方面,DM0.5 靠两件事兜底。一是推理速度:通过多项工程优化,模型核心延迟从 534 毫秒压到 57.49 毫秒,9.29 倍加速,同时在 2000 个 LIBERO 测试 episode 上成功率几乎无损(98.45% 降至 98.40%)。人眨一次眼约 100 到 150 毫秒,DM0.5 的“感知-思考-出手”全流程比眨眼还快,干扰发生的瞬间,模型已经完成了重新感知和决策。二是原生 60 秒记忆:即使任务被中断,模型知道刚才做到哪里了,能够续接而不是从头来。

通用操作方面 ,考的是在前三项能力全部就位之后,把原子技能有效组合完成完整任务序列的能力。物流分拣场景里,DM0.5 不依赖预设脚本,纯靠实时视觉识别和决策,平均 3 秒一件,准确率超 99%;亚毫米积木拼装场景里,出现接错时能自主感知失败,半秒内调整姿态重新抓取纠错,每 12 秒完成一次拼装,全天候无间断;灵巧手场景里,DM0.5 配合后训练,控制带有 58 个自由度的灵巧手完成切黄瓜、削黄瓜等厨房任务——柔性物体形状随机、易滚动,传统工业机器人靠预设轨迹根本无法应对,只能让底座模型实时感知、实时决策。

03


底座模型能力的直接检验

第一的获取方式,值得拿出来单独说。

DM0.5 在 RoboColiseum 上的路径是:强大的预训练底座,没有针对评测任务做专项优化,只是通过常规监督微调将模型能力迁移到了 RoboColiseum 的机器人构型和任务上,完成从底座到榜单任务的适配。


这个细节的意义在于,它让这份成绩更接近对底座模型真实能力的测量,而不是对评测优化技巧的测量。

额外对齐并非没有价值,但在具身领域,这类介入往往意味着模型开始针对特定的任务做定向优化。这种优化在某些场景下效果显著,但也容易让模型的泛化能力下降——在训练分布内表现优异,出了分布就掉价。

DM0.5 靠 SFT 就能登顶,说明它的预训练底座在指令理解、空间感知、历史记忆和动作生成上,已经形成了足够坚实的通用能力基础。这种通用性,才是支撑它在不同评测框架下都能维持领先的根本原因。

04


其他维度的佐证

原力灵机并非第一次拿到这样的好成绩。

上个月,DM0.5 刚刚登顶 RoboDojo——由香港大学多媒体实验室联合 UC 伯克利、清华大学等全球近 20 所顶尖机构共同发起的权威评测基准。AI 科技评论当时专门做了一篇深度分析,重点在于 Memory 维度。DM0.5 在记忆维度上取得 47.74 分和 47.44% 的成功率,而第二名只有 13.37 分和 12.11%——得分差了 3 倍多,成功率差了接近 4 倍。


如果说 RoboDojo 是一次横向比较,那么 DM0.5 在其他评测基准上的纵向成绩,则构成了另一条佐证线索。在真机与仿真评测中,LIBERO 综合成功率达到 99.0%;RoboTwin 2.0 简单和复杂场景下成功率分别为 93.6% 和 93.3%;VLA-Arena 三档难度下依次为 89.0%、53.6%、44.1%;导航场景仿真测试中,R2R 和 RxR 的 Val-Unseen 成功率分别达到 59.7% 和 65.5%,相比所有基线方法均取得显著优势。真机评测 RoboChallenge Table30 V2 里,面对 ARX5、UR5、ALOHA、Dexmal-Mirror 四种异构机型、30 个复杂任务,DM0.5 以 43.0% 的整体成功率、54.42 的综合得分同样位列第一。



跨越仿真与真机、覆盖操作与导航、兼容单一机型与多种异构构型,这些数字共同指向同一个结论:DM0.5 的成绩并非依赖某一个场景或评测框架的特殊适配,而是在多个独立的考场上反复被验证过的。

第三个佐证来自国际同行的引用。Physical Intelligence(π)在两次关键输出中,都将原力灵机的 MemoryVLA 纳入了学术参照系:一次是发布具身记忆架构论文 MEM(Multi-Scale Embodied Memory for Vision Language Action Models),一次是将 MEM 的理念落地为旗舰产品 π0.7。


MemoryVLA 受认知科学中工作记忆与海马体双机制启发,提出感知-认知记忆库,构建了一套面向动作控制的双流 latent memory 机制。PI 在大脑和小脑的全局视角定义问题,而 MemoryVLA 则在小脑记忆这条路径上给出了一套经过大规模实验验证的完整方案。两者是独立探索、方向趋同,这大概是 PI 连续两次引用的原因。

05


推理提速、全面开源、真机落地

DM0.5 目前的状态,可以用三件事来描述。

第一件:推理速度进入实时控制的时间窗口。通过 Vision TensorRT、Tuned FlexAttention、FP8 E4M3 Tensor Core、Triton 融合算子和 CUDA Graph 的联合优化,DM0.5 的模型核心延迟从 534 毫秒压到 57.49 毫秒,API 响应控制在 70 毫秒内(p50 67.75 ms,p90 70.01 ms),累计加速 9.29 倍,延迟降低 89.2%。整套 VLA 推理系统快了一个数量级,大模型的智力第一次跑进了实时控制要求的时间窗口。


第二件:全面开源。DM0.5 模型权重、训练框架,以及从 LIBERO、RoboTwin 2.0 到 RoboChallenge、真机 SO101 的多个下游任务完整工作流,已陆续在 GitHub 和 Hugging Face 上开放,核心代码也提交给了 LeRobot 社区。这个选择的背后有一个值得关注的行业逻辑:具身智能目前最缺的不是哪家公司独占一切,而是一个经过全科验证的公共底座。一个全科有效的底座开源出来,开发者可以把有限的资源用在特定场景的微调和落地上,而不必从零开始验证架构是否可靠。国际电信联盟(ITU)具身智能焦点组首次线下会议上,原力灵机当选了“开源生态”工作组组长单位。

第三件:真机落地持续推进。原力灵机已 在多个真实场景中部署测试:大型国际零售商仓储中,多台搭载 DM0.5 的机器人正与其他类型机器人协同作业,完成商品搬运与分拣;大型 3C 制造商工厂里,搭载 DM0.5 的机器人正配合生产线进行包装和废料回收。从榜单到工厂,这是评测成绩在真实世界中被验证的下一步。


06


全科优秀,才是真正的通行证

RoboDojo 和 RoboColiseum,一个由顶级学术机构操持,一个由产业机构主导;一个侧重记忆、长程执行和开放语义,一个侧重指令理解、空间认知、鲁棒性和操作组合。两套体系的出题逻辑几乎没有刻意对齐,但 DM0.5 在两个考场上都站在了最高处。

具身智能的评测体系还在建立中,行业至今没有一个像大语言模型那样被普遍接受的权威基准。在这个标准尚未收敛的阶段,能在多个不同方向的严格评测上都稳在第一梯队,含金量反而比刷穿某一套题更重。因为它证明的是,在标准统一之前就已经做好了应对任何标准的准备。

AI 科技评论之前写道,“全科优秀,才是进入百万小时时代的必要条件,每门课都没有结构性漏洞,数据才会真正转化为能力。”这句话说的是数据 Scaling 的前提。而现在看来,它同样适用于落地:工厂要求鲁棒性和节拍,家庭要求语义理解和精细操作,仓储要求长程稳定性,没有哪个真实场景会迁就你的短板。一个能力有结构性漏洞的模型,在某一类场景里可能跑得不错,但很难真正跨越到普适落地。

这也是为什么四榜同时第一,比任何一个单项冠军都更值得关注。只有整个能力谱系足够宽、足够均衡,才能同时承接真实世界里多样的任务要求。

物理世界的智能,靠单科状元是不够的。行业最终需要的,是能经得住不同考 场、不同考官、不同考题的长期答题者。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
克洛普:我愿为球员赴汤蹈火;两年多没带队训练,还好没生疏

克洛普:我愿为球员赴汤蹈火;两年多没带队训练,还好没生疏

懂球帝
2026-09-23 20:20:13
美国中将公开承认:打完伊朗,我才看清中国到底有多强大!

美国中将公开承认:打完伊朗,我才看清中国到底有多强大!

果妈聊娱乐
2026-09-17 08:20:56
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
斯诺克官宣!丁俊晖领衔,3大TOP16缺席,中国军团10人直通正赛!

斯诺克官宣!丁俊晖领衔,3大TOP16缺席,中国军团10人直通正赛!

刘姚尧的文字城堡
2026-09-23 08:36:19
2-0! 王欣瑜强势晋级16强, 中国网球1日2大喜讯! 郑钦文最新动态更新

2-0! 王欣瑜强势晋级16强, 中国网球1日2大喜讯! 郑钦文最新动态更新

云隐南山
2026-09-23 02:19:02
突发!陈冠希的新瓜,有点料!

突发!陈冠希的新瓜,有点料!

财经要参
2026-09-23 07:56:49
泽连斯基被曝与美国中央情报局局长在机场会面,知情人:两人在飞机加油期间进行了非正式交谈

泽连斯基被曝与美国中央情报局局长在机场会面,知情人:两人在飞机加油期间进行了非正式交谈

极目新闻
2026-09-22 10:22:09
不许降落加油!美国“掐断”伊朗全球航线

不许降落加油!美国“掐断”伊朗全球航线

凤眼论
2026-09-22 19:34:42
战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

体娱一家亲
2026-09-23 17:08:01
高圆圆在播客中首谈死亡:已和赵又廷商量好谁先走,理想告别是提前整理好东西不给孩子留麻烦

高圆圆在播客中首谈死亡:已和赵又廷商量好谁先走,理想告别是提前整理好东西不给孩子留麻烦

一盅情怀
2026-09-03 11:23:06
绝绝紫!凯特王妃出席首映礼,解锁了一条压箱底近百年的项链

绝绝紫!凯特王妃出席首映礼,解锁了一条压箱底近百年的项链

不太爱笑的小羊
2026-09-23 13:11:15
女儿为给发热父亲降温,用干冰直接敷在其身上,导致全身多处“冷烧伤”,医生:如同拿烧红的烙铁往皮肤上贴

女儿为给发热父亲降温,用干冰直接敷在其身上,导致全身多处“冷烧伤”,医生:如同拿烧红的烙铁往皮肤上贴

扬子晚报
2026-09-23 07:31:22
刘强东拿下张雪机车,震动行业!

刘强东拿下张雪机车,震动行业!

互联网品牌官
2026-09-23 11:50:56
财政部为什么是党组、公安部为什么是党委?

财政部为什么是党组、公安部为什么是党委?

画生笔记
2026-09-20 09:10:50
公务员严查再升级!这5类行为,纪委查到一起处理一起!

公务员严查再升级!这5类行为,纪委查到一起处理一起!

职场资深秘书
2026-09-23 12:28:40
苹果“最建议买”的3款手机,性能强不卡顿,能用到2032年

苹果“最建议买”的3款手机,性能强不卡顿,能用到2032年

小柱解说游戏
2026-09-23 00:30:51
陈妍希回应一天只吃一顿:白天喝咖啡能维持比较清醒的状态,晚上跟朋友约饭,是比较适合自己的方式;医生提醒:减肥不能以牺牲健康为代价

陈妍希回应一天只吃一顿:白天喝咖啡能维持比较清醒的状态,晚上跟朋友约饭,是比较适合自己的方式;医生提醒:减肥不能以牺牲健康为代价

台州交通广播
2026-09-22 12:00:00
随着中国男足0-0,朝鲜4-1伊朗,最终排名大反转:中国队变大赢家

随着中国男足0-0,朝鲜4-1伊朗,最终排名大反转:中国队变大赢家

大秦壁虎白话体育
2026-09-23 15:25:22
热议亚运男足小组第一出线:安东尼奥就是可以拿到想要的结果

热议亚运男足小组第一出线:安东尼奥就是可以拿到想要的结果

懂球帝
2026-09-23 16:49:54
“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

世界圈
2026-09-14 15:05:05
2026-09-23 20:35:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

教育
本地
手机
公开课
军事航空

教育要闻

2026想给孩子报记忆力培训班?隆成义最强大脑特训营口碑推荐

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

手机要闻

天玑9600 Pro更聪明的GPU 领跑手机光追、超分、插帧游戏体验

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版