![]()
新智元报道
![]()
刚刚,国产人形机器人「大小脑」, 和Figure杠上了!
它就是国内初创公司德塔智能新发布的双足人形机器人基础模型,Delta 0。
比速度、比长程,它都不输Figure Helix,任务花样甚至更多。
国内能做到这一步的,目前只有它。
只见,装上Delta 0的人形机器人,优雅地给自己放了张黑胶唱片,跟着音乐摇摆。
也一口气把一屋子的脏活累活挨个干了一遍。
它先走到床边,一只手轻轻攥住被角往外一抖,被子瞬间平平整整。
![]()
地上躺着一只玩偶。它膝盖一弯,直接「丝滑下跪」,把玩偶捡起来后单脚一蹬利落起身,顺手一放,玩偶又回到了床上。
![]()
椅子上搭着的脏衣服,被它一把抄起,塞进了洗衣机。
![]()
洗碗机的门关得死紧,它一把拽开,把刚从餐桌上拿来的杯子稳稳放进碗架。
![]()
最后,它拉开冰箱拎出一个快烂掉的苹果,走到脚踏垃圾桶前一脚踩开桶盖,把苹果精准丢了进去。
![]()
活儿全干完,它一转身,结结实实瘫进了沙发。
![]()
前后3分钟全自主完成,行云流水,中间连一次磕巴都没打。
这台机器人的身体是市面上就能买到的通用款,所以看着轻松的每个动作,难度全压在了Delta 0身上。
手上力气不够,它就全身一起使劲
刚才它一把拽开的那扇洗碗机门,其实比你想象的沉得多。
德塔团队拿拉力计实测过,想拽开它,得用上大约5公斤的力。可这台机器人手臂的力气只有1.5公斤左右,门要的力是它的3倍还多。
力气不够,那就借力。
它压根没打算只靠胳膊硬拽。一只手撑住柜子,给身体找个支点,另一只手握住门把手,同时腰和腿猛地往后一坐,把全身的重量压了上去。门顺着铰链转开,它拉的方向也跟着一点点转。
![]()
踩垃圾桶的时候,它得先把全身重心压在一条腿上,再抬起另一只脚,精准踩下踏板。劲儿小了桶盖弹不开,劲儿大了身子就容易晃倒。
前一秒还在走路的脚,这一秒成了开盖的工具。
![]()
Delta 0分成大脑和小脑两层。大脑看画面、听指令,决定接下来做什么,小脑再把这些决定翻译成全身每个关节的动作。
刚才借力拉门、单脚踩桶的时候,手脚怎么配合、怎么保证不摔跤,全是小脑在实时微操。
它也没把身体拆成上下两半来管。从手指到脚尖,全身被放进同一个动作空间,一共69个自由度,身体占29个,两只手留了40个。上下半身一起学,所以胳膊没劲儿的时候,它懂得调动腰和腿来帮忙。
会使劲还不够,还得知道自己使了多大劲,拉门、踩踏板时才拿捏得住分寸。
Delta 0的办法是直接算,德塔管这叫力的「内生」。它想把手伸到A点,却被门挡在了B点,差得越远,关节往A点使的劲就越大,所以看这段差距,就能算出这股力有多大。
顺着这个思路,团队做出了纯算法的力位混合控制,控制手脚位置的同时,把接触时的受力一起管住,相关成果拿下了机器人顶会CoRL的最佳论文。
快,是从人身上「扒」下来的
拉门、踩踏板靠的是全身发力,到了铺床、放唱片这种活,比的就是手脚够不够快。
Delta 0干起活来一点不磨蹭,手脚连贯利索。
铺床的时候,被子又软又滑,一扯就变形。它脚下沿着床边挪,手上一刻没闲着。
放唱片也干净利落。它捏起唱片,掀开防尘盖,把唱片稳稳落到转盘上。
走向目标的路上,它的身体已经在调整姿势,手臂提前伸出去,到了地方直接开干。
从预训练开始,Delta 0吃的就是没有降过速的人类全身数据,人平时怎么干活,它就照葫芦画瓢怎么学。
![]()
人铺床时采下的全身数据
等到练具体活儿的阶段,数据改用遥操作来采。操作员直接拿自己的身体当遥控器,人弯腰它就跟着弯腰,所以人干活有多利索,采出来的数据就有多利索。
这是双足人形才有的便宜。它和人长得一样,人一边走一边干的数据,它能原汁原味地直接学。
光有猛料还不行,脑子也得跟得上。
Delta 0的大脑每秒刷新10到20次动作规划,每次都提前盘算好接下来的一串动作,边做边想,不会做完一步停下来发呆。
小脑每秒至少执行50次,过了100次就很顺滑,团队内部已经跑出了500次的版本。
德塔还放了句狠话,以后发出来的画面,得按0.5倍速放,不然人眼根本看不清动作细节。
超长程任务,靠提前预演和自己纠错
连着干一串家务,磨人的地方就在衔接。
上一件事做完时身子停在哪、手里攥着什么,直接决定了下一件事从哪起步。
它从餐桌上端起杯子走到洗碗机前,先把杯子搁在旁边的台面上,腾出手去拉那扇沉门,等门开了,再把杯子拿起来放进去。
![]()
要是死攥着杯子不放,门根本拉不开;杯子搁得太远,门开了又够不着。
这一镜里的活儿,拆开是一长串动作。假设要连做30步,就算每一步都有95%的把握,一口气全做对的概率也只有两成出头。
Delta 0能把这一长串动作丝滑地串起来,先靠一个会提前「脑补」的大脑。
这个大脑是一个隐式世界-动作模型。身体动起来之前,它会先在脑子里把接下来的画面预演一遍。预演发生在模型内部的特征里,并不真的把画面画出来,所以叫「隐式」。
模型内部分了三路,分别处理眼前的画面和指令、预测未来的画面、规划全身动作,三路随时互通消息。
整段任务的指令只给大方向,比如这一段铺床,下一段捡玩偶。两段之间怎么接,全靠Delta 0自己补上。
光会脑补还不够,现实里意外多得是,出了岔子还得自己兜得住。
一把没抓稳,它会自己再抓一次。有人故意使坏,把垃圾桶盖按了回去,它就再踩一次,而且这次踩得比上次还用力。
整个过程,不需要有人冲上去帮它复位。
![]()
这些临场应变,不少都没人专门教过。人拉不开门会下意识用身子顶一下,这种本能早就藏在海量的人类数据里,Delta 0在预训练时一并学了过来。
换一套从没见过的彩色灯光,它照样能把杯子放进洗碗机。
![]()
能做完还不够,还得每次都做得完。
这得靠在真机上反复练。双足人形的大脑和小脑是两套独立的网络,过去想一边让它跑、一边纠正它,一直是个老大难。
Delta 0想了个巧招,把大小脑之间的指令改成了「增量动作」,每次只告诉小脑,在现在的姿势上再挪一点点。
于是人随时可以插手,在它快出错的那一瞬间直接把动作掰正,这段被掰正的轨迹,当场就变成了训练数据。这就是人在回路学习(Human-in-the-loop)。
![]()
抓杯子快出错时,人接手纠正
再配上一个价值模型,随时估算离干完还差多远,进展大的动作多学,往回退的少学。
洗碗机抓杯子这件事,只用遥操作数据训练时,20次只能成4次。在真机上练了一轮,成功率飙到50%,再练一轮,直接干到了65%。
当然这还远远不够,德塔团队表示,最终的目标是接近完美的成功率。
![]()
价值曲线,失手时往下掉,纠正后又拉回来
学出来的小脑,没练过也做得准
人脑里,大约80%的神经元都长在管运动的小脑里。
所以德塔认为,人形机器人的小脑也不能靠手写规则死磕,得靠数据「喂」出来,还得能越长越大。
Delta 0的小脑,就是一个纯靠学习练出来的全身控制器。
大脑下发一组「运动关键点」,可以理解成对人体骨骼的一种抽象表达,小脑稳稳接住,瞬间拆成全身几十个关节的协同动作。人遥控它的时候,走的也是这同一套关键点和同一个小脑。
为了验证小脑的效果,团队找来四个公开的全身控制器,其中就有英伟达开源的SONIC,拉着它们做了一场零样本「裸考」。501段日常动作、约3.5小时,全都没练过,直接上场。
![]()
全局位置误差(米,越低越好)。零样本测试,各家仿真配置不同。
![]()
身体位置误差(毫米,越低越好)。零样本测试,各家仿真配置不同。
Delta 0的全局位置误差只有0.106米,SONIC是0.165米;身体各部位的位置误差上,Delta 0是16.73毫米,SONIC是22.58毫米,两项都是五家里最低。
为了喂饱大小脑,德塔干脆自己下场采数据。
他们自研了头戴式全身全景数采设备D1,人戴上它正常走路干活,第一人称画面、全身骨骼动作连同手指上的细节,都能一样不落地记下来。
![]()
按团队的计划,年底前要攒够10万小时这样的全身数据。
清北UCLA王牌组合
补上AGI的物理拼图
做出Delta 0的,是一支清华加UCLA背景的王牌团队。
德塔智能今年1月才成立,由北京通用人工智能研究院孵化。
创始人兼CEO马晓健,本科毕业于清华计算机系,在UCLA拿到计算机科学博士。
回国前,他在Google DeepMind、英伟达研究院做机器人学习研究,之后又在通研院主导具身基础模型等项目。
联合创始人兼首席科学家黄思远,本科读的是清华自动化系,博士毕业于UCLA统计学专业。
他曾在DeepMind和Meta做前沿研究,现在还兼任通研院具身机器人中心主任。前面那套纯算法的力位混合控制,就出自他提出的理论。
联合创始人刘航欣,本科毕业于美国弗吉尼亚理工大学,在UCLA拿到机械工程硕士和计算机科学博士,现在是北京大学智能学院助理教授。
他曾任通研院研究员、机器人实验室主任,牵头完成过多个人形机器人在工业和特种场景里的应用交付,还主导研发了全手视触觉灵巧手F-TAC。
他的论文登上过《Science Robotics》《Nature Machine Intelligence》等顶刊。
成立半年,德塔就完成了六轮融资,最新一轮天使++轮近5亿元。
乐聚、智元、星海图几家机器人本体厂商,也成了它的战略投资方。
![]()
在马晓健看来,能源、基建这类高危场景,未来一两年就会迎来一波集中落地。
这套逻辑,马斯克其实早就讲过。他一直想让Optimus比人类先登上火星。
![]()
让机器人打头阵,是因为火星太要命,送人上去风险和代价都高得吓人。机器人得自己深一脚浅一脚地走到地方,到了还得上手干活,所以最合适的就是人形。
德塔看来,不用扯那么远,地球上就有不少「火星」。
高压电站、井下巷道、海上平台都是,脚下到处是台阶,门口还有几十公分高的挡鼠板,里面的阀门和开关却全是照着人的身高和手型设计的。
这些活人也能干,但风险高、环境恶劣,交给一个能自己走进去、使得上劲的人形机器人最合适。
据报道,今年光是人形带电作业机器人,国家电网就计划采购500台。
One More Thing
德塔给自己的定位是,要做就做全栈。
在他们看来,大模型擅长的是数字世界里的符号推理,通往AGI,还差物理世界这一块拼图。
一个懂物理、能迁移到不同机器人身上的大脑,配上一个懂得借力和接触的小脑,再让两者深度协同,是物理AI基础模型的终极使命。
这也是德塔想亲手补上的那一块。
参考资料:
https://x.com/elonmusk/status/1900774290682683612
https://x.com/elonmusk/status/1953028261044187204
https://www.21jingji.com/article/20260429/herald/6bc0f3fbe48368de421f1a7c9d0659c7.html
https://www.figure.ai/news/helix-02
编辑:摩西 Aeneas
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.