网易首页 > 网易号 > 正文 申请入驻

Helix 2.5-机器人不再一间一间地学

0
分享至

Helix 2.5:机器人不再一间一间地学


我走进一个从没去过的家,放下包就能开始干活。

床高一点,家具换了样式,我不需要重新学怎么铺床,也不需要重新学怎么收拾房间。

脑子里的物理世界是跟着人走的,从一处到另一处,不用重装。

机器人不是这样。

它们是一个地方一个地方地学。

学一处,会一处。

换个地方,从头再来。

Figure 发布的 Helix 2.5,是他们目前最强的神经网络。它要回答的问题只有一句:人形机器人能不能进一个从没见过的家,用整个身体,自己开工。

Helix 02 已经走到哪一步

Helix 02 证明过一件事:神经策略能让一个人形机器人长时间协调全身。

从卸洗碗机,到自主跑 200 小时的物流任务。

但那些系统的数据,采集自机器人以后要干活的地方。学会了活儿,也学会了那个地方。

这次的赌注押在数据上

Figure 的做法是先把 Helix 2.5 放在 Index 上预训练。Index 是他们自建的、全球规模的人类行为数据集。

这里有个差别值得记。Helix 2.5 完全从随机初始化起步,全程在 Index 上预训练。

上一代的 Helix 02,是从一个预训练的视觉语言模型开始的。

从这一个基础模型出发,他们做出三个行为:整理客厅、叠毛巾、铺床。

然后把机器人带进 30 个旧金山湾区的家。

这 30 个家里,一个数据点都没采。

五个结果

按 Figure 的说法,这是人形机器人上第一次做出这个量级的零样本全身泛化。

我注意到他们紧接着补了一句。

这不等于通用人形机器人已经解决。

三个任务为什么难

整理客厅、铺床、叠毛巾。三件事加在一起,需要感知、移动、操作、双手协调和全身控制。

每一个在固定环境里都不轻松。

大多数机器人泛化研究,是在为机器造好的环境里做的。桌面机械臂的活动范围固定,轮式机器人需要够宽的地面让底盘转身。

家里不提供这种条件。

人形机器人得一边移动一边完成任务,在狭窄、杂乱的缝隙里调整身体去看、去够、去操作。感知、移动、操作这三件事没法分开解。

零样本又把门槛抬高一截。房间没见过,布局没见过,物体没见过,到了之后也不许适配。

它只能用已经会的东西,把整套感知与控制问题解掉。

我理解这三个任务的分工:一个考找,一个考走,一个考手上的活。

9% 和 56% 是怎么测出来的

Figure 做了一个很干净的对照。

两个策略用完全相同的任务规格数据训练,数据里不含任何评测用的房间和物体。

一个从随机权重开始。另一个从 Index 预训练过的 Helix 2.5 开始。

架构、优化器、超参、下游数据、评测方式,全部固定。唯一的变量就是 Index 预训练。

盲测结果:从零训练的那个,零样本试验成功率 9%。Index 预训练的那个,56%。

差了 6 倍以上。

这个差距能说明问题,是因为预训练是唯一的实验变量。同一份任务规格数据,从一个学过广泛人类经验的模型出发,迁移效果好得多。

我看这个实验,关键不在 56% 这个数,在于变量只剩了一个。

成功判定很严。必须完成整个任务,每一件东西归位、每一条毛巾叠好、整张床铺完。

不给部分分。差一点就成的,也记成失败。

还有个细节我记下来了。没有任何单个评测任务,占 Index 预训练数据超过 1.90%。

预训练是刻意做宽的,为的是支撑任意行为的微调。这样出来的模型才不是围着某个任务长的。

30 个家是怎么评的

约束比任务本身更值得看。

  • 任何评测家庭都没有采集数据
  • 评测用的玩具、毛巾、床品,都没有出现在任务规格数据里
  • 物体在实验开始前就被单独放置,经 AI 模型与人工两轮复核
  • 三个任务在 30 个家里共用同一个固定 checkpoint
  • 没有针对评测家庭或物体做权重适配
  • 也没用评测过程数据来挑 checkpoint

这几条合起来,才是零样本这两个字的实际含义。

评分细则也不是临时定的

判定标准在评测开始之前就固定下来。

每一轮的初始配置都不一样。

时间上卡得很细。每件玩具 1 分钟,每条毛巾 3 分钟,每个枕头和被子每一侧各 1 分钟。

超时就中止,或者判失败。

毛巾还分档。四角都在 1 英寸以内算 A,只有两角在内算 B,都不在内算 C。

叠好了但没放进篮子,这一条判失败,折叠本身照常计分。

铺床按枕头和被子分开评。枕头放进床头上三分之一算过,横放且朝向偏差小于 15 度算好。

被子要求两侧都抬起、两角都到位。角与角相差 6 英寸以内算好,6 到 12 英寸之间算一般。

还有一条:如果过程中需要人工介入保证安全,这一轮直接中止并判失败。

我看下来,这套细则的作用不在于把门槛抬高,在于把主观空间压掉。

自己纠错

长时程任务里,纠错是必需的。环境越陌生,越是。

Helix 2.5 有个明显变化:它会自己纠正。后退重新定位,换站姿,绕着整张床走一圈去补救一处折叠。

Figure 把这种出错后能恢复、能继续推进的能力,算作 Index 预训练的结果。

那条曲线

语言模型的开发方式,是被 scaling law 改掉的。数据与算力上去,下一 token 的预测稳定变好。

大实验因此可以从小实验预测。这条规律后来成了整个行业的排期依据。

Figure 问的是同一件事:人→机器人的迁移,是不是也这么走。

他们用 Index 的嵌套子集训了四个模型。预训练数据跨度 8 倍,模型规模和下游训练固定。

每个模型在同一份任务数据上微调,用同一个留出的动作预测损失来评。

结果:Index 每翻一倍,损失稳定下降。

更关键的是精度够用。他们只用规模较小的那几次运行,就把最大一次运行的测试损失预测到了小数点后四位。

而且是在训练开始之前。

预测误差,是 8 倍数据范围里全部波动的 0.54%。

如果这条规律在人形机器人上也站得住,就意味着可以在训练前先算一笔账。

下一次翻倍的人类经验,值多少收益。

Index 的构成方式也有说明。他们用两种嵌入来刻画任务:每个片段的视频嵌入,以及一个视觉语言模型给出的文本嵌入。

我看到的边界

这份公告给得很实,但有几条线得画清楚。

一是口径。零样本指的是评测环境和被操作物体没见过。任务本身,仍然靠别处采集的微调数据来定义。

这不是无监督。

二是范围。测的是数据扩展,模型规模和下游训练是固定的。这条曲线只说明数据的边际收益可预测。

三是覆盖。三个任务,整理客厅、叠毛巾、铺床,推不出通用家务能力。

四是分值。成功判定不给部分分,所以 56% 是个偏保守的数。差一点就成的情形也被算作失败。

五是来源。所有数据出自 Figure 自家实验。在第三方复现之前,这些数字的适用范围就是这份公告本身。

对我来说,这几条不是打折,是给后面的复现留参照。

收尾

一年前,Figure 立过一个判断。

机器人在模型规模、算力、尤其是数据上,差了好几个数量级。

Index 是他们补这个差距的尝试。问的问题很简单——人形机器人能不能从人类经验里学到足够多。

多到不必再教它每一个以后要去的地方。

Helix 2.5 是他们目前最强的证据。

答案可能是能。

这套配方在别的 AI 领域已经见过:预训练里学宽,把行为规格化一次,部署时泛化。

Index 现在每秒产生大约 35 分钟的新人类经验。Figure 已经承诺 35 亿美元算力用来训练 Helix。

按 Helix 2.5 的表现推,更多数据和算力会换来更多先学会、再见到的物理世界。

这条曲线,我愿意再等一轮数据再下判断。

前提是它在更大规模上继续成立。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
泽连斯基反驳鲁比奥:“你们不能一面与俄罗斯谈判未来的经济项目,一面说我们陷入外交僵局”

泽连斯基反驳鲁比奥:“你们不能一面与俄罗斯谈判未来的经济项目,一面说我们陷入外交僵局”

政知新媒体
2026-10-09 19:38:01
我为什么相信懂车帝?

我为什么相信懂车帝?

葱哥说
2026-10-09 13:02:32
10月7日三周年——暴力口号让支持者却步,欧洲巴勒斯坦支持者集会人数大幅减少

10月7日三周年——暴力口号让支持者却步,欧洲巴勒斯坦支持者集会人数大幅减少

老王说正义
2026-10-10 09:59:28
深圳春秋假被投诉了,评论区吵到失控:这锅到底谁来背?

深圳春秋假被投诉了,评论区吵到失控:这锅到底谁来背?

今日搞笑分享
2026-10-11 02:14:00
医生发现:常吃红薯的糖尿病患者,用不了多久,身体或有6大变化

医生发现:常吃红薯的糖尿病患者,用不了多久,身体或有6大变化

王医生健康讲坛
2026-10-11 04:45:04
布云朝克特0-2止步次轮!赛中露出大肚腩引热议 职业网球手自律堪忧

布云朝克特0-2止步次轮!赛中露出大肚腩引热议 职业网球手自律堪忧

颜小白的篮球梦
2026-10-10 18:28:52
网传高盛预测中国房地产还会有新高点,评论区炸锅,骂声一片...

网传高盛预测中国房地产还会有新高点,评论区炸锅,骂声一片...

慧翔百科
2026-10-09 18:12:46
震惊!华人超市爆发枪战,情侣欲带狗进入,与保安冲突后拔枪互射,双双中弹倒地

震惊!华人超市爆发枪战,情侣欲带狗进入,与保安冲突后拔枪互射,双双中弹倒地

大洛杉矶LA
2026-10-11 02:35:21
接收中国转售天然气过冬,逼中国签自愿限制,欧盟剧本用错对象

接收中国转售天然气过冬,逼中国签自愿限制,欧盟剧本用错对象

喜你成疾药石无医
2026-10-11 05:39:59
8000万新援处子球,亚马尔13战狂造20球,巴萨3-0赫塔费豪取9连胜

8000万新援处子球,亚马尔13战狂造20球,巴萨3-0赫塔费豪取9连胜

钉钉陌上花开
2026-10-11 03:26:42
南非发生排外暴力事件 我使馆提醒公民加强防范

南非发生排外暴力事件 我使馆提醒公民加强防范

新京报
2026-10-10 17:01:17
大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

华庭讲美食
2026-10-11 01:54:37
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
12.8亿卖掉总统,卖掉工厂,卖掉国家,两年后两发子弹穿胸而过

12.8亿卖掉总统,卖掉工厂,卖掉国家,两年后两发子弹穿胸而过

墨策讲历史
2026-08-21 19:27:44
卫健委已将左氧氟沙星列为重点监控药物!提醒:服用千万注意

卫健委已将左氧氟沙星列为重点监控药物!提醒:服用千万注意

健康科普365
2026-10-07 11:35:08
12:0!广东末节反扑失败,3锋线激活,博日奇缺硬解能力仅得6分

12:0!广东末节反扑失败,3锋线激活,博日奇缺硬解能力仅得6分

曦言说
2026-10-11 04:50:28
告诉你一个心理学真相:你抑郁焦虑,原来是你缺乏强者思维

告诉你一个心理学真相:你抑郁焦虑,原来是你缺乏强者思维

松果正念袁老师
2025-02-17 20:22:19
炸裂!曝女领导婚内出轨多人,聊天记录大胆,女方撩拨攻势猛烈

炸裂!曝女领导婚内出轨多人,聊天记录大胆,女方撩拨攻势猛烈

历史点行
2026-10-10 13:23:35
92分钟遭绝平,1-1,曼联遭热刺逼平,连续4轮不胜

92分钟遭绝平,1-1,曼联遭热刺逼平,连续4轮不胜

侧身凌空斩
2026-10-11 02:27:11
懂车帝与华为积怨已久,不惜血本硬刚鸿蒙智行

懂车帝与华为积怨已久,不惜血本硬刚鸿蒙智行

上峰视点
2026-10-10 16:21:12
2026-10-11 07:36:49
创对未来
创对未来
分享一些商业热点
84文章数 37关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

亲子
教育
手机
本地
公开课

亲子要闻

工程车小故事 :分糖果

教育要闻

六年级思维训练,答对的学生寥寥无几

手机要闻

2nm芯片+无痕铰链+2亿哈苏四摄,OPPO这款阔折叠,十分激进!

本地新闻

踏访沙县第一村,寻国民小吃本源

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版