Helix 2.5:机器人不再一间一间地学
![]()
我走进一个从没去过的家,放下包就能开始干活。
床高一点,家具换了样式,我不需要重新学怎么铺床,也不需要重新学怎么收拾房间。
脑子里的物理世界是跟着人走的,从一处到另一处,不用重装。
机器人不是这样。
它们是一个地方一个地方地学。
学一处,会一处。
换个地方,从头再来。
Figure 发布的 Helix 2.5,是他们目前最强的神经网络。它要回答的问题只有一句:人形机器人能不能进一个从没见过的家,用整个身体,自己开工。
Helix 02 已经走到哪一步
Helix 02 证明过一件事:神经策略能让一个人形机器人长时间协调全身。
从卸洗碗机,到自主跑 200 小时的物流任务。
但那些系统的数据,采集自机器人以后要干活的地方。学会了活儿,也学会了那个地方。
这次的赌注押在数据上
Figure 的做法是先把 Helix 2.5 放在 Index 上预训练。Index 是他们自建的、全球规模的人类行为数据集。
这里有个差别值得记。Helix 2.5 完全从随机初始化起步,全程在 Index 上预训练。
上一代的 Helix 02,是从一个预训练的视觉语言模型开始的。
从这一个基础模型出发,他们做出三个行为:整理客厅、叠毛巾、铺床。
然后把机器人带进 30 个旧金山湾区的家。
这 30 个家里,一个数据点都没采。
五个结果
按 Figure 的说法,这是人形机器人上第一次做出这个量级的零样本全身泛化。
我注意到他们紧接着补了一句。
这不等于通用人形机器人已经解决。
三个任务为什么难
整理客厅、铺床、叠毛巾。三件事加在一起,需要感知、移动、操作、双手协调和全身控制。
每一个在固定环境里都不轻松。
大多数机器人泛化研究,是在为机器造好的环境里做的。桌面机械臂的活动范围固定,轮式机器人需要够宽的地面让底盘转身。
家里不提供这种条件。
人形机器人得一边移动一边完成任务,在狭窄、杂乱的缝隙里调整身体去看、去够、去操作。感知、移动、操作这三件事没法分开解。
零样本又把门槛抬高一截。房间没见过,布局没见过,物体没见过,到了之后也不许适配。
它只能用已经会的东西,把整套感知与控制问题解掉。
我理解这三个任务的分工:一个考找,一个考走,一个考手上的活。
9% 和 56% 是怎么测出来的
Figure 做了一个很干净的对照。
两个策略用完全相同的任务规格数据训练,数据里不含任何评测用的房间和物体。
一个从随机权重开始。另一个从 Index 预训练过的 Helix 2.5 开始。
架构、优化器、超参、下游数据、评测方式,全部固定。唯一的变量就是 Index 预训练。
盲测结果:从零训练的那个,零样本试验成功率 9%。Index 预训练的那个,56%。
差了 6 倍以上。
这个差距能说明问题,是因为预训练是唯一的实验变量。同一份任务规格数据,从一个学过广泛人类经验的模型出发,迁移效果好得多。
我看这个实验,关键不在 56% 这个数,在于变量只剩了一个。
成功判定很严。必须完成整个任务,每一件东西归位、每一条毛巾叠好、整张床铺完。
不给部分分。差一点就成的,也记成失败。
还有个细节我记下来了。没有任何单个评测任务,占 Index 预训练数据超过 1.90%。
预训练是刻意做宽的,为的是支撑任意行为的微调。这样出来的模型才不是围着某个任务长的。
30 个家是怎么评的
约束比任务本身更值得看。
- 任何评测家庭都没有采集数据
- 评测用的玩具、毛巾、床品,都没有出现在任务规格数据里
- 物体在实验开始前就被单独放置,经 AI 模型与人工两轮复核
- 三个任务在 30 个家里共用同一个固定 checkpoint
- 没有针对评测家庭或物体做权重适配
- 也没用评测过程数据来挑 checkpoint
这几条合起来,才是零样本这两个字的实际含义。
评分细则也不是临时定的
判定标准在评测开始之前就固定下来。
每一轮的初始配置都不一样。
时间上卡得很细。每件玩具 1 分钟,每条毛巾 3 分钟,每个枕头和被子每一侧各 1 分钟。
超时就中止,或者判失败。
毛巾还分档。四角都在 1 英寸以内算 A,只有两角在内算 B,都不在内算 C。
叠好了但没放进篮子,这一条判失败,折叠本身照常计分。
铺床按枕头和被子分开评。枕头放进床头上三分之一算过,横放且朝向偏差小于 15 度算好。
被子要求两侧都抬起、两角都到位。角与角相差 6 英寸以内算好,6 到 12 英寸之间算一般。
还有一条:如果过程中需要人工介入保证安全,这一轮直接中止并判失败。
我看下来,这套细则的作用不在于把门槛抬高,在于把主观空间压掉。
自己纠错
长时程任务里,纠错是必需的。环境越陌生,越是。
Helix 2.5 有个明显变化:它会自己纠正。后退重新定位,换站姿,绕着整张床走一圈去补救一处折叠。
Figure 把这种出错后能恢复、能继续推进的能力,算作 Index 预训练的结果。
那条曲线
语言模型的开发方式,是被 scaling law 改掉的。数据与算力上去,下一 token 的预测稳定变好。
大实验因此可以从小实验预测。这条规律后来成了整个行业的排期依据。
Figure 问的是同一件事:人→机器人的迁移,是不是也这么走。
他们用 Index 的嵌套子集训了四个模型。预训练数据跨度 8 倍,模型规模和下游训练固定。
每个模型在同一份任务数据上微调,用同一个留出的动作预测损失来评。
结果:Index 每翻一倍,损失稳定下降。
更关键的是精度够用。他们只用规模较小的那几次运行,就把最大一次运行的测试损失预测到了小数点后四位。
而且是在训练开始之前。
预测误差,是 8 倍数据范围里全部波动的 0.54%。
如果这条规律在人形机器人上也站得住,就意味着可以在训练前先算一笔账。
下一次翻倍的人类经验,值多少收益。
Index 的构成方式也有说明。他们用两种嵌入来刻画任务:每个片段的视频嵌入,以及一个视觉语言模型给出的文本嵌入。
我看到的边界
这份公告给得很实,但有几条线得画清楚。
一是口径。零样本指的是评测环境和被操作物体没见过。任务本身,仍然靠别处采集的微调数据来定义。
这不是无监督。
二是范围。测的是数据扩展,模型规模和下游训练是固定的。这条曲线只说明数据的边际收益可预测。
三是覆盖。三个任务,整理客厅、叠毛巾、铺床,推不出通用家务能力。
四是分值。成功判定不给部分分,所以 56% 是个偏保守的数。差一点就成的情形也被算作失败。
五是来源。所有数据出自 Figure 自家实验。在第三方复现之前,这些数字的适用范围就是这份公告本身。
对我来说,这几条不是打折,是给后面的复现留参照。
收尾
一年前,Figure 立过一个判断。
机器人在模型规模、算力、尤其是数据上,差了好几个数量级。
Index 是他们补这个差距的尝试。问的问题很简单——人形机器人能不能从人类经验里学到足够多。
多到不必再教它每一个以后要去的地方。
Helix 2.5 是他们目前最强的证据。
答案可能是能。
这套配方在别的 AI 领域已经见过:预训练里学宽,把行为规格化一次,部署时泛化。
Index 现在每秒产生大约 35 分钟的新人类经验。Figure 已经承诺 35 亿美元算力用来训练 Helix。
按 Helix 2.5 的表现推,更多数据和算力会换来更多先学会、再见到的物理世界。
这条曲线,我愿意再等一轮数据再下判断。
前提是它在更大规模上继续成立。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.