网易首页 > 网易号 > 正文 申请入驻

机器人也有Scaling Law了?智元GE-Act 2.0带来关键验证

0
分享至


出现了跨本体的能力迁移。

作者 |钟宸

编辑 |漠影

机器人前瞻9月10日报道,昨日,智元发布了原生世界—动作模型(World Action Model,WAM)GE-Act 2.0

智元称,GE-Act 2.0的所有模型参数,包括视觉表征、未来生成、动作预测等核心组件均从随机初始化开始,在具身操作数据上从头训练。

训练完成后,模型不针对评测任务做任何微调和示范,直接在陌生场景、陌生物体上,接受语言指令跟随、多技能操作和陌生环境泛化等真机零样本(Zero-shot)检验,覆盖100项原子任务、20类技能、两种机器人本体。

结果显示,随着数据规模扩大100倍,模型不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作。

智元称,这是原生世界—动作模型的Scaling路径首次被系统性验证。

01.

可在复杂场景完成任务,展现长程任务能力

在相同的零样本OOD协议下,智元评估了GE-Act 2.0在目标对象、颜色、大小、形状、位置和顺序方面的指令理解能力。实验表明,该算法能够在杂乱的场景中准确选择目标对象,且能够遵循习得动作偏好(Learned Action Biases)不同的指令,并且能够通过指令组合使能力泛化到新的任务场景中

首先,GE-Act 2.0可以在复杂场景中执行指令。在智元展示的视频中,模型可在杂乱的物品中识别指令所需的正确物品,并执行夹起的操作。


且该模型能够遵循更复杂的“抓取和放置”指令,结合物体和颜色的区别,正确识别需要移动的物体以及放置的位置。在智元展示的视频中,搭载该模型的G1-OP可将绿色苹果放到绿色的盘子中,并将橙子放到橙色的盘子中。

其次,GE-Act 2.0展现了避免习得动作偏好的能力。在视频中,即使鞋子在鞋盒旁边,G1-OP会遵循把杯子放进鞋盒的指令。智元指出,该策略遵循指令对象-目的关系,而非场景暗示的关系。

同时,模型还能够打断原来的指令,执行最新的指令,在智元展示的视频中,G1-OP可在取消拿起绿色杯子的指令后继续执行拿起蓝色杯子的指令,且进行了连续两次取消,但从视频来看,杯子差一点就要被拿起,且G1-OP显得有些“手忙脚乱”。


GE-Act 2.0还能够在非标准场景中,通过执行连续的单步指令,实现零样本泛化能力,从而完成全新的长程任务。它能利用语言指导,将熟悉的操作技能转化为新的任务序列,而无需针对特定任务的微调。

在展示的视频中,G1-OP的目标是食物放入托盘中,它可以将苹果、芒果、零食袋以及瓶子分不同步骤放进盘中。

02.

重新设计架构,实现跨本体迁移能力

这一模型是怎么做到的?智元对此的解释是,GE-Act 2.0面向具身操作重新设计整套架构,给出了从头预训练的完整方法论。


首先,智元设计了更高效的视觉编码器CoAE,将一帧256×384画面压缩为24个视觉token,仅为DINOv3的十六分之一,同时保留语义、运动与局部结构。

压缩后反推动作的精度与DINOv3、V-JEPA 2.1等高信息量表征接近,在4,000条机器人操作数据的受控测试中,指令—画面匹配准确率达97.95%,为五种对照表征中最佳。

其次,智元采用一步式视觉规划,一次生成完整未来,并让动作误差直接反馈给世界模型。配合高效视觉表征,模型在RTX 5090显卡上生成一个连续动作chunk仅需104毫秒。

最后,GE-Act 2.0采用了知识对齐选择性优化方法(KASO),即一次生成多个可能的未来,只选择与真实动作最一致的结果参与训练。在陌生场景的分布外(OOD)评测中,机器人选对指令目标的比例较基线提高7.5个百分点,最终完成抓取的成功率提高10个百分点。

在数据架构上,GE-Act 2.0提出让每类数据承担合适的学习任务:

  • 使用3.9万小时“指令—视频”数据预训练世界模型,学习环境如何变化,其中包含3,000小时无本体数据(不带动作标注的第一视角与人类操作视频);

  • 以3.2万小时机器人轨迹预训练逆动力学模型(IDM),学习“画面这样变化时机器人做了什么”,其中包含2,000小时失败操作与真实场景部署回流(rollout)数据,不要求成功标签;

  • 最后通过3万小时“指令—视频—动作”完整数据进行联合训练,把两种能力连接起来。


在评测中,GE-Act 2.0把真机零样本表现作为标准:不微调、不示范、不换模型,测试中的场景、背景、光照和物体实例均未进入训练。

在相同训练配方下,最后一阶段分别使用300/1,200/5,000/30,000小时四档数据,智元指出,模型在三方面展现出Scaling:

首先是取得非零成功率的任务,在G1-OP机器人上从39项增至76项,在G2-90D机器人上从24项增至72项。智元指出,折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作在小规模数据训练的模型上无法被理解,而当数据达到3万小时规模时出现显著的能力顿悟

从智元在技术博客展现的视频来看,G1-OP可在零样本的情况下,完成将倾倒的水瓶扶正的操作。


以及将一个杯子,套至另一个杯子内的操作。


以及擦去桌面油污的操作。


而对于仅贡献训练数据不足2%的G2-90D,该模型依然在零样本的情况下完成指令,诸如摘取笔帽,从视频来看,机械臂能精准识别到笔帽并完成摘取操作,同时右臂依然握住笔杆。


以及把芒果放进容器内的操作,但从视频来看,似乎机械臂并未准确定位到容器中央。


而从任务成功率的数据来看,G1-OP机器人总体成功率从17.1%提升至44.1%,G2-90D机器人从13.4%提升至31.1%,且5,000到30,000小时仍未见明显饱和


另外,虽然G1-OP机器人贡献超50%训练数据,G2-90D机器人占比不足2%,但后者总体成功率仍随共享数据扩大提升17.7个百分点,出现了跨本体的能力迁移



最后,微调后的GE-Act 2.0在RoboTwin陌生环境测试中取得60.52%成功率,在GenieSim指令遵循测试中获得0.770分,均超过π0.5、GR00T N1.7等参与比较的模型

03.

结语:从头训练,验证具身Scaling Law

从GE-Act 2.0的发布来看,智元正在试图回答具身智能领域一个核心但尚未被充分验证的问题:世界—动作模型是否也能像大语言模型一样,走出一条清晰的Scaling Law路径?

答案是初步肯定的。当训练数据从300小时扩展到3万小时,模型不仅在原有任务上表现更稳定,更在折叠毛巾、嵌套纸杯、插花等精细操作上出现了“顿悟”。

不过,G1-OP零样本44.1%的成功率也提醒我们,这条路径虽然被验证存在,但距离真正的应用仍有不小的距离。

跨本体迁移的出现固然令人振奋,说明模型学到的并非某一台机器人的肌肉记忆,而是某种更通用的操作语义,但G2-90D在部分任务中暴露的定位偏差以及数据上的差距,也说明能力在不同本体间的迁移可能并不均匀。

接下来值得关注的,是当数据规模继续扩大一个数量级后,是否还会涌现出现在尚未预见的新能力,以及能否实现更广泛的应用。

技术博客:

https://ge-act-v2.github.io/#conclusion


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
以色列用一座“地下五角大楼”的崩塌,完成了一次没有退路的宣示

以色列用一座“地下五角大楼”的崩塌,完成了一次没有退路的宣示

民间胡扯老哥
2026-09-12 01:05:00
斯诺克英格兰公开赛1/4决赛:周跃龙5-6惨遭卡特逆转,无缘四强

斯诺克英格兰公开赛1/4决赛:周跃龙5-6惨遭卡特逆转,无缘四强

金风说
2026-09-12 04:26:02
马科斯万万没料到!先来的不是莎拉下台,而是被老杜一家穷追不舍

马科斯万万没料到!先来的不是莎拉下台,而是被老杜一家穷追不舍

仙味少女心
2026-09-10 23:24:31
iPhone 18 Pro,今年可能要卖疯了

iPhone 18 Pro,今年可能要卖疯了

搞机小帝
2026-09-12 01:07:08
内塔尼亚胡和卡茨发表联合声明:使用超过1100吨炸药摧毁黎南部真主党地下设施,在地道内发现了伊朗制造的火箭弹、导弹和无人机等

内塔尼亚胡和卡茨发表联合声明:使用超过1100吨炸药摧毁黎南部真主党地下设施,在地道内发现了伊朗制造的火箭弹、导弹和无人机等

政知新媒体
2026-09-11 07:51:04
许家印靠山现状

许家印靠山现状

地产微资讯
2026-09-11 08:47:58
李小冉节目首度聊到前夫,公开了离婚的原因,谈及过往委屈落泪

李小冉节目首度聊到前夫,公开了离婚的原因,谈及过往委屈落泪

小武侃风云
2026-09-11 23:30:05
最后大决战开始了,也门领导人萨布里宣布,解放也门全境,把伊朗革命卫队以及也门胡塞武装赶出去!

最后大决战开始了,也门领导人萨布里宣布,解放也门全境,把伊朗革命卫队以及也门胡塞武装赶出去!

吃瓜小侦探
2026-09-08 21:38:50
胡塞武装终于见识到了什么叫真正的“收网”。

胡塞武装终于见识到了什么叫真正的“收网”。

回京历史梦
2026-09-10 17:53:27
陈治珍主任:煮一碗苹果水,一清内热,二养脾胃,三补津液,鼻炎、咳嗽、不长个的孩子,越早喝越好!

陈治珍主任:煮一碗苹果水,一清内热,二养脾胃,三补津液,鼻炎、咳嗽、不长个的孩子,越早喝越好!

蜡笔小小子
2026-07-23 13:48:08
留洋的重要性!男篮首秀狂轰17+9!杨瀚森不在,他成男篮内线新核

留洋的重要性!男篮首秀狂轰17+9!杨瀚森不在,他成男篮内线新核

兵哥篮球故事
2026-09-11 16:15:54
从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

健身狂人
2026-09-06 02:07:39
砍15+6开门红!中国男篮23岁2米23中锋归来:扮演杨瀚森替身冲冠

砍15+6开门红!中国男篮23岁2米23中锋归来:扮演杨瀚森替身冲冠

李喜林篮球绝杀
2026-09-11 11:37:17
算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

扶苏聊历史
2026-09-10 14:58:19
新加坡仇印情绪爆发,7%人口占31%高位,印度人不建设光摘桃子被反噬

新加坡仇印情绪爆发,7%人口占31%高位,印度人不建设光摘桃子被反噬

王新喜
2026-09-10 20:55:18
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
许华升与妻子婷婷爆发婚姻危机!婷婷控诉其一年365天,360天喝酒

许华升与妻子婷婷爆发婚姻危机!婷婷控诉其一年365天,360天喝酒

裕丰娱间说
2026-09-11 10:17:32
3-2胜汉娜·高达,陈幸同回应决胜局1-7落后逆转,日本3人晋级8强,男单全国冠军出局!

3-2胜汉娜·高达,陈幸同回应决胜局1-7落后逆转,日本3人晋级8强,男单全国冠军出局!

好乒乓
2026-09-12 00:51:22
自然资源部正式发布报告 我国稀土、钨、锡等14种矿产储量居世界第一

自然资源部正式发布报告 我国稀土、钨、锡等14种矿产储量居世界第一

每日经济新闻
2026-09-11 16:08:32
2800颗卫星组网,国星宇航8星出征

2800颗卫星组网,国星宇航8星出征

爬虫饲养员
2026-09-11 00:10:27
2026-09-12 05:40:49
机器人前瞻
机器人前瞻
智东西AI媒体矩阵品牌。机器人前瞻,机器人产业新媒体,专注报道全球机器人创新。
898文章数 17关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

手机
家居
亲子
艺术
军事航空

手机要闻

豆包手机二代下周发布!努比亚晒NaviX Ultra蓝境配色真机图

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

一定要告诉你的孩子,择偶就是改命!

艺术要闻

《步辇图》最大骗局:全程没有文成公主,却骗了所有中国人 1300 年

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版