网易首页 > 网易号 > 正文 申请入驻

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

0
分享至



机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?

他们最新发布了面向 VLA 的 VLM 底座VLAct。

VLAct 的整个 continued pre-training 只使用开源数据和16张GPU,但成绩相当能打:RoboTwin 2.0 成功率达到92.5%;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用20%的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也全部开源。



图 1|VLAct 主要结果一览:RoboDojo、RoboTwin 2.0、RoboCasa-GR1,以及 16 GPUs 与全开源。(项目宣传图)

机器人数据

没法像互联网数据一样“爬”

过去几年,大模型已经证明了一条非常有效的路线:数据更多、模型更大、算力更强,能力就不断往上走。VLA 自然也希望复制这条 Scaling 路线。

但机器人领域有一个绕不开的现实:机器人轨迹不是网页数据,不能从互联网直接爬下来。每条数据都需要机器人真正在物理世界里完成操作,背后往往还有遥操作、数据采集和硬件成本。更麻烦的是,机器人最终面对的是几乎无限的场景、物体、任务和机器人形态组合。

所以 VLAct 并不是想否定 Data Scaling,而是补上另一个问题:在同样的数据预算下,能不能让机器人轨迹在 Backbone 里留下更多可以跨任务、跨 Action Head、甚至跨机器人迁移的知识?



图 2|Naive VLA pre-training 容易绑定预训练场景;VLAct 把目标转向更可迁移的 Action-aware Representation。

一个有点反常识的发现:

Action 学得更好,Backbone 不一定更好

VLAct 真正的起点,来自团队前期实验中一个很有意思的现象。现在很多 VLA 都会从一个 VLM 出发,挂上 Action Head,再用机器人数据继续训练。很自然的想法是:Action 预测越准,说明这次 VLA 预训练越成功。

但实验发现,并不一定。以 RoboTwin 为例,使用 OFT Head 做 continued pre-training 后,如果下游继续使用 OFT,成功率可以从 61.7%提高到 75.8%;但把同一个 Backbone 换成 PI Head,下游反而从 60.5%下降到 55.1%;换成 GR00T Head 甚至从 51.2%降到 28.9%。

换句话说:Policy 在原来的 Head 上变强了,不代表 Backbone 真的变得更通用。



图 3|Action supervision 会直接塑造 Backbone:同 Head 性能提升,并不自动转化为 Cross-head 迁移能力。

原因也很直观。Action Head 和 Backbone 是一起训练的,只用一种 Head 时,Backbone 很容易逐渐学会一种“最方便这个 Head 读取”的 Feature Geometry。对于当前 Policy,这当然很好;但换一个 Action Head、任务甚至机器人后,这些 Representation 未必还能继续复用。论文把这种现象称为head-specific representation collapse。

于是 VLAct 把 continued pre-training 的目标重新定义了一遍:不是训练一个已经很会做动作的固定 Policy Initialization,而是训练一个能被不同 Action Head、不同任务、不同机器人继续利用的 VLM Backbone。

那怎么避免 Backbone 被“带偏”?

围绕这个目标,VLAct 没有重新发明复杂的 Policy Architecture,而是在 continued pre-training 阶段做了三件事。

第一,别把 VLM 原来学会的东西忘了。VLAct 保护 Vision Encoder 和较浅的 LLM 层,同时混入 Caption 数据,让模型在学习 Action 时尽量保住原来的视觉语言先验。

第二,别让一种 Action Head 说了算。VLAct 同时挂上 OFT、PI 和 GR00T 三种连续 Action Head,让它们共同读取一个 Backbone、预测同一套动作。这样 Backbone 想同时服务不同 Decoder,就不能只把信息组织成某一种 Head 最喜欢的形式。更重要的是,预训练结束后这些 Head 全部可以丢掉,下游重新初始化自己的 Action Head。

第三,不同机器人之间,该共享的物理语义就共享。例如“打开/关闭夹爪”在不同机器人上的物理意义高度相似,但不同机械臂的自由度和运动学结构又不能粗暴统一。因此 VLAct 只统一真正一致的 Action 维度,其他部分继续保持 Embodiment-specific。



图 4|VLAct 完整训练框架:Preserve VLM Prior、Multi-head Continuous Supervision、Partially Unified Action Space,下游重新初始化 Action Head。(论文 Figure 3 原图裁切)

RoboTwin 92.5%

RoboDojo 超所有 WAM

最终,这种 Representation 能不能迁移,还是得看结果。在 LIBERO-Plus 上,VLAct 达到82.6%;到了双臂操作的 RoboTwin 2.0,Data Scaling 设置下 Clean 成功率进一步达到92.5%,Random 设置也达到90.8%。

在 RoboDojo 上,VLAct 取得10.66Score 和7.60%的 Success Rate,并超过所有明确标注为 WAM 的参赛模型。也就是说,这套预训练并不是只在某一个机器人、某一个 Benchmark 上有效。

论文还在 Franka 真机上覆盖了单臂短时序、长时序、双臂协同,以及 Novel Object 和 Full Substitution 等 OOD 设置。



图 5|真实机器人评测任务:包括 In-domain 与 Out-of-domain、短时序、长时序和双臂操作。(论文 Figure 11 原图裁切)

20%数据

超过 GR00T N1.6 的 100%

最能体现迁移能力的实验来自RoboCasa-GR1。GR-1 这种机器人在 VLAct continued pre-training 的数据里一次都没有出现过:预训练阶段模型看到的是 Franka、AgileX 等机器人,然后再把 Backbone 拿到 GR-1 上进行下游 Fine-tuning。

结果只使用 20% 的 RoboCasa-GR1 轨迹,VLAct 就达到 49.5%的成功率,已经超过 GR00T N1.6 和 Qwen3VL-OFT 的全量数据基线;当数据提高到 100%时,VLAct 进一步达到 54.0%。



图 6|论文 Figure 5:真机单臂/长时序/双臂结果,以及 RoboCasa-GR1 跨本体迁移;20%下游数据已超过公开 full-data baselines。

Beyond Data Scaling

让每条机器人数据“学得更值”

VLAct 并不是想证明“数据不重要”。机器人数据当然还需要继续 Scale,但由于机器人数据昂贵、稀缺,而且很难完整覆盖真实物理世界,Representation Quality 本身也应该成为 VLA Scaling 的一条独立轴线。

过去大家更常问:“还能收多少机器人数据?”VLAct 希望同时再问一句:“同样这些机器人数据,到底能让模型学到多少可以迁移的东西?”

整个 VLAct continued pre-training 基于 Qwen3-VL-4B,只使用公开机器人数据和 16 张 GPU 完成。目前模型权重、Checkpoint、数据处理及训练 Pipeline 均已开放,希望把一个更适合物理世界、也更 Research-friendly 的 VLM Backbone 交给 VLA 社区。

项目链接





  • 项目主页:https://starvla.github.io/VLAct/
  • 论文标题:Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
  • 论文地址:https://arxiv.org/abs/2608.27550
  • GitHub:https://github.com/starVLA/VLAct
  • Hugging Face:https://huggingface.co/collections/StarVLA/vlact
  • X: https://x.com/YSenqiao/status/2094260526075302194

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1955年,开国上将中最特殊的一位:49岁的乌兰夫不曾效力红军,也没有参加八路军的履历,他为何有此殊荣?

1955年,开国上将中最特殊的一位:49岁的乌兰夫不曾效力红军,也没有参加八路军的履历,他为何有此殊荣?

唠叨说历史
2026-07-31 15:05:52
只换一人,利物浦从地狱到天堂!伊劳拉神换人,让全英超看呆了

只换一人,利物浦从地狱到天堂!伊劳拉神换人,让全英超看呆了

日常万物志
2026-09-06 07:18:03
助攻双响+一条龙绝杀!昔日英超德甲金靴150万欧重返西甲4轮4球2助

助攻双响+一条龙绝杀!昔日英超德甲金靴150万欧重返西甲4轮4球2助

狍子歪解体坛
2026-09-06 12:38:14
拒绝1.75亿,联盟29队无人问津,拖了62天,小托马斯或是前车之鉴

拒绝1.75亿,联盟29队无人问津,拖了62天,小托马斯或是前车之鉴

大西体育
2026-09-06 00:04:12
AI看病比医生强?论文刚发,美国医学会当场反驳

AI看病比医生强?论文刚发,美国医学会当场反驳

码上闲叙
2026-09-05 16:26:18
一个主字,砍断了44万医生的退路

一个主字,砍断了44万医生的退路

宝哥精彩赛事
2026-09-04 11:04:02
电芯一致性不足,为何家用车主几乎无感,营运车主却要花8万?

电芯一致性不足,为何家用车主几乎无感,营运车主却要花8万?

沙雕小琳琳
2026-09-05 09:54:14
委内瑞拉有20万华人,但最令人惊讶的是:这20万人里,竟有九成左右都来自同一个县城

委内瑞拉有20万华人,但最令人惊讶的是:这20万人里,竟有九成左右都来自同一个县城

背包旅行
2026-08-06 10:09:09
莆田暴雨洪灾直击:“平均两三分钟就能听到一个房屋倒塌的声音”,历经十多个小时救援队救出一对被困母女

莆田暴雨洪灾直击:“平均两三分钟就能听到一个房屋倒塌的声音”,历经十多个小时救援队救出一对被困母女

澎湃新闻
2026-09-05 11:02:12
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

瞎说娱乐
2026-08-22 16:07:15
不负歌迷!76岁谭咏麟积极备战红馆演唱会,成功减掉17磅

不负歌迷!76岁谭咏麟积极备战红馆演唱会,成功减掉17磅

暖心萌阿菇凉
2026-09-05 19:09:00
王菲迎麻烦仅3天,张柏芝再曝儿子病情,谢霆锋一举实现口碑暴涨

王菲迎麻烦仅3天,张柏芝再曝儿子病情,谢霆锋一举实现口碑暴涨

悦君兮君不知
2026-09-05 14:54:03
别被表面和谐骗了!《花儿与少年8》嘉宾初见,吴君如和殷桃的相处值得细品

别被表面和谐骗了!《花儿与少年8》嘉宾初见,吴君如和殷桃的相处值得细品

浑水默娱
2026-09-05 13:00:24
官媒发声!已调离武大的付磊或将被追责,不要以为换个学校就稳了

官媒发声!已调离武大的付磊或将被追责,不要以为换个学校就稳了

爱写的樱桃
2026-09-06 17:44:23
又内乱了!德云社元老级人物离开,发文内涵郭德纲,彻底撕破脸面

又内乱了!德云社元老级人物离开,发文内涵郭德纲,彻底撕破脸面

访史
2025-08-31 15:25:43
心酸!大二女生对着镜头哭得通红,一个月光吃饭就是1080,爸妈能不能再给点

心酸!大二女生对着镜头哭得通红,一个月光吃饭就是1080,爸妈能不能再给点

蝴蝶花雨话教育
2026-09-04 00:05:18
住建部正式发文!一个时代结束了

住建部正式发文!一个时代结束了

新浪财经
2026-09-04 23:55:17
星宇股份舆论继续升级!又引爆第三颗惊雷:黄河路智能产业园,近90%是临时工,正式工只剩10%

星宇股份舆论继续升级!又引爆第三颗惊雷:黄河路智能产业园,近90%是临时工,正式工只剩10%

火山詩话
2026-09-05 14:38:35
朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

人生录
2026-08-13 00:05:10
热搜第一!汤家凤呼吁取消英语主科地位,称“放眼全世界都是笑话”

热搜第一!汤家凤呼吁取消英语主科地位,称“放眼全世界都是笑话”

观察者网
2026-09-05 13:55:12
2026-09-06 18:47:01
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13930文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

教育
本地
数码
健康
公开课

教育要闻

中国博士后,已经突破50万人

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

数码要闻

获美国缪斯设计奖最高荣誉,追觅吸尘器携Air Station亮相柏林展台

脑梗取栓成功≠活下来,还有这三关

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版