网易首页 > 网易号 > 正文 申请入驻

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

0
分享至



机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?

他们最新发布了面向 VLA 的 VLM 底座VLAct。

VLAct 的整个 continued pre-training 只使用开源数据和16张GPU,但成绩相当能打:RoboTwin 2.0 成功率达到92.5%;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用20%的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也全部开源。



图 1|VLAct 主要结果一览:RoboDojo、RoboTwin 2.0、RoboCasa-GR1,以及 16 GPUs 与全开源。(项目宣传图)

机器人数据

没法像互联网数据一样“爬”

过去几年,大模型已经证明了一条非常有效的路线:数据更多、模型更大、算力更强,能力就不断往上走。VLA 自然也希望复制这条 Scaling 路线。

但机器人领域有一个绕不开的现实:机器人轨迹不是网页数据,不能从互联网直接爬下来。每条数据都需要机器人真正在物理世界里完成操作,背后往往还有遥操作、数据采集和硬件成本。更麻烦的是,机器人最终面对的是几乎无限的场景、物体、任务和机器人形态组合。

所以 VLAct 并不是想否定 Data Scaling,而是补上另一个问题:在同样的数据预算下,能不能让机器人轨迹在 Backbone 里留下更多可以跨任务、跨 Action Head、甚至跨机器人迁移的知识?



图 2|Naive VLA pre-training 容易绑定预训练场景;VLAct 把目标转向更可迁移的 Action-aware Representation。

一个有点反常识的发现:

Action 学得更好,Backbone 不一定更好

VLAct 真正的起点,来自团队前期实验中一个很有意思的现象。现在很多 VLA 都会从一个 VLM 出发,挂上 Action Head,再用机器人数据继续训练。很自然的想法是:Action 预测越准,说明这次 VLA 预训练越成功。

但实验发现,并不一定。以 RoboTwin 为例,使用 OFT Head 做 continued pre-training 后,如果下游继续使用 OFT,成功率可以从 61.7%提高到 75.8%;但把同一个 Backbone 换成 PI Head,下游反而从 60.5%下降到 55.1%;换成 GR00T Head 甚至从 51.2%降到 28.9%。

换句话说:Policy 在原来的 Head 上变强了,不代表 Backbone 真的变得更通用。



图 3|Action supervision 会直接塑造 Backbone:同 Head 性能提升,并不自动转化为 Cross-head 迁移能力。

原因也很直观。Action Head 和 Backbone 是一起训练的,只用一种 Head 时,Backbone 很容易逐渐学会一种“最方便这个 Head 读取”的 Feature Geometry。对于当前 Policy,这当然很好;但换一个 Action Head、任务甚至机器人后,这些 Representation 未必还能继续复用。论文把这种现象称为head-specific representation collapse。

于是 VLAct 把 continued pre-training 的目标重新定义了一遍:不是训练一个已经很会做动作的固定 Policy Initialization,而是训练一个能被不同 Action Head、不同任务、不同机器人继续利用的 VLM Backbone。

那怎么避免 Backbone 被“带偏”?

围绕这个目标,VLAct 没有重新发明复杂的 Policy Architecture,而是在 continued pre-training 阶段做了三件事。

第一,别把 VLM 原来学会的东西忘了。VLAct 保护 Vision Encoder 和较浅的 LLM 层,同时混入 Caption 数据,让模型在学习 Action 时尽量保住原来的视觉语言先验。

第二,别让一种 Action Head 说了算。VLAct 同时挂上 OFT、PI 和 GR00T 三种连续 Action Head,让它们共同读取一个 Backbone、预测同一套动作。这样 Backbone 想同时服务不同 Decoder,就不能只把信息组织成某一种 Head 最喜欢的形式。更重要的是,预训练结束后这些 Head 全部可以丢掉,下游重新初始化自己的 Action Head。

第三,不同机器人之间,该共享的物理语义就共享。例如“打开/关闭夹爪”在不同机器人上的物理意义高度相似,但不同机械臂的自由度和运动学结构又不能粗暴统一。因此 VLAct 只统一真正一致的 Action 维度,其他部分继续保持 Embodiment-specific。



图 4|VLAct 完整训练框架:Preserve VLM Prior、Multi-head Continuous Supervision、Partially Unified Action Space,下游重新初始化 Action Head。(论文 Figure 3 原图裁切)

RoboTwin 92.5%

RoboDojo 超所有 WAM

最终,这种 Representation 能不能迁移,还是得看结果。在 LIBERO-Plus 上,VLAct 达到82.6%;到了双臂操作的 RoboTwin 2.0,Data Scaling 设置下 Clean 成功率进一步达到92.5%,Random 设置也达到90.8%。

在 RoboDojo 上,VLAct 取得10.66Score 和7.60%的 Success Rate,并超过所有明确标注为 WAM 的参赛模型。也就是说,这套预训练并不是只在某一个机器人、某一个 Benchmark 上有效。

论文还在 Franka 真机上覆盖了单臂短时序、长时序、双臂协同,以及 Novel Object 和 Full Substitution 等 OOD 设置。



图 5|真实机器人评测任务:包括 In-domain 与 Out-of-domain、短时序、长时序和双臂操作。(论文 Figure 11 原图裁切)

20%数据

超过 GR00T N1.6 的 100%

最能体现迁移能力的实验来自RoboCasa-GR1。GR-1 这种机器人在 VLAct continued pre-training 的数据里一次都没有出现过:预训练阶段模型看到的是 Franka、AgileX 等机器人,然后再把 Backbone 拿到 GR-1 上进行下游 Fine-tuning。

结果只使用 20% 的 RoboCasa-GR1 轨迹,VLAct 就达到 49.5%的成功率,已经超过 GR00T N1.6 和 Qwen3VL-OFT 的全量数据基线;当数据提高到 100%时,VLAct 进一步达到 54.0%。



图 6|论文 Figure 5:真机单臂/长时序/双臂结果,以及 RoboCasa-GR1 跨本体迁移;20%下游数据已超过公开 full-data baselines。

Beyond Data Scaling

让每条机器人数据“学得更值”

VLAct 并不是想证明“数据不重要”。机器人数据当然还需要继续 Scale,但由于机器人数据昂贵、稀缺,而且很难完整覆盖真实物理世界,Representation Quality 本身也应该成为 VLA Scaling 的一条独立轴线。

过去大家更常问:“还能收多少机器人数据?”VLAct 希望同时再问一句:“同样这些机器人数据,到底能让模型学到多少可以迁移的东西?”

整个 VLAct continued pre-training 基于 Qwen3-VL-4B,只使用公开机器人数据和 16 张 GPU 完成。目前模型权重、Checkpoint、数据处理及训练 Pipeline 均已开放,希望把一个更适合物理世界、也更 Research-friendly 的 VLM Backbone 交给 VLA 社区。

项目链接





  • 项目主页:https://starvla.github.io/VLAct/
  • 论文标题:Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
  • 论文地址:https://arxiv.org/abs/2608.27550
  • GitHub:https://github.com/starVLA/VLAct
  • Hugging Face:https://huggingface.co/collections/StarVLA/vlact
  • X: https://x.com/YSenqiao/status/2094260526075302194

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2‑0惜败!鲍骊婧/曹梓涵屈居亚军,国羽女双新星暴露进攻短板

2‑0惜败!鲍骊婧/曹梓涵屈居亚军,国羽女双新星暴露进攻短板

小兰看体育
2026-09-06 16:26:17
乌克兰人大概率肠子都悔青了!

乌克兰人大概率肠子都悔青了!

安安说
2026-09-06 14:30:59
日本专家曾发警告:高市铁了心要与中国开战,或再次发动侵略战争

日本专家曾发警告:高市铁了心要与中国开战,或再次发动侵略战争

赫逗足球解说
2026-09-06 07:31:25
景甜背后的金主之谜!时间回到15年前,王思聪早已道出事实

景甜背后的金主之谜!时间回到15年前,王思聪早已道出事实

文刀贰
2026-08-28 04:10:03
1米3袖珍美女:嫁给1米48男孩,婚后丈夫奇迹长高,最终不欢而散

1米3袖珍美女:嫁给1米48男孩,婚后丈夫奇迹长高,最终不欢而散

梦醉为红颜一笑
2026-09-05 01:01:29
日本人常说的“八嘎呀路”翻成中文究竟啥意思?原来是两个词组成的

日本人常说的“八嘎呀路”翻成中文究竟啥意思?原来是两个词组成的

零点历史说
2026-09-06 07:25:13
5冠已出3!中国大师赛:金牌榜出炉 国羽、日本各自1金1银 韩国1金

5冠已出3!中国大师赛:金牌榜出炉 国羽、日本各自1金1银 韩国1金

泽风飘渺j
2026-09-06 16:45:36
手机,正在批量废掉底层家庭的下一代

手机,正在批量废掉底层家庭的下一代

古月明
2026-08-30 11:37:50
低保家庭女孩执意赴港看演唱会,全家低保被取消!舆论哗然

低保家庭女孩执意赴港看演唱会,全家低保被取消!舆论哗然

胡侃社会百态
2026-09-06 13:33:31
一辆不值钱的“奔驰E300L”,让学生家长被嘲笑:现实点吧,别心比天高

一辆不值钱的“奔驰E300L”,让学生家长被嘲笑:现实点吧,别心比天高

熙熙说教
2026-08-31 14:59:44
错抱29年新进展:当天只生了1个女孩,还是抱错了,魏女士将聘请律师起诉医院

错抱29年新进展:当天只生了1个女孩,还是抱错了,魏女士将聘请律师起诉医院

汉史趣闻
2026-09-05 11:43:19
阿萨德父子恐怕怎么也想不到,两代人几十年都办不到的事,朱拉尼上台才二十个月就干成了

阿萨德父子恐怕怎么也想不到,两代人几十年都办不到的事,朱拉尼上台才二十个月就干成了

人生录
2026-09-04 00:30:06
路边碰到一群精神小妹,我想知道他们的出路在哪

路边碰到一群精神小妹,我想知道他们的出路在哪

皮蛋儿电影
2026-09-05 16:09:44
家长会穿得像去蹦迪,俩妈妈成功让全班家长忘了老师说了啥

家长会穿得像去蹦迪,俩妈妈成功让全班家长忘了老师说了啥

雪饼说
2026-09-05 12:22:29
游客称在苏州住店遭遇停车“刺客”,停车18小时6分钟收费380元;酒店:曾发送停车指引

游客称在苏州住店遭遇停车“刺客”,停车18小时6分钟收费380元;酒店:曾发送停车指引

大风新闻
2026-09-05 18:58:11
中国女篮vs捷克前瞻:关键卡位战 王思雨或复出+双塔成争胜保障

中国女篮vs捷克前瞻:关键卡位战 王思雨或复出+双塔成争胜保障

醉卧浮生
2026-09-06 06:55:18
美国观众倒戈,日本媒体紧盯,郑钦文凭啥让人又怕又服?

美国观众倒戈,日本媒体紧盯,郑钦文凭啥让人又怕又服?

刘哥谈体育
2026-09-06 13:35:48
强奸儿媳,凌辱女儿致怀孕,儿子怒火中烧砍掉父亲下体,被判死缓

强奸儿媳,凌辱女儿致怀孕,儿子怒火中烧砍掉父亲下体,被判死缓

易玄
2026-08-10 02:49:08
“好像被割一样痛”!母子俩草地休憩后,全身莫名刺痛,医生从皮肤里挑出近30处“细针”

“好像被割一样痛”!母子俩草地休憩后,全身莫名刺痛,医生从皮肤里挑出近30处“细针”

环球网资讯
2026-09-04 19:23:18
林肯号近800女兵登岸休整,286天高压封闭部署,她们同样撑到极限

林肯号近800女兵登岸休整,286天高压封闭部署,她们同样撑到极限

近史博览
2026-09-06 10:34:47
2026-09-06 19:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13931文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

杨紫成90后首位白玉兰影后!《家业》热播曝爸爸暖喊:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

手机
艺术
家居
教育
公开课

手机要闻

运营商曝光iPhone 18系列售价,苹果折叠屏售价1.5万元起

艺术要闻

艾琳·汉森 2026年油画新作

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

教育部:把不必要的检查、评比、填表真正减下来,让老师把心安放在课堂,把爱倾注给孩子。(来源:央视新闻)

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版