网易首页 > 网易号 > 正文 申请入驻

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

0
分享至


视觉轨迹充当“同声传译”,让世界模型和机器人动作真正“同频对话”。

作者丨幸丽娟

编辑丨岑 峰

日前,一篇叫做《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的论文悄然上线 arXiv。论文署名中出现了两个大家很熟悉的名字——李飞飞、吴佳俊。


论文链接:https://arxiv.org/html/2608.24101v1

熟悉具身智能圈的人都知道,这两个名字放在一起,分量不轻。

李飞飞是世界模型“空间智能”方向的旗帜人物,而刚刚领完 IJCAI 2026 计算机与思想奖的吴佳俊,则是这一领域最核心的研究者之一。

这两位长期合作的学术战友,最近在具身智能领域动作频频。就在一个月前,他们刚与 ControlNet 作者张吕敏等十余位学者共同发表了《Masked Visual Actions for Unified World Modeling》,把机器人动作渲染成像素轨迹,喂给视频世界模型。

但对于他们而言,之前的尝试或许还不够彻底。

世界模型能看懂机器人动作了,但机器人动作那一侧的问题还卡着:动作怎么实时变成轨迹?世界模型预演完,怎么反过来帮机器人挑动作?

这条往返的路,还没有打通。

这一次,他们直指这个问题的核心:机器人的“动作控制”和世界模型的“预测画面”,说的根本不是同一种语言。

TrAct 的解法,就是在中间配一位“同声传译”。


01

世界模型的“巴别塔”:动作和像素,鸡同鸭讲

先解释一下背景。

现在具身智能行业正在形成一种共识:光靠 VLA“条件反射”式地输出动作不够,得让机器人学会“先在脑子里过一遍”——多个候选动作,交给世界模型预演未来,再挑结果最好的执行。

π0.5、GR00T 这些头部 VLA 模型,在标准基准上已经刷到接近满分。但在真实世界的泛化中,它们依然频频翻车。

因此,世界模型的“预演”能力,被普遍认为是具身智能的下一个关键拼图。

但问题是,“预演”这出戏,主演对不上台词。

机器人控制器输出的是一串低维的“动作方言”:可能是末端位姿,可能是关节角,可能是夹爪开合,也可能三者组合——十几或二十个低维数字。

世界模型需要输出的是高维的“像素画面”:夹爪在画面中的像素坐标、轮廓形状、与物体的距离;面条在每一帧中如何弯曲、滑动、与碗壁碰撞。每一帧可能是 224×224×3 ≈ 15 万像素,16 帧就是 240 万像素。

问题来了:20 个数字怎么推导出 240 万个像素?

从“末端位姿变化 0.02 米”到“夹爪在画面中向右移动了 50 个像素”,中间隔着一整条物理因果链——关节转动、末端接触、物体滑动、相机成像。把前者直接喂给后者,等于给导演看剧本大纲里的 20 个关键词,让他脑补出两个小时的电影。

世界模型就是在硬着头皮干这个"脑补"的活儿。 论文将这种方案称为AWM(Action-conditioned World Model,动作条件世界模型) ——给定动作指令,直接预测未来画面。

不意外的是,这套"硬猜硬译"的方案,翻车姿势非常典型:

夹爪姿态预测错了;背景和目标物体在预测画面里凭空消失;两个相机视角对同一物体的位置判断互相打架。

更要命的是,每一种机器人的“动作方言”都不一样。 Franka 说 Franka 语(末端位姿+夹爪开合),UR5 说 UR5 语(另一套关节参数),双臂机器人又说第三套。

同样是“把面条放进碗里”,每台机器人“念出来的台词”完全不同。

也就是说,换一台机器人,之前学的"动作到画面"的映射几乎作废——跨本体泛化,就成了行业公认的死结。

一边是机器人执行不了的像素,一边是世界模型看不懂的动作。

TrAct 的答案:请一位“同声传译”,把两边的话翻译成彼此都懂的语言。

这位“同声传译”,叫做视觉轨迹(visual track)。


02

TrAct :让视觉轨迹当“同声传译”

视觉轨迹是什么?一句话:具身无关而任务相关的关键点,在图像坐标里随时间移动的路径。

TrAct 会跟踪两类点:

1.夹爪点:机械臂夹爪上的 7 个固定网格顶点,覆盖夹爪的轮廓和运动范围——解决“手怎么动”;

2.场景点:图像平面上 5×5 均匀网格采样的 25 个点,分散在整个画面——解决“环境怎么动”(物体滑动、相机晃动)。

这两类点的分工很明确: 夹爪点是“主动运动”的源头,直接反映机器人的动作意图;网格点是“被动运动”的参照,帮助模型判断画面变化是来自夹爪移动、物体滑动,还是镜头晃动。两者结合,世界模型才能准确理解“哪些像素动、为什么动”。

这套语言妙就妙在“通用”:不管 Franka、UR5 还是人手,把物体放进碗里这个动作,翻译成轨迹都是同一句话——“夹爪关键点沿这条路径移动,物体从当前位置进入碗的区域”。动作带着本体特异性,轨迹却是跨本体的“普通话”。


围绕这个接口,TrAct 搭了一个“剧组”,三个阶段、三个组别分工明确:

VLAT(Vision-Language-Action-and-Track model),出方案的导演组。

在预训练 flow-matching VLA π0.5 的基础上改造动作头,让它同时输出动作块对应的轨迹块。

  • 动作块a是“方言”——末端位姿、关节角、夹爪开合,这些低维的机器人指令;

  • 轨迹块τ是“普通话”——任务相关关键点在图像坐标系中的运动路径。

两者必须严格成对: 每一组候选方案里,动作和轨迹来自同一次策略采样,不能拆开自由组合。这是贯穿全文的一条红线——预演条件是轨迹,执行控制是动作,两者必须对应同一套方案。如果轨迹描绘出一个美好的未来,配对的执行动作却实现不了这条轨迹,预演就成了“自我感动”。

训练时,VLAT同时优化两个流匹配损失:动作损失监督“方言怎么说”,保证指令可执行;轨迹损失监督“普通话怎么写”,保证轨迹准确描述了画面里点的运动轨迹。换句话说,导演组既要把戏排出来(动作),又要把分镜画清楚(轨迹),两条线同时推进。

TWM(Track-conditioned World Model),预演的拍摄组。

分镜画好了,谁来把它变成成片画面?拍摄组上场。

TWM以 Stable Video Diffusion(SVD)为视频生成骨干,增加了一个 Temporal ControlNet 分支,专门把轨迹坐标渲染成空间控制图。智能体视角(agent-view)的轨迹走红色通道,腕部视角(wrist-view)走蓝色通道——两个视角共享时间线,各自保留独立的“机位”。

有了轨迹这个普通话版的“分镜脚本”,世界模型的工作方式彻底变了:

之前(AWM)是“给一串方言,硬猜画面”:给定末端位姿变化0.02米,模型得自己脑补“这会导致夹爪在画面中向右移动50个像素、同时把面条推出去、碗的遮挡关系发生变化……”——整条物理因果链全靠硬猜。

现在(TWM)是“给一段普通话,按脚本渲染画面”:已知关键点从A位置移动到B位置、物体从P点滑到Q点,把对应的像素生成出来就行。

从“因果推理”变成了“条件渲染”,难度降了一个维度。 拍摄组不需要理解“关节转了30度会怎样”,只需要按照分镜把画面拍出来。

VLAC(Vision-Language Reward Model),拍板的审片人。

画面拍出来了,谁来定稿?审片人。

VLAC基于 InternVL2 的视觉语言奖励模型,对每条预演视频按任务指令打分。但它评的不是“画质清不清晰”,而是“任务完成了没有”——面条进碗了吗?夹爪够到目标了吗?关柜门关严了吗?

审片人只看剧情对不对得上剧本。哪怕样片画质有点糊,只要动作做对了,VLAC就给高分;反之,画面再逼真、动作跑偏了,照样不及格。


推理时,三个角色是这么协作的:

1.导演组出方案:每个决策点,VLAT用TSR(Temperature-Scaled Resampling,温度缩放重采样) 生成K个候选动作-轨迹对(仿真K=20,真机K=16)。

2.拍摄组拍画面:TWM拿着每个候选方案里的轨迹,逐一生成预演视频。

3.审片人打分:VLAC对每条预演视频按任务指令打分,选出得分最高的那一条。

4.执行:把那条高分样片对应的动作交给机器人执行。

选中的永远是同一对(a,τ)——预演条件与执行控制来自同一次策略采样。“想得到”(轨迹预演)和“做得到”(动作执行)被绑定,减少中间的信息传递失真。


03

数据引擎:没有动作标签的人类视频,也能“重用”

这套接口的另一重红利,来自于数据侧。

机器人数据贵得离谱,而互联网上人类第一视角操作视频近乎无限——但人类视频没有机器人动作标注,传统 VLA 拿它们没什么办法。

轨迹接口绕开了这堵墙:人类视频虽然给不了“机器人这段方言怎么说”,但完全能给得出“这段画面的分镜脚本长什么样”。

于是 TrAct 的预训练配方是:76K 条 DROID 机器人遥操作数据 + 约 150K 条 EgoDex 人类第一视角操作视频(约占完整 EgoDex 的一半),按 1:2 混合。

DROID 的夹爪 7 点、EgoDex 每只手 7 点加 25 个背景网格点,全部统一映射进同一套轨迹槽位布局——缺失的相机、操控器和轨迹槽位全部用掩码处理。

这意味着什么?人类视频终于不用“翻译成动作”,就能直接参与机器人模型的预训练。

背后的逻辑很清楚:视觉运动是可以跨具身共享的监督信号,而且这个信号的供给几乎是无限的。 人类视频的量级,是机器人遥操作数据永远追不上的。这就让 TrAct 在预训练阶段获得了远超纯机器人数据的运动先验。

数据规模和跨具身通用性,两者在这个接口下被同时激活了。


04

更严酷的考场,更硬核的物理测试

▎仿真基准:LIBERO-INTEGRAL 上全面领先

先说基准。标准 LIBERO 上,各家模型的表现已经接近天花板——π0.5 平均 96.8%,TrAct 98.3%,差距不到 2 个点,说明刷榜刷不出区分度。


于是团队自建了一个更严酷的考场——LIBERO-INTEGRAL,共 20 个任务:

  • 10 个鲁棒性任务:涵盖物体互换(Swap)、物体变化(Object)、任务变化(Task)、相机视角变化(Camera)、机器人初始位姿变化(RobotInit),各 2 个,全部取 LIBERO-Plus 最难档位;

  • 10 个跨具身任务:把场景里的 Franka Panda 直接换成 UR5,任务规范和场景配置保持不变。

“考生”包括四种策略变体:

  • π0.5:基线 VLA 策略

  • VLAT:联合预测视觉轨迹和可执行动作,无动作选择

  • TrAct:完整框架,包含轨迹条件世界模型动作选择

  • VLAT+AWM:用动作条件替代轨迹条件

换到 LIBERO-INTEGRAL这个考场,差距瞬间拉开

• π0.5 平均成功率27%,其中任务变化 15%、跨本体 17%——“换任务”、“换机器人”恰好是其表现最惨的两项,而这正是机器人动作执行的痛点所在;

• VLAT(加轨迹头但不做预演)平均成功率是 44%;

• VLAT+AWM(用动作条件世界模型做预演)平均成功率是 49%;

TrAct 拿下 55%的成功率,比 π0.5 翻了一倍还多,比同样做预演的动作条件版本再高 6 个点。

逐类别看,TrAct 在 Swap 65%、Object 60%、Task 50%、Camera 60%、RobotInit 65%、跨本体 50%,六项全部领先;20 个任务里 18 个拿到最佳或并列最佳。


跨本体任务的细节更能说明问题:

UR5 版“把橙汁放进篮子”,π0.5 成功率 0.0,TrAct 拉到50%;

“把碗放到盘子上”,π0.5 成功率 40%,TrAct 拉到 80%。

当然也有翻车的——“拿番茄酱进篮子”,π0.5 是 0.0,TrAct 也只有 10%。团队没有回避这一点:难任务依然难。


统计显著性也做了确认:三种随机种子的评估中,TrAct 平均 0.547(95% 置信区间 [0.53, 0.56]),VLAT+AWM 平均 0.490([0.47, 0.51]),两个置信区间完全不重叠——改进是真实的,不是抽签抽出来的

▎视频预演质量:有“分镜”的,碾压没“分镜”的

再看世界模型的视频预演质量本身。论文比较了 TWM(轨迹条件,有分镜) 与 AWM(动作条件,没分镜)在仿真和真实两个场景、智能体和腕部两个视角下,在五个标准视频质量指标上的表现:

PSNR:峰值信噪比,越高越好; SSIM:结构相似性指数,越高越好; LPIPS:学习感知图像块相似度,越低越好; FID:弗雷歇起始距离,越低越好; FVD:弗雷歇视频距离,越低越好;

结果,轨迹条件(TWM)对动作条件(AWM)是全指标碾压。

差距最悬殊的是仿真 + 智能体视角这一配置:TWM 比 AWM, PSNR 高出 62%,SSIM 高出 75%,LPIPS 低了 76%, FID 低37%,FVD 低 70%。

真实世界腕部视角同样悬殊:TWM 比 AWM,PSNR高出 22% ;SSIM 高出 19% ;LPIPS 低 40% ;FID 从 176 降至 130,低 26% ;FVD 低 43% 。

两个场景、两个视角、五个指标,TWM 无一例外全部领先。

也就是说,有“分镜”的比没“分镜”的预演画面,质量高出一个维度。把“动作方言”翻译成“轨迹普通话”再预演,比从动作指令硬猜画面,准得多。

▎更硬核的物理机器人实验:继续遥遥领先

仿真里的成功还不够。团队把 TrAct 搬到了真实的 Franka Panda 机器人上,看看它在物理世界里到底扛不扛得住。

机器人配备了两个 RGB 相机——一个从第三方视角看着整个桌面,一个装在夹爪上近距离盯着操作区域。训练数据只有 400 条 15Hz 的演示,覆盖了 4 个基础任务;测试则是 5 个训练时从没见过的任务:

1.将半长粉色面条放入碗中;

2.将热狗面包放入碗中;

3.将绿色砖块放入碗中;

4.关闭部分打开的右柜门;

5.将倾斜勺中的意大利面倒入锅中。

每个任务 10 个 episode,而且不仅要过常规背景这一关,还要在换了桌面背景的陌生环境下再跑一遍——看看它会不会被“换了个桌布”就搞懵。


最终平均成功率:π0.5 是 49%,加上 VLAC 评委直接打分是 65%,VLAT+AWM 是 66%,TrAct 是 76%。

两个任务的细节值得单独拎出来说。


一个是“关右边的柜门”——五个任务里唯一接触密集型的,最能拷打预演精度。

常规背景下,π0.5 只有 50%,VLAT+AWM 也才 60%,TrAct 做到 80%;

换到陌生背景下,动作条件版本直接掉到40%,TrAct 反而稳在 70%。

这就说明,域偏移越大,轨迹接口的优势越明显。因为轨迹描述的是"画面里该怎么动",天然不依赖具体背景长什么样。

另一个是“半根粉色面条放进碗里”,TrAct 在常规背景下拿到了满分。机器臂夹着一段训练时没见过的、更短的面条,稳稳放进碗里。泛化能力,同样肉眼可见。

更大规模的预训练变体TrAct+(76K DROID + 60K BridgeData V2 + 完整 30 万级 EgoDex,8 块 H100 跑 60K 步),也把五个最难的 UR5 任务从 π0.5 的 6%、TrAct 的 32% 进一步拉升到 38%。


这也进一步论证了,接口红利之外,数据规模红利依然在兑现。


05

TrAct 对具身智能行业的意义

回过头来看,TrAct 真正的贡献,并不在于它刷新了 SOTA,而是“接口层”的统一:

以前,动作是世界模型的输入。你给 Franka 语它就学 Franka,给 UR5 语它就学 UR5——换台机器人,推倒重来。

现在,机器人动作和世界模型预测之间有了统一的翻译层。机器人输出动作(方言),轨迹把它翻译成“画面里的点怎么动”(普通话),世界模型拿着翻译结果做预测。

机器人动作和世界模型“鸡同鸭讲”的行业困局,第一次得到系统性的破局。

但硬币的另一面同样清晰,论文自己也交代得明白:

第一,TrAct 不是物理模拟器。轨迹是二维图像空间的点运动,不显式建模力、碰撞和接触状态;它预测的是"看起来会发生什么",不保证“物理上一定发生什么”。

第二,预演的可靠性最终依赖 VLAT 的轨迹预测质量。如果动作本身不可靠,轨迹和动作可能一起错,高分预演不等于安全执行。

第三,它不便宜,每个决策点要跑十几次视频生成和打分,推理成本是真金白银。雷峰网雷峰网雷峰网

第四,真机数据也还是少了点:400 条演示,5 个评测任务,离工业级场景的验证还有距离。

在整个行业都在苦寻大模型如何驱动机器人的当下,大家都在问同一个根本问题:世界模型和机器人之间,到底该用什么语言对话。

TrAct 交出了一份极具启发性的答卷。它证明了,肉眼可见的视觉轨迹,可以成为这一通用的语言。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为什么日本不敢直面历史却妄想赢得信任

为什么日本不敢直面历史却妄想赢得信任

风铃草语
2026-09-17 07:46:16
葡萄牙欧国联大名单将公布,曝41岁C罗不退队,距1000球仅差21球

葡萄牙欧国联大名单将公布,曝41岁C罗不退队,距1000球仅差21球

小火箭爱体育
2026-09-17 20:17:27
“10岁就有九个洞了!”小学女孩早熟视频火了,中学生都看不下去

“10岁就有九个洞了!”小学女孩早熟视频火了,中学生都看不下去

妍妍教育日记
2026-09-11 15:24:51
价格大跳水!暴跌87%

价格大跳水!暴跌87%

无锡eTV全媒体
2026-09-17 13:44:15
37岁吴曦回应吊射世界波:没踢正部位!超龄球员谈不上帮助 一起拼

37岁吴曦回应吊射世界波:没踢正部位!超龄球员谈不上帮助 一起拼

念洲
2026-09-17 07:26:31
算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

扶苏聊历史
2026-09-10 14:58:19
为什么沙特高价战机成了胡塞武装的活靶子?

为什么沙特高价战机成了胡塞武装的活靶子?

小眼睛小世界
2026-09-17 07:20:26
海港、国安、申花取得亚冠开门红,中超官方晒海报祝贺

海港、国安、申花取得亚冠开门红,中超官方晒海报祝贺

懂球帝
2026-09-17 23:09:13
万科大批员工被裁

万科大批员工被裁

地产微资讯
2026-09-15 09:16:28
“这颜值,放艺术生里也是顶级了!”家长晒素颜大一女儿哭鼻子,院校揭晓网友都慕了

“这颜值,放艺术生里也是顶级了!”家长晒素颜大一女儿哭鼻子,院校揭晓网友都慕了

妍妍教育日记
2026-09-14 20:51:56
网上几十年来对西安事变的赞颂从未停歇,我只想说句实话:若无张学良扣押蒋介石,何来西安事变的历史转折?认清核心人物方能读懂历史

网上几十年来对西安事变的赞颂从未停歇,我只想说句实话:若无张学良扣押蒋介石,何来西安事变的历史转折?认清核心人物方能读懂历史

人生录
2026-09-16 00:05:14
比腐败更可怕的,是所有人都在假装岁月静好

比腐败更可怕的,是所有人都在假装岁月静好

笑熬浆糊111
2026-08-17 09:07:45
美军一个排的标准编制,想消灭美军一个排有多难?

美军一个排的标准编制,想消灭美军一个排有多难?

莫地方
2026-09-14 23:20:02
为什么红军到了陕北,就安全了?原因很现实,6个原因

为什么红军到了陕北,就安全了?原因很现实,6个原因

纪史行者
2026-08-10 21:21:43
特斯拉Model Y L后悬架调查追踪:华域汽车旗下公司仍向Model 3、Model Y等供应悬架弹簧,车主手册离地间隙出现两种数据

特斯拉Model Y L后悬架调查追踪:华域汽车旗下公司仍向Model 3、Model Y等供应悬架弹簧,车主手册离地间隙出现两种数据

每日经济新闻
2026-09-17 16:03:50
收回台湾,祖国大陆要承受多大伤亡?中国“专家”:一亿四千万人

收回台湾,祖国大陆要承受多大伤亡?中国“专家”:一亿四千万人

老夳古装影视解说
2026-09-16 17:40:26
悲痛!广州一医学生不幸坠亡,聊天记录显示导师曾转账并关心,家属:很难过,请大家不要再网暴我们和孩子导师

悲痛!广州一医学生不幸坠亡,聊天记录显示导师曾转账并关心,家属:很难过,请大家不要再网暴我们和孩子导师

新快报新闻
2026-09-16 20:17:13
办不起就别办!中国队自费住酒店,泰国队机场打地铺,印度队最惨

办不起就别办!中国队自费住酒店,泰国队机场打地铺,印度队最惨

天马幸福的人生
2026-09-17 20:25:07
杨毅怼苏群:918中日对决只是普通比赛?真清高!出事你从不担责

杨毅怼苏群:918中日对决只是普通比赛?真清高!出事你从不担责

念洲
2026-09-17 16:37:13
寿命长不长,牙齿先知?65岁后,掉牙多的人活得久?告诉你答案

寿命长不长,牙齿先知?65岁后,掉牙多的人活得久?告诉你答案

医学科普汇
2026-09-17 17:45:08
2026-09-17 23:51:00
雷峰网 incentive-icons
雷峰网
关注智能与未来!
71017文章数 656242关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

时尚
本地
数码
家居
房产

受够了逆天女装,年轻女孩们开始手搓内裤

本地新闻

不止胖东来!许昌藏着半部三国史

数码要闻

Bose Ultra Open Earbuds夹耳式无线耳机发布,售价299美元

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

突发!三亚安居房出台新政!

无障碍浏览 进入关怀版