网易首页 > 网易号 > 正文 申请入驻

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

0
分享至


视觉轨迹充当“同声传译”,让世界模型和机器人动作真正“同频对话”。

作者丨幸丽娟

编辑丨岑 峰

日前,一篇叫做《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的论文悄然上线 arXiv。论文署名中出现了两个大家很熟悉的名字——李飞飞、吴佳俊。


论文链接:https://arxiv.org/html/2608.24101v1

熟悉具身智能圈的人都知道,这两个名字放在一起,分量不轻。

李飞飞是世界模型“空间智能”方向的旗帜人物,而刚刚领完 IJCAI 2026 计算机与思想奖的吴佳俊,则是这一领域最核心的研究者之一。

这两位长期合作的学术战友,最近在具身智能领域动作频频。就在一个月前,他们刚与 ControlNet 作者张吕敏等十余位学者共同发表了《Masked Visual Actions for Unified World Modeling》,把机器人动作渲染成像素轨迹,喂给视频世界模型。

但对于他们而言,之前的尝试或许还不够彻底。

世界模型能看懂机器人动作了,但机器人动作那一侧的问题还卡着:动作怎么实时变成轨迹?世界模型预演完,怎么反过来帮机器人挑动作?

这条往返的路,还没有打通。

这一次,他们直指这个问题的核心:机器人的“动作控制”和世界模型的“预测画面”,说的根本不是同一种语言。

TrAct 的解法,就是在中间配一位“同声传译”。

01


世界模型的“巴别塔”:

动作和像素,鸡同鸭讲

先解释一下背景。

现在具身智能行业正在形成一种共识:光靠 VLA“条件反射”式地输出动作不够,得让机器人学会“先在脑子里过一遍”——多个候选动作,交给世界模型预演未来,再挑结果最好的执行。

π0.5、GR00T 这些头部 VLA 模型,在标准基准上已经刷到接近满分。但在真实世界的泛化中,它们依然频频翻车。

因此,世界模型的“预演”能力,被普遍认为是具身智能的下一个关键拼图。

但问题是,“预演”这出戏,主演对不上台词。

机器人控制器输出的是一串低维的“动作方言”:可能是末端位姿,可能是关节角,可能是夹爪开合,也可能三者组合——十几或二十个低维数字。

世界模型需要输出的是高维的“像素画面”:夹爪在画面中的像素坐标、轮廓形状、与物体的距离;面条在每一帧中如何弯曲、滑动、与碗壁碰撞。每一帧可能是 224×224×3 ≈ 15 万像素,16 帧就是 240 万像素。

问题来了:20 个数字怎么推导出 240 万个像素?

从“末端位姿变化 0.02 米”到“夹爪在画面中向右移动了 50 个像素”,中间隔着一整条物理因果链——关节转动、末端接触、物体滑动、相机成像。把前者直接喂给后者,等于给导演看剧本大纲里的 20 个关键词,让他脑补出两个小时的电影。

世界模型就是在硬着头皮干这个"脑补"的活儿。 论文将这种方案称为AWM(Action-conditioned World Model,动作条件世界模型) ——给定动作指令,直接预测未来画面。

不意外的是,这套"硬猜硬译"的方案,翻车姿势非常典型:

夹爪姿态预测错了;背景和目标物体在预测画面里凭空消失;两个相机视角对同一物体的位置判断互相打架。

更要命的是,每一种机器人的“动作方言”都不一样。 Franka 说 Franka 语(末端位姿+夹爪开合),UR5 说 UR5 语(另一套关节参数),双臂机器人又说第三套。

同样是“把面条放进碗里”,每台机器人“念出来的台词”完全不同。

也就是说,换一台机器人,之前学的"动作到画面"的映射几乎作废——跨本体泛化,就成了行业公认的死结。

一边是机器人执行不了的像素,一边是世界模型看不懂的动作。

TrAct 的答案:请一位“同声传译”,把两边的话翻译成彼此都懂的语言。

这位“同声传译”,叫做视觉轨迹(visual track)。

02


TrAct :让视觉轨迹当“同声传译”

视觉轨迹是什么?一句话:具身无关而任务相关的关键点,在图像坐标里随时间移动的路径。

TrAct 会跟踪两类点:

1.夹爪点:机械臂夹爪上的 7 个固定网格顶点,覆盖夹爪的轮廓和运动范围——解决“手怎么动”;

2.场景点:图像平面上 5×5 均匀网格采样的 25 个点,分散在整个画面——解决“环境怎么动”(物体滑动、相机晃动)。

这两类点的分工很明确: 夹爪点是“主动运动”的源头,直接反映机器人的动作意图;网格点是“被动运动”的参照,帮助模型判断画面变化是来自夹爪移动、物体滑动,还是镜头晃动。两者结合,世界模型才能准确理解“哪些像素动、为什么动”。

这套语言妙就妙在“通用”:不管 Franka、UR5 还是人手,把物体放进碗里这个动作,翻译成轨迹都是同一句话——“夹爪关键点沿这条路径移动,物体从当前位置进入碗的区域”。动作带着本体特异性,轨迹却是跨本体的“普通话”。


围绕这个接口,TrAct 搭了一个“剧组”,三个阶段、三个组别分工明确:

VLAT(Vision-Language-Action-and-Track model),出方案的导演组。

在预训练 flow-matching VLA π0.5 的基础上改造动作头,让它同时输出动作块对应的轨迹块。

  • 动作块 a是“方言”——末端位姿、关节角、夹爪开合,这些低维的机器人指令;

  • 轨迹块 τ 是“普通话”——任务相关关键点在图像坐标系中的运动路径。

两者必须严格成对: 每一组候选方案里,动作和轨迹来自同一次策略采样,不能拆开自由组合。这是贯穿全文的一条红线——预演条件是轨迹,执行控制是动作,两者必须对应同一套方案。如果轨迹描绘出一个美好的未来,配对的执行动作却实现不了这条轨迹,预演就成了“自我感动”。

训练时,VLAT同时优化两个流匹配损失:动作损失监督“方言怎么说”,保证指令可执行;轨迹损失监督“普通话怎么写”,保证轨迹准确描述了画面里点的运动轨迹。换句话说,导演组既要把戏排出来(动作),又要把分镜画清楚(轨迹),两条线同时推进。

TWM(Track-conditioned World Model),预演的拍摄组。

分镜画好了,谁来把它变成成片画面?拍摄组上场。

TWM以 Stable Video Diffusion(SVD)为视频生成骨干,增加了一个 Temporal ControlNet 分支,专门把轨迹坐标渲染成空间控制图。智能体视角(agent-view)的轨迹走红色通道,腕部视角(wrist-view)走蓝色通道——两个视角共享时间线,各自保留独立的“机位”。

有了轨迹这个普通话版的“分镜脚本”,世界模型的工作方式彻底变了:

之前(AWM)是“给一串方言,硬猜画面”:给定末端位姿变化0.02米,模型得自己脑补“这会导致夹爪在画面中向右移动50个像素、同时把面条推出去、碗的遮挡关系发生变化……”——整条物理因果链全靠硬猜。

现在(TWM)是“给一段普通话,按脚本渲染画面”:已知关键点从A位置移动到B位置、物体从P点滑到Q点,把对应的像素生成出来就行。

从“因果推理”变成了“条件渲染”,难度降了一个维度。 拍摄组不需要理解“关节转了30度会怎样”,只需要按照分镜把画面拍出来。

VLAC(Vision-Language Reward Model),拍板的审片人。

画面拍出来了,谁来定稿?审片人。

VLAC基于 InternVL2 的视觉语言奖励模型,对每条预演视频按任务指令打分。但它评的不是“画质清不清晰”,而是“任务完成了没有”——面条进碗了吗?夹爪够到目标了吗?关柜门关严了吗?

审片人只看剧情对不对得上剧本。哪怕样片画质有点糊,只要动作做对了,VLAC就给高分;反之,画面再逼真、动作跑偏了,照样不及格。


推理时,三个角色是这么协作的:

1.导演组出方案:每个决策点,VLAT用TSR(Temperature-Scaled Resampling,温度缩放重采样) 生成K个候选动作-轨迹对(仿真K=20,真机K=16)。

2.拍摄组拍画面:TWM拿着每个候选方案里的轨迹,逐一生成预演视频。

3.审片人打分:VLAC对每条预演视频按任务指令打分,选出得分最高的那一条。

4.执行:把那条高分样片对应的动作交给机器人执行。

选中的永远是同一对(a,τ)——预演条件与执行控制来自同一次策略采样。“想得到”(轨迹预演)和“做得到”(动作执行)被绑定,减少中间的信息传递失真。

03


数据引擎:没有动作标签的

人类视频,也能“重用”

这套接口的另一重红利,来自于数据侧。

机器人数据贵得离谱,而互联网上人类第一视角操作视频近乎无限——但人类视频没有机器人动作标注,传统 VLA 拿它们没什么办法。

轨迹接口绕开了这堵墙:人类视频虽然给不了“机器人这段方言怎么说”,但完全能给得出“这段画面的分镜脚本长什么样”。

于是 TrAct 的预训练配方是:76K 条 DROID 机器人遥操作数据 + 约 150K 条 EgoDex 人类第一视角操作视频(约占完整 EgoDex 的一半),按 1:2 混合。

DROID 的夹爪 7 点、EgoDex 每只手 7 点加 25 个背景网格点,全部统一映射进同一套轨迹槽位布局——缺失的相机、操控器和轨迹槽位全部用掩码处理。

这意味着什么?人类视频终于不用“翻译成动作”,就能直接参与机器人模型的预训练。

背后的逻辑很清楚:视觉运动是可以跨具身共享的监督信号,而且这个信号的供给几乎是无限的。 人类视频的量级,是机器人遥操作数据永远追不上的。这就让 TrAct 在预训练阶段获得了远超纯机器人数据的运动先验。

数据规模和跨具身通用性,两者在这个接口下被同时激活了。

04


更严酷的考场,

更硬核的物理测试

仿真基准:LIBERO-INTEGRAL 上全面领先

先说基准。标准 LIBERO 上,各家模型的表现已经接近天花板——π0.5 平均 96.8%,TrAct 98.3%,差距不到 2 个点,说明刷榜刷不出区分度。


于是团队自建了一个更严酷的考场——LIBERO-INTEGRAL,共 20 个任务:

  • 10 个鲁棒性任务:涵盖物体互换(Swap)、物体变化(Object)、任务变化(Task)、相机视角变化(Camera)、机器人初始位姿变化(RobotInit),各 2 个,全部取 LIBERO-Plus 最难档位;

  • 10 个跨具身任务:把场景里的 Franka Panda 直接换成 UR5,任务规范和场景配置保持不变。

“考生”包括四种策略变体:

  • π0.5:基线 VLA 策略

  • VLAT:联合预测视觉轨迹和可执行动作,无动作选择

  • TrAct:完整框架,包含轨迹条件世界模型动作选择

  • VLAT+AWM:用动作条件替代轨迹条件


换到 LIBERO-INTEGRAL这个考场,差距瞬间拉开

• π0.5 平均成功率27%,其中任务变化 15%、跨本体 17%——“换任务”、“换机器人”恰好是其表现最惨的两项,而这正是机器人动作执行的痛点所在;

• VLAT(加轨迹头但不做预演)平均成功率是 44%;

• VLAT+AWM(用动作条件世界模型做预演)平均成功率是 49%;

TrAct 拿下 55%的成功率,比 π0.5 翻了一倍还多,比同样做预演的动作条件版本再高 6 个点。

逐类别看,TrAct 在 Swap 65%、Object 60%、Task 50%、Camera 60%、RobotInit 65%、跨本体 50%,六项全部领先;20 个任务里 18 个拿到最佳或并列最佳。


跨本体任务的细节更能说明问题:

UR5 版“把橙汁放进篮子”,π0.5 成功率 0.0,TrAct 拉到50%;

“把碗放到盘子上”,π0.5 成功率 40%,TrAct 拉到 80%。

当然也有翻车的——“拿番茄酱进篮子”,π0.5 是 0.0,TrAct 也只有 10%。团队没有回避这一点:难任务依然难。


统计显著性也做了确认:三种随机种子的评估中,TrAct 平均 0.547(95% 置信区间 [0.53, 0.56]),VLAT+AWM 平均 0.490([0.47, 0.51]),两个置信区间完全不重叠——改进是真实的,不是抽签抽出来的

视频预演质量:有“分镜”的,碾压没“分镜”的

再看世界模型的视频预演质量本身。论文比较了 TWM(轨迹条件,有分镜) 与 AWM(动作条件,没分镜)在仿真和真实两个场景、智能体和腕部两个视角下,在五个标准视频质量指标上的表现:

PSNR:峰值信噪比,越高越好; SSIM:结构相似性指数,越高越好; LPIPS:学习感知图像块相似度,越低越好; FID:弗雷歇起始距离,越低越好; FVD:弗雷歇视频距离,越低越好;


结果,轨迹条件(TWM)对动作条件(AWM)是全指标碾压。

差距最悬殊的是仿真 + 智能体视角这一配置:TWM 比 AWM, PSNR 高出 62%,SSIM 高出 75%,LPIPS 低了 76%, FID 低37%,FVD 低 70%。

真实世界腕部视角同样悬殊:TWM 比 AWM,PSNR高出 22% ;SSIM 高出 19% ;LPIPS 低 40% ;FID 从 176 降至 130,低 26% ;FVD 低 43% 。

两个场景、两个视角、五个指标,TWM 无一例外全部领先。

也就是说,有“分镜”的比没“分镜”的预演画面,质量高出一个维度。把“动作方言”翻译成“轨迹普通话”再预演,比从动作指令硬猜画面,准得多。

更硬核的物理机器人实验:继续遥遥领先

仿真里的成功还不够。团队把 TrAct 搬到了真实的 Franka Panda 机器人上,看看它在物理世界里到底扛不扛得住。

机器人配备了两个 RGB 相机——一个从第三方视角看着整个桌面,一个装在夹爪上近距离盯着操作区域。训练数据只有 400 条 15Hz 的演示,覆盖了 4 个基础任务;测试则是 5 个训练时从没见过的任务:

1.将半长粉色面条放入碗中;

2.将热狗面包放入碗中;

3.将绿色砖块放入碗中;

4.关闭部分打开的右柜门;

5.将倾斜勺中的意大利面倒入锅中。

每个任务 10 个 episode,而且不仅要过常规背景这一关,还要在换了桌面背景的陌生环境下再跑一遍——看看它会不会被“换了个桌布”就搞懵。


最终平均成功率:π0.5 是 49%,加上 VLAC 评委直接打分是 65%,VLAT+AWM 是 66%,TrAct 是 76%。

两个任务的细节值得单独拎出来说。


一个是关右边的柜门”——五个任务里唯一接触密集型的,最能拷打预演精度。

常规背景下,π0.5 只有 50%,VLAT+AWM 也才 60%,TrAct 做到 80%;

换到陌生背景下,动作条件版本直接掉到40%,TrAct 反而稳在 70%。

这就说明,域偏移越大,轨迹接口的优势越明显。因为轨迹描述的是"画面里该怎么动",天然不依赖具体背景长什么样。

另一个是“半根粉色面条放进碗里”,TrAct 在常规背景下拿到了满分。机器臂夹着一段训练时没见过的、更短的面条,稳稳放进碗里。泛化能力,同样肉眼可见。

更大规模的预训练变体TrAct+(76K DROID + 60K BridgeData V2 + 完整 30 万级 EgoDex,8 块 H100 跑 60K 步),也把五个最难的 UR5 任务从 π0.5 的 6%、TrAct 的 32% 进一步拉升到 38%。


这也进一步论证了,接口红利之外,数据规模红利依然在兑现。

05


TrAct 对具身智能行业的意义

回过头来看,TrAct 真正的贡献,并不在于它刷新了 SOTA,而是“接口层”的统一:

以前,动作是世界模型的输入。你给 Franka 语它就学 Franka,给 UR5 语它就学 UR5——换台机器人,推倒重来。

现在,机器人动作和世界模型预测之间有了统一的翻译层。机器人输出动作(方言),轨迹把它翻译成“画面里的点怎么动”(普通话),世界模型拿着翻译结果做预测。

机器人动作和世界模型“鸡同鸭讲”的行业困局,第一次得到系统性的破局。

但硬币的另一面同样清晰,论文自己也交代得明白:

第一,TrAct 不是物理模拟器。轨迹是二维图像空间的点运动,不显式建模力、碰撞和接触状态;它预测的是"看起来会发生什么",不保证“物理上一定发生什么”。

第二,预演的可靠性最终依赖 VLAT 的轨迹预测质量。如果动作本身不可靠,轨迹和动作可能一起错,高分预演不等于安全执行。

第三,它不便宜,每个决策点要跑十几次视频生成和打分,推理成本是真金白银。

第四,真机数据也还是少了点:400 条演示,5 个评测任务,离工业级场景的验证还有距离。

在整个行业都在苦寻大模型如何驱动机器人的当下,大家都在问同一个根本问题:世界模型和机器人之间,到底该用什么语言对话。

TrAct 交出了一份极具启发性的答卷。它证明了,肉眼可见的视觉轨迹,可以成为这一通用的语言。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
情况不妙了,另一场大战随时开打,朝俄动作不断,中国避得开?

情况不妙了,另一场大战随时开打,朝俄动作不断,中国避得开?

史潎的生活日记
2026-09-21 18:19:22
湖南二婚女爱上美国大叔,带儿子远嫁美国,现在却要和宠物狗争宠

湖南二婚女爱上美国大叔,带儿子远嫁美国,现在却要和宠物狗争宠

橘仔看世界
2026-09-23 18:35:15
毛伟杰是少数亮点,U23国足后防不稳,胡荷韬传球失误多,依木兰不受重用

毛伟杰是少数亮点,U23国足后防不稳,胡荷韬传球失误多,依木兰不受重用

替补席看球
2026-09-23 15:53:07
张展硕破纪录成绩有多强?过去3届奥运均能夺冠,现役仅1人能超他

张展硕破纪录成绩有多强?过去3届奥运均能夺冠,现役仅1人能超他

全景体育V
2026-09-23 17:17:43
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
王东伟任安徽省委副书记,省政府党组书记、代理省长

王东伟任安徽省委副书记,省政府党组书记、代理省长

界面新闻
2026-09-23 18:44:49
被批"太暴露"后,她穿三件内衣登台,网友笑疯

被批"太暴露"后,她穿三件内衣登台,网友笑疯

热搜摘要官
2026-09-21 16:39:09
章子怡湾区晚会状态引热议:不是胖了老了,是活成了另一种境界

章子怡湾区晚会状态引热议:不是胖了老了,是活成了另一种境界

小椰的奶奶
2026-09-22 14:36:12
中央5台直播亚运女篮时间表:9月24日CCTV5直播中国PK蒙古冲击4强

中央5台直播亚运女篮时间表:9月24日CCTV5直播中国PK蒙古冲击4强

薇说体育
2026-09-23 17:24:43
超长长长长长蛋挞,你还敢吃吗?你也被收割了吗?爆出内幕了

超长长长长长蛋挞,你还敢吃吗?你也被收割了吗?爆出内幕了

西楼知趣杂谈
2026-09-22 20:06:45
孙千肚子上的肉也太真实了!我盯了半天,普通女生谁还敢饿自己

孙千肚子上的肉也太真实了!我盯了半天,普通女生谁还敢饿自己

南万说娱26
2026-09-21 08:50:16
一斤等于10斤菠菜!一护肝,二润肠,三排毒,不吃亏大了

一斤等于10斤菠菜!一护肝,二润肠,三排毒,不吃亏大了

美食店主
2026-09-16 02:21:46
深业集团:有错就要认,被打要立正

深业集团:有错就要认,被打要立正

大嘴説
2026-09-23 14:39:38
蔡澜说,刘銮雄追女明星,都是先送3000万,这样90%港姐可以拿下

蔡澜说,刘銮雄追女明星,都是先送3000万,这样90%港姐可以拿下

晓銊就是我
2026-09-07 12:39:23
俄方:泽连斯基的声明自相矛盾

俄方:泽连斯基的声明自相矛盾

参考消息
2026-09-23 13:29:26
没想到人性中的恶如此恐怖!网友隐姓埋名分享真实经历,我大为震撼

没想到人性中的恶如此恐怖!网友隐姓埋名分享真实经历,我大为震撼

夜深爱杂谈
2026-08-25 19:54:03
如今黄金价格变成了一个天大的笑话,买黄金的人可笑到什么程度?

如今黄金价格变成了一个天大的笑话,买黄金的人可笑到什么程度?

史虇的生活科普
2026-09-03 16:32:12
国家一级女演员陈丽云被逮捕!

国家一级女演员陈丽云被逮捕!

许三岁
2026-03-28 09:24:30
24股今日获机构买入评级 6股上涨空间超20%

24股今日获机构买入评级 6股上涨空间超20%

证券时报
2026-09-23 17:58:02
2026-09-23 21:31:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

时尚
艺术
健康
教育
军事航空

这些老电影里的穿搭技巧,很绝!

艺术要闻

深圳4座新全球总部:大疆尖塔、京东画境、OPPO曲面、科达利窗口

痘痘没成熟,千万别硬挤!

教育要闻

拯救躺平的孩子有个最简单办法:把他当“狗”养!

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版