网易首页 > 网易号 > 正文 申请入驻

李飞飞团队发布新一代世界模型Atlas:从零训练,一次性打通视频生成、 3D重建与机器人仿真

0
分享至



今天,李飞飞创办的空间智能公司 World Labs 发布了新一代世界模型 Atlas。World Labs 在社交平台上将其称为“全球首个多模态世界模型”,希望用同一个基础模型同时完成视频生成、3D 重建和时空模拟。

和目前主流的视频生成模型不同,Atlas 并不是在现有视频或 3D 模型上继续改造而来。World Labs 从零开始对它进行预训练,让文本、图像、视频和 3D 数据从训练起步阶段就进入同一个模型,并尝试把这些不同形式的信息统一理解为同一个三维空间。


(来源:X)

基于这个空间,它既可以从一张照片生成新的视角,也可以按照给定的镜头轨迹生成最长 1 分钟、1440p 的视频,还能将照片和视频重新构建成点云和 3D 高斯泼溅(Gaussian Splatting)场景,进一步用于影视制作、游戏以及机器人仿真。

Atlas 目前已经向少数合作伙伴开放早期测试,未来也会成为 World Labs 旗下 3D 世界生成产品 Marble 的底层模型。

这也是 World Labs 成立两年以来最重要的一次基础模型发布。这家公司由李飞飞与 Justin Johnson、Christoph Lassner、Ben Mildenhall 共同创立,后几位分别来自计算机视觉、生成式 AI 和计算机图形学领域。

2024 年,World Labs 以 2.3 亿美元融资正式走出隐身模式;今年 2 月,公司又完成 10 亿美元新融资,其中 Autodesk 投资 2 亿美元,AMD、英伟达和 Fidelity 等也参与其中。

过去两年,World Labs 一直在强调一个判断:语言模型让机器学会了处理“文字”,下一步则需要让 AI 真正理解“空间”。

一个模型,同时生成视频和重建 3D 世界

Atlas 最核心的变化,是把相机在三维空间中的位置和姿态直接变成模型的一种原生输入。

普通视频模型接受“镜头向左移动”“绕着物体旋转”等自然语言指令后,本质上仍然是在像素空间里猜测后续画面。Atlas 则会把每一张输入图像与对应的相机位置绑定起来,放进一个共享的 Spatial Context(空间上下文)。

对于这个能力,我们可以简单理解为:模型不仅知道“这张照片里有什么”,还知道“这张照片是从空间中的哪里拍出来的”。

因此,当用户移动摄像机时,Atlas 要做的不只是生成另一张看起来合理的图片,还要尽量让新的画面与此前观察到的空间结构保持一致。对于原图中没有出现的区域,模型再利用自身的世界知识补全。World Labs 展示的例子中,只给 Atlas 一张机器人的正面照片,再把镜头绕到背后,模型能够生成此前完全没有出现在输入中的机器人背面以及周围环境。

这种机制也让 Atlas 获得了比普通视频模型精细得多的运镜控制。

World Labs 在社交平台展示的一段视频中,团队只提供了 7 张参考图,然后人工设计了一整条相机轨迹,Atlas 最终生成了一段 1 分钟、1440p 的连续视频。镜头可以在复杂场景中前进、旋转、转向,而不是只能依赖一句“航拍”“推进镜头”来碰运气。

World Labs 还做了一组相机控制测试。Atlas 与 Seedance 2.5、FLUX 3、Gemini Omni Flash 等模型分别按照指定镜头轨迹生成视频,再由第三方标注者判断哪一段更符合预定运镜。在与 Seedance 2.5 的对比中,94% 的评审选择了 Atlas;与 Gemini Omni Flash 对比时,这一比例为 81%。

不过这组测试也有一个需要注意的地方:Atlas 可以直接读取精确的相机轨迹,而其他视频模型并不支持这种输入,因此 World Labs 只能把相同的镜头运动转换成文字提示。这实际上既体现了 Atlas 的优势,也意味着它并不是完全同条件的纯视频质量比较。

Atlas 的第二项能力则更接近传统计算机视觉:从稀疏图片重新构建 3D 世界。

一张照片也可以完成,但需注意,这里的“重建”并不代表照片之外的部分是真实的。

World Labs 展示了一个案例。第一次只输入一张花园照片时,Atlas 能从空中重新观察这个花园,但花园以外的房屋和环境基本都是模型根据常识“想象”出来的;加入第二张小屋照片后,小屋的位置开始与真实环境对应;再加入第三张主屋照片后,整个空间才进一步接近实际场景。

World Labs 将这套机制概括为:模型看到得越多,需要想象的就越少。通常两三张图片已经可以得到较为忠实的重建,而 Atlas 最多也能利用超过 100 张图片作为空间上下文。

更重要的是,它得到的并不只有一段“看起来像 3D”的视频。

Atlas 可以同时预测每一帧的深度,把结果组合成点云,并进一步生成 3D高斯泼溅场景。后者可以直接在本地以较高帧率渲染,也是 World Labs 目前 Marble 产品使用的 3D 表示形式。这代表着同一个模型生成的结果,可以进一步进入游戏、VFX、建筑设计等现有 3D 工作流。

几部手机,为机器人重建真实世界

如果说前两项能力主要解决的是空间,Atlas 更进一步的目标则是把时间也放进世界模型。

World Labs 展示了一个类似《黑客帝国》“子弹时间”的案例。

传统的多视角自由视点视频,通常需要大量同步摄像机和专门的拍摄系统。World Labs 的研究人员只使用 3—5 台普通手机或运动相机,从几个方向同时拍摄动态事件。Atlas 将这些视角重新对齐并建立空间模型后,用户可以在事件已经发生以后,再从现实中根本不存在的摄影机位置观看同一个瞬间。


(来源:World Labs)

而这项能力最终指向的,不只有影视制作。World Labs 同时展示了 Atlas 在机器人 Real-to-Sim (真实到仿真)中的应用。

研究人员首先用手机视频拍摄两个真实环境,分别从视频中选取 24 帧完成空间重建;随后让不同形态的机器人沿着任意路径在这个虚拟空间中移动。除了重建环境本身,Atlas 还会根据机器人的位置,生成其机载摄像头应该观察到的 RGB 图像和深度数据。

随着机器人在其中移动,它还需要持续获得与当前位置对应的视觉和深度观测。Atlas 希望把这两件事交给同一个模型完成:既重建机器人所在的世界,也生成机器人在这个世界中“看到”的内容。

World Labs 还展示了进一步面向机器人操作的实验。通过少量真实世界录像,Atlas 可以辅助建立包含物体运动和交互的模拟场景,包括刚体、带关节物体以及可变形物体。完成模拟后,研究人员还可以改变物体及其位置、机器人动作、光照和背景,从同一个真实任务中扩展出更多训练和测试环境。

过去如果想把一家真实工厂、一间仓库或者一套住宅转化成可用于机器人模拟的环境,往往需要更复杂的扫描和建模设备。World Labs 希望借助世界模型,把其中相当一部分过程压缩成普通手机就能够完成的数据采集。

Atlas 之所以能够在视频生成、3D 重建和机器人模拟之间切换,也与它的底层架构有关。

Atlas 是一个多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer)。和普通视频模型不同,文本、图像、相机位姿和 3D 深度图等不同信息都会被放进同一个序列中,每一张图像和深度图还会与明确的相机位置绑定,由此组成一个共享的 Spatial Context。

在生成过程中,Atlas 又结合了两套我们已经熟悉的技术路线:一方面,它像语言模型一样采用自回归方式,根据此前的上下文逐个生成新的元素;另一方面,它又像现代图像和视频模型一样,通过扩散模型的逐步去噪处理高维视觉信息。


(来源:World Labs)

世界模型正在从“生成画面”走向“建立空间”

Atlas 不是过去一年出现的第一个世界模型。

2025 年 8 月,Google DeepMind 发布 Genie 3,可以从文本实时生成 720p、20—24fps 的交互式环境,并在几分钟内维持基本的一致性;去年 11 月,World Labs 自己推出的 Marble 已经可以接受文本、图片、视频和粗略 3D 布局,生成可自由探索和导出的 3D 世界;今年 6 月,英伟达又推出 Cosmos 3,用统一架构处理语言、图像、视频、声音和机器人动作,将世界模拟进一步延伸到 Physical AI。

因此,如果严格按照行业定义来看,“全球首个多模态世界模型”其实并不是一个没有争议的说法。World Labs 自己此前就将 Marble 称为多模态世界模型,英伟达也将 Cosmos 3 称为全模态世界模型(omnimodal world model)。

Atlas 更值得关注的地方,是把过去相对分离的生成、重建和模拟任务,进一步放进了一个以 3D 空间为核心的统一基础模型里。

今年 6 月,李飞飞和 World Labs 曾经把现阶段的世界模型分成三类:负责产生视觉画面的 Renderer(渲染器)、负责建立几何结构和物理环境的 Simulator(模拟器),以及负责决定智能体下一步行动的 Planner(规划器)。他们当时提出,最终目标应该是让这三个方向重新汇合到一个统一的世界模型中。

Atlas 显然是朝这个方向迈出的一步:它已经开始同时承担渲染器和模拟器的部分工作。但距离真正能够“模拟现实世界”,它仍然有明显距离。

目前 Atlas 公布的机器人案例主要证明了空间重建、视觉观测生成和简单物体交互能力,World Labs 尚未公布它在碰撞、摩擦、材料特性、复杂动力学以及长时间物理演化上的系统性测试,也没有证明由 Atlas 生成的模拟环境能够稳定提高机器人策略在真实世界中的成功率。

世界模型用于机器人训练时,最危险的问题恰恰是一个视觉上完全合理的世界,在物理上却可能是错误的。相关研究者也一直将 sim-to-real gap视为这类技术必须解决的核心问题。

与此同时,Atlas 目前还没有公开模型参数规模、训练数据量和训练算力,也没有发布权重;它刚刚进入少量合作伙伴的早期测试阶段,目前的能力和 benchmark 主要来自 World Labs 自己公布的结果,还缺少独立测试。

因此,Atlas 现在还不能被简单理解成一个已经能够“预测现实”的物理世界模拟器。

但它展现出了一条越来越明确的技术路线:过去的生成模型学习如何根据已有像素预测下一帧,而世界模型正在尝试回答一个更复杂的问题——如果摄像机移动到世界中的另一个位置,会看到什么;如果一个物体或机器人在这个世界里开始运动,接下来又会发生什么。

1.https://www.worldlabs.ai/blog/atlas

2.https://www.worldlabs.ai/atlas

3.https://www.worldlabs.ai/blog/marble-world-model

4.https://www.worldlabs.ai/blog/taxonomy-of-world-models

5.https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/

6.https://www.nvidia.com/en-us/ai/cosmos/

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
随着莱巴金娜2-1高芙 萨巴伦卡2-0,美网决赛对阵出炉,奖金3692万

随着莱巴金娜2-1高芙 萨巴伦卡2-0,美网决赛对阵出炉,奖金3692万

侃球熊弟
2026-09-11 11:10:13
清远英德市原副市长罗伟权被查

清远英德市原副市长罗伟权被查

新快报新闻
2026-09-11 14:05:09
奉劝所有人,今年冬天务必做好心理准备!世界气象组织9月3日确认厄尔尼诺将进一步增强,可能影响今冬温度和降水格局

奉劝所有人,今年冬天务必做好心理准备!世界气象组织9月3日确认厄尔尼诺将进一步增强,可能影响今冬温度和降水格局

扶苏聊历史
2026-09-11 14:01:29
太打脸!外国网友集体开喷:iPhone Duo照搬华为 Pura X,洗都洗不白

太打脸!外国网友集体开喷:iPhone Duo照搬华为 Pura X,洗都洗不白

数码八叔
2026-09-11 13:18:04
两性专家说:做老婆的,别管男人跟谁睡,他出去了,不在你身边,你管他干什么?只要不要损害这个家庭的经济利益,就不要生闲气

两性专家说:做老婆的,别管男人跟谁睡,他出去了,不在你身边,你管他干什么?只要不要损害这个家庭的经济利益,就不要生闲气

心理观察局
2026-09-11 06:59:05
碰臀女生没等来正式录取,先等来马来亚大学调查,学费恐要打水漂

碰臀女生没等来正式录取,先等来马来亚大学调查,学费恐要打水漂

陈博世财经
2026-09-11 11:56:47
中方赴印代表团规模有多大?外交部:目前无可提供的信息

中方赴印代表团规模有多大?外交部:目前无可提供的信息

澎湃新闻
2026-09-11 15:26:29
苹果官网更新iPhone 18系列和iPhone Duo国行售价

苹果官网更新iPhone 18系列和iPhone Duo国行售价

财闻
2026-09-10 02:41:45
iPhone Duo 大圆角设计真丑!黔驴技穷,苹果早就不行了

iPhone Duo 大圆角设计真丑!黔驴技穷,苹果早就不行了

喜爱的CAD
2026-09-10 10:42:16
离婚4年后,黄晓明首谈失败婚姻,结婚时不成熟做了错误的评估

离婚4年后,黄晓明首谈失败婚姻,结婚时不成熟做了错误的评估

椰黄娱乐
2026-09-11 10:58:22
不装了!公开挑衅!美国中情局副局长放话:要扩大对华间谍活动,中企是“目标”

不装了!公开挑衅!美国中情局副局长放话:要扩大对华间谍活动,中企是“目标”

每日经济新闻
2026-09-10 21:56:54
已破案!员工裸奔涉事上市公司出来认领了

已破案!员工裸奔涉事上市公司出来认领了

财通社
2026-09-10 20:51:58
杜兰特首秀27分8助攻零失误 火箭127比119赢下内部对抗

杜兰特首秀27分8助攻零失误 火箭127比119赢下内部对抗

刘哥谈体育
2026-09-11 09:23:51
吴柳芳称直播带货销量不理想,账号超90%是男粉,但“他们不消费”

吴柳芳称直播带货销量不理想,账号超90%是男粉,但“他们不消费”

韩小娱
2026-09-10 09:05:17
招行原副行长施顺华被查 此前已有两名原副行长先后被查

招行原副行长施顺华被查 此前已有两名原副行长先后被查

科技金融在线
2026-09-11 17:52:53
打不赢伊朗、争不过中国,恼羞成怒的特朗普,打算拆了中国的棋盘

打不赢伊朗、争不过中国,恼羞成怒的特朗普,打算拆了中国的棋盘

铜臭的历史味
2026-09-11 08:52:59
屏下前摄还没藏好?iPhone Duo真机被曝“纱窗效应”,网友:不如用挖孔!

屏下前摄还没藏好?iPhone Duo真机被曝“纱窗效应”,网友:不如用挖孔!

泡泡网
2026-09-10 17:07:04
法布雷加斯:昨天看了巴萨与费耶诺德的比赛,现在的巴萨太吓人了

法布雷加斯:昨天看了巴萨与费耶诺德的比赛,现在的巴萨太吓人了

懂球帝
2026-09-11 09:54:02
45年,全国小学从91.7万所降到12.83万所

45年,全国小学从91.7万所降到12.83万所

老郭在学习
2026-09-10 16:32:25
外交部:中方已经就“台独”政客赴意大利出席有关会议,向意方、欧方提出严正交涉

外交部:中方已经就“台独”政客赴意大利出席有关会议,向意方、欧方提出严正交涉

新京报
2026-09-11 15:30:29
2026-09-11 18:35:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17227文章数 515214关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

数码
本地
手机
家居
公开课

数码要闻

240Hz跑出1000Hz效果!英伟达发布G-SYNC Pulsar新固件:动态清晰度暴增

本地新闻

拼假 13 天国内长线路线合集

手机要闻

网友调侃iPhone 18系列发布:iPhone都已成年了 我还在用正太苹果

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版