![]()
9月2日,被称作“AI教母”的斯坦福教授李飞飞创立的空间智能公司World Labs宣布推出新一代全模态世界模型Atlas。这是该公司继商用产品Marble和World API之后,在三维世界理解与生成方向上的最新进展。
World Labs由李飞飞与Justin Johnson、Ben Mildenhall、Christoph Lassner于2024年共同创办,目标是让人工智能具备空间智能,也就是理解物体如何存在于三维空间、场景如何延伸、动作如何改变环境。公司当年以约2.3亿美元融资出道并成为独角兽,2026年2月又完成约10亿美元新一轮融资。李飞飞一直认为,语言模型让机器学会了说话,但真正走向物理世界,还需要能够感知、生成并与三维空间交互的世界模型。
Atlas被官方称为omni world model。它从零开始预训练,原生同时处理文本、图像、视频和三维数据,采用多模态自回归扩散Transformer架构。所有输入会被编码进同一个共享的空间上下文,每张图像都带有明确的相机位姿,模型据此生成后续内容,既保持三维一致性,又能对未见区域作出合理想象。公司表示,该模型性能会随训练算力增加而提升,并计划将其用于未来版本的Marble及其他产品。早期访问将向选定合作伙伴开放。
据官方介绍,Atlas覆盖生成、重建和模拟三类任务。在相机控制生成方面,用户只需提供一张或几张参考图,就能指定精确相机路径,输出最高1440p、最长约一分钟的视频。与依赖模糊文字指令控制镜头的方式不同,Atlas把相机几何作为原生输入,创作者可以更接近“布景和调度”而不是“碰运气写提示词”。在三维重建方面,模型可从少量普通照片重建真实场景,同时输出新视角画面和点云、高斯溅射等显式三维结果。公司公布的内部对比显示,在多个稀疏视角重建基准上,Atlas的平均误差低于当时领先的专用三维重建模型。输入图像越多,模型越少依赖想象、越接近忠实还原。
在时空模拟方面,Atlas能从少量视频中同时建模空间结构与时间变化。一个直观例子是“子弹时间”:用几部手机拍下的素材,即可冻结时间并从新角度重拍。对机器人而言,这意味着更便宜的Real-to-Sim路径——拍摄真实环境后,模型可生成机器人视角的图像与深度,并进一步模拟物体交互,用于训练和测试。此外,Atlas也能根据文本生成图像和360度全景,并支持多种风格。
这条产品线并非突然出现。2025年10月,World Labs发布研究预览RTFM,尝试在单卡上实时生成可交互视频;同年11月推出首个商用产品Marble,用户可用文本、图像、视频或粗略三维布局生成可探索、可导出的持久三维世界;2026年1月上线World API,7月收购SceniX以加强机器人仿真。Atlas被放在这条路线的下一站:它介于“渲染画面”和“模拟世界如何响应动作”之间,既能生成一致的三维视图,也能输出可供后续物理引擎使用的几何。
对影视、设计、建筑和机器人团队来说,这意味着现场几张照片就可能快速重建场地,镜头调度可以更精确,仿真环境不必完全依赖昂贵扫描和手工建模。不过,目前公开的对比数据仍以公司内部评测为主,独立第三方验证尚未全面展开,世界模型赛道上的竞争也在加快。即便如此,Atlas仍代表一种明确方向:把文本、图像、视频和三维几何放进同一个空间上下文里联合建模,让机器不只描述世界,而是开始在三维中理解、想象并辅助行动。从ImageNet让计算机看见二维图像,到Atlas试图让计算机走进三维世界,李飞飞和World Labs的这条线依然清晰。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.