网易首页 > 网易号 > 正文 申请入驻

全球首款原生全模态交互式世界模型来了,AI 视频终于能“玩”了

0
分享至

这是苍何的第 580 篇原创!

大家好,我是苍何。

判断一段 AI 生成内容究竟是一段视频,还是一个真正的世界,可以试试一个最简单的动作:转身。

沿着街道向前走,拐过一个路口,再回到原地,刚才的建筑还在吗?

推开桌上的杯子,它会按照真实的方向倒下吗?

镜头从第一人称切换到第三人称,人物、空间和光影还能保持一致吗?


这些听起来很自然的事情,对今天的 AI 视频模型来说,却都很难。

过去两年,AI 视频一直在卷画质、时长和运镜。但无论画面多逼真,只要用户无法进入、无法控制,场景也记不住刚才发生了什么,它本质上仍然只是一段被提前生成好的内容。

现在,AI 视频正在跨过一条新的分界线:从生成画面,走向生成世界。

8 月 17 日,智象未来发布了 HiDream-O1-World,并将它定位为全球首款原生全模态交互式世界模型。


它把目标推进了一步:生成一个可以自由探索、持续交互,并且遵循一定物理规律的动态世界。

当观众走进画面

HiDream-O1-World 提供了漫游、编辑和交互三类核心能力。

在漫游状态下,用户可以通过屏幕上的移动按钮控制角色前进、后退和转向,也可以在第一人称与第三人称视角之间切换。

第一人称更像是整个人进入了场景。你可以转头、环顾、仰视和俯察,画面会跟随视角实时变化;第三人称则更接近游戏,可以同时观察角色动作和周围环境。

这件事表面看只是“让画面动起来”,背后的难度却比生成一条普通视频高得多。

普通视频只需要保证前后几秒看起来连贯,但可交互世界必须记住整个场景:一棵树原来在哪里,一栋建筑是什么结构,角色刚才走过哪条路,视线之外的物体是否还存在。

否则用户走几步、转个身,整个世界就会偷偷刷新。房子变了,物体消失了,角色也可能突然换了一张脸。

这也是很多生成式场景最容易出现的“越玩越崩”。

HiDream-O1-World 还提供了编辑能力。用户可以通过文字、语音或图片下达指令,让角色完成抓取、奔跑、下蹲、跳跃等动作,也可以驾驶载具,或者触发近战、射击等更复杂的交互。

按照官方介绍,模型支持长时视频的连续生成,并能保持音视频同步。这意味着用户的多次操作可以被串联成一段持续发展的体验,各个片段之间也能保持连贯。

换句话说,你的选择可以直接改变角色行为和故事走向,体验也由此摆脱了模型提前安排好的固定路线。

比如当在角色前进时,打下文字“神兽出现”,在前面就会很自然的出现了神兽。

角色在飞行过程中,可以改变前方的实时环境:

讲真,这个万物生长这一段,极其丝滑,你丝毫不会怀疑这是由模型本身生成的。

还可以一句话把船变成茶杯,把树变成糖果,把水变成红茶,几乎没有延迟,很自然。

让你看看,雨过天晴的感觉。

还有这个用 HiDream-O 1-World 做的也非常的逼真,结果实时能呈现。

过去所谓的互动内容,很多时候仍然是几个固定分支之间的选择。你选择 A,就播放 A 视频;选择 B,就播放 B 视频。

世界模型会根据用户此刻的输入,继续生成接下来发生的事情,每一种结果都可以在交互过程中实时出现。

用户因此从观众变成了参与者,甚至同时成为这个世界的导演。

一个世界,首先必须有记忆

要实现这种体验,需要先解决两个基础问题:时空一致性和物理一致性。 单帧画面的精致,只是起点。

所谓时空一致性,是指无论用户怎样移动视角、切换镜头或重新回到原来的位置,场景的空间关系都不能突然改变。

所谓物理一致性,则是角色与物体的运动、碰撞、重力、形变和光影变化,需要符合人对现实世界的基本认知。


在 HiDream-O1-World 之前,智象未来已经围绕空间一致性展开了长期研究。

其发表的论文《DreamWorld:Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling》已被 ECCV 2026 录用。论文聚焦一个很具体的问题:给定一张图片和一条相机运动轨迹,模型如何在大幅改变视角后,继续生成结构稳定的新画面。

ECCV 2026(欧洲计算机视觉国际会议):与 CVPR和ICCV齐名,是全球计算机视觉与人工智能领域的三大顶级学术会议之一,每两年举行一届。

常见的相机控制视频模型会把相机参数或点云投影作为生成条件,剩余的空间结构交给视频模型自行推断。当镜头转向原图没有展示过的区域,模型很容易生成扭曲的物体和互相冲突的空间关系。

DreamWorld 把三维几何特征放到了生成流程的中间位置。模型先借助 3D Foundation Model 推演目标视角下的空间结构,再根据几何特征合成最终画面。


DreamWorld 技术路线:先生成目标视角的几何结构,再完成画面合成

这套 Geometry-then-Appearance 流程把空间推理和视觉生成拆成两个阶段。前一个阶段专注结构补全、跨视角一致性和相机轨迹,后一个阶段负责纹理、细节与真实感。

从论文给出的案例可以看到,直接使用投影结果时,灯具、桌椅等物体容易发生形变;加入几何先验后,新视角里的物体轮廓和空间关系更加稳定。


红框区域展示了投影伪影和物体形变,最右侧为 DreamWorld 的生成结果

DreamWorld 在 RealEstate10K、Tanks-and-Temples 和 WorldScore 等基准上取得了领先结果。这项研究聚焦相机控制下的新视角生成,HiDream-O1-World 则覆盖漫游、编辑和交互等完整能力。两项工作分属不同层面,共同指向一个基础目标:让场景在镜头运动和持续交互中保持稳定。

按照智象未来披露的信息,HiDream-O1-World 引入了 “3D 先验注入 Memory 上下文”与 TTT 两套机制,让模型持续“记住”眼前的世界。

“3D 先验注入 Memory 上下文”负责保存场景中的几何结构、空间坐标和物体关系。可以把它理解成模型在生成画面的同时,也在脑海中维护着一张持续更新的空间地图。

TTT,也就是 Test-Time Training,则负责在推理过程中根据当前的相机轨迹和场景状态进行动态适配。每一次移动和视角切换,模型都会重新校正自己对这个世界的理解。


简单来说,Memory 负责记住这个世界,TTT 负责在变化中不断校准这个世界。


两者共同解决的,是世界模型最关键的持久性问题:人走了,世界不会刷新;镜头转回去,场景也不会被重新发明一遍。

在物理一致性上,智象未来还加入了大量碰撞、流体、柔性形变、重力抛射等高难度训练数据,让模型学习不同物体之间的运动与因果关系。

它需要让每个动作发生以后,后续变化依然合理。单帧的真实感,也要延伸到连续的因果关系中。

这也是视频生成模型与世界模型之间一个非常重要的区别:视频关心下一帧像不像,世界模型还要关心下一步对不对。

第三方榜单第一,意味着什么?

除了演示效果,HiDream-O1-World 也参加了美团 LongCat 团队与复旦大学推出的交互式世界模型评测基准 WBench。

WBench 一共包含 289 个测试案例、1058 轮交互和 22 项细分指标,从视频质量、设定遵循、交互能力、一致性和物理合理性五个维度,对模型进行综合评估。

在最新公开榜单中,HiDream-O1-World 的综合得分为 80.9 分,位列第一;其中物理维度为 73.3 分,同样排名第一,一致性维度达到 88.0 分。


WBench 最新榜单:HiDream-O1-World 综合得分与物理维度均排名第一

这个结果超过了腾讯混元 HY-World 1.5、阿里 Happy Oyster 等模型。更值得关注的是,WBench 的评测范围已经从画面质量延伸到操作响应、空间维持和后续变化的合理性。

当然,一次评测并不能证明模型已经真正理解了完整的物理世界,但它至少说明,交互式生成正在从主观 Demo,逐步走向可以量化比较的阶段。

当视频变成世界,内容行业会发生什么?

世界模型最直接的落地方向,是互动影游。

传统影视内容是线性的,创作者决定开始和结局;传统游戏虽然可以交互,却需要提前制作大量场景、角色、动作和剧情分支。

如果世界能够被实时生成,这两种内容形态之间的边界就会开始模糊。

未来,一部电影也许会拥有持续生长的剧情。观众可以走进场景,与角色交谈,改变某个关键事件,并看到一个从未被编剧提前写下的结局。

对于创作者来说,它也可能改变内容生产方式。过去需要建模、贴图、绑定、动画和渲染才能完成的场景,未来或许可以先通过一句话生成,再通过自然语言不断修改。


另一个更具产业价值的方向,是具身智能仿真。

机器人和自动驾驶系统需要在大量不同环境中训练,但真实世界的数据采集成本高、速度慢,一些危险和极端场景也很难反复复现。

如果世界模型能够快速生成具有空间与物理一致性的城市、工厂和室内环境,就能为机器人提供一个可反复试错的虚拟训练场。


智象未来此前已经与诺亦腾机器人展开合作:由诺亦腾提供真实的人体动作数据,再通过生成模型扩展不同人物、环境与视觉条件,在保留动作信息的同时放大数据规模。

世界模型的长远价值也在这里:既服务人的观看与创作,也能成为机器学习如何行动的数据基础设施。

从 Model the World 到 Mold the World

过去的大语言模型,以文字 Token 为基础理解和压缩人类知识;图像与视频模型,则主要学习视觉世界的分布。

真实世界始终由多种模态共同构成。

它同时包含图像、声音、动作、空间、时间、触觉和因果关系。想让 AI 真正理解并参与这个世界,仅仅把不同模型连接在一起可能还不够。

HiDream-O1-World 背后的 UiT 原生全模态架构,尝试从底层把图像像素、文本 Token、视频、音频、动作和空间关系映射到同一个共享 Token 空间,再交给同一套 Unified Transformer 进行理解、生成和推理。

这条路线强调的核心,是“统一”。

图像、文本、动作和声音从一开始就在同一套表征系统里共同训练、相互影响。

智象未来创始人梅涛曾用两个词概括自己对世界模型的判断。过去人们谈论 Model the World,让 AI 表达和理解世界。在他看来,世界模型还应该走向 Mold the World,让 AI 推演、构造乃至重塑世界。

从这个角度看,HiDream-O1-World 展示了视频生成之外的更大目标。

它代表着一次方向上的变化:AI 开始尝试建立一个能够被持续探索、实时干预的世界。

当然,今天的世界模型距离真正稳定、开放且可长期运行的数字世界,还有很长的路要走。连续生成和当前的榜单成绩,共同构成了这一阶段的起点。

但当画面开始拥有记忆,角色开始响应行动,场景开始遵循因果,视频和世界之间的那条边界,已经变得越来越模糊。

当观看变成进入,AI 生成内容也就拥有了通往“世界”的入口。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
深圳网友称高铁候补订单0:38兑现成功,早上睡醒发现车已开走,12306回应:候补时可设置截止兑现时间,系统默认截止兑现时间为开车前6小时

深圳网友称高铁候补订单0:38兑现成功,早上睡醒发现车已开走,12306回应:候补时可设置截止兑现时间,系统默认截止兑现时间为开车前6小时

潇湘晨报
2026-10-01 10:53:13
触目惊心!沪昆高速怀化段车祸残骸曝光,6死4伤,57岁老司机涉嫌疲劳驾驶

触目惊心!沪昆高速怀化段车祸残骸曝光,6死4伤,57岁老司机涉嫌疲劳驾驶

火山詩话
2026-10-01 12:14:04
胡锡进发微博忘删AI回复“需要我帮你通读核对吗?”,网友:比自己写便宜

胡锡进发微博忘删AI回复“需要我帮你通读核对吗?”,网友:比自己写便宜

可达鸭面面观
2026-10-01 14:43:37
让空姐下跪的乘客,接下来可能要面对3个窘境:全网公愤、亲友改观、工作受影响

让空姐下跪的乘客,接下来可能要面对3个窘境:全网公愤、亲友改观、工作受影响

王老师你还好吗
2026-10-01 01:31:27
就在今天,鲁比奥向中方发来贺电,与前任国务卿比,措辞略有不同

就在今天,鲁比奥向中方发来贺电,与前任国务卿比,措辞略有不同

原谅你
2026-10-01 15:23:04
财政部确认了:10月1日起,我国将对居民购房实施贷款贴息,聚焦首套刚需,单户所购住房建筑面积不超过120平方米、购房价格不超过150万元

财政部确认了:10月1日起,我国将对居民购房实施贷款贴息,聚焦首套刚需,单户所购住房建筑面积不超过120平方米、购房价格不超过150万元

吉刻新闻
2026-09-29 20:35:46
清华讲台,翁帆还没开口,衣服先替她说了话!她一出现,目光就被那身打扮勾住了,这样的翁帆,确实让人移不开眼!

清华讲台,翁帆还没开口,衣服先替她说了话!她一出现,目光就被那身打扮勾住了,这样的翁帆,确实让人移不开眼!

财经要参
2026-09-30 19:39:44
迪拜航空客机上唯一医护乘客披露救治细节:印度籍机长“手部几乎被切断”

迪拜航空客机上唯一医护乘客披露救治细节:印度籍机长“手部几乎被切断”

澎湃新闻
2026-10-01 16:30:27
反转又反转!美国女死囚被注射两剂致死药物后仍活着还打鼾,紧急送医治疗

反转又反转!美国女死囚被注射两剂致死药物后仍活着还打鼾,紧急送医治疗

澎湃新闻
2026-10-01 16:10:04
拳王泰森来瞻仰毛主席遗容,他出来说了一句这辈子都没敢说的话

拳王泰森来瞻仰毛主席遗容,他出来说了一句这辈子都没敢说的话

游文刀
2026-09-30 00:14:51
著名演员发声:我糟蹋了自己的身体

著名演员发声:我糟蹋了自己的身体

中国新闻周刊
2026-09-30 21:10:04
真大胆!两名华人拿着微信买来的美国护照入境,人脸识别当场露馅!

真大胆!两名华人拿着微信买来的美国护照入境,人脸识别当场露馅!

华人生活网
2026-10-01 02:15:33
以色列:以方今后将掌握所有飞往以色列航班飞行员身份,并进行一定程度安全审查

以色列:以方今后将掌握所有飞往以色列航班飞行员身份,并进行一定程度安全审查

新京报
2026-10-01 15:49:35
日本股市暴涨2000点,发生了什么?

日本股市暴涨2000点,发生了什么?

金石随笔
2026-10-01 13:54:11
人人人人人人人人人人

人人人人人人人人人人

上海黄浦
2026-10-01 17:20:20
苦战163分钟!中网金花德比:郑钦文2-1险些爆冷,下一轮对手出炉

苦战163分钟!中网金花德比:郑钦文2-1险些爆冷,下一轮对手出炉

侃球熊弟
2026-10-01 12:18:01
暴利!净利润 5697 亿、收入 8930 亿

暴利!净利润 5697 亿、收入 8930 亿

云头条
2026-10-01 10:59:38
林诗栋4-0王楚钦夺冠,现场却齐喊“王皓下课”,王皓罕见连鼓两次掌回怼

林诗栋4-0王楚钦夺冠,现场却齐喊“王皓下课”,王皓罕见连鼓两次掌回怼

火锅局
2026-10-01 13:09:57
张又侠、刘振立被褫夺党籍、军籍后,我们的军队刀刃向内整风了!

张又侠、刘振立被褫夺党籍、军籍后,我们的军队刀刃向内整风了!

叶葉夜
2026-09-26 22:23:38
尿酸危机,席卷中国

尿酸危机,席卷中国

快刀财经
2026-10-01 00:51:49
2026-10-01 19:44:49
苍何
苍何
前大厂工程师,努力分享AI干货知识
183文章数 173关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

家居
本地
房产
旅游
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

旅游要闻

赤水河畔雨中行 四川古蔺600余人国庆重走长征路

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版