网易首页 > 网易号 > 正文 申请入驻

全球首款原生全模态交互式世界模型来了,AI 视频终于能“玩”了

0
分享至

这是苍何的第 580 篇原创!

大家好,我是苍何。

判断一段 AI 生成内容究竟是一段视频,还是一个真正的世界,可以试试一个最简单的动作:转身。

沿着街道向前走,拐过一个路口,再回到原地,刚才的建筑还在吗?

推开桌上的杯子,它会按照真实的方向倒下吗?

镜头从第一人称切换到第三人称,人物、空间和光影还能保持一致吗?


这些听起来很自然的事情,对今天的 AI 视频模型来说,却都很难。

过去两年,AI 视频一直在卷画质、时长和运镜。但无论画面多逼真,只要用户无法进入、无法控制,场景也记不住刚才发生了什么,它本质上仍然只是一段被提前生成好的内容。

现在,AI 视频正在跨过一条新的分界线:从生成画面,走向生成世界。

8 月 17 日,智象未来发布了 HiDream-O1-World,并将它定位为全球首款原生全模态交互式世界模型。


它把目标推进了一步:生成一个可以自由探索、持续交互,并且遵循一定物理规律的动态世界。

当观众走进画面

HiDream-O1-World 提供了漫游、编辑和交互三类核心能力。

在漫游状态下,用户可以通过屏幕上的移动按钮控制角色前进、后退和转向,也可以在第一人称与第三人称视角之间切换。

第一人称更像是整个人进入了场景。你可以转头、环顾、仰视和俯察,画面会跟随视角实时变化;第三人称则更接近游戏,可以同时观察角色动作和周围环境。

这件事表面看只是“让画面动起来”,背后的难度却比生成一条普通视频高得多。

普通视频只需要保证前后几秒看起来连贯,但可交互世界必须记住整个场景:一棵树原来在哪里,一栋建筑是什么结构,角色刚才走过哪条路,视线之外的物体是否还存在。

否则用户走几步、转个身,整个世界就会偷偷刷新。房子变了,物体消失了,角色也可能突然换了一张脸。

这也是很多生成式场景最容易出现的“越玩越崩”。

HiDream-O1-World 还提供了编辑能力。用户可以通过文字、语音或图片下达指令,让角色完成抓取、奔跑、下蹲、跳跃等动作,也可以驾驶载具,或者触发近战、射击等更复杂的交互。

按照官方介绍,模型支持长时视频的连续生成,并能保持音视频同步。这意味着用户的多次操作可以被串联成一段持续发展的体验,各个片段之间也能保持连贯。

换句话说,你的选择可以直接改变角色行为和故事走向,体验也由此摆脱了模型提前安排好的固定路线。

比如当在角色前进时,打下文字“神兽出现”,在前面就会很自然的出现了神兽。

角色在飞行过程中,可以改变前方的实时环境:

讲真,这个万物生长这一段,极其丝滑,你丝毫不会怀疑这是由模型本身生成的。

还可以一句话把船变成茶杯,把树变成糖果,把水变成红茶,几乎没有延迟,很自然。

让你看看,雨过天晴的感觉。

还有这个用 HiDream-O 1-World 做的也非常的逼真,结果实时能呈现。

过去所谓的互动内容,很多时候仍然是几个固定分支之间的选择。你选择 A,就播放 A 视频;选择 B,就播放 B 视频。

世界模型会根据用户此刻的输入,继续生成接下来发生的事情,每一种结果都可以在交互过程中实时出现。

用户因此从观众变成了参与者,甚至同时成为这个世界的导演。

一个世界,首先必须有记忆

要实现这种体验,需要先解决两个基础问题:时空一致性和物理一致性。 单帧画面的精致,只是起点。

所谓时空一致性,是指无论用户怎样移动视角、切换镜头或重新回到原来的位置,场景的空间关系都不能突然改变。

所谓物理一致性,则是角色与物体的运动、碰撞、重力、形变和光影变化,需要符合人对现实世界的基本认知。


在 HiDream-O1-World 之前,智象未来已经围绕空间一致性展开了长期研究。

其发表的论文《DreamWorld:Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling》已被 ECCV 2026 录用。论文聚焦一个很具体的问题:给定一张图片和一条相机运动轨迹,模型如何在大幅改变视角后,继续生成结构稳定的新画面。

ECCV 2026(欧洲计算机视觉国际会议):与 CVPR和ICCV齐名,是全球计算机视觉与人工智能领域的三大顶级学术会议之一,每两年举行一届。

常见的相机控制视频模型会把相机参数或点云投影作为生成条件,剩余的空间结构交给视频模型自行推断。当镜头转向原图没有展示过的区域,模型很容易生成扭曲的物体和互相冲突的空间关系。

DreamWorld 把三维几何特征放到了生成流程的中间位置。模型先借助 3D Foundation Model 推演目标视角下的空间结构,再根据几何特征合成最终画面。


DreamWorld 技术路线:先生成目标视角的几何结构,再完成画面合成

这套 Geometry-then-Appearance 流程把空间推理和视觉生成拆成两个阶段。前一个阶段专注结构补全、跨视角一致性和相机轨迹,后一个阶段负责纹理、细节与真实感。

从论文给出的案例可以看到,直接使用投影结果时,灯具、桌椅等物体容易发生形变;加入几何先验后,新视角里的物体轮廓和空间关系更加稳定。


红框区域展示了投影伪影和物体形变,最右侧为 DreamWorld 的生成结果

DreamWorld 在 RealEstate10K、Tanks-and-Temples 和 WorldScore 等基准上取得了领先结果。这项研究聚焦相机控制下的新视角生成,HiDream-O1-World 则覆盖漫游、编辑和交互等完整能力。两项工作分属不同层面,共同指向一个基础目标:让场景在镜头运动和持续交互中保持稳定。

按照智象未来披露的信息,HiDream-O1-World 引入了 “3D 先验注入 Memory 上下文”与 TTT 两套机制,让模型持续“记住”眼前的世界。

“3D 先验注入 Memory 上下文”负责保存场景中的几何结构、空间坐标和物体关系。可以把它理解成模型在生成画面的同时,也在脑海中维护着一张持续更新的空间地图。

TTT,也就是 Test-Time Training,则负责在推理过程中根据当前的相机轨迹和场景状态进行动态适配。每一次移动和视角切换,模型都会重新校正自己对这个世界的理解。


简单来说,Memory 负责记住这个世界,TTT 负责在变化中不断校准这个世界。


两者共同解决的,是世界模型最关键的持久性问题:人走了,世界不会刷新;镜头转回去,场景也不会被重新发明一遍。

在物理一致性上,智象未来还加入了大量碰撞、流体、柔性形变、重力抛射等高难度训练数据,让模型学习不同物体之间的运动与因果关系。

它需要让每个动作发生以后,后续变化依然合理。单帧的真实感,也要延伸到连续的因果关系中。

这也是视频生成模型与世界模型之间一个非常重要的区别:视频关心下一帧像不像,世界模型还要关心下一步对不对。

第三方榜单第一,意味着什么?

除了演示效果,HiDream-O1-World 也参加了美团 LongCat 团队与复旦大学推出的交互式世界模型评测基准 WBench。

WBench 一共包含 289 个测试案例、1058 轮交互和 22 项细分指标,从视频质量、设定遵循、交互能力、一致性和物理合理性五个维度,对模型进行综合评估。

在最新公开榜单中,HiDream-O1-World 的综合得分为 80.9 分,位列第一;其中物理维度为 73.3 分,同样排名第一,一致性维度达到 88.0 分。


WBench 最新榜单:HiDream-O1-World 综合得分与物理维度均排名第一

这个结果超过了腾讯混元 HY-World 1.5、阿里 Happy Oyster 等模型。更值得关注的是,WBench 的评测范围已经从画面质量延伸到操作响应、空间维持和后续变化的合理性。

当然,一次评测并不能证明模型已经真正理解了完整的物理世界,但它至少说明,交互式生成正在从主观 Demo,逐步走向可以量化比较的阶段。

当视频变成世界,内容行业会发生什么?

世界模型最直接的落地方向,是互动影游。

传统影视内容是线性的,创作者决定开始和结局;传统游戏虽然可以交互,却需要提前制作大量场景、角色、动作和剧情分支。

如果世界能够被实时生成,这两种内容形态之间的边界就会开始模糊。

未来,一部电影也许会拥有持续生长的剧情。观众可以走进场景,与角色交谈,改变某个关键事件,并看到一个从未被编剧提前写下的结局。

对于创作者来说,它也可能改变内容生产方式。过去需要建模、贴图、绑定、动画和渲染才能完成的场景,未来或许可以先通过一句话生成,再通过自然语言不断修改。


另一个更具产业价值的方向,是具身智能仿真。

机器人和自动驾驶系统需要在大量不同环境中训练,但真实世界的数据采集成本高、速度慢,一些危险和极端场景也很难反复复现。

如果世界模型能够快速生成具有空间与物理一致性的城市、工厂和室内环境,就能为机器人提供一个可反复试错的虚拟训练场。


智象未来此前已经与诺亦腾机器人展开合作:由诺亦腾提供真实的人体动作数据,再通过生成模型扩展不同人物、环境与视觉条件,在保留动作信息的同时放大数据规模。

世界模型的长远价值也在这里:既服务人的观看与创作,也能成为机器学习如何行动的数据基础设施。

从 Model the World 到 Mold the World

过去的大语言模型,以文字 Token 为基础理解和压缩人类知识;图像与视频模型,则主要学习视觉世界的分布。

真实世界始终由多种模态共同构成。

它同时包含图像、声音、动作、空间、时间、触觉和因果关系。想让 AI 真正理解并参与这个世界,仅仅把不同模型连接在一起可能还不够。

HiDream-O1-World 背后的 UiT 原生全模态架构,尝试从底层把图像像素、文本 Token、视频、音频、动作和空间关系映射到同一个共享 Token 空间,再交给同一套 Unified Transformer 进行理解、生成和推理。

这条路线强调的核心,是“统一”。

图像、文本、动作和声音从一开始就在同一套表征系统里共同训练、相互影响。

智象未来创始人梅涛曾用两个词概括自己对世界模型的判断。过去人们谈论 Model the World,让 AI 表达和理解世界。在他看来,世界模型还应该走向 Mold the World,让 AI 推演、构造乃至重塑世界。

从这个角度看,HiDream-O1-World 展示了视频生成之外的更大目标。

它代表着一次方向上的变化:AI 开始尝试建立一个能够被持续探索、实时干预的世界。

当然,今天的世界模型距离真正稳定、开放且可长期运行的数字世界,还有很长的路要走。连续生成和当前的榜单成绩,共同构成了这一阶段的起点。

但当画面开始拥有记忆,角色开始响应行动,场景开始遵循因果,视频和世界之间的那条边界,已经变得越来越模糊。

当观看变成进入,AI 生成内容也就拥有了通往“世界”的入口。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
还得是谷歌,Gemini 4 发布,猛的离谱。。。

还得是谷歌,Gemini 4 发布,猛的离谱。。。

苍何
2026-10-01 07:14:23
活塞再次让步!再不签真成傻子了!

活塞再次让步!再不签真成傻子了!

柚子说球
2026-10-01 13:47:06
成本仅3000万,票房破5亿?陈思诚都压不住,这才是国庆档大黑马

成本仅3000万,票房破5亿?陈思诚都压不住,这才是国庆档大黑马

靠谱电影君
2026-09-29 17:18:16
张继科回怼“银牌比金牌有含金量”发言:笑话、胡说八道,就是胜者为王!

张继科回怼“银牌比金牌有含金量”发言:笑话、胡说八道,就是胜者为王!

烟浔渺渺
2026-10-01 14:08:32
U23国足遭吐槽!徐亮:不用太指望,只看上王钰栋,徐彬太一般

U23国足遭吐槽!徐亮:不用太指望,只看上王钰栋,徐彬太一般

奥拜尔
2026-10-01 16:52:12
一动不动,高速“沦陷”  ,聪明人都堵在了路上

一动不动,高速“沦陷” ,聪明人都堵在了路上

楼主说楼市
2026-10-01 14:12:20
农业农村部:在充分尊重农民意愿基础上盘活利用闲置农房,让农民多一份财产性收入!

农业农村部:在充分尊重农民意愿基础上盘活利用闲置农房,让农民多一份财产性收入!

极目新闻
2026-09-29 13:50:07
触目惊心!沪昆高速怀化段车祸残骸曝光,6死4伤,57岁老司机涉嫌疲劳驾驶

触目惊心!沪昆高速怀化段车祸残骸曝光,6死4伤,57岁老司机涉嫌疲劳驾驶

火山詩话
2026-10-01 12:14:04
此案例完美解释了国企亏损的原因,令人震惊…

此案例完美解释了国企亏损的原因,令人震惊…

慧翔百科
2026-09-30 08:28:46
湖南一孕妇马路中间骑车压速并别车,后车司机怒而下车一脚将车踹翻,司机:赔了800元,交警队已获取完整视频,将处理

湖南一孕妇马路中间骑车压速并别车,后车司机怒而下车一脚将车踹翻,司机:赔了800元,交警队已获取完整视频,将处理

台州交通广播
2026-10-01 12:47:18
江西小伙内蒙旅游误入蒙族婚宴,随礼2888,走前被新娘妹妹拦住

江西小伙内蒙旅游误入蒙族婚宴,随礼2888,走前被新娘妹妹拦住

故事秘栈
2025-06-21 18:56:16
公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

只要高兴就好
2026-09-24 11:58:50
热苏斯:我和C罗约好首战后休两场,热身太久没上他生我气了

热苏斯:我和C罗约好首战后休两场,热身太久没上他生我气了

懂球帝
2026-10-01 03:04:06
“吕布跳大”候车厅火了!武汉汉口站被国庆人流填满,网友实拍:两公里堵到步行进站

“吕布跳大”候车厅火了!武汉汉口站被国庆人流填满,网友实拍:两公里堵到步行进站

火山詩话
2026-10-01 08:38:44
139票赞成,0票反对,匈牙利传来新消息!

139票赞成,0票反对,匈牙利传来新消息!

故事终将光明磊落
2026-09-30 16:26:44
金牌甩日本3倍!10月1日奖牌榜早报:排名再洗牌,三队奖牌数破百

金牌甩日本3倍!10月1日奖牌榜早报:排名再洗牌,三队奖牌数破百

大秦壁虎白话体育
2026-10-01 07:22:52
大批历史博主集体阵亡?百万账号封禁?不是限流,是断流清退!

大批历史博主集体阵亡?百万账号封禁?不是限流,是断流清退!

升子山的她视界
2026-10-01 16:19:35
几乎全假货!利润高达2400%,为何消费者还一头扎进去争相购买?

几乎全假货!利润高达2400%,为何消费者还一头扎进去争相购买?

兵卒史
2026-10-01 14:07:08
亚运最快一金!储守宏4.714秒破亚运纪录 夺攀岩男子速度赛金牌

亚运最快一金!储守宏4.714秒破亚运纪录 夺攀岩男子速度赛金牌

醉卧浮生
2026-10-01 19:52:33
热苏斯发布会语出惊人!巨星好合作,难管的是自视高手

热苏斯发布会语出惊人!巨星好合作,难管的是自视高手

圣西罗的太阳
2026-10-01 12:35:12
2026-10-01 20:55:00
苍何
苍何
前大厂工程师,努力分享AI干货知识
183文章数 173关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

足够先进可以展示 191式自动步枪硬核开箱视频首次披露

头条要闻

足够先进可以展示 191式自动步枪硬核开箱视频首次披露

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

家居
亲子
时尚
本地
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

开学一个月“学习困难门诊”迎就诊高峰,医生:就诊诉求几乎只有“提分”

在米兰,用时装唤醒内心的自我

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版