网易首页 > 网易号 > 正文 申请入驻

国产世界模型EchoWM开源!会发声的「可探索世界」来了

0
分享至

编辑|杜伟

进入到 2026 年,可交互世界生成面对一道更难的考题:AI 生成的世界能否经得起用户反复探索?一扇门画得逼真,只是起点。往前走,它要自然靠近;穿过走廊再回头,它还应该留在原来的位置。用户每一次移动、转身和折返,都在检验模型是否有能力记住已经生成的世界。

世界模型的竞争开始从画面质量延伸到持续交互中的可靠性。镜头要听从指令,场景要保持连贯,生成速度还要跟得上操作。这些能力需要同时成立,任何一处掉链子,都可能打断探索。

近一年来的技术进展,让这条主线更加清晰。谷歌 DeepMind 的 Genie 3 展示了实时探索与分钟级一致性,英伟达 SANA-WM 将分钟级生成、精确相机控制与更高效率结合了起来,World Labs 的 Atlas 通过空间上下文支持沿指定相机轨迹生成新视角,维持场景的几何关系。

当探索进一步触及到视听体验,新的问题随之出现:用户改变路线或者切换视角时,脚步声、环境声和人物说话声,是否能够与画面一起连贯地延续?因此,对于面向沉浸式内容的世界模型,视听生成与交互控制的结合更加值得关注。

9 月 9 日,在京东全球科技探索者大会(JDD)上,京东探索研究院发布 JoyAI-Echo 系列最新进展:超长音视频生成模型升级至 JoyAI-Echo 1.5;同时发布并开源面向可交互视听世界生成的 JoyAI-EchoWM

该模型延续了此前 JoyAI-Echo 的原生音视频生成能力,在同一套框架中可以生成视频以及环境音、音乐和语音,同时能够实时响应用户操作。



现在,第一人称视角下,用户可以直接在场景中移动和探索;切换到第三人称视角,摄像机运动与主体运动也能保持协同。经过多轮、长时操作之后,整体画面、空间关系、主体状态依然能够很好地延续。JoyAI-EchoWM 创造了一个真正可进入、可操控、可探索的视听一体化世界

在相关论文报告的 158 个 WBench Navigation 案例评测中,JoyAI-EchoWM 取得了 81.7 的最高平均分,并在一致性(89.8)和交互性(87.2)等指标上位于前列。同时四步因果流式版本 EchoWM-Flash 的平均分为 81.0,交互得分为 87.9,表明减少采样步数后,模型仍具备较强的导航响应能力。



相较于同一评测中的其他模型,Genie 3 强调实时探索与分钟级世界一致性;LingBot-World 2.0 通过因果生成与少步蒸馏推进长时程交互,并结合相机位姿和文本指令控制视角、动作及事件;HappyOyster 将音视频联合生成与实时交互结合,提供导演和第一人称漫游两种模式。JoyAI-EchoWM 的路线特点,兼顾跨视角控制与持续视听体验,为可进入的生成内容提供了更完整的能力组合

这条技术路线如何体现在交互中,可以从用户按下操作键后,镜头、画面与声音的变化看起。

按下操作键,AI 世界用画面与声音回应你

普通视频生成,生成结束以后任务基本完成。即使主体位置略有漂移、空间关系偶尔变化,只要整体画面自然,人眼未必能察觉到。可一旦允许用户自由移动、切换视角,此前很多可以被视觉效果遮过去的小错误,在交互状态下都可能会变成 Bug。

这是因为,交互给视频生成增加了一层要求:模型需要根据用户操作,生成与此前内容衔接的画面。

JoyAI-EchoWM 如何解决这些问题呢?它的思路是通过共用一套交互接口,让画面中的主体、空间关系和声音随着用户探索一起延续。团队将这一支持持续导航并获得同步视听反馈的模型称为面向「可进入生成媒体」的全模态世界模型



  • arXiv 论文:https://arxiv.org/pdf/2608.23189
  • 项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/
  • GitHub 代码:https://github.com/jd-opensource/JoyAI-Echo

要实现这样的交互,首先需要统一不同视角下的控制方式。第一人称视角下,镜头接近观察者的眼睛,移动镜头对应自身移动。第三人称多了一层关系:镜头要跟随人物、车辆等主体,主体运动也要与画面构图配合。与此同时,用户按下的 WASD 方向键是离散指令,模型需要处理的相机位置和朝向却是连续变化的,为不同视角和控制设备分别设计接口会增加系统的适配负担。

为此,JoyAI-EchoWM 采用了统一的「相机意图」(camera intent)表示,用以描述用户希望镜头如何移动、 从什么角度观察场景。键盘操作经过固定映射,转换为相对初始位姿的连续 6-DoF 轨迹,也就是镜头在 3D 空间中的平移和旋转。

同一条轨迹在不同视角下承担不同作用。第一人称下,它直接描述观察者的运动;第三人称下,它规定相机的变化,人物移动与镜头跟随之间的关系则由模型从数据中学习。模型无需额外接收角色轨迹、控制器状态或相机预设的跟随参数。



第一人称控制方式覆盖了户外、室内、水下和奇幻等多场景。用户可以沿着指定方向移动,让眼前环境逐步展开。如下冰湖探索的演示中,第一人称视角沿冰面不断向前推进,远处的木门逐渐靠近,雪山、森林与湖面倒影持续展开,环境声也随画面同步生成。



视频链接:https://mp.weixin.qq.com/s/DeRINAhowAGMobWR1yz_Ug

第三人称视角展示了镜头与主体的配合。下面荒漠骑马的片段中,骑手向前推进,镜头从后方跟随,并左右移动。



视频链接:https://mp.weixin.qq.com/s/DeRINAhowAGMobWR1yz_Ug

探索过程中,声音同样参与生成。JoyAI-EchoWM 采用原生音视频联合生成,视频和音频分支在生成过程中交换信息,使声音与画面中的场景和事件相互关联。相机轨迹只直接输入视频分支,音频侧没有独立的轨迹条件,也没有额外训练一套「动作 — 声音控制器」。

简单来说,操作先改变画面,声音则根据画面的变化同步跟上。人物等主体讲话时生成对应语音,风、脚步和碰撞等事件伴随相应声响,音乐也随着场景延续。下面橘猫讲话的同时配上了背景音。



视频链接:https://mp.weixin.qq.com/s/DeRINAhowAGMobWR1yz_Ug

当探索进入下一轮,模型还要承接已经发生的内容。JoyAI-EchoWM 会提取上一段末尾的一段同步音视频,作为下一轮生成的上下文。用户在新一轮调整相机轨迹,继续向前探索。后续画面和声音共享同一段近期历史,为场景布局、主体外观和声音的延续提供依据。

这套机制有助于维持连续体验,但仍存在边界。模型目前没有显式的持久三维记忆,多轮生成后,几何关系、主体身份和音频仍可能发生漂移。



视频链接:https://mp.weixin.qq.com/s/DeRINAhowAGMobWR1yz_Ug

要让画面、声音和用户操作在同一个生成过程中形成配合,需要先解决数据与训练上的几道难题。

JoyAI-EchoWM 三重挑战:好看、好控,长时间不跑偏

高质量音视频未必带有准确的相机轨迹,而轨迹可靠的数据也未必拥有丰富的声音。进入持续交互后,模型还要应对误差累积和不断增长的计算开销。JoyAI-EchoWM 从数据引擎入手,通过统一轨迹尺度和分阶段训练,逐步连接起这些能力

首先是数据。团队采用了四类互补来源,搭建起了一套世界数据引擎,不同数据分别提供更可靠的监督。其中:

  • 内部采集的 gameplay 可以同步获得操作日志、原生游戏音频和较清晰的动作 — 观察对应关系;
  • 互联网上的人类实玩录像,操作节奏更自然,也包含游戏对白、玩家解说等更丰富的人声;
  • UE(Unreal Engine)仿真直接提供米制真值位姿和动作日志,几何监督最干净,但不提供自然音频;
  • 普通互联网视频补充真实世界外观、环境声、语音,以及更丰富的镜头和主体关系。

收集数据之后,团队又根据训练目标重新组织了三组数据配比。AV-rich 侧重画面、环境声和语音质量,Control-clean 优先保留轨迹可靠、运动清晰的样本,Balanced high-quality 则从中筛选兼具可靠控制信号和较高视听质量的数据,供后续联合训练使用。


世界数据引擎


数据来源变多,也带来了尺度问题。不同视频中的相机移动幅度差异非常大,如果每条轨迹都按自身的运动范围单独归一化,大幅移动和小幅移动就可能被压缩到相近的数值区间。原有的位移差异也会丢失,相邻生成片段采用不同尺度时,还可能带来速度突变。

JoyAI-EchoWM为训练轨迹建立了一把统一的「尺子」:先计算每条轨迹的最大平移幅度,再取这些值的第 90 百分位数作为全局尺度。最大平移幅度不超过这一阈值的轨迹被保留,并使用同一尺度归一化;旋转保持不变。这样可以保留不同轨迹之间的相对位移差异,减轻分段定标带来的不连续性。

有了互补数据和统一尺度,接下来的问题是如何安排训练。音视频质量与轨迹控制依赖不同的监督信号,如果同时强化两者,训练目标可能相互干扰。JoyAI-EchoWM 先依照三个阶段分别学习,再共同适配。

第一阶段是音视频持续预训练(AV-CPT),使用 AV-rich 数据训练已有的音视频骨干,使其适应交互场景中的视觉动态、环境声和语音。第二阶段是动作微调(Action-SFT),冻结音视频骨干,只训练轻量的相机轨迹分支,并使用 Control-clean 数据强化轨迹响应。这一阶段使用的控制监督仍然是相机轨迹。第三阶段是联合微调(Joint-FT),使用 Balanced high-quality 数据,以较低学习率共同调整音视频骨干和轨迹分支,让视听生成与控制能力进一步配合,同时尽量减少对已有能力的扰动。

完成以上三个阶段之后,模型还要适应长时间交互。持续生成时,前一段输出成为后一段的输入。早期出现的偏差可能被带入后续内容,从而影响场景、主体和声音。为此 JoyAI-EchoWM 引入了第四阶段:自回归后训练(AR post-training)

团队首先利用音视频 Teacher Forcing 将双向模型改造为因果分块生成模型。模型学习依据此前的音视频上下文生成下一块同步内容,为流式输出建立基础。随后,短时程 Self-Gradient Forcing(SGF)让模型基于自己生成的历史继续向前生成。同时分布匹配蒸馏(DMD)将多步生成压缩为少步采样,降低每个音视频块所需的去噪步数。训练之后进一步扩展到更长的自生成序列,让模型接触交互中逐步累积的偏差,学习在这些条件下保持连贯。

另外,历史信息的保留也需要控制成本。JoyAI-EchoWM 采用sink-plus-FIFO 机制,固定保留早期的一部分上下文,并滚动维护最近一段历史。较旧的局部缓存按先进先出的顺序移出,限制 KV 缓存规模。


JoyAI-EchoWM 训练流程图


这套方法能在多大程度上兼顾生成质量、控制精度与长时程稳定性,还需要通过系统评测来检验。

从轨迹控制到长时一致性,JoyAI-EchoWM 表现如何?

除了开篇提到的 WBench Navigation,团队还通过 SANA-WM-Bench 和用户研究,进一步考察 JoyAI-EchoWM 的轨迹跟随、长时程生成与主观体验。

SANA-WM-Bench 将测试分为简单轨迹和困难轨迹,每组包含 80 个场景。评测同时关注画面质量与相机控制,分别统计 VBench 视觉质量得分,以及旋转、平移和相机运动一致性误差。

前 241 帧的短时程测试中,JoyAI-EchoWM 在两组轨迹上的 VBench 得分分别为 83.91 和 83.96,均为测试模型中的最高值。简单轨迹下,其平移误差和相机运动一致性误差也最低。而困难轨迹下,SANA-WM 的相机控制误差更低,JoyAI-EchoWM 保持了较高的视觉质量。



生成延长到 961 帧,测试进一步检查模型回到相近相机位姿时,画面能否前后对应。在这一长时程设置下,四步因果流式版本 EchoWM-Flash 的 VBench 得分分别为 80.13 和 81.06,在测试的因果模型中领先,轨迹精度和视角重访一致性也表现突出。



此外团队还在自建的 200 案例测试集上进行成对用户研究,比较 JoyAI-EchoWM 与 LingBot-World-v2、HappyOyster 的生成表现。评测涵盖语义遵循、初始世界一致性、运动、时空一致性、视觉美感和整体偏好,并保留「两者都好」、「两者都差」选项。

其中在整体偏好结果中,相较于 LingBot-World-v2,选择 JoyAI-EchoWM 的占 46.50%,选择对方的占 21.57%;相较于 HappyOyster,这两项指标分别为 63.13% 和 27.06%。需要注意的是,这些比例统计的是评价选择,不能直接理解为任务成功率。

分项结果也体现了不同模型的特点。JoyAI-EchoWM 在时空一致性和视觉美感上获得更多偏好;HappyOyster 在语义遵循和运动两项中,被单独选为更优的比例更高。



评测让我们看到了 JoyAI-EchoWM 的表现与边界,也为判断它适合进入哪些实际场景提供了依据。

世界模型走向不同的应用场景,带来了技术路线的逐步分化。面向互动内容,生成速度与操作响应直接影响体验;面向空间创作,几何一致性和场景编辑能力更关键;面向机器人,模型要为预测环境变化和执行动作提供支持。因此,判断一个世界模型的价值,需要看它能在具体任务中解决哪些问题。

以 Genie 3、Atlas、Cosmos 3 为例,这些方向存在交集,也有不同的技术取舍。随着应用深入,持续交互、空间表示与行动能力之间的配合至为关键。在这一背景下,JoyAI-EchoWM 的定位更接近面向生成媒体的可交互世界模型。

从当前能力看,游戏原型可能是 JoyAI-EchoWM 较有潜力的应用方向。创作者可以进入生成场景,尝试空间布局、路线设计与镜头体验,再决定后续制作方向。当然,一个可以探索的世界距离成熟游戏仍有距离,玩法、规则和任务设计都需要继续补齐。

另外,互动叙事、沉浸内容和虚拟游览也有机会借助 JoyAI-EchoWM 减少预制素材需求,让内容按照用户选择持续生成。数字人场景则可以探索动态环境与镜头、声音的协同生成,使人物表演与周围视听内容共同展开。

将视线拉回京东,JoyAI-EchoWM 是其基础模型矩阵升级的一部分。京东在 JDD 大会上全新展示了 JoyAI-Video 音视频基础模型,并带来了JoyAI-Echo 1.5、JoyAI-Voice 2.0 等版本迭代。结合此前发布的 JoyAI-Video-Edit 与 JoyAI-Image-Edit、JoyAI-Talker 和 JoyAI-RA,京东的布局已经全方位铺开。JoyAI-EchoWM 带来的世界模型与音视频能力,使这套体系进一步覆盖对环境的理解、生成和交互。



立足这一布局,京东正在为 AI 进入物理世界补齐相互补充的基础能力。同时,模型矩阵的长期价值取决于这些能力能否在具体任务中有效协同,并通过真实场景反馈持续改进。这呼应了京东建设「全球最大的物理世界运营中心」的战略目标。对拥有零售、物流等优势业务场景的京东来说,接下来的看点是如何将模型能力用于实际流程,并验证其可靠性、成本与效率。

JoyAI-EchoWM 的开源既为可交互视听生成提供了一套可供社区借鉴的方案,也让这条技术路径有机会接受更多真实场景的检验。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
爆了!美国政府网站上线了 Qwen3

爆了!美国政府网站上线了 Qwen3

云头条
2026-09-17 01:20:25
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
克洛普:打了50多通电话向一些球员解释落选原因

克洛普:打了50多通电话向一些球员解释落选原因

懂球帝
2026-09-17 20:30:11
1949年阅兵时一士兵突然举枪指向毛主席,李克农没抓人,让他“留队观察”

1949年阅兵时一士兵突然举枪指向毛主席,李克农没抓人,让他“留队观察”

往史
2026-09-17 17:05:05
9月17日俄乌:欧盟重申继续支持乌克兰,俄军单日损失近2000人

9月17日俄乌:欧盟重申继续支持乌克兰,俄军单日损失近2000人

山河路口
2026-09-17 23:03:33
国锦赛一夜2场冷门!中国军团4胜1负,张安达、霍金斯都造6-0惨案

国锦赛一夜2场冷门!中国军团4胜1负,张安达、霍金斯都造6-0惨案

小火箭爱体育
2026-09-17 22:32:35
杨坤判决结果出了,落泪原因曝光,炮轰刀郎的他还是走到了这一步

杨坤判决结果出了,落泪原因曝光,炮轰刀郎的他还是走到了这一步

调侃国际观点
2026-09-16 16:44:09
幸好!如果当初决策层相信了许小年,中国可能会比现在落后二十年

幸好!如果当初决策层相信了许小年,中国可能会比现在落后二十年

叮当当科技
2026-09-17 05:00:02
教授为学生上解剖课,察觉尸体标本模样不对劲,下秒赶紧报警求救

教授为学生上解剖课,察觉尸体标本模样不对劲,下秒赶紧报警求救

悬案解密档案
2025-05-26 13:38:33
敬一丹葬礼现场曝光!多位"大人物"到场,让人泪目的一幕出现了

敬一丹葬礼现场曝光!多位"大人物"到场,让人泪目的一幕出现了

寒士之言本尊
2026-09-17 19:27:05
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
沙特球迷意难平!不仅因为78-87惜败中国男篮,更在于以下5点

沙特球迷意难平!不仅因为78-87惜败中国男篮,更在于以下5点

林子说事
2026-09-17 05:38:59
王曼昱回应成为世界第一,名记预测国乒亚运:男子项目全军覆没!

王曼昱回应成为世界第一,名记预测国乒亚运:男子项目全军覆没!

三十年莱斯特城球迷
2026-09-16 23:13:28
几万人涌入赖文峰直播间刷屏杨钰莹,他一句“我和岗岗没有任何问题”

几万人涌入赖文峰直播间刷屏杨钰莹,他一句“我和岗岗没有任何问题”

喜欢历史的阿繁
2026-09-16 14:22:02
成都一网友称携带油纸伞坐地铁被拦下,地铁工作人员回应:属易燃易爆物品,禁止携带进站

成都一网友称携带油纸伞坐地铁被拦下,地铁工作人员回应:属易燃易爆物品,禁止携带进站

扬子晚报
2026-09-17 20:47:16
全球最大岛礁被我国收回:面积相当于四个深圳,曾遭美菲合力抢夺

全球最大岛礁被我国收回:面积相当于四个深圳,曾遭美菲合力抢夺

瓦伦西亚月亮
2026-08-30 05:02:05
东风导弹全球首次实战!沙特对胡塞武装动用DF-15,释放了什么信号?

东风导弹全球首次实战!沙特对胡塞武装动用DF-15,释放了什么信号?

麓谷隐士
2026-09-16 07:25:02
A股:股市拐点来临了,不出意外,周五很可能这样走!

A股:股市拐点来临了,不出意外,周五很可能这样走!

财经大拿
2026-09-17 14:01:14
太极实业午后闪崩!70亿巨量炸板,谁在涨停板上“割韭菜”

太极实业午后闪崩!70亿巨量炸板,谁在涨停板上“割韭菜”

慧眼看世界哈哈
2026-09-17 10:20:04
浴缸陪睡、洗内裤接口水、24小时卖命,多位助理"反水"曝明星猛料

浴缸陪睡、洗内裤接口水、24小时卖命,多位助理"反水"曝明星猛料

北海史记
2026-07-29 21:30:54
2026-09-18 02:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14014文章数 142733关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

艺术
旅游
游戏
教育
军事航空

艺术要闻

色彩狂魔比肖夫:评论家说他与表现主义调情,野兽派看了都沉默!

旅游要闻

让双节旅游市场活力更加充分释放

TES冒泡赛前换教练,小天阿水重回巅峰晋级S16,iG只剩一条命!

教育要闻

认知篇:顶级留学生会戒掉的几种学生思维!

军事要闻

韩国外长表态:尚未决定是否向霍尔木兹海峡派兵

无障碍浏览 进入关怀版