网易首页 > 网易号 > 正文 申请入驻

原来世界模型,已经能边玩边生成了

0
分享至

这是苍何的第 584 篇原创!

大家好,我是苍何。

兄弟们,最近我连续看了几段爱诗科技旗下 PixVerse R2 的视频,有个感觉特别强烈:这玩意儿已经很难用单一品类来概括了。

第一段,是空间体验。

人在一个修仙世界里,可以通过 WASD 控制移动,再用方向键调整镜头。每一次操作都会成为新的输入,眼前的场景也会跟着继续生成。

第二段,是互动影游。

故事已经开始,用户可以通过选择、文字或语音参与其中。角色接下来做什么,镜头如何演出,局部剧情往哪里发展,都会受到输入影响。

第三段,是数字人。

直播带货、三星堆等场景里,数字人可以持续接收提示词输入,结合人设和上下文做出回应。语音、表情、神态和动作被放进同一段实时表演中,交流过程也更接近一个持续存在的角色。

把这几段视频摆在一起看,会发现它们很像三类完全不同的产品:一个像游戏,一个像互动电影,一个像可以随时交流的虚拟角色。

它们的底层却来自同一个实时世界模型。

更准确地说,是同一套实时世界模型提供生成底座,Director Agent 负责理解意图和组织演出,Runtime 负责管理持续变化的内容状态。

一个模型,开始撑起空间、故事和角色三种玩法。

一个世界持续运行,有多难?

过去生成一段内容,任务结束于成片交付。

实时世界模型面对的是另一种工作方式:内容始终在运行,用户随时可能按下一个方向键、说一句话、换一个目标,模型需要立刻接住这次变化,再继续生成后面的世界。

生成下一段只是起点。

真正麻烦的地方,在于连续经历多次操作以后,场景、角色、运动和上下文还能不能保持稳定。

比如用户刚刚经过一座建筑,转动视角后,这座建筑的位置和形态需要延续;角色上一轮做了一个动作,下一轮的姿态需要自然衔接;故事里刚刚发生的事件,也应该继续影响后面的演出。


每一次生成还会成为下一次生成的历史。一个很小的偏差写入历史后,可能沿着后续内容不断放大,最后出现人物变脸、场景突变、亮度漂移、动作断裂等问题。

视频生成关心下一段看起来是否自然,持续运行的世界还要关心每一次变化能否接得住。

R1 做成全球首个,R2 开始解决 Scaling

2026 年 1 月,爱诗科技发布 PixVerse R1。根据 PixVerse 官方发布信息,R1 是全球首个实时世界模型,也是行业第一次把连续、可交互的 1080P AI 视频生成,以及对用户输入的即时响应,放进同一套实时系统。

这一定位也有一线媒体的外部报道作背书:36氪称其为全球首个支持最高 1080P 分辨率的通用实时世界模型;新华网则指出,R1 首次将视频生成延迟降至“即时”响应,推动 AIGC 视频从静态输出迈入实时交互的新阶段。

这不是简单地把一段视频生成得更快,而是第一次让视频从“生成后播放”,走向“边生成、边交互、边延续”的实时世界。

到了 4 月,R1 又完成了一次行业首次:用户第一次可以用个性化 Avatar 进入 AI 生成世界,与其他人实时共同探索、共同影响世界走向。7 月发布的 PixVerse Game Engine,则进一步把实时世界模型、AI Agent 和结构化游戏机制连接起来。

这一连串更新证明了实时生成世界的技术路线能够跑通。


R2 更关键的变化,是让一次输入进入正在运行的内容状态:它会继续影响剧情分支、角色记忆、任务进度、结果反馈和关系变化。

接下来还要回答一个更难的问题:当模型规模、训练数据、交互任务、控制信号和运行时间继续增长,已有能力如何一起增长?


过去的长视频和实时生成框架,往往依赖一条很长的训练流水线。

双向基础模型先转成自回归模型,再构造面向具体任务的蒸馏 Teacher,接着进行 DMD 蒸馏,后面还要加入带 Self-Rollout 的训练,继续修正训练和推理之间的差异。

流程每多一个阶段,就会多一次能力迁移和目标对齐。上游积累的画面、运动、条件遵循和长程稳定能力,也可能在迁移中产生折损。


图 1:R2 将原先的多阶段训练流水线收敛为 Omni Causal AR 与 Real-Time Acceleration 两个核心过程。(来源:PixVerse R2 技术报告)

PixVerse R2 把这条长流水线收敛成两个核心过程。

第一步,持续预训练统一的Omni Causal AR,让模型在同一个体系里吸收更多数据、任务、模态和长时间交互轨迹。

第二步,通过Real-Time Acceleration,直接把已经形成的世界建模能力加速到低延迟的实时运行区间。


同一个 Omni Causal AR 同时承担 Student ODE 的初始化和蒸馏 Teacher,Teacher、Student 与真实的自回归推理共享同一套因果建模基础。

它会把完整时空建模获得的生成先验,转化为沿时间单向推进的世界状态变化。Text、Reference、Audio 与 Action,也由此成为持续推动世界演化的因果信号。

少了反复搬运,新增能力可以沿着同一条训练路径继续积累。

这也是 R2 所说的 Scaling:世界模型从“能不能做”,开始走向“能不能持续做大”。

一个模型,怎么接住不同玩法?

空间探索、互动影游和数字人,表面上差别很大,底层输入的节奏也完全不同。

按一次 WASD,需要模型马上反馈移动结果;一句 Prompt 可能描述一个完整事件;一段语音同时包含语义、情绪、节奏和时间信息;参考图片还要约束角色或场景的视觉状态。

如果把这些信号全部塞进固定长度的时间单元,响应速度和表达完整度很容易互相牵制。

R2 引入了Dynamic Chunk。

模型会根据控制信号的语义边界和持续时间,自适应地切分音视频序列。短 Chunk 用来接住动作和局部指令,长 Chunk 用来保留事件、运动和音视频语义的完整结构。


简单理解,用户按下一个方向键,系统就用更细的时间颗粒快速响应;用户给出一段复杂的剧情指令,系统会留出更完整的生成空间。

Text、Reference、Audio 和 Action 因此能够进入同一套因果生成接口,持续改变下一段世界状态。

这也是报告标题里 “Omni” 的含义:不同模态、不同任务和不同控制信号,都在同一个模型中学习和运行。


图 2:Text、Reference、Audio 与 Action 可以在不同交互时刻进入同一个因果生成过程,并驱动下一段音视频。(来源:PixVerse R2 技术报告)

世界一直往前走,怎么减少漂移?

长时间运行会带来两个直接问题。

历史全部保留,计算和显存成本会越来越高;历史裁剪过多,角色身份、场景设定和关键事件又容易丢失。

R2 给出的方案是一套多尺度记忆体系。

Sink Memory保存角色、场景、风格和世界规则等长期锚点;Rolling History关注最近的动作、姿态、镜头和环境变化;Object KV Cache复用并压缩已经计算过的对象级历史表征。

长期信息、近期动态和对象状态各走一条通道,模型可以在固定预算内维持世界身份与局部连续性。

训练阶段还加入了 Hybrid Teacher Forcing 和 Diffusion Forcing。

模型一边学习干净历史,保持单次生成的质量上限;一边接触带噪历史,提前适应真实运行中由自身生成的小误差。


图 3:Hybrid TF/DF 的统一因果掩码。Diffusion Forcing 只读取历史窗口;Teacher Forcing 中干净查询读取干净历史,带噪查询读取此前历史与自身状态,任何未来状态均不可见。(来源:PixVerse R2 技术报告)

R2 还建立了一个Error Bank,把有代表性的错误历史状态存下来,再按一定比例放回训练过程。模型会反复学习如何识别、吸收和修复已经出现偏差的历史。

技术报告给出了一组阶段性结果:长期亮度漂移指标从 0.201 降到 0.129,降幅约 35.8%;29 个长序列样例中有 20 个获得改善,5 个明确无动作的样例全部减少了错误运动。


截图来源:PixVerse R2 技术报告。

这组数字很有意思。

它意味着模型的训练目标里,已经加入了“犯错以后怎么继续走”这件事。

能力有了,怎么塞进实时交互?

完整的世界模型能力很重,实时交互又对延迟极其敏感。

R2 的实时加速层主要做三件事。


第一件是 DDMD with Adversarial Regularization。

条件对齐负责让模型准确响应 Prompt、Reference、Audio 和 Action,分布匹配负责继承 Teacher 的生成能力,对抗正则则用真实数据帮助模型维持纹理、运动和整体真实感。

第二件是 Block-sparse Attention。

模型把注意力计算集中到当前控制、近期运动和关键世界状态相关的少量计算块上。报告称注意力稀疏度已经提升到 90% 以上,当前评测中的画面质量、动作连续性、条件遵循和长时稳定性没有出现明显退化。

第三件是 Pyramid Ultra-few-step Distillation。

模型先用一到两个低分辨率阶段确定场景布局、主体运动和镜头结构,再通过一个高分辨率阶段恢复纹理、边缘和局部细节。

先搭骨架,再补细节,高分辨率空间里的重复计算会少很多。

这三部分共同做了一件事:把已经形成的世界建模能力,尽可能完整地加速到实时运行区间。


三种玩法,指向同一个变化

理解完这些技术,再回头看开头的三段视频,会发现三类体验恰好对应了 R2 的不同能力。

空间体验里的 WASD 和镜头控制,对应 Action 的即时输入、Dynamic Chunk 的快速响应,以及长期运行中的场景连续性。

互动影游里的选择、文字和语音,对应多模态控制进入正在发生的故事,让输入继续影响角色行为、局部演出和后续分支。


数字人方向则把语音、人设、记忆、表情和动作放进持续互动过程。角色要听懂当下的问题,也要保持前后身份一致,让回答与表演能够衔接起来。

World、Story、Character,构成了 PixVerse R2 当前最清晰的三个产品入口。

往更远处看,互动影视的观众可以进入剧情,实时生成游戏的内容会跟着玩家行动继续生长,虚拟角色也能从一段预制表演走向持续交流。

互动娱乐的内容形态,正在从固定成品变成一套持续运行、持续响应的系统。

回头看 PixVerse 这一年的演进,R1 证明了实时视频世界模型可以成立,R2 开始建立一条统一、可扩展、能够持续提升的训练路径。

一个模型可以继续吸收更多数据、更多任务、更多控制方式和更长时间尺度,再让这些能力进入实时交互。

空间、故事和角色,也由此拥有了共同的技术底座。

当世界能够持续接收输入并继续演化,AI 生成的内容也有了可参与、可延续的生命力。一个真正可以走进去的世界,开始出现了。

如果让你从空间探索、互动影游和实时数字人中选一个先体验,你会选哪一个?

评论区聊聊,点赞、在看,也欢迎关注我。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
深圳网友称高铁候补订单0:38兑现成功,早上睡醒发现车已开走,12306回应:候补时可设置截止兑现时间,系统默认截止兑现时间为开车前6小时

深圳网友称高铁候补订单0:38兑现成功,早上睡醒发现车已开走,12306回应:候补时可设置截止兑现时间,系统默认截止兑现时间为开车前6小时

潇湘晨报
2026-10-01 10:53:13
触目惊心!沪昆高速怀化段车祸残骸曝光,6死4伤,57岁老司机涉嫌疲劳驾驶

触目惊心!沪昆高速怀化段车祸残骸曝光,6死4伤,57岁老司机涉嫌疲劳驾驶

火山詩话
2026-10-01 12:14:04
胡锡进发微博忘删AI回复“需要我帮你通读核对吗?”,网友:比自己写便宜

胡锡进发微博忘删AI回复“需要我帮你通读核对吗?”,网友:比自己写便宜

可达鸭面面观
2026-10-01 14:43:37
让空姐下跪的乘客,接下来可能要面对3个窘境:全网公愤、亲友改观、工作受影响

让空姐下跪的乘客,接下来可能要面对3个窘境:全网公愤、亲友改观、工作受影响

王老师你还好吗
2026-10-01 01:31:27
就在今天,鲁比奥向中方发来贺电,与前任国务卿比,措辞略有不同

就在今天,鲁比奥向中方发来贺电,与前任国务卿比,措辞略有不同

原谅你
2026-10-01 15:23:04
财政部确认了:10月1日起,我国将对居民购房实施贷款贴息,聚焦首套刚需,单户所购住房建筑面积不超过120平方米、购房价格不超过150万元

财政部确认了:10月1日起,我国将对居民购房实施贷款贴息,聚焦首套刚需,单户所购住房建筑面积不超过120平方米、购房价格不超过150万元

吉刻新闻
2026-09-29 20:35:46
清华讲台,翁帆还没开口,衣服先替她说了话!她一出现,目光就被那身打扮勾住了,这样的翁帆,确实让人移不开眼!

清华讲台,翁帆还没开口,衣服先替她说了话!她一出现,目光就被那身打扮勾住了,这样的翁帆,确实让人移不开眼!

财经要参
2026-09-30 19:39:44
迪拜航空客机上唯一医护乘客披露救治细节:印度籍机长“手部几乎被切断”

迪拜航空客机上唯一医护乘客披露救治细节:印度籍机长“手部几乎被切断”

澎湃新闻
2026-10-01 16:30:27
反转又反转!美国女死囚被注射两剂致死药物后仍活着还打鼾,紧急送医治疗

反转又反转!美国女死囚被注射两剂致死药物后仍活着还打鼾,紧急送医治疗

澎湃新闻
2026-10-01 16:10:04
拳王泰森来瞻仰毛主席遗容,他出来说了一句这辈子都没敢说的话

拳王泰森来瞻仰毛主席遗容,他出来说了一句这辈子都没敢说的话

游文刀
2026-09-30 00:14:51
著名演员发声:我糟蹋了自己的身体

著名演员发声:我糟蹋了自己的身体

中国新闻周刊
2026-09-30 21:10:04
真大胆!两名华人拿着微信买来的美国护照入境,人脸识别当场露馅!

真大胆!两名华人拿着微信买来的美国护照入境,人脸识别当场露馅!

华人生活网
2026-10-01 02:15:33
以色列:以方今后将掌握所有飞往以色列航班飞行员身份,并进行一定程度安全审查

以色列:以方今后将掌握所有飞往以色列航班飞行员身份,并进行一定程度安全审查

新京报
2026-10-01 15:49:35
日本股市暴涨2000点,发生了什么?

日本股市暴涨2000点,发生了什么?

金石随笔
2026-10-01 13:54:11
人人人人人人人人人人

人人人人人人人人人人

上海黄浦
2026-10-01 17:20:20
苦战163分钟!中网金花德比:郑钦文2-1险些爆冷,下一轮对手出炉

苦战163分钟!中网金花德比:郑钦文2-1险些爆冷,下一轮对手出炉

侃球熊弟
2026-10-01 12:18:01
暴利!净利润 5697 亿、收入 8930 亿

暴利!净利润 5697 亿、收入 8930 亿

云头条
2026-10-01 10:59:38
林诗栋4-0王楚钦夺冠,现场却齐喊“王皓下课”,王皓罕见连鼓两次掌回怼

林诗栋4-0王楚钦夺冠,现场却齐喊“王皓下课”,王皓罕见连鼓两次掌回怼

火锅局
2026-10-01 13:09:57
张又侠、刘振立被褫夺党籍、军籍后,我们的军队刀刃向内整风了!

张又侠、刘振立被褫夺党籍、军籍后,我们的军队刀刃向内整风了!

叶葉夜
2026-09-26 22:23:38
尿酸危机,席卷中国

尿酸危机,席卷中国

快刀财经
2026-10-01 00:51:49
2026-10-01 19:44:49
苍何
苍何
前大厂工程师,努力分享AI干货知识
183文章数 173关注度
往期回顾 全部

游戏要闻

成人脱衣新游公布!文学少女打地牢 战斗越伤衣服越少

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

头条要闻

C罗离开后葡萄牙队7号球衣疑光速易主 莱奥将披7号球衣

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

科技要闻

5999元起!华为Mate 90系列发布

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

健康
手机
时尚
亲子
公开课

刷酸祛痘,为什么有人翻车?

手机要闻

越用越懂你 Mate90上的小艺这次升级戳中了多少用户痛点

在米兰,用时装唤醒内心的自我

亲子要闻

开学一个月“学习困难门诊”迎就诊高峰,医生:就诊诉求几乎只有“提分”

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版