智猩猩AI整理
编辑:知知
视频展示 DreamX-Creator 1.0 在不同内容场景中的联合音视频生成效果。建议开启声音观看。
当视频生成逐渐从"画面能动"走向"内容可用",声音不应只是最后补上的配乐或音效。对白是否贴合口型、动作是否踩准声响、环境音是否随场景变化,都会直接影响一段生成视频是否自然、是否完整。
为此,阿里 DreamX Team 团队提出 DreamX-Creator 1.0 来解决这一问题,这是一套紧凑的原生音视频生成系统。
DreamX-Creator 1.0 不是“先生成视频,再为视频配音”,而是让音频与视频在生成过程中持续交换信息,同时保留各自的建模能力。
其以 7B 联合生成器为核心,在统一时间坐标下同步建模画面与声音,并配套音视频数据系统、渐进式联合训练、模态感知强化学习,以及自回归单步 2K Refiner。
给定首帧和文本提示,模型能够共同生成在内容与时间上相互关联的视频和音频。
![]()
DreamX-Creator 1.0 效果概览。左侧展示 2K Refiner 对局部细节的增强,右侧展示语音、天气与动物等不同场景下连续画面和同步音轨。
![]()
论文题目:
DreamX-Creator 1.0: Democratizing Native Audio-Video Generation at 2K Resolution
01
从“视频配音”走向
原生音视频生成
常见的级联系统通常先生成视频,再调用独立模型补充声音。
这种方式容易扩展,但两个模型没有共享同一个生成过程,人物已经张嘴,语音可能尚未开始;物体已经落地,碰撞声却提前或滞后;镜头切换后,环境音仍停留在上一场景。
原生联合生成试图从源头减少这种割裂,却也带来一组更难的问题:怎样构建真正同步且描述完整的数据,怎样让两种模态充分交互而不破坏各自已有能力,怎样直接优化观感、听感和同步关系,以及怎样在联合生成之外,以可接受的计算开销输出 2K 画面。
DreamX-Creator 1.0 将完整系统组织为三段:原生音视频联合生成负责建立画面与声音,音视频强化学习进一步优化质量、提示词遵循和同步关系,独立的单步 2K Refiner 则负责恢复高分辨率细节,同时保留原始音轨。
![]()
系统整体流程。从首帧和文本提示出发,联合生成器同步产生视频与音频;模态感知反馈用于后训练;最后由 Refiner 将低分辨率视频提升至 2K。
02
数据系统:同步能力
首先来自同步数据
高质量音频和高质量视频并不天然组成高质量音视频样本。训练数据还需要满足镜头边界清晰、声音有效、两种模态在时间和语义上相关,以及文字描述能够同时覆盖“看见什么”和“听见什么”。
最新版技术报告从公开数据、网络视频、授权内容和内部数据等异构来源构建语料,并依次进行镜头切分、近静音片段剔除、有效性检查、画面与运动质量评估、声音质量评估,以及一般事件和可见语音场景下的音画同步检测。
完成筛选后,系统使用多模态模型联合理解画面和声音,通过语音识别补充对白,再将主体、动作、镜头、语音、音乐、音效与环境声整合成一条具有时间顺序的联合描述。与分别生成图像描述和音频描述再拼接相比,这种联合标注更有利于保留两种模态之间的对应关系。
![]()
数据系统包括异构数据收集、片段构建与过滤、结构化多模态标注,以及面向能力的数据组织。
整理后的样本被组织为语音与对话、动作与拟音、环境声与音乐、通用影视内容等能力池。最新版数据构成以语音和事件声为主体,同时覆盖音乐、自然声和混合内容,为不同形式的跨模态依赖提供更有针对性的监督。
03
7B 联合生成器:
专业分工,也保持双向交流
DreamX-Creator 没有把音频和视频 token 全部塞进同一条处理链,而是保留音频、视频各自专用的 DiT 分支。网络前半段主要让两种模态分别建立自身结构;进入后半段后,系统加入成对的 A2V(音频到视频)和 V2A(视频到音频)跨注意力,使动作、对白、环境声和镜头变化能够相互提供条件。
两条分支共享时间坐标,并通过时间旋转位置编码对齐各自的序列位置。
模型还为跨模态信息设置了细粒度输出门控,每个注意力头的输出都会根据当前目标特征和另一模态上下文动态缩放。这样既允许同步线索进入,也降低无关或噪声信息直接干扰主分支的风险。
![]()
网络前半段独立处理音频与视频,后半段通过双向门控跨注意力交换信息;右侧展示基于共享时间位置和上下文的逐头输出门控。
同一结构支持 A2V、V2A 和联合生成等内部训练配置。
训练时,模型先以参数高效方式建立跨模态连接,再进行全参数联合适配,最后使用质量与同步要求更严格的数据完成高质量微调。这条渐进式路径将“保留已有模态能力”和“学习跨模态关系”分开处理,为联合训练提供更稳定的起点。
04
模态感知强化学习:
把反馈送到相关分支
常规流匹配训练能够教会模型还原数据分布,却不会直接告诉模型,画面是否自然、声音是否悦耳、提示词是否被遵循,以及动作与声音是否准确同步。
DreamX-Creator 的强化学习将反馈区分为视频、音频和跨模态三类。系统在相同首帧和提示词下生成多组候选,分别评价视觉质量、听觉质量、提示词一致性和音画同步,再把视频反馈主要作用于视频分支、音频反馈作用于音频分支,同步反馈则共同作用于两条分支及其双向交互模块。
![]()
相同条件下生成多组音视频候选,再按反馈来源分别计算优势并更新相应分支;共享的同步反馈同时优化音频、视频和跨模态交互。
对于同步反馈,训练还会提高关键时间区域的权重,并更保守地控制浅层模态专用模块所接收的梯度。其目的不是简单叠加多个奖励,而是尽量保留反馈的模态来源,在改善联合表现时减少对已有视觉和声音先验的扰动。
05
单步 2K Refiner:
把高分辨率生成放到独立阶段
联合生成模型需要同时处理两种高维信号;如果再直接承担 2K 视频生成,显存与推理成本会明显增加。DreamX-Creator 因此先生成较低分辨率的联合音视频,再由独立 Refiner 增强画面,并保持音轨不变。
Refiner 的训练依次经历双向多步教师、自回归多步模型和自回归单步学生。推理时,模型按时间块依次处理视频,每个时间块只执行一次去噪评估,同时参考低分辨率输入与此前生成的高分辨率内容,以维持细节和时间连续性。
![]()
Refiner 从双向多步教师过渡到自回归多步模型,最终蒸馏为自回归单步学生。
这种设计把高分辨率细节恢复与基础音视频生成解耦,便于分别控制计算预算。不过,画面增强仍可能改变局部运动与声音事件之间的对应关系,因此评估时需要同时观察画面质量和时间一致性,不能只看清晰度。
06
最新评测:
既看自动评估,也看真实偏好
最新版技术报告在 Verse-Bench 上覆盖通用音视频事件和可见人物语音场景,并将原本分开的画面描述与声音描述合并成统一提示词。
除了自动评估,报告还加入盲测用户研究,受试者在隐藏模型身份、随机左右顺序的条件下,从文本与视频一致性、音画一致性、视频质量和音频质量等方面进行成对比较。
与 Ovi、UniAVGen、NAVA 和 DaVinci 等研究基线相比,DreamX-Creator 在盲测的各组对比中总体获得更多偏好,尤其在视频质量方面表现突出。这说明紧凑模型已经具备较有竞争力的联合生成基础,但并不代表所有内容类型和能力维度都已解决。
07
与更大模型仍有明确差距
与 LTX-2.3、MiniMax-H3 等更大规模模型相比,DreamX-Creator 1.0 尚未实现全面持平。技术报告显示,当前版本在音频美感、跨模态语义一致性和部分口型同步场景上仍有提升空间。
用户研究也给出了相似信号,在所抽取的样本中,DreamX-Creator 的视频质量可以接近部分工业级系统,但在音频质量和音画对齐上,与 Wan2.7、Kling v3、MiniMax-H3 仍存在差距。由于这组用户研究对高动态、复杂构图场景的覆盖有限,它更适合说明模型在相对常见场景中的竞争力,而不能据此推导出与工业级系统全面持平。
因此,现阶段更准确的定位是DreamX-Creator 以更紧凑的参数规模取得了具有竞争力的视觉效果和一般音画同步能力,同时把音频质量、复杂事件同步和跨模态语义理解保留为后续需要重点提升的方向。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.