一条视频,30秒,1080P,还自带音轨——不是分段拼接,不是后期配音,而是模型一次生成出来的。阿里云最新发布的Wan3.0,把这件事变成了默认能力。
这项能力被命名为Omni-reference,核心在于"单次生成"(single pass)。过去视频模型生成带声音的内容,通常需要先出画面、再单独合成音频,两个步骤分开跑。Wan3.0的做法是让音频和视频在同一个生成流程里完成,省掉了中间的对齐和拼接环节。
![]()
30秒意味着什么
时长是另一个关键指标。目前主流视频生成模型大多停留在5到10秒的片段,30秒的连续生成对模型的上下文一致性和计算资源都是考验。Wan3.0把原生时长拉到30秒,意味着它不需要依赖"首帧+尾帧"的插值技巧来延长视频,而是直接输出完整片段。
分辨率同步跟上。1080P在当前视频生成模型里属于较高规格,配合30秒时长和音视频同步生成,这三个参数叠加在一起,指向的是同一个方向:视频生成正在从"能出片"走向"能直接交付"。
为什么音视频同步生成是分水岭
做过AI视频的人都知道,画面和声音分开生成的最大问题是"对不上"。人物嘴型、环境音效、背景音乐,任何一条轨道错位都会让成片显得廉价。Omni-reference把音频和视频放进同一个生成流程,从源头规避了这类对齐问题。
这对内容创作者来说意味着更短的生产链路。以前生成一条带声音的视频,可能需要跑两遍模型、再做后期同步;现在一次生成,拿到就是成品。对于批量生产短视频内容的团队,这个效率差是数量级的。
在哪里能用上
Wan3.0已经上线阿里云的两个平台。Model Studio和Qwen Cloud都提供了访问入口,开发者可以直接调用。从官方发布的信息看,这次开放的是模型能力本身,具体API参数和计费方式还需要在平台上进一步确认。
阿里云在官方推文中提到,Wan3.0正在赢得全球视频创新者的信任。这句话的底气,大概就来自Omni-reference这套原生能力——不是靠后期修补,而是把复杂问题在模型层面解决掉。
视频生成的下一步
30秒1080P带声音,单次生成,这个组合放在当前行业里属于第一梯队。但更值得关注的是它背后的趋势:视频生成模型的竞争,正在从"比谁生成的画面更精致"转向"比谁交付的成品更完整"。画面、声音、时长、分辨率,这些维度正在被整合进同一个模型里。
对于开发者来说,这意味着选择模型的标准也在变化。以前看画质、看风格,现在还要看它能不能一次给出可用的成品。Wan3.0的Omni-reference,算是把这条标准往前推了一步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.