玩 AI 视频的朋友,大概率都踩过同一个大坑。
明明准备好了角色人设图、场景参考,生成视频之后,角色脸直接崩掉,发型服装乱变,场景画风到处串。做动画、做品牌短片,反复抽卡,耗时间又耗算力。
最近Wan 3.0图生视频支持同时上传多张参考图,每张图各管一部分——哪张锁角色、哪张锁场景、哪张锁风格,模型再按文字指令把它们拼成一段视频。
![]()
Wan 3.0的图生视频不是首帧延展这种简单逻辑,而是允许同时上传多张参考图,分别指定各自的职责——哪张管角色、哪张管场景、哪张管风格,模型再把这些约束拼成一段连贯视频。对角色向、品牌向的创作者来说,这个思路比纯文生视频更贴近实际使用场景。
听起来很美好,但实际用起来效果到底如何?
PART 01
测试 1:三张参考图,做日系科幻对峙 CG
第一组测试,我们放了 3 张参考图:男性角色、女性角色、传统木质道场场景。
指令里要求对两个角色的面部、发型、服装、机械配饰做了逐项约束,包括男性的护目镜、银灰发型、深灰色外套,女性的双发髻、红色机械面罩和白色战斗服,禁止模型改动。
![]()
成片约24秒,日系科幻游戏开场CG,两个角色在道场空间对峙,带日语对白,音画同步。
结果超出预期。三张图各司其职,角色五官没有互相融合,场景风格也没有乱漂移。只要把每张图的职责写清楚,模型可以稳稳守住人物外观和空间环境。
PART 02
测试 2:直接丢品牌文档,生成暖调 TVC 短片
第二个测试,想试试 “文档直接出短片” 这条链路。
上传一份品牌故事文档(拾光咖啡的品牌介绍),提示词只有一句:把品牌故事做成暖调品牌TVC短片,要有情绪价值,看完让人想去店里坐坐。
![]()
没有角色参考图,模型自行解析文档里的品牌主张、原料坚持和空间体验描述,转译成画面语言。
720P、25 秒成片。模型自己读懂文档里面的品牌理念、门店体验,转化成镜头语言。没有大段文字直接糊在画面上,整体是柔和的门店叙事氛围。
对于餐饮、本地生活商家来说,这个能力很实用。不用费劲写复杂脚本,一份品牌文案,就可以快速拿到宣传片草稿。
PART 03
测试 3:双兽人角色,佛窟遗迹高速打斗动画
第三组,挑战高难度动作镜头。
两张角色参考图:狸花猫女性角色、灰狼男性角色。要求生成30秒、16:9、1080P的电影级3D动画动作短片,场景为佛窟遗迹徒手对练。
![]()
外观细节逐条列出:狸花猫的棕灰虎斑毛色、额头深色条纹、琥珀金眼睛、青绿色连帽披风;灰狼的层次灰毛、冰蓝眼睛、深蓝披风、蓝色绑带护腕。
高速位移场景(追逐、腾跃、坠落)里,毛发细节、服饰形态、剑鞘位置、尾巴摆动最容易穿帮。
成片跑下来,惊喜的是,在大幅度动作之下,两套角色的外形、服饰、毛发没有出现明显崩坏,全程人物特征保持稳定。
PART 04
个奇幻小动物的东方奇幻短片
这是本次压力最大的一组测试,一口气上传 9 张参考图。
九张参考图:一张真人少女形象,一张秘境空间参考,七张拟人化小动物设定(麒麟小鹿、萌兔绒绒、叶虫芽芽、水母泡泡等)。
![]()
要求30秒、16:9电影级超现实东方奇幻短片,真人少女作为全片最高优先级参考,正面、侧面、中景、远景构图里都要保持五官比例、发型、服装一致;七个动物角色要在连续叙事中,从二维原画形象过渡成三维实感角色。
实测下来,所有小动物辨识度保住了,没有互相乱融合。但代价也很明显:提示词必须写得极度细致。只要有一处描述模糊,就会丢失部分角色细节。
这也给我一个很深的感受:它不是丢一堆图就自动出大片的魔法工具。指令越细,效果越稳。
PART 05
测试 5:四人团体 MV,8 种语言演唱,考验口型与人物锁定
最后一组,测试多人 + 口型同步场景。
三张参考图锁定四人团体阵容:一名女主唱、一名男DJ、左右各一名hype performer。要求生成24秒电影级国际化hip-hop音乐视频,高端街头时尚MV调性,节奏明快。
![]()
提示词特别标注"不得新增、复制或互换人物",这是针对多人物场景的常见问题预先设限。同一位主唱在片中切换八种语言演唱,屋顶舞台和镜头轴线全程稳定,口型、声线、节拍需精准同步0。
这条同时考验多语言口型对齐、多人物身份锁定、运镜稳定性三项能力。成片在口型同步上有辨识度,八种语言切换没有出现明显卡帧或滞后。
PART 06
聊聊实际成本:按秒计费,不同档位怎么选
![]()
这里给一个实操建议:前期调试提示词、验证角色锁不锁得住,优先跑 480P 版本。反复试到效果满意,再切 1080P 输出最终成片,能省下不少成本。
PART 07
组测试总结,这几个坑一定要避开
![]()
把五组案例全部跑完,我总结出很实在的结论:
✅ 优势:
1.可以给不同参考图分配不同职责,分别锁定角色、场景,相比传统图生视频,人物一致性提升非常明显。
2.支持文档直接解析生成短片,对品牌、商家做快速内容很友好。
3.长动作、多人物、多角色场景,只要指令到位,可以拿到可用性很高的成片。
⚠️ 现实局限:
1.不是图片丢进去就万事大吉。参考图分工、角色细节、禁止改动的描述,都要写进提示词。描述含糊,就会出现细节漂移。
2.参考图数量越多,对提示词精细度要求越高。9 图的案例效果尚可,但提示词写的工作量也成倍上涨。
3.口型可以做到基础对齐,但还不能对标真人实拍的精准度。
说白了,Wan3.0 更像一个执行力很强的助手。你把需求交代得清清楚楚,它就给你稳定的结果;如果你指令模糊,它就会自由发挥,出现各种意料之外的画面。
PART 08
写给创作者的小建议
如果你手上已经有现成角色设定稿、品牌物料,想低成本测试短片方案。
不要上来直接拉满 1080P。先用 480P 多跑几轮,把角色锁定、画面风格调顺,确认没有明显崩坏,再升级高清版本。
AI 视频工具,降低的是制作成本,不是思考和写提示词的成本。
今天的分享就到这里啦,觉得我的文章有用,记得一键三连,点个关注、分享、喜欢。持续分享更多 AI 内容创作干货技巧~
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.