网易首页 > 网易号 > 正文 申请入驻

直播换脸这件事,能做到实时又不崩脸吗?

0
分享至


你有没有刷到过那种带货主播,突然把自己P成了毛绒玩具风格,或者头上凭空多了顶帽子,全程流畅得像本来就是这样拍的?

这背后其实藏着一个挺棘手的技术难题。

先说个可能颠覆你认知的事实:现在最火的视频编辑AI模型,处理一段视频动辄需要几十步去噪加上好几秒到几十秒的等待时间。这在电影特效制作里完全没问题,反正后期慢慢渲染。但放到直播场景里,这几乎等于判了死刑。主播在镜头前挥手、眨眼、说话,你的编辑模型如果要等上一两秒才能吐出画面,观众看到的就是一卡一卡的鬼畜现场。更麻烦的是,市面上那些做视频编辑的模型,训练数据大多是用另一个AI模型生成的"伪造"视频对,这就导致一个连锁反应:模型学会的表情本身就是走样的,人脸编辑时经常出现原本在笑,编辑完成了变成面无表情,或者嘴型对不上这种尴尬场面。

这篇来自澳门大学、vivo蓝图实验室和大湾大学的论文,就是奔着这个硬骨头去的。他们做的东西叫EditaLive,一套能实时给直播画面做人物换装换风格的系统,同时还要保证主播的表情动作分毫不差地保留下来。

问题到底难在哪

先给你交代一下这个领域此前的技术格局。

传统的视频编辑思路大概分两派。一派是逐帧编辑,把图片编辑模型套在视频的每一帧上分别处理,这样做效率不错,但帧与帧之间缺乏关联,编辑结果这一帧红色下一帧粉色,看起来就是闪烁跳动的。另一派是原生视频编辑模型,直接对整段视频联合处理,时间一致性好了很多,但代价是必须一次性看到完整视频片段,还得跑几十步去噪,这就是所谓的双向注意力机制。

双向注意力:模型在处理某一帧时,可以同时参考它前面和后面的所有帧,这样时序更连贯,但也意味着必须等整段视频拍完才能开始编辑,天然不适合直播这种边生成边播放的场景。

这两派方法放在直播里都有问题。逐帧的会闪烁,联合编辑的又太慢。最近有些工作尝试用一种叫Self Forcing的技术把联合编辑模型改造成可以流式生成的版本,让模型一边生成一边往外吐结果,理论上能实时了。但论文里指出,这些方法的训练过程和真正推理时的运行方式对不上号,具体表现在位置编码和历史缓存的构建方式不一致,跑的时间一长,误差越积越多,人物的脸慢慢就"漂移"走样了,跟最开始设定的目标形象渐行渐远。

这就是这篇论文要解决的三个核心矛盾:表情失真、离线推理速度太慢、长时间生成后的画面漂移。

换个角度想问题:把外观和动作拆开

研究者们的思路挺巧妙,他们没有继续死磕怎么让联合编辑模型跑得更快,而是换了个起点。

他们注意到一件事:一个人的长相(外观)和这个人正在做的动作(比如挥手、说话、表情变化)其实是两件可以分开处理的事情。你换了衣服风格,不代表你的表情动作就要跟着变。反过来说,你的表情动作一直在变,但你的外观在一段直播里应该是稳定不变的。

基于这个洞察,团队选了一个叫Wan-Animate的预训练图像动画模型作为起点。

Wan-Animate:一个本身就能把外观和动作信号分开处理的图像动画基础模型,简单说就是给它一张人物照片和一段动作数据,它能让这张照片里的人"动起来",同时保持照片里的长相不变。

这就好比你有一张自己的证件照,另外找一个演员帮你演动作,最后合成出来的视频里,脸是你的,但表情动作完全按照那个演员的来演。这套逻辑天然适合拿来做人物编辑,因为编辑外观和跟随动作本来就是两件独立的事。

具体怎么用这个模型来做编辑呢?团队设计了一套挺聪明的训练方案,叫重建式训练。

他们不是直接找一堆"编辑前视频"和"编辑后视频"的配对数据来喂给模型(这类数据大多是别的AI生成的,天生带有表情失真的毛病),而是反过来操作:只对视频的第一帧参考图片做编辑,编辑完之后,再让模型学习"如何从这张被编辑过的图片恢复出原始的真实视频"。

举个例子,假设原视频里主播戴着棒球帽,团队先用图像编辑工具把这张参考图上的帽子去掉,得到一张"没有帽子"的照片。然后给模型一个反向指令"给他戴上棒球帽",加上原始视频里真实的骨骼动作和面部表情信号,让模型学着从这张没帽子的照片,结合动作数据,一帧一帧重建出原本戴帽子的真实视频。

这个操作听起来有点绕,但精妙之处在于:整个训练过程里,唯一被AI合成过的东西只有那一张参考图片,视频本身从头到尾都是真实拍摄的素材,表情动作都是真人原生的,完全不会被污染。

如果不这样设计会怎样?如果直接用AI生成整段"编辑后视频"当训练数据,那模型学到的表情动态从一开始就是失真的,之后不管怎么优化架构,这个先天缺陷都改不掉,这就是为什么现有很多编辑数据集训出来的模型总是在表情上翻车的根本原因。

围绕这套逻辑,团队还专门构建了一个叫CharEdit-50K的数据集,包含五万条精心筛选的人物编辑样本,覆盖添加物品、去除物品、改变颜色、风格转换四大类编辑任务,每张参考图片都经过脸部清晰度、手部完整性等多重质量把关,编辑指令由GPT-5.5生成并做了类别和颜色的均衡处理,避免模型在某一类编辑上过拟合。

从离线到实时:把整段视频切成小块流水线处理

外观和动作解耦这个思路解决了表情失真的问题,接下来要啃的是速度这块硬骨头。

Wan-Animate原本是个离线的双向注意力模型,处理视频得等完整片段送进来才能开工,这在直播场景根本行不通。团队的解法是把整段视频切成一个个小片段(论文里叫chunk),每个片段内部保持双向注意力,让片段内的帧互相参照效果更好,但片段与片段之间只能单向往前看,后面的片段可以参考前面已经生成好的内容,前面的片段绝不能偷看后面还没生成的内容。

这个设计换个说法你可能更好理解。想象一个厨房流水线,如果非要等所有菜都做好摆盘完毕才能上第一道菜,那客人得等到天荒地老。但如果每道菜做完立刻端上桌,同时保留刚上过的几道菜的味道记忆用来调配下一道菜的口味,客人就能边吃边等,整体体验流畅很多。这里"保留几道菜的味道记忆"对应的就是论文里说的历史上下文缓存,模型靠这个缓存记住之前生成过的画面信息,来保证新生成的片段跟之前衔接得上。

这一步的关键设计是让参考图片(也就是要编辑成的目标外观)保持"干净",不参与去噪计算的损失函数,只作为一个稳定的条件信息提供给模型。团队做了个对比实验:如果让参考图和目标视频一起被优化(论文里叫Ref.+Tgt.方案),模型会陷入一种自相矛盾的境地,同一个指令下,参考图被要求"保持不变",目标视频却被要求"按指令变化",这两个信号互相打架,结果就是模型生成的人物形象出现意料之外的走样。改成只优化目标视频的位置(Tgt. only方案)之后,这种冲突就消失了,编辑效果也更忠实于指令。

把多步去噪压缩成两步:对齐训练和推理的鸿沟

光是切片段实现流式生成还不够快,因为传统扩散模型的去噪过程本身需要好多步迭代,一步步把噪声"擦"成清晰画面。团队接下来做的事情,是把这个多步过程压缩成只需要两步。

这里用到了一个叫Self Forcing的现有技术,但团队发现直接套用会出问题,于是提出了改进版,叫Align Forcing。

先说Self Forcing的毛病在哪。这个技术的核心思路是让模型在训练时也用自己生成的、可能带误差的预测结果去做后续步骤,而不是总喂给它完美无瑕的标准答案,这样能减少所谓的曝光偏差。

曝光偏差:模型训练时只见过标准答案,一到真正推理阶段就得依赖自己生成的、可能有瑕疵的结果继续往下走,这种训练和使用时"喂料"不一致造成的性能落差,就叫曝光偏差。

但Self Forcing有个隐藏的坑:它把"什么时候更新梯度"和"什么时候停止推理"这两件事绑在了一起。训练时随机选一个步骤更新梯度,选到哪一步就在哪一步喊停,把那一步的中间结果拿去构建后续片段要用的缓存。可是真正推理的时候,模型是老老实实走完全部去噪步骤,拿最终结果去构建缓存的。这就好比考试的时候,你平时练习是做到一半就交卷检查答案,正式考试却要求你做完整张卷子才能交,练习方式和实战方式对不上,效果自然打折扣。

Align Forcing的改法是把这两件事解耦:梯度只在随机选中的那一步计算,但后续步骤依然老老实实走完,只是不再计算梯度(用了停止梯度技巧)。这样一来,缓存永远是拿最终完整结果构建的,跟推理时的行为完全对齐。代价是每次训练要多跑一次计算(从平均2.5次前向计算变成固定2次),但换来的是训练和推理彻底一致,长时间生成时误差不再累积走偏。

除了这个,团队还发现了另一个更隐蔽的坑,跟位置编码有关。

标准的位置编码(RoPE)是按照绝对位置来给每一帧标号的,第1帧编号1,第100帧编号100,以此类推。问题是训练时只能覆盖有限的片段数量,等到真正直播的时候跑到几百几千帧,模型就会遇到训练时从没见过的编号,这时候模型有点像见了没学过的题,表现自然打折扣。更麻烦的是,作为外观参考的那一帧永远固定在位置0,随着生成帧数越来越多,它和当前帧的编号距离越拉越大,这个距离一变大,参考图对生成结果的约束力就跟着变弱,画面就慢慢跑偏了。

团队的解法叫Fixed RoPE,简单粗暴又有效:不管实际生成到第几帧,永远只用0到9这十个固定编号来标记参考帧、历史缓存的不同层级和当前片段。这就好比不管你的手机相册里存了多少张照片,置顶收藏夹里的照片永远排在第一位,不会因为你后来又拍了几千张新照片就把它挤到几千名开外去,它和你此刻正在拍的这张照片之间的相对位置关系永远是固定的。

最后一个坑是关于历史信息该怎么取舍的问题,团队管这个叫首帧保留稀疏注意力(FPSA)。

问题出在哪呢?当前生成的画面片段,天然会更信赖时间上离它最近的那几个历史片段,因为长得最像。但这样一来,模型反而容易忽略掉更早之前、也更能代表"标准外观"的参考信息,久而久之画面就开始悄悄漂移。团队的做法是把注意力计算按空间时间分块,每次只挑选得分最高的一部分历史信息块参与计算(省了大量计算量),但强制规定第一帧生成出来的画面信息永远必须被选中参与计算,不管它的得分排名如何。

这个设计的用意很直接:第一帧是模型对目标外观最初、也是最准确的一次呈现,把它焊死在每次计算里,相当于给长时间生成过程钉了一根锚。实验数据显示,完全去掉这个机制,人物一致性得分(论文里叫ID-SIM)只有0.455,加上稀疏选择但不锁定首帧,涨到0.466,再加上首帧强制保留,涨到0.492,肉眼可见地看到人物脸部特征在长视频里稳住了,不再随时间推移悄悄变形。

效果到底怎么样

说了这么多设计思路,最终效果得看数据说话。

在短视频测试集上,EditaLive的编辑成功率达到0.720,是所有对比方法里最高的,第二名是13B参数量的UniVideo,只有0.533。更关键的是速度指标:EditaLive端到端生成速度达到14.47帧每秒,单个片段的处理延迟只有0.829秒。作为对比,速度最快的双向基线方法LucyEdit处理延迟高达26.27秒,EditaLive比它快4.7倍,延迟只有它的三十一分之一。

如果拿一个更贴近实际应用的方案来比,也就是先用图像编辑工具改好参考图,再用Wan-Animate做动画驱动的两步走方案,EditaLive依然比它快11.4倍,延迟差了76.7倍。这组数字挺说明问题的,因为两步走方案听起来简单直接,但级联误差和延迟叠加会让它在实时场景里完全站不住脚。

长视频测试上表现同样扎实。在超过一分钟的长视频测试集上,EditaLive的人物一致性得分0.492,是所有对比方法里最高的,编辑成功率0.817,也是最高。反观其他流式方法,比如SANA-Streaming成功率只有0.233,StreamDiffusionV2只有0.100,说明这些方法在短时间内可能表现还行,但一旦拉长时间跨度,画面漂移的问题就藏不住了。

写在后面

读完这篇论文,有个细节让我印象很深:团队为了解决表情失真问题,没有去优化模型架构,而是直接从训练数据的构造方式下手,只对静态图片做AI编辑,视频永远保持真实拍摄。这提醒我一件事,很多时候模型学不好不是因为架构不够聪明,而是喂给它的数据本身就带着一个学不掉的偏差,架构再怎么调也调不出干净的表情。

另一个值得琢磨的地方是Align Forcing这个改进,它解决的问题其实特别朴素:训练和实战不一致。这种"训练时图省事,实战时露马脚"的坑其实在很多机器学习场景里都存在,只是这次刚好被这篇论文的作者们精确地揪出来并且量化了差距(从2.5次前向计算到2次,看似省了计算,实际上省的是误差累积的隐患)。

论文里也坦诚提到了两个还没解决的问题:一是骨骼动作信号抓不住手指的精细动作,主播比个复杂的手势可能会走样;二是单张参考图片提供的外观信息终究有限,如果视频里出现了参考图没拍到的角度或者被遮挡的部位,模型只能靠猜。这些留白说明这套系统还没到完美,但已经把直播换脸这件事从"能不能做"推进到了"做得好不好"的阶段。

Q&A

Q1:EditaLive是什么?

A:EditaLive是一套面向直播场景的实时人物视频编辑框架,能在保留主播原本表情动作的前提下,实时修改人物的外观风格,比如换发型、加配饰、改变整体艺术风格。

Q2:EditaLive为什么能做到实时?

A:它把离线的多步去噪压缩成两步,并把整段视频切分成小片段流式处理,同时通过Align Forcing、Fixed RoPE等技术让训练过程和真实推理过程保持一致,减少误差累积,最终实现单个片段0.829秒的低延迟输出。

Q3:EditaLive如何避免长时间直播后人物变形走样?

A:它采用了首帧保留稀疏注意力机制,强制让最早生成的那一帧画面始终参与后续每一步的计算,相当于给长期生成过程钉住一个稳定的外观锚点,防止画面随时间推移逐渐漂移变形。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

火山詩话
2026-09-11 10:01:05
A股三大指数跌幅扩大,沪指跌2%

A股三大指数跌幅扩大,沪指跌2%

每日经济新闻
2026-09-11 10:48:03
私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

乌克兰小静
2026-09-10 09:09:45
大学生被40多岁富婆包养后,爱上富婆想娶对方,2019年富婆将他分尸,不想让丈夫知道

大学生被40多岁富婆包养后,爱上富婆想娶对方,2019年富婆将他分尸,不想让丈夫知道

汉史趣闻
2026-09-10 14:48:13
暴跌98.7%,AI第一大忽悠栽了

暴跌98.7%,AI第一大忽悠栽了

投资家
2026-09-10 21:34:12
网友称父亲打120误点荣耀“魔法画报”,致母亲错过最佳抢救时机去世?荣耀客服回应

网友称父亲打120误点荣耀“魔法画报”,致母亲错过最佳抢救时机去世?荣耀客服回应

潇湘晨报
2026-09-11 13:28:11
2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

生活的哲学
2026-09-11 07:49:04
南京大牌档福州门店均停业,曾是“排队王”

南京大牌档福州门店均停业,曾是“排队王”

海峡网
2026-09-11 10:39:36
875亿现金储备加持,理想汽车26.5亿加码电池产业链

875亿现金储备加持,理想汽车26.5亿加码电池产业链

道哥说车
2026-09-11 09:35:25
杀进决赛却丢世界第1!萨巴伦卡不解:这很奇怪 会努力把它抢回来

杀进决赛却丢世界第1!萨巴伦卡不解:这很奇怪 会努力把它抢回来

风过乡
2026-09-11 13:08:30
生涯首进美网决赛!莱巴金娜2-1逆转高芙,将战萨巴伦卡争冠

生涯首进美网决赛!莱巴金娜2-1逆转高芙,将战萨巴伦卡争冠

全景体育V
2026-09-11 11:12:32
不到一年,被捧上神坛的“英雄”成了“人人喊打的过街老鼠”

不到一年,被捧上神坛的“英雄”成了“人人喊打的过街老鼠”

小马姨
2026-09-01 10:37:59
苹果突然官宣:9月11日,iPhone17Pro抵扣价6400元

苹果突然官宣:9月11日,iPhone17Pro抵扣价6400元

搞机小帝
2026-09-11 10:53:02
这张照片,在印度引发热议!

这张照片,在印度引发热议!

环球时报国际
2026-09-11 07:52:48
走向百年企业,吉利做了一项系统工程

走向百年企业,吉利做了一项系统工程

砺石商业评论
2026-09-09 09:59:38
不忍了,韩旭发言一针见血,中国女篮最大问题或是宫鲁鸣和张子宇

不忍了,韩旭发言一针见血,中国女篮最大问题或是宫鲁鸣和张子宇

宗介说体育
2026-09-11 10:29:21
刘翔,2026年教师节,多捐了3毛3 发文地址已从上海变更为江苏

刘翔,2026年教师节,多捐了3毛3 发文地址已从上海变更为江苏

劲爆体坛
2026-09-10 11:59:09
复旦女硕士在意大利旅游被蜱虫叮咬染重症,严重时生活不能自理,家属全网求助:暂无特效药,希望找到擅长蜱传疾病的专家,寻求诊疗方案

复旦女硕士在意大利旅游被蜱虫叮咬染重症,严重时生活不能自理,家属全网求助:暂无特效药,希望找到擅长蜱传疾病的专家,寻求诊疗方案

鲁中晨报
2026-09-11 07:15:05
亚运开门红!中国男篮38分狂胜哈萨克斯坦 庞峥麟19分李弘权16+9

亚运开门红!中国男篮38分狂胜哈萨克斯坦 庞峥麟19分李弘权16+9

醉卧浮生
2026-09-11 10:38:01
25死5伤!青岛货轮火灾搜救结束,本次事故至少有4个重要信息披露

25死5伤!青岛货轮火灾搜救结束,本次事故至少有4个重要信息披露

火山詩话
2026-09-10 20:24:19
2026-09-11 15:15:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9826文章数 568关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

小孩坠楼砸烂宝马定损5万 车主:家长要求拆车件维修

头条要闻

小孩坠楼砸烂宝马定损5万 车主:家长要求拆车件维修

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

17岁拿下世界第一,还被亲妈吐槽?

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

亲子
房产
旅游
家居
教育

亲子要闻

幼儿园还没开学,媳妇要把女儿送新幼儿园,4岁女儿急的直磕头

房产要闻

时隔7年,绿地海南再拿地!

旅游要闻

一城同源,古韵新生 “南山八景”全民带路计划首站解锁“古城宁南”

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

【张捷杂谈】深圳统一校服背后的利益与教育观

无障碍浏览 进入关怀版