网易首页 > 网易号 > 正文 申请入驻

AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何?

0
分享至


先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。

这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。

这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。

**核心问题出在哪**

想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。

现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。

这里麻烦就来了。

骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。

如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。

除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。

另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。

论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。

这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。

**解法:先想清楚,再动手**

论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。

这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。

大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。

视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。

整个流程分成三个阶段。

第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。

第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。

这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。

这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。

生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。

视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。

为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。

这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。

第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。

这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。

对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。

**用什么衡量效果**

光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。

评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。

结果摆出来相当直接。

| 方法 | CSEC | MID | ZDSS | 平均分 |

| Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 |

| Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 |

| HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 |

| MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** |

有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。

论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。

论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。

**写在后面**

读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。

这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。

论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。

这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。

Q&A

Q1:MMLVE任务是什么?

A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。

Q2:MMLVE-Agent和现有视频编辑模型比有什么不同?

A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。

Q3:全局记忆卡是怎么保证跨镜头一致性的?

A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
津门虎1-0铁人!积分追平对手 科尔多瓦制胜 铁人3连败+6轮仅1分

津门虎1-0铁人!积分追平对手 科尔多瓦制胜 铁人3连败+6轮仅1分

我爱英超
2026-09-12 20:56:49
突发!马斯克出事了!

突发!马斯克出事了!

财经要参
2026-09-12 15:38:35
等不到金砖开幕了,印度提前对华摊牌:要求中方让出印度市场

等不到金砖开幕了,印度提前对华摊牌:要求中方让出印度市场

触摸史迹
2026-09-12 13:57:11
打不赢伊朗,特朗普下定决心给日本撑腰,葫芦里到底卖的什么药?

打不赢伊朗,特朗普下定决心给日本撑腰,葫芦里到底卖的什么药?

近史博览
2026-09-12 10:30:41
16岁的中国“小花”首夺美网冠军!

16岁的中国“小花”首夺美网冠军!

五星体育
2026-09-13 01:04:57
鼻毛总是“窜”出来的男人,有什么不同?鼻毛变白,暗示了什么?

鼻毛总是“窜”出来的男人,有什么不同?鼻毛变白,暗示了什么?

熊猫医学社
2026-09-12 11:40:03
10位被永久封禁的网红:从4400万粉到全网消失,他们踩了哪些红线

10位被永久封禁的网红:从4400万粉到全网消失,他们踩了哪些红线

喜欢历史的阿繁
2026-09-12 09:47:25
我国公布新规定,对等回应日本,高市早苗傻眼了,非常不简单

我国公布新规定,对等回应日本,高市早苗傻眼了,非常不简单

DS北风
2026-09-11 16:46:19
1-2!88分钟惨遭绝杀!5.7亿战舰4轮1分仅进1球 夏窗卖人收入全球第二

1-2!88分钟惨遭绝杀!5.7亿战舰4轮1分仅进1球 夏窗卖人收入全球第二

狍子歪解体坛
2026-09-13 00:18:20
相红想疯了!被摸臀女生认怂,恶心一幕却发生,她的同类冒了出来

相红想疯了!被摸臀女生认怂,恶心一幕却发生,她的同类冒了出来

随笔写人间
2026-09-11 15:33:36
男子买95万二手房装修,发现卧室面积少4平米,砸开墙后顿时愣住

男子买95万二手房装修,发现卧室面积少4平米,砸开墙后顿时愣住

程哥讲堂
2025-06-02 18:21:32
“宜宾一镇干部被指推女子入厕强奸”续:当地警方已立案

“宜宾一镇干部被指推女子入厕强奸”续:当地警方已立案

澎湃新闻
2026-09-12 11:32:27
哈尔滨姑娘带19车亲友远嫁南京撑场面,结果婆家只给娘家人付一晚房费,新娘当场掀了婚宴桌子带人就走

哈尔滨姑娘带19车亲友远嫁南京撑场面,结果婆家只给娘家人付一晚房费,新娘当场掀了婚宴桌子带人就走

LULU生活家
2026-09-12 18:00:41
8 月 28 日,尼日利亚通信卫星信号被中方正式切断。没有剑拔弩张的外交博弈,也无关大国之间的政治施压

8 月 28 日,尼日利亚通信卫星信号被中方正式切断。没有剑拔弩张的外交博弈,也无关大国之间的政治施压

回京历史梦
2026-09-10 17:53:55
现在才懂,为啥中日闹得再凶,咱们也不拆钓鱼岛上的灯塔,因为这座灯塔,极有可能就是引爆中日战争的那根导火索。

现在才懂,为啥中日闹得再凶,咱们也不拆钓鱼岛上的灯塔,因为这座灯塔,极有可能就是引爆中日战争的那根导火索。

回京历史梦
2026-09-12 20:18:10
广州一男子联系“急开锁”,上门前说只要200元,之后暴力开锁换新锁要1730;消费者:师傅大高个拿扳手有纹身,不敢不给;开锁平台回应

广州一男子联系“急开锁”,上门前说只要200元,之后暴力开锁换新锁要1730;消费者:师傅大高个拿扳手有纹身,不敢不给;开锁平台回应

大风新闻
2026-09-12 20:33:04
因赛车起火处理不当,多支车队宣布退出CHINA GT赛事,为何闹这么大?赛事该如何补救平息怒火?

因赛车起火处理不当,多支车队宣布退出CHINA GT赛事,为何闹这么大?赛事该如何补救平息怒火?

之乎者也小鱼儿
2026-09-12 21:57:23
强烈要求党和国家给企退老职工享有公平的退休待遇!

强烈要求党和国家给企退老职工享有公平的退休待遇!

你在偷看谁
2026-09-12 20:50:56
国民党彻底乱套!宁可输掉2026大选,也要扳倒郑丽文?幕后水太深

国民党彻底乱套!宁可输掉2026大选,也要扳倒郑丽文?幕后水太深

时尚的弄潮
2026-09-12 11:37:27
2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

陈腕特色体育解说
2026-09-12 20:38:07
2026-09-13 03:24:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9843文章数 568关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

钟丽淇疑入ICU?聚会合照早露端倪

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

艺术
本地
家居
亲子
公开课

艺术要闻

法国女画家勒梅尔,为什么她笔下的女人让人看一眼就沦陷?

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

江苏徐州一幼儿园开展日常生活劳动课,孩子们在劳动中学技能、长本领

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版