![]()
你有没有想过这样一个场景:如果有一个AI助理,全天候戴着摄像头跟着你生活了一整个星期,录下了44个小时的视频,然后你随口问它一句"我上次说要种花是什么时候的事,是谁提议的",它能不能立刻给你答案?
这听起来像是科幻电影里的桥段,但其实已经是一个真实存在的研究课题,叫做长视频问答。而浙江大学等机构的研究者们最近发现,做这件事的现有方法,全都卡在了同一个坑里。
这个坑说起来有点反直觉。你可能觉得,AI处理长视频,无非就是把视频拆成一堆片段,每个片段生成一段文字描述,存起来,问问题的时候搜一下相关的文字就行了。这套逻辑听上去挺合理,业内也确实是这么做的。但研究者们发现,这套看似合理的流程,在真实提问面前会频繁翻车。
问题出在哪儿
先说个具体例子。EgoLifeQA这个数据集里有一道题,问"谁打算种花",正确答案是"卡特里娜"。用一个叫WorldMM的现有先进系统去检索,它翻出了三段证据:11点34到36分卡特里娜在讨论花和花瓶,11点35到36分一群人在讨论手工花艺,11点34到35分附近提到了另一个人塔莎。结果这个系统被搞糊涂了,最后给出的答案是塔莎,错了。
问题不是证据没找到,证据其实都找到了。问题是这些证据是散的,是三条彼此独立的片段,谁是"打算种花的人"这个关键的绑定关系,没有被明确地存下来。语言模型看到三条线索,得自己在推理的那一刻现场把"人"和"计划"和"物品"拼在一起,而这个拼接过程本身就容易出错,尤其是在上下文预算有限、干扰信息一堆的情况下。
这就是研究者提出的核心诊断,现有的多模态记忆系统普遍采用的是"先检索、再对齐"的模式。也就是说,字幕、关键帧、语音转录、知识图谱里的事实,各自独立存放,检索的时候各查各的,最后把结果一股脑扔给语言模型,让它自己去拼凑跨模态、跨时间的联系。这套流程听起来很自然,做起来却处处是隐患,因为语言模型在生成答案的那一刻,恰恰是它上下文最紧张、注意力最容易分散的时刻,让它在这个时候现场做复杂的证据拼接,风险很大。
打个比方,这就好比你去银行办贷款,银行要求你提供身份证明、收入证明、房产证明,但这三份材料分别锁在三个不同的抽屉里,办事员现场从三个抽屉里翻出来,再靠自己脑子把"这个人""这份收入""这套房子"对应起来。如果材料本来就存在同一个档案袋里,办事员一伸手就是一整套齐活的资料,出错的概率自然大大降低。如果不把材料提前归档,每次办业务都要现场东拼西凑,效率低不说,漏看错看的概率会随着业务量暴涨。
研究者们把这个思路反过来了。他们提出的方法叫EM2Mem,核心想法是把"先检索再对齐"改成"先对齐再检索"。
事件锚点:把散落的证据钉在同一根钉子上
EM2Mem的第一个关键设计,是引入了事件锚点这个概念。
事件锚点(Event Anchor):指的是视频中一段固定时长(比如30秒)的时间区间标记,它本身不存储任何内容,只是一个用来挂载证据的"地址"。
具体做法是,先把长视频切成一段一段30秒的小片段,每个片段对应一个事件锚点。然后围绕这个锚点,把这段时间里能收集到的所有异质证据都绑在一起,包括画面里的关键帧描述、语音转录的对话内容、结构化的元数据(比如动作、物体、场景、话题、涉及的人物),全部统一存进一个叫"事件记忆单元"的容器里。
这跟之前的做法有什么本质区别?之前的做法是按模态分开存,字幕一个库,转录一个库,关键帧一个库,图谱一个库,检索的时候四路并发各找各的。现在是按事件维度绑在一起存,问一个关于某个时刻的问题,直接把那个时间点上所有相关的信息一次性拿出来,不需要再做跨库拼接。
回到前面种花的例子。在EM2Mem的记忆里,这段视频不再是三条孤立的记录,而是一个统一的事件记忆单元,里面明确写着人物是卡特里娜、计划是"花艺手工"、涉及物品是花和花瓶、时间是11点33到36分、话题是"压花手工艺"。这些字段是绑定在一起的,不是分散的。当问题问到"谁打算种花",系统直接命中这个记忆单元,"卡特里娜"这个答案已经现成写在那儿了,不需要现场推理谁跟谁有关系。
这就是为什么研究者管这个设计叫"构建时对齐,推理时检索"。所有跨模态、跨证据的绑定工作,都提前在存储阶段做完了,等到真正要回答问题的时候,系统要做的只是"找到对的那个记忆单元,读出来",而不是"找一堆碎片,现场拼图"。
这个设计带来的好处,在效率数据上体现得特别明显。研究者做了对比实验,在EgoLifeQA这个数据集上,EM2Mem把平均每次查询的延迟从459秒压到98.21秒,快了4.67倍,把总的推理token消耗从4203万降到1527万,减少了63.66%。这不是靠并行加速蒙混过关的,因为WorldMM本身受限于推理过程中要动态构建知识图谱,本质上快不起来,而EM2Mem直接从预先构建好的事件记忆单元里读取现成的答案原料,省掉了推理时反复对齐的开销。
多尺度时间视野:既要看得细,也要看得远
只有单个30秒事件的记忆还不够用。有些问题需要跨越好几个小时才能回答,比如"这个人有没有反复迟到的习惯",光靠一个30秒片段根本判断不出来。
于是EM2Mem在事件记忆单元之上,又叠加了一层多尺度时间上下文视图。系统会在3分钟、10分钟、1小时这几个不同的时间尺度上,把连续的事件锚点打包,生成对应尺度的摘要。每个尺度的摘要都会包含文字叙事、视觉概况和归一化的元数据(比如反复出现的动作、物体、场景)。
这个设计的用意在于给不同粒度的问题匹配不同粒度的记忆。局部的、发生在几十秒内的问题,直接查30秒级别的事件记录就够了。但涉及习惯、长期偏好、跨越很长时间段的关系判断,就得靠更粗粒度的时间视图来兜底。
研究者用了一个消融实验来验证这套设计的必要性。他们把时间上下文视图整个拿掉,只留下30秒级别的事件记录,结果EgoLifeQA上的整体准确率从66.0%直接掉到60.4%,跌了5.6个百分点。这是所有消融实验里跌幅最大的一项,说明多尺度的时间视图不是锦上添花的可选项,而是支撑长程推理的骨架。
这让我想起一个日常的类比。你回忆一件事的时候,脑子里其实同时存在两种记忆模式。一种是特别具体的片段式记忆,比如你记得昨天下午三点在便利店买了瓶水,这是精确到分钟的记忆。另一种是概括式的模糊记忆,比如你隐约觉得自己这个月总是很晚睡,这不是靠某一个具体的夜晚回忆出来的,而是靠对一整段时间的模糊综合印象。如果一个人只有精确到分钟的记忆能力,没有概括长期规律的能力,他大概率答不出"我最近是不是总是很晚睡"这种问题,因为他得把过去30天的每一分钟都倒出来现场统计,那太累了,人脑做不到,机器如果只存30秒记录也做不到高效回答。
事件关联图谱:把孤立的事件连成网
第三个关键组件,是两张轻量级的图谱,一张叫情景图谱,一张叫语义图谱。
情景图谱(Episodic Graph):把不同的事件锚点用具体的人物、物体、地点、场景、话题连接起来,还包括事件之间的时间先后关系。每一条连接关系都能追溯回它所对应的原始事件证据。
语义图谱(Semantic Graph):从情景证据里提炼出的更高层规律,比如某人的习惯、偏好、稳定的人际关系。这些抽象出来的事实同样绑定着支持它们的原始事件锚点,不会变成空中楼阁。
为什么需要这两张图?因为有些问题的答案,散落在时间上相距很远的多个事件里,需要靠共同的人物、物体或话题作为桥梁才能串起来。举个例子,如果问题是"上次和这个朋友一起做的事情是什么",答案可能藏在两周前的某个事件里,光靠时间上下文视图未必能直接命中,但如果图谱里已经标记了"这个朋友"和某个事件的关联,检索时就能沿着这条边直接跳过去。
消融实验同样验证了这两张图谱的价值。去掉语义记忆,整体准确率从66.0%掉到61.4%,跌了4.6个百分点。去掉情景图谱,准确率掉到61.6%,跌了4.4个百分点。两项都是仅次于时间上下文视图的重要贡献。
尤其值得一提的是,这套图谱设计对不同类型问题的帮助程度并不均匀。研究者的详细分类数据显示,去掉情景图谱对"关系图谱"类问题(涉及人际互动的题目)的伤害最大,准确率直接从72.8%掉到68.8%,说明情景图谱在梳理人物关系时起的作用特别关键。
图谱这个东西,其实很像你手机通讯录里的备注功能。如果只是单纯存了一堆姓名和电话号码,没有任何关联标注,那你想不起"上次帮我修电脑的是哪个朋友"这种问题,因为电话簿本身不记录人和事之间的关系。但如果你在联系人备注里写了"张三,修过我电脑",这条备注本身就是一条边,把"张三"这个节点和"修电脑"这件事连了起来,下次想不起名字时,反查备注就行。如果没有这层关联标注,你就得翻遍所有联系人自己回忆,效率天差地别。
结构化字段:为什么不直接用原始画面或者流水账字幕
研究者还做了一组挺有意思的对比实验,专门比较了视觉证据用什么形式来存最合适。他们测试了三种方式:原始视频帧、扁平化的字幕文字、结构化的事件字段(也就是把动作、物体、场景这些拆成明确的字段分别存)。
结果显示,结构化字段的表现明显优于另外两种方式,在结合"构建时统一"的处理方式后,达到了71.2%的准确率,比原始帧高出3.2个百分点,比扁平字幕高出5.6个百分点。
这个结果乍一看有点反直觉。按理说原始画面信息量最丰富,理论上应该包含最多细节,为什么反而效果不如结构化的文字字段?研究者给出的解释是,结构化字段是一种更适合语言模型使用的接口。原始帧虽然信息全,但检索、表达、归因都困难,语言模型很难直接从像素里抽取出"谁""在哪""做了什么"这些关键要素。扁平字幕虽然是文字了,但把所有信息糊成一整段叙述性文字,反而丢失了明确的实体、动作、场景边界,检索的时候很难精准命中。而结构化字段相当于提前把"主语""动作""地点""物体"这些语法成分拆好了放在那儿,语言模型拿来就能直接用,既好检索又好归因。
这就像你去查字典和去读一整本没有目录的百科全书的区别。字典里每个词条都有明确的词性、释义、例句,你查"苹果"直接翻到对应页码就行。百科全书虽然信息量可能更大,但如果没有目录和索引,你想找"苹果"这个词,得从头翻到尾,效率极低。结构化字段扮演的就是词典词条的角色,不是信息量的增加,而是检索效率和归因清晰度的提升。
同一组实验还验证了另一件事:不管用哪种证据形式,"构建时统一"总是比"检索时融合"效果好。这再次印证了论文最核心的设计哲学,把跨模态对齐这件事尽早做完,而不是拖到推理阶段现场处理。
关键帧的角色:辅助验证,而不是主力证据
有意思的是,EM2Mem并没有完全抛弃原始画面。研究者发现,在已经检索到相关事件单元之后,再补充少量关键帧(大约3张)给最终生成答案的模型作参考,整体准确率能从63.2%提升到66.0%。
这说明结构化的文字记忆虽然是主力,但有些问题还是需要一点视觉线索来做最后的确认,比如任务是否完成、参与者是谁、互动场景是什么样,这类问题靠视觉验证效果更好,而涉及长期行为模式的习惯类问题,靠零星的关键帧反而帮助不大,因为习惯这种东西本来就不是靠单张画面能判断出来的。
所以EM2Mem的最终定位是,结构化的事件记忆是回答问题的主力信息来源,关键帧只是最后阶段的轻量级视觉核实手段,不是让模型从头到尾靠画面去推理,而是在证据已经基本确定的情况下,用画面做个"眼见为实"的最后把关。
事件级别的检索效果:一次到位,而非反复摸索
除了准确率,研究者还专门评估了系统能不能精准定位到具体的证据时间段。这里用了一个很严格的标准,叫"严格30秒事件级别召回率",只有检索到的事件锚点精确匹配标注的证据片段才算对。
在这个严苛标准下,EM2Mem在检索前5个候选时召回率达到30.8%,比对照系统WorldMM经过5轮迭代检索后的23.8%还要高出7.0个百分点。更值得关注的是,EM2Mem只检索一次(前1个候选)的召回率就有23.0%,已经接近WorldMM反复检索5轮才达到的水平。
这意味着什么?意味着EM2Mem不需要像其他系统那样反复来回搜索、层层试探,靠事件锚点的精确索引,单次检索就能定位到高相关性的证据段。这就好比一个熟练的图书管理员和一个新手管理员的区别,新手可能得在书架间来回走五趟才能找到你要的那本书,熟练的管理员因为脑子里对分类系统了如指掌,一次就能直奔目标书架。如果索引系统本身设计得不好,就算允许你反复搜索,效率提升也是有限的,这正是WorldMM即便迭代5轮,召回率依然被单轮检索的EM2Mem反超的原因。
三大测试集上的整体成绩单
研究者在三个长视频问答基准上做了全面测试,分别是聚焦一周生活记录的EgoLifeQA、面向超长第一视角推理的Ego-R1 Bench,以及通用领域的长视频理解基准Video-MME长视频子集。
在使用相同评测条件重现的对比中,EM2Mem在EgoLifeQA上比最强的记忆基线系统WorldMM高出2.0个百分点(66.0%对64.0%),在Video-MME长视频子集上高出3.7个百分点(76.8%对73.1%)。在Ego-R1 Bench上(使用WorldMM原始发表的成绩作对比),EM2Mem达到67.7%,比WorldMM的65.3%高出2.4个百分点。
具体拆解到题目类型上,EM2Mem在关系图谱类和任务追踪类问题上的优势尤其明显,这类问题往往需要把散落在不同时间点的证据串起来,靠人物、物体或活动关系连接。这恰好印证了前面提到的图谱和多尺度时间视图的价值。不过EM2Mem在某些习惯性、时序性和合成推理类问题上,还是不如原始发表的WorldMM,说明这套方法并非在所有维度都占优,长期习惯类的判断依然是个挑战。
成本账:构建阶段多花钱,推理阶段省大头
任何把工作前置的设计,都得算一笔账,提前投入的成本,能不能在后续被摊平。
研究者做了详细的核算。EM2Mem在离线构建记忆的阶段确实要多花一些计算资源,总耗时从WorldMM的88708秒增加到99022秒,多了10314秒。但推理阶段的节省幅度要大得多,从229502秒骤降到6138秒,省下223364秒。算下来端到端的总耗时从318210秒降到105160秒,提速3.03倍。
按照单次查询的延迟数据算,大约29次查询就能把多花的构建成本赚回来。按照实际评测吞吐量算,大概24次查询就能实现盈亏平衡。这意味着,只要一段视频记忆会被反复查询超过二三十次,构建时多花的那点时间就完全值回票价。这类场景其实很常见,比如个人生活日志的长期问答、企业视频档案的反复检索、无监控用途的历史视频归档搜索。反过来说,如果一段视频只会被问一次问题,用完就扔,那额外的构建成本就没有摊薄的机会,未必划算。
这就好比你花时间给家里所有的箱子贴标签分类整理,第一次整理确实要花不少功夫,比直接把东西一股脑塞进箱子慢得多。但如果这些箱子接下来一年里你要反复翻找十几次,那么每次翻找省下来的时间早就把当初整理花的功夫赚回来了。如果这些箱子整理完第二天就要全部丢掉,那这份整理功夫自然是白费的。EM2Mem的设计逻辑正是基于"视频记忆会被反复查询"这个假设,这也是为什么论文的限制说明里特别强调,这套框架更适合"处理一次、反复查询"的场景,不太适合完全实时的一次性场景。
这个设计留下的缺口
研究者也坦诚地指出了这套方法目前没解决的问题。
结构化字段虽然检索效率高,但把视觉信息压缩成文字字段的过程,注定会丢失一些细粒度的像素级信息,比如小物件、颜色、布局这些细节。虽然论文里补充了关键帧做最后一步的视觉核实,但这终究是一种折中,没有完全解决"结构化"和"保真"之间的权衡。
另外,"先对齐再检索"这个理念虽然在文字和结构化层面做到了,但最终生成答案时依然要靠挑选出来的关键帧做视觉推理,这部分对齐工作其实还是留到了推理阶段,并没有做到彻底的构建时统一。
这些坦白的局限,反倒让整个研究显得更可信,一个方法承认自己没有解决所有问题,往往比宣称"完美解决"更值得信任。
写在后面
读完这篇论文,最让我意外的是那个种花的案例。它不是一个刻意设计的教科书式例子,而是研究者用来直观展示问题所在的真实测试案例,一个看似简单的"谁打算种花"问题,居然能把一个先进系统绕晕,把答案从卡特里娜答成塔莎。这提醒我一件事,很多时候AI系统的失败并不是因为它"没看到"关键信息,而是因为看到的信息是散的,没有被正确地绑定在一起。这跟我们平时理解"AI记忆力不好"的直觉完全不同,不是记不住,是记住了但没串起来。
另一个值得琢磨的地方是关于结构化字段和原始画面的对比实验。直觉上信息越丰富越好,但这个实验告诉我们,对于语言模型这种消费方式,接口的清晰程度有时候比信息的原始丰富度更重要。这其实和数据库设计里"规范化"的思路有点像,把杂乱的原始数据整理成结构化的字段,往往比保留原汁原味的混沌信息更有用,哪怕表面上"损失"了一些细节。
这也让我忍不住想,如果把这套"事件锚点"的思路搬到别的领域会怎样,比如一个人几十年的病历记录,或者一家公司几十年的邮件往来,能不能也用类似的方式,把散落的证据绑定在"事件"这个统一的索引单元上,让未来的查询变得又快又准?这个问题,论文没有回答,但值得继续想下去。
Q&A
Q1:EM2Mem解决的核心问题是什么?
A:EM2Mem要解决长视频问答里的证据碎片化问题。以往的系统把字幕、转录、关键帧、图谱各自独立存储,检索时各查各的,语言模型需要在推理时现场把这些碎片拼接成完整答案,容易出错。EM2Mem把这个对齐工作提前到记忆构建阶段完成。
Q2:EM2Mem相比现有最强系统WorldMM提升了多少?
A:在相同评测条件下,EM2Mem在EgoLifeQA上准确率提升2.0个百分点,在Video-MME长视频子集上提升3.7个百分点,同时把单次查询延迟降低4.67倍,推理阶段的token消耗减少63.66%。
Q3:EM2Mem的事件锚点具体是怎么工作的?
A:事件锚点是把视频切成30秒左右的固定片段,每个片段作为一个索引地址,把这段时间里的关键帧描述、语音转录、结构化元数据统一绑定存储成一个记忆单元,检索时直接命中完整证据,不需要跨模态现场拼接。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.