网易首页 > 网易号 > 正文 申请入驻

模型听见了,却为什么记不住?EnvMem 揭开多轮语音模型的「声学失忆」| GAIR Paper 130

0
分享至


声学记忆并未消失,只是轨迹发生漂移。

作者丨肖扬

它记得你说过什么,却忘了你当时身处怎样的世界。EnvMem 发现,多轮语音模型的声学记忆并未彻底消失,而是在网络深处逐渐走偏。

想象一下。

你在厨房里和语音助手说话。水龙头一直开着,流水声清晰地混在第一句话里。十几轮对话之后,你忽然问它:“刚才背景里是什么声音?”

它答错了。

奇怪的是,如果你问第一轮里说过的某个事实,它往往还能回答。它没有忘记你的话,却忘了声音里的世界。

这正是当前大型音频语言模型面临的一种隐蔽断裂:模型可以在单轮输入中“听见”环境声,却未必能让这段声音穿过多轮对话,最终抵达答案。

更关键的问题是:它真的把声音忘了吗?还是声音仍在,只是已经变成了解码器不会使用的样子?

围绕这个问题,来自墨尔本大学、KAIST、奥克兰大学和新南威尔士大学的研究团队提出了 EnvMem,并系统分析 Qwen2.5-Omni、Qwen2-Audio 与 Kimi-Audio 的多轮声学记忆。

这项工作不只想证明模型会忘。

它更想找到:记忆究竟坏在了哪里。

01


为什么需要 EnvMem

过去的音频评测经常把语言内容和背景声音放在一起。模型回答正确,我们不知道它依赖的是语义,还是确实记住了环境声;模型回答错误,也无法判断是第一轮没有听清,还是后续对话把记忆冲淡了。

所以,EnvMem 先做了一件看似简单、但非常关键的事:把“说了什么”和“听到了什么”拆开来测。

它围绕两个研究问题展开:

  • RQ1:语言记忆与环境声学记忆,在多轮对话中的性能差距有多大?

  • RQ2:声学记忆失败主要来自表示层,还是来自 attention 检索层?


每个样本都从同一个场景开始:第一轮用户语音中混入一种环境声音,之后追加若干不含新环境声的对话轮次,最后再向模型提问。

同一段对话会产生两类问题。一类询问第一轮说过的语言事实;另一类询问第一轮背景中的环境声音。脚本、说话人、上下文长度和选项数量全部保持一致,唯一变化的是模型最终要找回哪一种记忆。

研究覆盖 10 类 ESC-50 环境声音、4 种对话长度——2、4、8、16 轮——以及 3 个开源音频语言模型。声学问题和语义问题各有 2,000 个测试实例,第一轮音频统一按照 10 dB 信噪比混合。

换句话说,EnvMem 不是再造一个“大而全”的榜单。

它更像一间声学记忆实验室:控制变量,然后看声音从哪一层开始走丢。

02


RQ1:声学记忆比语言记忆更脆弱

答案非常直接:模型更容易记住“你说了什么”,而不是“当时听到了什么”。


以 Qwen2.5-Omni 为例。当对话从 2 轮延长到 16 轮,语义问题准确率从 0.92 降到 0.84;声学问题则从 0.70 降到 0.56。到了 16 轮,两类记忆的相对退化差距达到 +12%。

Kimi-Audio 也呈现同一方向,长上下文下的相对退化差距达到 +8%。

Qwen2-Audio 暴露出另一个问题:在最短的 2 轮上下文里,它的声学准确率只有 0.39,而语义准确率达到 0.90。也就是说,一部分“遗忘”其实从第一轮就开始了——模型可能一开始就没有把非语言声音编码得足够好。

因此,所谓声学失忆并不是单一故障。

它至少包含两层:一层是初始感知差距,另一层是环境声音在长对话中的跨轮衰退。

语言可以沿着模型熟悉的语义通道稳定传播;非语言声学线索却更像一名没有通行证的旅客,每经过一轮对话,都更容易偏离主干道。

03


RQ2:记忆到底坏在了哪里

看到准确率下降,一个最自然的判断是:声音信息已经被覆盖、压缩,最后从网络里消失了。

但线性探针给出了一个反直觉的答案。

研究者在模型不同层的最终查询位置上训练分类器,检查隐藏状态中还能否读出第一轮的环境声音类别。


在 16 轮上下文中,第 25 层附近的探针准确率仍能达到约 70%。即使只看模型最终答错的样本,探针准确率也约为 48%,远高于 10 类分类的随机水平 10%。

这意味着一件很重要的事:模型答错,不等于信息已经消失。

声音仍然藏在隐藏状态里,只是模型自己的输出路径没能把它正确读出来。外部探针看得见,原生解码器却不会用。

随后,CKA 表示相似度分析进一步揭开了这条路径。随着上下文变长,模型的中间层表示逐渐偏离短上下文轨迹;失败样本并不是简单变得“没有信息”,而是走上了一条不同于成功样本的内部路线。到了深层,声学线索才被重新聚合,但时间和格式都已经发生偏移。

论文把这种现象概括为:表示轨迹漂移。

记忆没有被彻底删除,只是没有以解码器期待的形状抵达终点。

那会不会只是 attention 没看对地方?

第二种解释同样合理:信息还在,但模型生成答案时没有把足够的 attention 分配给第一轮声音。

如果这个假设成立,随着对话变长,模型对第一轮声学片段的 attention 应该持续下降;失败样本的注意力也应该比成功样本更加分散。


实验结果却没有出现这种稳定模式。

在 4 轮上下文中,第一轮声学锚点获得的 attention 多数低于后续填充轮;但到 16 轮时,差值反而转为正数,约为 +0.005 到 +0.010。对话更长,并没有让模型稳定地“少看”第一轮。

研究者还计算了覆盖 90% attention 所需的对话轮数和 token 数。成功样本与失败样本之间的差异很小,方向也不一致。失败样本没有系统性地表现出更弥散的注意力。

这里的结论需要说得准确:论文不是证明“attention 永远不重要”,而是发现,在当前模型与测量方式下,attention 分配无法稳定解释声学记忆失败。

模型可能已经回头看了。

只是它看到的那份记忆,已经不是解码器认识的格式。

04


因果实验:

修表示有效,拉 attention 无效

观察只能说明相关性。要判断真正的瓶颈,还需要直接干预模型。

研究者首先进行激活修补:在深层解码位置,把失败样本的隐藏状态替换为另一个样本的表示,然后观察答案能否恢复。


结果不是“换一个向量就行”,而是表现出很强的 donor 特异性。

以 Qwen2.5-Omni 的 16 轮失败样本为例:不修补时,准确率约为 0.13;换入错误环境类别的表示后只有 0.17;换入同类但同样失败的表示后为 0.22。

只有换入“类别相同、预测成功”的干净表示,准确率才从 0.13 跃升到 0.75。

这组数字几乎把问题钉在了表示上。

真正有用的不是更多激活,也不是任何来自正确类别的线索,而是一份仍然保持可解码结构的干净表示。

反过来,研究者尝试放大第一轮 attention、压制后续填充轮,或把相同增益施加到随机轮次。结果都很小,而且置信区间覆盖 0。系统扫参得到的最大提升为 +3.7,随机控制也能达到 +1.3。

一边是 0.13 到 0.75,另一边是微弱且不稳定的几个百分点。

EnvMem 给出的诊断因此十分清晰:主要瓶颈不是模型“有没有看第一轮”,而是第一轮声学信息在跨层传播后,是否还保持着输出路径可以使用的表示格式。

05


这篇论文真正改变了什么

过去谈长上下文记忆,人们很容易把问题归结为容量:上下文不够长、KV cache 不够大、检索范围不够广。

EnvMem 提醒我们,记忆还有另一个维度:可读性。

信息留在网络里,不代表模型还能使用它;attention 落在正确位置,也不代表被取回的内容仍然保持正确结构。

这对下一代音频语言模型至少提出了三个方向。

第一,评测不能只看转录、语义问答和单轮声学识别。模型是否能跨轮保留警报声、交通声、婴儿哭声等环境线索,应该成为独立能力。

第二,训练目标不能只要求“把信息塞进去”。模型还需要学习让声学表示在长上下文传播之后保持兼容,让早期形成的有效表示不会在中间层逐渐漂移。

第三,修复声学记忆不能只盯着 attention 热图。更细粒度的跨模态连接、记忆 token、KV 状态管理和层间表示对齐,可能比单纯提高某一段注意力更值得投入。

它把问题从“模型为什么忘了”推进到了更精确的一步:

模型不是没有记忆,而是记忆没有沿着正确的轨迹抵达答案。

06


结语:听见,只是记忆的开始

一个真正理解声音世界的模型,不能只在第一秒认出雨声、流水声或警报声。

它还要在十几轮对话之后,知道那段声音曾经发生过,并在需要时准确地把它找回来。

对音频语言模型而言,长期记忆不只是保存信息。

它还意味着:让信息在漫长的计算路径里始终可读、可路由、可解码。

听见,是感知。

记得住,才是理解的开始。

论文:Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory

作者:Yang Xiao、Siyi Wang、Han Yin、Hong Jia、Vidhyasaharan Sethu、Eun-Jung Holden、Ting Dang

单位:The University of Melbourne、KAIST、The University of Auckland、UNSW Sydney

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
克洛普:我愿为球员赴汤蹈火;两年多没带队训练,还好没生疏

克洛普:我愿为球员赴汤蹈火;两年多没带队训练,还好没生疏

懂球帝
2026-09-23 20:20:13
美国中将公开承认:打完伊朗,我才看清中国到底有多强大!

美国中将公开承认:打完伊朗,我才看清中国到底有多强大!

果妈聊娱乐
2026-09-17 08:20:56
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
斯诺克官宣!丁俊晖领衔,3大TOP16缺席,中国军团10人直通正赛!

斯诺克官宣!丁俊晖领衔,3大TOP16缺席,中国军团10人直通正赛!

刘姚尧的文字城堡
2026-09-23 08:36:19
2-0! 王欣瑜强势晋级16强, 中国网球1日2大喜讯! 郑钦文最新动态更新

2-0! 王欣瑜强势晋级16强, 中国网球1日2大喜讯! 郑钦文最新动态更新

云隐南山
2026-09-23 02:19:02
突发!陈冠希的新瓜,有点料!

突发!陈冠希的新瓜,有点料!

财经要参
2026-09-23 07:56:49
泽连斯基被曝与美国中央情报局局长在机场会面,知情人:两人在飞机加油期间进行了非正式交谈

泽连斯基被曝与美国中央情报局局长在机场会面,知情人:两人在飞机加油期间进行了非正式交谈

极目新闻
2026-09-22 10:22:09
不许降落加油!美国“掐断”伊朗全球航线

不许降落加油!美国“掐断”伊朗全球航线

凤眼论
2026-09-22 19:34:42
战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

体娱一家亲
2026-09-23 17:08:01
高圆圆在播客中首谈死亡:已和赵又廷商量好谁先走,理想告别是提前整理好东西不给孩子留麻烦

高圆圆在播客中首谈死亡:已和赵又廷商量好谁先走,理想告别是提前整理好东西不给孩子留麻烦

一盅情怀
2026-09-03 11:23:06
绝绝紫!凯特王妃出席首映礼,解锁了一条压箱底近百年的项链

绝绝紫!凯特王妃出席首映礼,解锁了一条压箱底近百年的项链

不太爱笑的小羊
2026-09-23 13:11:15
女儿为给发热父亲降温,用干冰直接敷在其身上,导致全身多处“冷烧伤”,医生:如同拿烧红的烙铁往皮肤上贴

女儿为给发热父亲降温,用干冰直接敷在其身上,导致全身多处“冷烧伤”,医生:如同拿烧红的烙铁往皮肤上贴

扬子晚报
2026-09-23 07:31:22
刘强东拿下张雪机车,震动行业!

刘强东拿下张雪机车,震动行业!

互联网品牌官
2026-09-23 11:50:56
财政部为什么是党组、公安部为什么是党委?

财政部为什么是党组、公安部为什么是党委?

画生笔记
2026-09-20 09:10:50
公务员严查再升级!这5类行为,纪委查到一起处理一起!

公务员严查再升级!这5类行为,纪委查到一起处理一起!

职场资深秘书
2026-09-23 12:28:40
苹果“最建议买”的3款手机,性能强不卡顿,能用到2032年

苹果“最建议买”的3款手机,性能强不卡顿,能用到2032年

小柱解说游戏
2026-09-23 00:30:51
陈妍希回应一天只吃一顿:白天喝咖啡能维持比较清醒的状态,晚上跟朋友约饭,是比较适合自己的方式;医生提醒:减肥不能以牺牲健康为代价

陈妍希回应一天只吃一顿:白天喝咖啡能维持比较清醒的状态,晚上跟朋友约饭,是比较适合自己的方式;医生提醒:减肥不能以牺牲健康为代价

台州交通广播
2026-09-22 12:00:00
随着中国男足0-0,朝鲜4-1伊朗,最终排名大反转:中国队变大赢家

随着中国男足0-0,朝鲜4-1伊朗,最终排名大反转:中国队变大赢家

大秦壁虎白话体育
2026-09-23 15:25:22
热议亚运男足小组第一出线:安东尼奥就是可以拿到想要的结果

热议亚运男足小组第一出线:安东尼奥就是可以拿到想要的结果

懂球帝
2026-09-23 16:49:54
“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

世界圈
2026-09-14 15:05:05
2026-09-23 20:35:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

教育
游戏
时尚
数码
手机

教育要闻

2026想给孩子报记忆力培训班?隆成义最强大脑特训营口碑推荐

长的丑就要被鬼追着杀!恐怖猎奇新游设定巨诡异

消失的天后,带病复出,先赚10个亿

数码要闻

首发玄戒O3!小米18 Fold首销量同比上代增长300%

手机要闻

天玑9600 Pro更聪明的GPU 领跑手机光追、超分、插帧游戏体验

无障碍浏览 进入关怀版