网易首页 > 网易号 > 正文 申请入驻

滑动窗口打败线性注意力:一篇让整个领域尴尬的论文

0
分享至


2024 年前后,AI 圈子里流行一种说法:大语言模型的注意力机制是个定时炸弹。

每处理一个新词,模型都得把它的信息存起来,存到一个叫做 KV 缓存的地方。

KV缓存:大语言模型在生成文字时,用来记住之前所有词语信息的存储区,随着对话变长,这个缓存会不停膨胀。

问题是,这个缓存只会越存越大,从不清空。对话越长,占用的显存越多,处理速度也越慢。学术界给这个问题起了个名字,叫"二次方扩展",意思是计算量会随着文本长度的平方增长。文本长一倍,计算量涨四倍。这事显然不可持续。

于是"线性注意力"横空出世,听起来像救世主:把二次方的计算量压缩成线性的,不管文本多长,每处理一个新词的成本都是固定的。学术论文里各种线性注意力的变体层出不穷,从 Mamba 到 RWKV,从 GLA 到 Gated DeltaNet,每一篇都说自己解决了问题,而且性能几乎不掉。

但微软这几位研究者做了一件挺较真的事:他们找来一个大家几乎已经遗忘的老方法,滑动窗口注意力,加上一个小技巧,跟这些号称先进的线性注意力模型正面对比了一下。

结果很打脸。

这个不需要任何训练、几乎零成本的老方法,在几乎所有测试里,表现都不输,甚至超过那些耗费大量算力训练出来的线性注意力模型。

这篇论文的标题就是这么直白:《滑动窗口打败线性注意力》。

问题到底难在哪

要理解这件事的分量,得先明白线性注意力想解决的到底是个什么麻烦事。

Transformer模型:目前几乎所有大语言模型的底层架构,靠"自注意力机制"让模型在处理每个词的时候,都能看看前面所有词跟它的关系。

自注意力的计算方式是这样的:模型处理第 t 个词的时候,要把它和前面所有 t-1 个词都做一次"相关性打分",然后加权汇总。这意味着处理第 1000 个词,要跟前面 999 个词都算一遍关系。处理第 10000 个词,就要跟前面 9999 个词都算一遍。

这就是为什么会有 KV 缓存这种东西存在,模型必须把每个词处理后产生的"键"(key)和"值"(value)都存下来,供后面的词查询用。文本越长,这个缓存越大,占用的显存越夸张,处理速度也越慢。

线性注意力的思路是:能不能不要把每个词的信息单独存起来,而是把它们压缩进一个固定大小的"状态"里,像滚雪球一样不断更新?这样无论文本多长,需要存储和更新的东西大小都是固定的。

这个想法听起来很美好,但现实很骨感。

线性注意力有三个天生的毛病。第一,表达能力不如原版注意力,因为把信息压缩进固定大小的状态,必然会丢失一些细节。第二,也是最麻烦的一点:模型必须在信息进来的那一刻,就决定要不要把它记住,而且一旦决定,以后很难反悔。这就像你边听课边做笔记,笔记本只有一页纸的空间,你得随时判断哪句话重要,值得记下来,哪句话可以舍弃,等老师讲到重点你才反应过来前面记错了地方,那已经来不及了,之前记的东西已经被新内容覆盖掉了。如果一开始就设计成"只有固定空间可以记笔记",你就必须承担"记错优先级"的风险,而这正是线性注意力模型训练起来特别难、效果总是差一口气的核心原因。第三,训练这类模型的软硬件生态还很不成熟,大部分显卡和框架都是为传统注意力优化的。

正因为从零训练线性注意力模型太贵太麻烦,研究者们想了个取巧的办法:拿一个已经训练好的、用传统注意力的大模型,硬把它的注意力机制换成线性版本,再用少量数据"补一补",让它尽量恢复原来的水平。这个过程叫"线性化"或者"蒸馏"。

其中最出名的一个方法叫 LoLCATs,它只用了 4000 万个训练词元(相当于一本厚字典的量级),就能让线性化后的模型恢复原模型九成以上的性能,堪称业界标杆。这个成绩确实让人眼前一亮,毕竟从零训练一个大模型动辄需要几千亿甚至几万亿词元。

问题出在对比的基准上。

这些论文在展示自己"表现不错"的时候,拿来对比的滑动窗口注意力,用的是一个"缺陷版本",没有加attention sink(注意力汇聚点)。而这个缺陷版本早就被证实会灾难性崩溃。换句话说,线性注意力模型们一直在跟一个"残废对手"比赛,赢了也说明不了什么。

滑动窗口注意力到底是什么

滑动窗口注意力(简称 SWA)这个思路其实特别朴素:既然看全部历史太贵,那就只看最近的 w 个词就行了,别的都不管。

滑动窗口注意力:模型在处理第 t 个词时,只关注前面 w 个词,而不是全部历史词语,这样计算量就固定住了,不会随文本变长而增长。

这个想法乍一听有点简陋,甚至有点"偷懒"的感觉,模型难道不需要记住很久以前说过的话吗?

但这里有个巧妙的地方:虽然单层只能看 w 个词,但 Transformer 是很多层堆叠起来的。第一层看到最近 w 个词,第二层在第一层的基础上又能往前延伸 w 个词的信息,这样一层一层叠加,实际的"感受范围"会随着层数线性增长。这跟卷积神经网络里的"感受野"概念是一个道理,单个卷积核看得不远,但堆叠很多层之后,网络整体能看到的范围就变得很大了。

这就好比一个传声筒游戏,但不是简单的一句话传下去,而是每个人在转述给下一个人时,还能顺便把前面几个人说过的关键词悄悄叠加进去。传的人越多,信息覆盖的范围就越广,即使每个人一次只能记住最近说的几句话。如果没有这种层层叠加的机制,模型就真的只能看到眼前这一小段文字,什么都记不住,那滑动窗口就真的是"金鱼记忆"了,根本没法用。

不过滑动窗口有个致命伤,早年间就被发现了:大语言模型有个很奇怪的习惯,会把大量不必要的注意力都堆到最开头的几个词上,哪怕这几个词本身毫无意义。

这些词被称为attention sink(注意力汇聚点):模型学会把多余的、不知道该放哪里的注意力都堆积在序列最开始的几个词上,即使这些词的实际内容并不重要,它们更像是注意力机制的"泄压阀"。

这就意味着,如果滑动窗口一旦往前滑动,把这几个开头词挤出窗口,模型就会突然"发疯",性能断崖式下跌。这个问题的解法后来也被找到了:无论窗口滑到哪里,始终保留最开始的 4 个词,让它们继续待在窗口里当"泄压阀"。这个简单的补丁彻底解决了滑动窗口的崩溃问题。

想象一下你在整理书桌,规定自己只保留最近处理的 64 份文件,其余的全部扔掉腾地方。如果你把最早放进抽屉的那份说明书也一起扔了,结果发现所有后续文件的编号系统全靠那份说明书才看得懂,那整个抽屉就全乱套了。解决办法很简单:那份说明书永远留着,不管抽屉多满都不动它,剩下的空间才轮到"先进先出"的规则。这就是"4 个哨兵词"的作用,它们不参与正常的新陈代谢,但撑住了整个系统的稳定性。

有了这个补丁的滑动窗口注意力,才是这篇论文里真正拿来做对比的版本,公平地跟各路线性注意力模型掰手腕。

正面对决:知识问答类任务

研究团队选了一堆有代表性的模型做基座,从 13 亿参数的小模型 Phi1.5,到 700 亿参数的 Llama-3.1-70B,涵盖了从小到大各个体量。测试的项目是几个业界通用的知识和推理基准,包括常识问答、科学推理、物理常识判断等等。

结果列在论文的核心表格里,这里挑几个有代表性的数字说一说。

在 11 组不同的模型对比里,滑动窗口注意力在其中 9 组里都拿到了最好的平均分。剩下两组也只是"平局"或者微弱落后。

具体到 MMLU(一个综合知识测试,考察模型在 57 个学科上的表现)这个指标上,滑动窗口注意力几乎每次都是表现最好的那个,唯一的例外是在 Llama2.0-7B 上,一个叫 DiJiang 的方法以 40.7 分小胜滑动窗口的 39.8 分,差距只有不到一分。

更有意思的是效率对比。论文里统计了一个"性能恢复率",意思是线性化后的模型能追回原模型多少百分比的分数。滑动窗口注意力在 MMLU 上追回了 93.2% 的分数,平均综合分数追回了 99.0%,而且完全不需要任何训练。

跟它打得最接近的是一个叫 QRWKV6 的方法,MMLU 恢复率 92.4%,平均分恢复率 99.1%,两者其实半斤八两。但 QRWKV6 需要 3.5 到 7 亿个训练词元才能达到这个效果,而滑动窗口注意力用的训练量是零。

这就好比两个学生考试成绩差不多,一个是花了几个月刷题冲刺出来的,另一个是裸考直接上场,压根没复习。两人分数打平,但你会觉得哪个更厉害?

其他方法的表现落差就更明显了。比如 Hedgehog 这个线性化方法,用了 4000 万训练词元,结果 MMLU 只恢复了 36.9%,平均分恢复了 73.9%,比滑动窗口差了一大截。SUPRA 用了整整 1000 亿词元训练,MMLU 恢复率也只有 53.0%。

这些数字放在一起看,传递的信息其实很扎心:花了大价钱训练出来的线性注意力模型,很多时候还打不过一个完全不需要训练、直接改改注意力遮罩就能用的老方法。

长文本推理:差距被彻底拉开

如果说短文本知识问答上滑动窗口注意力只是"略胜一筹",那在长文本推理任务上,这个差距直接变成了断崖式的碾压。

论文用了两个经典的长文本测试。第一个叫 Needle-in-a-Haystack(大海捞针),简单说就是在一大段无关文本中间藏一句关键信息,然后问模型能不能找出来。第二个叫 BABILong,是一套更复杂的长文本推理题目,需要模型在很长的干扰文本里做多步逻辑推理。

在大海捞针测试里,测试的上下文长度从 0.5K 一路拉到 4K 词元,窗口大小设置为 128、256、512 三档分别测试。结果是:不管哪个窗口大小,不管哪个长度,滑动窗口注意力的得分永远等于或者高于 LoLCATs 和另一个方法 Liger-GLA。

具体到 4K 长度这一档,滑动窗口注意力能保留原始满血模型 17% 到 23% 的准确率,而 LoLCATs 只能保留最多 5.8%,Liger-GLA 更惨,最多只有 0.8%。

这意味着什么?意味着在长文本场景下,LoLCATs 差不多已经"失明"了,100 次里只有不到 6 次能找到藏起来的关键信息,而滑动窗口注意力至少还能保住五分之一左右的能力。

BABILong 测试的结果趋势也一样。在上下文长度为 0 的时候(也就是没有额外干扰文本),LoLCATs 表现略微领先滑动窗口注意力,56 分对 55 分,差距很小。但一旦上下文拉长到 2K,滑动窗口注意力反超到 19 分,LoLCATs 掉到 10 分。拉长到 4K,滑动窗口注意力还能保住 15 分,LoLCATs 只剩 3 分。

用恢复率来说,在 4K 长度下,滑动窗口注意力能恢复原始满血模型 25% 的表现,LoLCATs 只能恢复 5%。

这个现象背后其实揭示了线性注意力最本质的软肋:它把所有历史信息压缩进一个固定大小的状态里,文本越长,需要压缩进去的信息越多,挤压得越厉害,早期的关键信息就越容易被后来的信息"挤没了"。这就像往一个已经装满的行李箱里硬塞新衣服,塞得越多,越早放进去的东西被压得越扁,甚至找不到了。滑动窗口没有这个"越塞越挤"的问题,因为它压根不试图记住太久以前的东西,它诚实地承认自己的局限,只精确处理最近的一段窗口,反而在长文本上更稳。

速度和显存:便宜到不讲道理

除了准确率之外,论文还测了推理速度和显存占用,这两项对实际部署来说同样关键。

测试在 NVIDIA RTX PRO 6000 显卡上进行,对比了传统的全量注意力、不同窗口大小的滑动窗口注意力、纯线性注意力,以及 LoLCATs 这种线性加滑动窗口的混合方案。

速度上,全量注意力在文本长度超过 1000 词元之后就开始明显掉速,越长越慢,一直掉到 25.6 万词元时几乎慢到无法忍受。而滑动窗口注意力从头到尾速度都很平稳,几乎不受文本长度影响,而且是所有方法里最快的,窗口设为 64 的版本比设为 512 的还要更快一些。

显存占用上,全量注意力的显存随文本长度线性暴涨,这也正是本文一开始提到的那个"不可持续"的问题的直观体现。滑动窗口注意力的显存占用会随长度增长,但一旦达到窗口大小就不再增加,稳稳地停在那里。窗口设为 64 的版本显存占用是所有方法里最低的。

这组数据说明一件事:滑动窗口注意力不仅效果不输甚至更好,成本还更低。既省钱又好用,这在工程实践里几乎是不可能同时满足的两个条件,但这次真的同时满足了。

后续的探索方向

这篇论文之后,研究者们也承认还有不少值得深挖的地方。

比如,这次的滑动窗口注意力是完全不训练的版本,但已经有别的研究证明,如果给滑动窗口也做一些针对性的训练,效果还能更好,这个方向值得跟线性化方法做更细致的对比,看看在同样训练预算下谁更划算。

再比如,这篇论文没有测试"混合模型",也就是那种部分层用全量注意力、部分层用滑动窗口或线性注意力的架构。这类混合方案在工业界其实已经有不少落地案例,未来做一次系统对比会很有价值。

论文里还提到一个挺有意思的旁证:在视频生成这个完全不同的领域,滑动窗口的思路同样很能打。有一个叫 Sliding Tile Attention 的方法,把滑动窗口的思路用在视频扩散模型上,在几乎不训练的情况下,能保留原模型 97% 的生成质量评分,同时速度提升了 3.53 倍。这说明"局部窗口 + 极少数关键锚点"这个思路,可能是一个跨领域都适用的通用规律,不只是语言模型的专利。

写在后面

读完这篇论文,最让人意外的不是滑动窗口赢了,而是这场"比赛"存在了这么久,却几乎没人认真跑过。

这背后可能藏着一个挺普遍的科研现象:当一个新方向足够热门,聚集了足够多的论文和关注度之后,大家默认的对比基准会不知不觉地被"锚定"在某个不完整的版本上,然后所有后续工作都在这个不完整的基准上争夺一两个百分点的优势,却没人回头去检查这个基准本身对不对。

这篇论文做的事情说起来特别朴素,就是回头把那个被简化掉的细节(attention sink)补上,再重新跑一遍对比。结果发现整个赛道的排名可能都得重新洗一次牌。

这让我想起一件事:技术圈里经常听到"某个老方法已经过时了"这种论断,但很多时候,所谓的"过时"其实只是没人认真给它补上该有的补丁,然后拿一个残缺版本去陪跑,再顺理成章地宣布新方法获胜。

如果连滑动窗口这么简单的东西都能在合理配置下反杀一众精心设计的线性注意力模型,那还有多少被判了"死刑"的老方法,其实只是缺了一个四个词元大小的补丁?

Q&A

Q1:滑动窗口注意力和线性注意力哪个更好?

A:根据这篇论文的测试,带有注意力汇聚点的滑动窗口注意力在多数知识问答和长文本推理任务上,表现等于或优于经过后训练的线性注意力模型,而且完全不需要训练,速度更快,显存占用更低。

Q2:为什么滑动窗口注意力需要保留开头的几个词?

A:因为大语言模型会把大量不必要的注意力集中堆积在序列最开始的几个词上,这些词被称为注意力汇聚点。如果窗口滑动时把它们挤出去,模型性能会灾难性崩溃,保留开头4个词就能解决这个问题。

Q3:线性注意力模型的主要缺点是什么?

A:线性注意力把历史信息压缩进固定大小的状态里,表达能力不如原始注意力,且必须实时决定该记住什么该忘记什么,这个决策一旦做出很难反悔,长文本场景下早期关键信息容易被后续信息挤压丢失,训练和推理生态也不如传统注意力成熟。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
房价很大可能重走1998年老路!所有人一定要提前做好心理准备

房价很大可能重走1998年老路!所有人一定要提前做好心理准备

偷喝一口奶
2026-09-11 08:36:30
中国男篮99-61哈萨克斯坦  球员评价:7人优秀,3人及格

中国男篮99-61哈萨克斯坦 球员评价:7人优秀,3人及格

篮球资讯达人
2026-09-11 11:16:41
10万起!广汽新车官宣:9月15日,正式上市

10万起!广汽新车官宣:9月15日,正式上市

科技堡垒
2026-09-10 09:49:03
虚构:中国的一部手机,竟救了总统阿萨德的命,助他顺利到达俄罗斯

虚构:中国的一部手机,竟救了总统阿萨德的命,助他顺利到达俄罗斯

红豆讲堂
2025-01-15 10:49:37
印度破防了,竟然给苏-30MKI“画上”了击落歼-10CE战机的标识!

印度破防了,竟然给苏-30MKI“画上”了击落歼-10CE战机的标识!

华人星光
2026-09-10 15:25:03
演员陈赫自曝确诊!已暂停工作

演员陈赫自曝确诊!已暂停工作

背包旅行
2026-09-09 18:39:24
突发!伊朗示弱了!

突发!伊朗示弱了!

财经要参
2026-09-11 08:01:04
大快人心!被摸臀女生再惹大人物,马来亚大学表态,退路彻底没了

大快人心!被摸臀女生再惹大人物,马来亚大学表态,退路彻底没了

听风喃
2026-09-11 11:28:04
从2800亿到570亿:耐克用5年证明,“去中国化”的代价到底有多贵

从2800亿到570亿:耐克用5年证明,“去中国化”的代价到底有多贵

午夜搭车a
2026-09-11 13:11:55
工龄39年,个帐52万,2026.8上海退休养老金太惊艳了!

工龄39年,个帐52万,2026.8上海退休养老金太惊艳了!

乐天果果
2026-09-11 13:05:54
CCTV5直播,中国女篮PK泰国女篮,三大短板待解决,宫鲁鸣冲首胜

CCTV5直播,中国女篮PK泰国女篮,三大短板待解决,宫鲁鸣冲首胜

体坛小快灵
2026-09-11 12:25:48
微信被曝史诗级漏洞:打个语音电话,号就“没了”

微信被曝史诗级漏洞:打个语音电话,号就“没了”

三言科技
2026-09-11 11:26:36
越扒越癫!被摸臀女生是惯犯,顺风车司机发声,更荒唐的在后面

越扒越癫!被摸臀女生是惯犯,顺风车司机发声,更荒唐的在后面

叶公子
2026-09-10 16:21:34
越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

平老师666
2026-09-08 21:41:14
深圳宝安警方通报“江西台记者采访被掌掴”:打人者已被行政拘留

深圳宝安警方通报“江西台记者采访被掌掴”:打人者已被行政拘留

每日经济新闻
2026-09-11 14:43:09
高校买商品房当学生宿舍:空调洗衣机齐全,双人间一年1320元

高校买商品房当学生宿舍:空调洗衣机齐全,双人间一年1320元

环球网资讯
2026-09-11 09:01:09
张继科:刘翔是奥运冠军!是我们国家的英雄 别的不知道不能胡说

张继科:刘翔是奥运冠军!是我们国家的英雄 别的不知道不能胡说

念洲
2026-09-11 07:00:49
胶衣大佬式穿搭,不能把那份燥热露出来

胶衣大佬式穿搭,不能把那份燥热露出来

飛尚日记
2026-09-11 08:07:15
外交部:中方已经就“台独”政客赴意大利出席有关会议,向意方、欧方提出严正交涉

外交部:中方已经就“台独”政客赴意大利出席有关会议,向意方、欧方提出严正交涉

新京报
2026-09-11 15:30:29
为什么现在还有那么多人坚持认为:中国的改革开放只有少数人得利?

为什么现在还有那么多人坚持认为:中国的改革开放只有少数人得利?

非虚构人间
2026-09-10 20:54:21
2026-09-11 17:07:01
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9842文章数 568关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

家居
本地
手机
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

拼假 13 天国内长线路线合集

手机要闻

vivo法务部回应“MCN组织博主诋毁品牌被判赔130万”

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版