网易首页 > 网易号 > 正文 申请入驻

田渊栋转发!微软提出滑动窗口注意力,超过多种线性注意力方案

0
分享至

智猩猩AI整理

编辑:BugMaker

过去几年,大模型长上下文推理一直在寻找一个问题的答案。

当上下文越来越长,是否一定要牺牲模型能力,换取更低的推理成本?

传统Transformer中的全注意力机制(Full Attention)需要让每个Token关注全部历史信息,随着上下文增加,用于保存历史信息的KV Cache不断增长,推理显存和计算压力也随之上升。

为了摆脱这一限制,研究者提出了线性注意力(Linear Attention)路线,希望通过重新设计注意力计算方式,降低原本随序列长度增长的计算成本。

微软研究团队最近给出了一个反直觉结果:

可能不需要重新训练模型,不需要复杂的结构改造,只需要改变Attention计算范围,就能达到甚至超过许多线性注意力方案。

今天要介绍的这项工作来自微软的研究团队,论文《Sliding-window beats linear attention》系统比较了滑动窗口注意力(SWA)与多种线性注意力后训练方法。


实验覆盖1.3B到70B规模的大语言模型。结果显示,无需任何训练的滑动窗口注意力在11组通用知识和推理实验中9组取得最佳平均性能,在部分长上下文推理任务中,滑动窗口注意力准确率达到线性注意力方案的2到10倍

早在2024年,田渊栋参与的StreamingLLM工作就发现,大语言模型在生成过程中会对最开始几个Token产生异常高的注意力,这种现象被称为注意力汇Attention Sink

StreamingLLM利用这一现象,让模型保留前几个作为注意力汇的Token以及最近窗口Token。

微软团队进一步证明,注意力汇并不仅仅服务于流式生成场景。结合滑动窗口注意力后,它也能够超过部分线性注意力后训练方案,成为一种高效推理优化方式。

田渊栋本人也在社交平台转发这项工作,并表示这是“StreamingLLM再次发挥作用”,这一讨论也让注意力汇这一早期发现重新受到关注。


01

长上下文推理还有另一条路

随着上下文长度增加,Transformer最大的瓶颈来自自注意力机制(Self-Attention)。

在推理阶段,模型需要保存历史Token对应的Key和Value,也就是KV Cache(键值缓存)。每生成一个新Token,都需要继续维护这份不断增长的缓存。

线性注意力提出了一条完全不同的路线。

它通过重新设计注意力计算方式,降低随着序列增长带来的计算和存储压力。

但这类方法仍然存在一些现实问题。

一方面,它需要模型学习“哪些信息应该记住,哪些信息可以遗忘”。

另一方面,现有大模型和硬件优化大多围绕传统注意力机制设计,将Transformer转换为线性注意力通常需要额外训练。


此前一些工作已经证明,通过数千万甚至数十亿Token的后训练,可以让线性注意力恢复部分性能。

研究人员发现,一个更简单的方法可能被忽略了。

直接结合注意力汇机制的滑动窗口注意力,也许已经足够。

02

保留几个特殊Token,

滑动窗口注意力为什么有效

滑动窗口注意力的核心思想很简单。

模型不再关注全部历史Token,而只关注最近窗口内的信息。

例如窗口大小设置为64,当前Token只查看最近64个Token。

表面看,这似乎会损失大量信息。

Transformer经过多层堆叠后,局部窗口的信息仍然可以逐层传播,因此模型依然能够建立较远距离的信息联系。

研究发现,大语言模型经常会给最开始几个Token分配异常高的注意力,即使这些Token本身并没有重要语义。

这种异常吸收注意力的现象,就是注意力汇。

如果简单使用滑动窗口,当这些Token离开窗口后,模型性能会严重下降。

因此团队采用了一种简单策略,保留前4个Token作为注意力汇位置,同时关注最近窗口中的Token


也就是最近窗口负责局部信息。

前几个Token作为注意力汇,避免初始Token离开窗口后造成性能下降。

03

不用训练,简单调整就能

超过部分方案

为了验证这一发现,论文测试了多个主流模型,包括Phi、Mistral、Llama、Qwen等,模型规模覆盖1.3B到70B。

实验指标包括MMLU、ARC、HellaSwag、PIQA等知识推理任务。

实验结果显示,滑动窗口注意力只需要在推理阶段调整注意力掩码(Attention Mask),无需任何训练,就能达到接近甚至超过线性注意力后训练模型的效果。

在MMLU测试中,滑动窗口注意力保留了原始模型93.2%的性能。

而部分线性注意力方法需要额外进行数千万甚至数十亿Token规模的训练,才能达到类似水平。

差距更明显的是长上下文推理任务。

在Needle-in-a-Haystack任务中,模型需要在大量无关文本中找到隐藏信息。

当上下文扩展到4K时,滑动窗口注意力可以恢复Full Attention在该任务上的17.2%—23%性能。

在BABILong长上下文测试中,4K上下文下滑动窗口注意力达到15%的准确率,而LoLCATs只有3%


04

更低成本的长上下文推理方案

除了效果,论文还比较了不同注意力方案的推理速度和显存占用。

实验使用NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition进行测试。

结果显示,随着上下文长度增加,Full Attention速度持续下降,显存占用也线性增长。

而滑动窗口注意力在达到窗口大小后,显存基本保持稳定。

其中窗口大小为64的滑动窗口注意力拥有最低显存占用,同时保持较高解码速度。

滑动窗口注意力速度最快,并且在窗口小于512时,显存成本低于或接近线性注意力方案。


这篇论文并不是证明线性注意力没有价值。

作者也指出,线性注意力依然具有降低推理复杂度的潜力。

论文真正想回答的是,在已有大模型基础上,为了降低长上下文成本,是否真的需要重新设计Attention结构并进行额外训练

从现有实验结果看,重新设计注意力结构并非唯一选择。

滑动窗口注意力通过一个非常简单的注意力掩码修改,就实现了接近原模型能力的长上下文推理效果。

在固定较小显存成本的场景下,优先考虑带注意力汇的滑动窗口注意力方案。

不过,这项工作目前也有一定限制。

现有实验主要集中在语言模型任务,作者还没有验证更复杂的Agent任务、多模态模型以及更大规模模型上的表现。

对于长上下文大模型而言,这项工作说明:

解决注意力机制瓶颈,不一定总要重新设计模型,有时候重新思考已有结构的使用方式,同样可能带来巨大收益。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
再遭打击!瓦伦西亚主帅下课 利物浦外租小将前途未卜

再遭打击!瓦伦西亚主帅下课 利物浦外租小将前途未卜

球事百科吖
2026-09-14 05:28:07
新瓜,孙宇晨彻底吊打景甜!

新瓜,孙宇晨彻底吊打景甜!

财经要参
2026-08-29 07:05:19
美宇航员登月后变不正常,死前直言:人类不应该踏足远方

美宇航员登月后变不正常,死前直言:人类不应该踏足远方

第四思维
2025-07-31 18:47:40
【逝者】敬一丹的离去,是电视古典主义黄金时代的谢幕

【逝者】敬一丹的离去,是电视古典主义黄金时代的谢幕

界面新闻
2026-09-13 09:16:04
“一周就被摧残成这样了”,女老师晒前后面相变化,令人不敢相信

“一周就被摧残成这样了”,女老师晒前后面相变化,令人不敢相信

熙熙说教
2026-09-11 12:20:11
活久见!网传哈尔滨业主在电梯贴漫画,点名怒斥19楼老太吸烟,评论区瞬间炸锅

活久见!网传哈尔滨业主在电梯贴漫画,点名怒斥19楼老太吸烟,评论区瞬间炸锅

火山詩话
2026-09-13 10:09:02
日本记者门田隆将声称,中国是“无法无天”的国家!

日本记者门田隆将声称,中国是“无法无天”的国家!

果妈聊娱乐
2026-09-11 13:06:16
马云这辈子最大的错误,就是裁掉了淘宝创始人孙彤宇

马云这辈子最大的错误,就是裁掉了淘宝创始人孙彤宇

流苏晚晴
2026-09-13 14:16:03
4岁男童摸臀事件闹大了!马来西亚大学收到举报了,回应将会对女子采取必要措施

4岁男童摸臀事件闹大了!马来西亚大学收到举报了,回应将会对女子采取必要措施

小徐讲八卦
2026-09-11 05:52:14
菲利佩谈争议判罚:主裁应该自己去看回放确定是否是点球

菲利佩谈争议判罚:主裁应该自己去看回放确定是否是点球

懂球帝
2026-09-13 07:42:13
女神的19禁新剧,太生猛了

女神的19禁新剧,太生猛了

来看美剧
2026-09-13 21:47:05
形势有多严峻?网传有公司程序员被裁差不多了,留下的年底走人..

形势有多严峻?网传有公司程序员被裁差不多了,留下的年底走人..

慧翔百科
2026-09-11 11:48:37
山东烟台有人当街枪战?警方回应了

山东烟台有人当街枪战?警方回应了

网易号社区管理员
2026-09-13 18:18:42
“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

林林先生
2026-08-29 10:51:30
比托纳利更坑!热刺头号水货彻底隐身!19 次触球 7 次丢球太离谱

比托纳利更坑!热刺头号水货彻底隐身!19 次触球 7 次丢球太离谱

澜归序
2026-09-13 09:48:05
30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

三农雷哥
2026-09-05 12:16:13
英超裁判机构承认误判:哈兰德绝杀本应无效

英超裁判机构承认误判:哈兰德绝杀本应无效

元气满分吖
2026-09-14 05:33:28
李小冉节目上首谈前夫,坦诚公开离婚的原因,谈及过往委屈到落泪

李小冉节目上首谈前夫,坦诚公开离婚的原因,谈及过往委屈到落泪

铁锤妹妹是只猫
2026-09-12 05:20:00
创新,柬埔寨超级联赛成为亚洲首个引入“新秀章”的联赛

创新,柬埔寨超级联赛成为亚洲首个引入“新秀章”的联赛

懂球帝
2026-09-14 00:09:15
出轨风波后她自曝单身禁欲:没人能再碰我,这是对自己的承诺

出轨风波后她自曝单身禁欲:没人能再碰我,这是对自己的承诺

浅遇时光
2026-09-13 04:06:04
2026-09-14 07:12:49
智猩猩
智猩猩
AI 技术内容与服务平台
108文章数 5关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

体育要闻

魔术是今夏市场上最安静的球队

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

艺术
手机
本地
时尚
公开课

艺术要闻

朱总理的硬笔字

手机要闻

iPhone17三巨头霸榜,2026 W36销量第四名,竟是这台“塑料机”?

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

伊姐周六热推:电视剧《生逢其时》;综艺《大哥小助理》......

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版