网易首页 > 网易号 > 正文 申请入驻

少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

0
分享至



Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。

兼顾线性注意力(Linear Attention)的效率与全注意力(Full Attention)的建模能力,混合线性注意力大模型(HLA LLM)已成为 Qwen3.5、Kimi Linear、Nemotron-H、Zamba 等模型采用的一条重要架构路线。然而,当两类序列混合机制被交错放进同一个深层网络,它们会如何相互影响?少数 Full Attention 层又会怎样改变前后 Linear Attention 层的激活动态?

本研究由以 StartLux 为核心的联合团队完成。StartLux 是专注全本地智能解决方案的科技企业,致力于打造可部署于个人终端的高性能人工智能系统。StartLux 携手清华大学、中国科学院大学、香港大学、悉尼大学和哥伦比亚大学的研究者,选择以 Massive Activations(MAs,大值激活)为「探针」,对这一问题展开系统研究。研究覆盖五种 Linear Attention 架构、六种混合配置、五个数据域,以及 12 个公开 HLA LLM 检查点,模型总参数量从 1.2B 横跨至 397B。



  • 论文标题:Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
  • 论文链接:https://arxiv.org/abs/2608.12149
  • Hugging Face:https://huggingface.co/papers/2608.12149
  • 代码链接:https://github.com/StartLuxLabs/Massive-Activations-HLA

Full Attention 前一层的「尖峰」

研究者首先汇总所有 Full Attention 层和注意力头接收到的注意力,选取被最多注意力头关注的 token 作为「全局 Attention Sink」,再固定该 token 沿深度追踪其 MAs 。

在 1.3B、12:1 混合比例的 M-A-P 模型上,RetNet、HGRN、GLA、DeltaNet 和 Gated DeltaNet(GDN)五种骨干呈现出一致的规律:在每个 Full Attention 层之前的连续 Linear Attention 区间内,与 Sink 相关的 MAs 总是在 Full Attention 前一层达到局部最大值。作者将这种形态命名为「注意力前尖峰」(Pre-Attention Spikes,PAS)。



五种 Linear Attention 骨干中,MAs 均在 Full Attention 之前形成尖峰。红色虚线为 Full Attention 前一层,绿色虚线为 Full Attention 层。

这一规律随后在五个数据域得到验证,在 Full Attention 前一层恰好取得前置 Linear Attention 区间最大激活值的平均比例达到 99.4%—100%,远高于随机选层时 9.1% 的期望值。

真正反直觉之处在于,尖峰并非 Full Attention 输出的产物,而是在 Full Attention 开始计算之前便已形成。换言之,Full Attention 所在位置对应的结构性印记,已经提前显现在上游残差流中。

从孤立「尖峰」到持续「平台」

当研究者固定模型骨干,只改变 24 层模型中 Full Attention 的数量,对比纯 Linear Attention、24:1、12:1、6:1、3:1 和纯 Full Attention 六种配置时,另一种形态随之浮现。

Full Attention 稀疏时,例如 24:1,PAS 像彼此分离的孤峰。随着 Full Attention 变密,例如 6:1、3:1,两个尖峰之间的 MAs 不再充分衰减,而是穿过中间的 Linear Attention 层保持高位,逐渐托起「尖峰间平台」(Inter-Spike Plateaus,ISP)。



从孤立 PAS 到 ISP 的过渡 —— 随着 Full Attention 变密,尖峰逐渐被平台连接。

定量结果清晰展示了这一趋势。在 1.3B 模型上,当混合比例从 12:1 变为 3:1,RetNet 的尖峰间保留分数从 18.8% 升至 85.4%,HGRN 则从 7.2% 升至 92.5%。全部 20 组相邻密度比较,都呈现 Full Attention 越密、尖峰间保留分数越高的趋势。

混合比例因此不只是一项效率参数,它也在塑造 MAs 沿深度展开的「时间形态」:Full Attention 稀疏时,离群值短暂而局部;变密后,离群值开始在层间驻留,彼此分离的尖峰也由此连成平台。

开源模型验证:振幅会变,节拍不变

上述规律首先来自共享训练配方的受控模型。为检验其广泛性,作者进一步分析了 Kimi Linear、Qwen3.5、Nemotron-H 和 Zamba2 的 12 个公开模型权重,规模从 1.2B 到 397B。不同模型中,均可观察到与 Full Attention 排布相对齐的 MA 组织形态。

跨模型比较中,一个差异格外清楚:层间形态比绝对幅值更加稳定。不同规模的 Qwen3.5 中,尖峰高度并不随参数量单调变化,但 PAS 与 ISP 始终紧随 Full Attention 的排布。Nemotron-H 与 Zamba2 的结果,则将这一规律从 Linear Attention 延伸至状态空间模型(SSM)与 Transformer 的混合架构。不同输入也呈现类似特点:数据域会明显改变峰值高低,但尖峰出现的位置和平台覆盖的区间总体稳定。



公开混合模型中的 MAs 轨迹。

尖峰与平台,在训练早期便已写入

这些规律是训练完成后偶然形成的,还是在预训练早期便开始出现?为观察其演化过程,作者从头训练了 340M 和 1.3B 的 24 层 GDN 模型。

答案出现得很早:340M 模型训练 10 亿 token 后已能观察到 PAS;1.3B 模型在 50 亿 token 时出现较弱前兆,100 亿 token 时形成清晰尖峰,并持续与 Full Attention 的位置对齐。改变 Full Attention 的插入位置,PAS 也随之移动。ISP 同样在训练早期出现,并随着训练推进逐步稳定。



Full Attention 层与 GDN 层的输出门控干预实验

研究者还进行了两组门控干预实验:给 Full Attention 增加逐元素输出门控,以及移除 GDN 原有的输出门控。结果呈现出明显的不对称性:前者显著压低 PAS 和 ISP 的绝对幅值,却不消除其层间组织;后者仅带来温和放大。

这组结果表明,Full Attention 的排布是 MA 动力学的主要「组织者」,GDN 门控则更多调节离群值的传播幅度。门控可以压低尖峰,却没有改变尖峰出现的层间节奏。

「写入 — 汇聚 — 消除」:

一个贯穿 PAS 与 ISP 的生命周期

研究者在一个 1.3B、12:1 的 GDN 模型中,固定同一个 Sink token 与特征维度,追踪第 12 层 Full Attention 边界前后的残差流变化。系统性离群值分析显示,PAS 对应一个紧凑的三阶段过程:

  • 写入(write)——Full Attention 的前一层在该 token— 特征坐标上形成极端值,为整个事件提供起点。
  • 汇聚(sink)—— 进入 Full Attention 后,承载该离群值的 token 从后续 query 获得不成比例的注意力,成为 Attention Sink。
  • 消除(cancel)—— 同一坐标随后出现符号相反的大幅更新,显著抵消此前写入的离群值,PAS 随之快速回落。

作者将其概括为「写入 — 汇聚 — 消除」(write—sink—cancel)。在 PAS 中,三个阶段集中发生在 Full Attention 边界附近,于是激活曲线上留下一个短促而尖锐的峰。



PAS 对应一次局部的 write—sink—cancel 过程——三步在相邻两层内连续完成。

ISP 的持续形态,则与同一生命周期中的「延迟消除」相一致:极端值形成后,符号相反的抵消更新没有立即到来,而是被推迟到更深的层。离群值因此得以穿过多个 Linear Attention 层持续存在,形成连接相邻 PAS 的平台。



ISP 对应 write—sink—cancel 生命周期中的延迟消除状态 —— 消除被推迟,MAs 穿过多层 Linear Attention 持续存在。

由此,PAS 与 ISP 可以被纳入同一个由消除时机组织的解释框架:局部、快速的消除形成 PAS,更晚发生的消除则让大值激活延伸为 ISP。随着 Full Attention 变得密集,尖峰之间的低谷逐渐被平台填平;到纯 Full Attention 的极限,尖峰与平台的区分消失,最终恢复为传统 Transformer 中横跨大部分中间层的稳定 MA 形态。

稀疏 Full Attention 配置中的局部 PAS → 密集配置中由 ISP 连接的 PAS → 纯 Full Attention 模型中的稳定 MAs

三者由此构成一条连续的形态谱系,为理解 PAS 与 ISP 提供了机制解释。

为混合架构绘制一张内部计算地图

这项研究为理解混合线性注意力大模型的内部计算提供了一张新的地图:混合比例远非一张效率配方 —— 多少层使用 Linear Attention、隔多久插入一次 Full Attention,也在组织模型内部计算的「节奏」。

Full Attention 的位置对应 MAs 在哪里形成尖峰,其密度影响离群值能够在层间保持多久;Linear Attention 的具体状态更新机制,则进一步调节 ISP 从何时开始出现。少数 Full Attention 层并非只在轮到自身时才发挥作用,它们与前后多个层中的离群值写入、传播和消除联系在一起。

离散分布的 Full Attention 会沿模型深度留下有规律的跨层痕迹;PAS、ISP 与传统 Full Attention 模型中的持续 MAs,也由此汇入同一条形态演化路径。对这条路径的理解,不仅为 Full Attention 的插入位置、混合密度和门控方式等架构选择提供了新的观察维度,也可能为模型压缩与量化带来线索:针对极端激活集中出现的层和架构边界,或许可以采用更具位置感知能力的处理策略。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
原来他俩早就离了,如今一个在云南当院长,一个潇洒分走2500万

原来他俩早就离了,如今一个在云南当院长,一个潇洒分走2500万

离离言几许
2026-09-02 01:50:44
日本的反击来了:中国敢不买日本水产?马上关了在中国的事务所

日本的反击来了:中国敢不买日本水产?马上关了在中国的事务所

墨兰史书
2026-09-01 16:35:07
原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

扶苏聊历史
2026-09-02 17:28:54
美军暴击伊朗,6个半小时压着打,已造成大量伤亡,伊朗激射10枚重型导弹反击!

美军暴击伊朗,6个半小时压着打,已造成大量伤亡,伊朗激射10枚重型导弹反击!

扶苏聊历史
2026-09-02 16:59:45
秘鲁宣布与伊朗断绝外交关系

秘鲁宣布与伊朗断绝外交关系

澎湃新闻
2026-09-02 08:16:08
癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

路医生健康科普
2026-09-02 17:00:07
羽坛名将李宗伟:36岁患癌喉咙全烂,花近1000万续命,如今怎样了

羽坛名将李宗伟:36岁患癌喉咙全烂,花近1000万续命,如今怎样了

史行途
2026-09-02 09:35:51
华为不可能错的

华为不可能错的

正言智驾
2026-09-01 15:16:17
曾经身价上亿如今负债3600万,38岁浙江老板开700万劳斯莱斯,选择跑路换环境重新出发

曾经身价上亿如今负债3600万,38岁浙江老板开700万劳斯莱斯,选择跑路换环境重新出发

捣蛋窝
2026-09-02 11:46:14
18点开打!U23国足亚运首战,输球基本难出线

18点开打!U23国足亚运首战,输球基本难出线

SilverLife银生活家
2026-09-02 17:16:11
钱再多又如何?52岁刘强东手握千亿身家,儿子成了一生的遗憾

钱再多又如何?52岁刘强东手握千亿身家,儿子成了一生的遗憾

莫地方
2026-08-23 19:19:07
特鲁姆普称吴宜泽和罗伯逊不配竞争世界第一!墨菲吐槽中国赛安排不合理

特鲁姆普称吴宜泽和罗伯逊不配竞争世界第一!墨菲吐槽中国赛安排不合理

世界体坛观察家
2026-09-02 14:22:30
太难选择了!成都27岁女生相亲陷入两难:要生理性喜欢,还是要2000万家底

太难选择了!成都27岁女生相亲陷入两难:要生理性喜欢,还是要2000万家底

火山詩话
2026-09-01 07:05:33
中纪委再次重拳出击!这4个领域将被严查,这4种行为将被严肃处理

中纪委再次重拳出击!这4个领域将被严查,这4种行为将被严肃处理

细说职场
2026-09-02 19:22:46
泥石流冲不垮的……(记者手记)

泥石流冲不垮的……(记者手记)

人民网
2026-09-02 09:10:51
鲁迅的文章,当年是怎么过审的?

鲁迅的文章,当年是怎么过审的?

刘晓原
2026-08-31 21:46:15
第五代三菱帕杰罗全球首发,经典硬派越野正式回归

第五代三菱帕杰罗全球首发,经典硬派越野正式回归

陋观
2026-09-02 19:25:06
景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

景甜背后纹身图片被疯传,张继科直播一番话,被指保护了景甜!

背包旅行
2026-08-31 10:01:31
“他们会把我绞死”——普京为何不愿结束战争

“他们会把我绞死”——普京为何不愿结束战争

走进乌克兰2022
2026-09-01 08:39:24
2026教师节新规正式落地!教育部明确发文,全国所有学校统一执行

2026教师节新规正式落地!教育部明确发文,全国所有学校统一执行

世界有奇事
2026-08-30 08:34:02
2026-09-02 20:35:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

健康
家居
教育
数码
军事航空

越吃越爆痘?医生讲清7大真相

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

新生入学当天,成都这所学校办了一场“导师双选会”

数码要闻

179元!米家石墨烯暖风机C众筹开售 支持80°广角送风

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版