网易首页 > 网易号 > 正文 申请入驻

少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

0
分享至



Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。

兼顾线性注意力(Linear Attention)的效率与全注意力(Full Attention)的建模能力,混合线性注意力大模型(HLA LLM)已成为 Qwen3.5、Kimi Linear、Nemotron-H、Zamba 等模型采用的一条重要架构路线。然而,当两类序列混合机制被交错放进同一个深层网络,它们会如何相互影响?少数 Full Attention 层又会怎样改变前后 Linear Attention 层的激活动态?

本研究由以 StartLux 为核心的联合团队完成。StartLux 是专注全本地智能解决方案的科技企业,致力于打造可部署于个人终端的高性能人工智能系统。StartLux 携手清华大学、中国科学院大学、香港大学、悉尼大学和哥伦比亚大学的研究者,选择以 Massive Activations(MAs,大值激活)为「探针」,对这一问题展开系统研究。研究覆盖五种 Linear Attention 架构、六种混合配置、五个数据域,以及 12 个公开 HLA LLM 检查点,模型总参数量从 1.2B 横跨至 397B。



  • 论文标题:Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
  • 论文链接:https://arxiv.org/abs/2608.12149
  • Hugging Face:https://huggingface.co/papers/2608.12149
  • 代码链接:https://github.com/StartLuxLabs/Massive-Activations-HLA

Full Attention 前一层的「尖峰」

研究者首先汇总所有 Full Attention 层和注意力头接收到的注意力,选取被最多注意力头关注的 token 作为「全局 Attention Sink」,再固定该 token 沿深度追踪其 MAs 。

在 1.3B、12:1 混合比例的 M-A-P 模型上,RetNet、HGRN、GLA、DeltaNet 和 Gated DeltaNet(GDN)五种骨干呈现出一致的规律:在每个 Full Attention 层之前的连续 Linear Attention 区间内,与 Sink 相关的 MAs 总是在 Full Attention 前一层达到局部最大值。作者将这种形态命名为「注意力前尖峰」(Pre-Attention Spikes,PAS)。



五种 Linear Attention 骨干中,MAs 均在 Full Attention 之前形成尖峰。红色虚线为 Full Attention 前一层,绿色虚线为 Full Attention 层。

这一规律随后在五个数据域得到验证,在 Full Attention 前一层恰好取得前置 Linear Attention 区间最大激活值的平均比例达到 99.4%—100%,远高于随机选层时 9.1% 的期望值。

真正反直觉之处在于,尖峰并非 Full Attention 输出的产物,而是在 Full Attention 开始计算之前便已形成。换言之,Full Attention 所在位置对应的结构性印记,已经提前显现在上游残差流中。

从孤立「尖峰」到持续「平台」

当研究者固定模型骨干,只改变 24 层模型中 Full Attention 的数量,对比纯 Linear Attention、24:1、12:1、6:1、3:1 和纯 Full Attention 六种配置时,另一种形态随之浮现。

Full Attention 稀疏时,例如 24:1,PAS 像彼此分离的孤峰。随着 Full Attention 变密,例如 6:1、3:1,两个尖峰之间的 MAs 不再充分衰减,而是穿过中间的 Linear Attention 层保持高位,逐渐托起「尖峰间平台」(Inter-Spike Plateaus,ISP)。



从孤立 PAS 到 ISP 的过渡 —— 随着 Full Attention 变密,尖峰逐渐被平台连接。

定量结果清晰展示了这一趋势。在 1.3B 模型上,当混合比例从 12:1 变为 3:1,RetNet 的尖峰间保留分数从 18.8% 升至 85.4%,HGRN 则从 7.2% 升至 92.5%。全部 20 组相邻密度比较,都呈现 Full Attention 越密、尖峰间保留分数越高的趋势。

混合比例因此不只是一项效率参数,它也在塑造 MAs 沿深度展开的「时间形态」:Full Attention 稀疏时,离群值短暂而局部;变密后,离群值开始在层间驻留,彼此分离的尖峰也由此连成平台。

开源模型验证:振幅会变,节拍不变

上述规律首先来自共享训练配方的受控模型。为检验其广泛性,作者进一步分析了 Kimi Linear、Qwen3.5、Nemotron-H 和 Zamba2 的 12 个公开模型权重,规模从 1.2B 到 397B。不同模型中,均可观察到与 Full Attention 排布相对齐的 MA 组织形态。

跨模型比较中,一个差异格外清楚:层间形态比绝对幅值更加稳定。不同规模的 Qwen3.5 中,尖峰高度并不随参数量单调变化,但 PAS 与 ISP 始终紧随 Full Attention 的排布。Nemotron-H 与 Zamba2 的结果,则将这一规律从 Linear Attention 延伸至状态空间模型(SSM)与 Transformer 的混合架构。不同输入也呈现类似特点:数据域会明显改变峰值高低,但尖峰出现的位置和平台覆盖的区间总体稳定。



公开混合模型中的 MAs 轨迹。

尖峰与平台,在训练早期便已写入

这些规律是训练完成后偶然形成的,还是在预训练早期便开始出现?为观察其演化过程,作者从头训练了 340M 和 1.3B 的 24 层 GDN 模型。

答案出现得很早:340M 模型训练 10 亿 token 后已能观察到 PAS;1.3B 模型在 50 亿 token 时出现较弱前兆,100 亿 token 时形成清晰尖峰,并持续与 Full Attention 的位置对齐。改变 Full Attention 的插入位置,PAS 也随之移动。ISP 同样在训练早期出现,并随着训练推进逐步稳定。



Full Attention 层与 GDN 层的输出门控干预实验

研究者还进行了两组门控干预实验:给 Full Attention 增加逐元素输出门控,以及移除 GDN 原有的输出门控。结果呈现出明显的不对称性:前者显著压低 PAS 和 ISP 的绝对幅值,却不消除其层间组织;后者仅带来温和放大。

这组结果表明,Full Attention 的排布是 MA 动力学的主要「组织者」,GDN 门控则更多调节离群值的传播幅度。门控可以压低尖峰,却没有改变尖峰出现的层间节奏。

「写入 — 汇聚 — 消除」:

一个贯穿 PAS 与 ISP 的生命周期

研究者在一个 1.3B、12:1 的 GDN 模型中,固定同一个 Sink token 与特征维度,追踪第 12 层 Full Attention 边界前后的残差流变化。系统性离群值分析显示,PAS 对应一个紧凑的三阶段过程:

  • 写入(write)——Full Attention 的前一层在该 token— 特征坐标上形成极端值,为整个事件提供起点。
  • 汇聚(sink)—— 进入 Full Attention 后,承载该离群值的 token 从后续 query 获得不成比例的注意力,成为 Attention Sink。
  • 消除(cancel)—— 同一坐标随后出现符号相反的大幅更新,显著抵消此前写入的离群值,PAS 随之快速回落。

作者将其概括为「写入 — 汇聚 — 消除」(write—sink—cancel)。在 PAS 中,三个阶段集中发生在 Full Attention 边界附近,于是激活曲线上留下一个短促而尖锐的峰。



PAS 对应一次局部的 write—sink—cancel 过程——三步在相邻两层内连续完成。

ISP 的持续形态,则与同一生命周期中的「延迟消除」相一致:极端值形成后,符号相反的抵消更新没有立即到来,而是被推迟到更深的层。离群值因此得以穿过多个 Linear Attention 层持续存在,形成连接相邻 PAS 的平台。



ISP 对应 write—sink—cancel 生命周期中的延迟消除状态 —— 消除被推迟,MAs 穿过多层 Linear Attention 持续存在。

由此,PAS 与 ISP 可以被纳入同一个由消除时机组织的解释框架:局部、快速的消除形成 PAS,更晚发生的消除则让大值激活延伸为 ISP。随着 Full Attention 变得密集,尖峰之间的低谷逐渐被平台填平;到纯 Full Attention 的极限,尖峰与平台的区分消失,最终恢复为传统 Transformer 中横跨大部分中间层的稳定 MA 形态。

稀疏 Full Attention 配置中的局部 PAS → 密集配置中由 ISP 连接的 PAS → 纯 Full Attention 模型中的稳定 MAs

三者由此构成一条连续的形态谱系,为理解 PAS 与 ISP 提供了机制解释。

为混合架构绘制一张内部计算地图

这项研究为理解混合线性注意力大模型的内部计算提供了一张新的地图:混合比例远非一张效率配方 —— 多少层使用 Linear Attention、隔多久插入一次 Full Attention,也在组织模型内部计算的「节奏」。

Full Attention 的位置对应 MAs 在哪里形成尖峰,其密度影响离群值能够在层间保持多久;Linear Attention 的具体状态更新机制,则进一步调节 ISP 从何时开始出现。少数 Full Attention 层并非只在轮到自身时才发挥作用,它们与前后多个层中的离群值写入、传播和消除联系在一起。

离散分布的 Full Attention 会沿模型深度留下有规律的跨层痕迹;PAS、ISP 与传统 Full Attention 模型中的持续 MAs,也由此汇入同一条形态演化路径。对这条路径的理解,不仅为 Full Attention 的插入位置、混合密度和门控方式等架构选择提供了新的观察维度,也可能为模型压缩与量化带来线索:针对极端激活集中出现的层和架构边界,或许可以采用更具位置感知能力的处理策略。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
​热苏斯:为加盟巴萨大幅降薪,每赛季少赚300万欧元

​热苏斯:为加盟巴萨大幅降薪,每赛季少赚300万欧元

足球推文C
2026-09-02 17:36:55
吉格斯:11年巴萨在我心中最强,如果无梅西我们当年有能力赢

吉格斯:11年巴萨在我心中最强,如果无梅西我们当年有能力赢

懂球帝
2026-09-02 17:04:32
新款 iPad mini 史诗级更新!即将发布

新款 iPad mini 史诗级更新!即将发布

花果科技
2026-08-31 22:21:22
美国副总统万斯演讲严重口误:“我们马上要庆祝9·11事件25周年了”,随后立即改口

美国副总统万斯演讲严重口误:“我们马上要庆祝9·11事件25周年了”,随后立即改口

极目新闻
2026-09-01 18:00:06
硬仗拉满!严子怡总决赛遇死亡阵容,夺冠真的不稳了

硬仗拉满!严子怡总决赛遇死亡阵容,夺冠真的不稳了

涵有话说
2026-09-02 10:01:34
世界上66%国家都选左舵,中国为何放弃右舵,竟和美国援助有关?

世界上66%国家都选左舵,中国为何放弃右舵,竟和美国援助有关?

铭记历史呀
2026-09-01 02:02:30
官司还没宣判,舆论先炸锅,景甜这件事被胡锡进一语道破

官司还没宣判,舆论先炸锅,景甜这件事被胡锡进一语道破

小徐讲八卦
2026-09-02 15:06:59
快讯!知名演员刘晓庆传来新消息!

快讯!知名演员刘晓庆传来新消息!

故事终将光明磊落
2026-09-02 16:39:21
尼克斯名宿:杰伦·布伦森整体表现已超越了NBA传奇德里克·罗斯

尼克斯名宿:杰伦·布伦森整体表现已超越了NBA传奇德里克·罗斯

好火子
2026-09-01 22:08:52
刘亦菲妈妈近照曝光!67岁仍优雅,戴百万手镯,无惧和陈金飞绯闻

刘亦菲妈妈近照曝光!67岁仍优雅,戴百万手镯,无惧和陈金飞绯闻

叶公子
2026-09-01 13:02:38
中国正式进入“超级内卷”时代!只有一种人能赚钱(深度)

中国正式进入“超级内卷”时代!只有一种人能赚钱(深度)

新浪财经
2026-06-23 08:51:12
6名“正部级”干部任免发布

6名“正部级”干部任免发布

涵豆说娱
2026-09-01 11:05:49
没料到!勒庞决选通杀,亲华派跌剩2%支持率,法国恐怕要大变天

没料到!勒庞决选通杀,亲华派跌剩2%支持率,法国恐怕要大变天

共工之锚
2026-09-02 00:23:56
郑丽文回应“请辞党主席”,什么情况?

郑丽文回应“请辞党主席”,什么情况?

新民周刊
2026-09-01 09:11:33
《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

3DM游戏
2026-08-29 11:32:21
斯诺克最新战报!姚朋成1-4被逆转,龙泽煌夺赛点,雷佩凡范争一暂平!

斯诺克最新战报!姚朋成1-4被逆转,龙泽煌夺赛点,雷佩凡范争一暂平!

刘姚尧的文字城堡
2026-09-02 18:40:39
许家印刚判完,国家就动手了!现房是好事,但代价可能比你想的要大

许家印刚判完,国家就动手了!现房是好事,但代价可能比你想的要大

小莜读史
2026-09-02 20:32:03
濮存昕没想到,自己竟因李维康葬礼上一个特殊举动,实现口碑翻盘

濮存昕没想到,自己竟因李维康葬礼上一个特殊举动,实现口碑翻盘

娱圈办事处
2026-09-02 18:59:56
星宇不怕网友抵制,他们的客户还有:奇瑞大众理想丰田赛利斯蔚来小鹏等

星宇不怕网友抵制,他们的客户还有:奇瑞大众理想丰田赛利斯蔚来小鹏等

曹莽看世界
2026-09-02 18:03:43
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
2026-09-02 21:28:50
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

房产
亲子
数码
公开课
军事航空

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

亲子要闻

宝蓝和弟弟妹妹手上涂满颜料,用手掌画画,有趣又漂亮~

数码要闻

宏碁推出SFF RTX Spark迷你主机,最高128GB内存

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版