网易首页 > 网易号 > 正文 申请入驻

像素级对标?智谱、Kimi 底层参数「撞衫」背后,藏着线性注意力的黄金窗口

0
分享至


国产大模型内卷到算子底层。

作者丨高允毅

编辑丨岑 峰

昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。

这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。

它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流形约束超连接(mHC)技术,可以大幅降本提效。

今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.3-Flash 的模型配置文件后,贴出一张 Kimi K3 和 GLM-5.3-Flash 的底层代码对比图。

他发现两者不仅都采用了KDA 线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lower_bound) 同样是 - 5


从 Kimi K3 公开技术报告到智谱上新,还不到一个月。有人感叹:哪怕是参考了 Kimi 的公开参数,短短 20 天内就能推出这么强的模型,也太惊人了。


这背后其实是一种技术必然。在大模型长文本的深水区,KDA,尤其是它的核心参数,一直是实现“长记忆”和“训练稳定性”的关键。线性注意力发展到今天,数值稳定的最优区间本就极度狭窄。即便是顶尖团队各自独立试错,最终也往往会收敛到同一个数值。

-5数值背后,既是Kimi K3在开源领域的巨大辐射力,也揭开了中国最顶尖的大模型团队,正不约而同迈进了同一个底层算子优化的技术深水区。


01


KDA的核心参数,为什么都选择-5?

为什么两家顶尖大模型团队,会不约而同地把 KDA 的核心参数设为 -5?要解答这个问题,得先搞懂大模型在长文本赛道经历了什么。

过去,传统 Transformer 架构用的是 Softmax 注意力机制,它保留了大模型的完整记忆。大模型会把每一个 Token 都存进 KV 缓存,随着对话拉长,计算量会呈平方级( )暴涨,KV 缓存的显存占用也随上下文长度线性攀升,当上下文拉到百万级别,光 KV 缓存就能吃掉几十 GB 显存,推理成本高到无法商业化。

为了把成本打下来,行业开始转向“线性注意力”路线。月之暗面的KDA正是其中代表。

它不再保存全量 KV 缓存,而是用一块固定大小的状态矩阵压缩历史信息,模型一边写入新内容,一边用一个名为“遗忘门”的组件来控制旧信息的衰减。这样无论后续涌入多少文本,占用的显存基本保持恒定。这也是近期百万级长文本 API 能卖出“白菜价”的底层逻辑。

但这套 “压缩记忆”的模式 也有自己的天然缺陷,那就是数值溢出

线性注意力靠循环乘法来更新状态,当它每处理一个新 Token,旧状态就要乘一次遗忘门系数。当上下文越来越长,乘法次数多了,数值要么不断变小直到彻底归零,要么反向暴涨成无穷大。这个过程,只要算出一个错误结果(NaN),训练直接崩溃,千万级算力直接打水漂。这就是线性注意力过去没有被广泛使用的原因。

这个瓶颈卡了很多年,直到一个名叫杨松霖的哈佛博士生,发表门控线性注意力(GLA)论文,系统提出门控状态衰减方案,这一问题才有了系统性的学术解决思路。他首次系统提出必须给状态衰减设一个“下限”,不允许它无限趋近于 0。

但从学术成果到大规模工业落地,仍有不少问题。

当月之暗面(Kimi)团队基于 GLA 演进出自研的 KDA 架构,试图将上下文推向 100 万字时,直接撞上了底层芯片的物理极限。

在大规模预训练中,万卡集群普遍使用的是 fp16 或 bf16 半精度浮点数,其数值动态范围极其狭窄。而线性注意力需要对超长序列进行数万次循环累乘,在这种递推计算中,任何微小的数值发散,都会在半精度芯片的反复乘法中被迅速放大。最终触发 NaN(非数)崩溃,导致高昂的训练算力成本折损。

为了规避这种因数值不稳定带来的算力风险,Kimi 的底层架构团队直接下潜到硬件算子层,在自研的 FlashKDA CUDA 内核里,设定 gate_lower_bound = -5。

-5 经过激活函数转换后,大约对应 0.67% 的留存率。这意味着,哪怕模型决定遗忘某段信息,也会被强制保留 0.67% 的旧信息。

至于为何是 - 5 这个数值,这是靠海量工程试错找出的黄金平衡点

如果设得太高,比如设在 - 3,对应的留存比例约为 5%,旧信息在矩阵中过度堆积,会导致网络过载、梯度爆炸或上下文混杂幻觉。


如果数值太低,比如设在 - 8,对应留存比例仅约 0.03%,模型会出现严重的 “健忘症”,长文本读到后面就忘记前面的关键信息,在长代码调试、长财报分析等需要精准召回的任务直接失效。

-5 恰好卡在中间。在预训练中,它为算子底层的稳定性“保驾护航”;在推理端,它则是性价比之王,让线性注意力机制得以在极低的显存开销下稳住长文本召回率,使百万级长文本的商业化落地真正成为可能。

02


同样是 -5,

Kimi和智谱又走出不同的路

但同样选择 - 5 的遗忘门下界,对于Kimi 和智谱又是不同的意味。

对于Kimi K3而言,它采用的是混合注意力架构,用线性注意力承接长上下文的记忆压缩,把显存和推理成本打下来;同时,它也用传统 Softmax 注意力,处理复杂逻辑推理,保证核心能力不打折。

在这套架构里,gate_lower_bound=-5从预训练启动的第一天就已嵌入,是原生设计的一部分。这个数值是 Kimi 团队在自身万卡级预训练中,通过大量试错踩出来的稳定解。 这些都在Kimi K3公开技术报告里体现了出来,底层算子怎么实现、配置怎么设、工程上踩过哪些坑,全部公开。

而智谱 GLM-5.3 Flash 的配置文件中,虽然出现了完全一致的 gate_lower_bound=-5,但陈广宇猜测这很有可能是“中途注入”

这种操作在工程逻辑上完全成立,甚至是很高明的策略。在预训练中后期追加门控约束,再用调低后的学习率续训一段时间,不需要推倒重来重置权重,就能让一个原本就在相近区间摸索的模型,快速对齐行业验证过的最佳实践。这种打法省下的是动辄数亿的底层试错算力,体现的是智谱极强的工程落地效率。


当然这并不意味着仅靠改一个数字就能迭代出新模型,智谱本身在线性注意力方向已有数月研发积累,更合理的逻辑是,团队原本就在相近区间内做实验,看到 Kimi 报告明确验证了 - 5 在大参数量级下的稳定性后,直接采用了这一经过工业验证的最佳实践,省去了大量重复试错的成本。

那么,中途加入这样一个底层约束,到底会不会影响模型的实际表现?

评论区有一位开发者Oliver Sieberling认为,这属于 “非侵入式改动”。遗忘门本身是模型自适应学习的结果,加一个下限只是卡住了极端取值,并不会改变遗忘门本身的学习目标,对模型主体的扰动极小,更像加了一道安全护栏,性价比很高。


但这一取舍也有一定的风险,比如隐性分布偏移的危害。 模型经过几千万步预训练,已经形成了 “遗忘门可以调到极低” 的内在行为模式,中途突然锁死下限,相当于半路修改了底层运行规则。表面上看训练损失、公开基准跑分都正常,但模型内部的记忆分布其实已经悄悄发生了偏移。

这种偏移很难通过常规测试发现,但在 50 万字以上的超长代码、超长文档这类极端长尾场景中,可能会因为残留信息持续累积出现 “慢性中毒”,产生一些逻辑错误。

事实上,在长文本底层优化这条赛道上,并非只有这一条路线。国内另一家顶尖玩家DeepSeek,就走出了完全独立的技术路径。

他们没有采用 Delta Rule 谱系下的 - 5 门控方案,而是沿着自研的 MLA(混合潜在注意力)与 NSA(原生稀疏注意力)持续演进,通过低秩压缩和硬件级算子优化,在另一套数学框架里实现了长序列的数值稳定。

为什么中国最顶尖的大模型团队,都集体下潜到算子层,死磕长文本的底层计算瓶颈?答案藏在大推理模型时代的算力账本里。

自 o1 与 DeepSeek-R1 开启强化学习大推理时代以来,模型在后台进行深度推导时需要自主生成几十万字的“思维链(CoT)”Token。如果还固守传统 Transformer 平方级增长的算力成本,超长思维链带来的显存黑洞,会直接吞掉任何一家公司的商业毛利。

谁能用线性的成本守住长文本的体验底线,谁就能在推理时代拿到最高的利润空间。而当行业都在相近的模型规模、相近的训练框架下做超参搜索时,基于 Delta Rule 的线性注意力,其数学收敛的物理极限区间,天然就指向 这个窄小的黄金带。

从这个角度看,参数 “撞衫” 从来不是抄袭的佐证,而是行业集体挺进技术深水区时,必然会出现的技术趋同。

03


参数战之后,

是品味、效率与创新的真正较量

回到最初的问题:智谱有没有“参考”Kimi的参数?

在“exe文件比txt文件重要”的工业界,这个问题其实已经不重要。大语言模型的技术日新月异,如果一直固守传统Transformer架构,在强调只讲究数学规律和商业ROI的产业界完全行不通。-5这个参数,不是属于谁的专利,而是在攀登技术高峰中,目前唯一一条被探明、不会摔得粉身碎骨的安全道路

当大模型公司的竞争下沉到算子优化、数值边界、训练工程细节这些看不见的底层功夫。参数战之外,还有品味战、效率战、创新之战。这本身就是行业成熟的信号。

任何经受住万卡集群实战检验的“最佳实践”,都会在最短的时间内沦为行业的通用基建。这也解释了为什么国产大模型在长文本处理与超低成本推理上,能在极短时间内逼近甚至斩落国际顶尖闭源模型的身位。

因为在极致的算力压迫下,中国最顶尖的顶尖大脑,正在以一种惊人的敏捷度,最终都会不约而同地攀上统一做山峰的极顶,向物理极限不断发起挑战。

参考链接:https://x.com/nathancgy4/status/2092626984362725877

https://x.com/Zai_org/status/2092616204787626030

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
突发!陈冠希的新瓜,有点料!

突发!陈冠希的新瓜,有点料!

财经要参
2026-09-23 07:56:49
随着中国香港0-4,日本3-0,亚运男足四分之一决赛对阵出炉:中国PK泰国

随着中国香港0-4,日本3-0,亚运男足四分之一决赛对阵出炉:中国PK泰国

侧身凌空斩
2026-09-23 20:22:30
河南郑州一70后大叔近10年没摸电脑,接触AI不到一年后,30分钟手搓工作台,做一条视频只需十几分钟,白天当货车司机,晚上做程序员

河南郑州一70后大叔近10年没摸电脑,接触AI不到一年后,30分钟手搓工作台,做一条视频只需十几分钟,白天当货车司机,晚上做程序员

台州交通广播
2026-09-22 09:51:43
王慧文发文声援西贝:想组局买下来!评论区立马有人给老王出主意

王慧文发文声援西贝:想组局买下来!评论区立马有人给老王出主意

大厂青年
2026-09-23 17:07:42
杨幂在米兰成“洋幂”了?还自曝是一时兴起的DIY

杨幂在米兰成“洋幂”了?还自曝是一时兴起的DIY

木子爱娱乐大号
2026-09-23 15:30:25
1-4遭逆转!伊朗球员崩溃瘫坐 从头名到出局 曾嘲讽国足非争冠对手

1-4遭逆转!伊朗球员崩溃瘫坐 从头名到出局 曾嘲讽国足非争冠对手

我爱英超
2026-09-23 16:14:32
2-0领先被逼入绝境!王楚钦抢五4-7逆转太关键 世界第一再现大心脏

2-0领先被逼入绝境!王楚钦抢五4-7逆转太关键 世界第一再现大心脏

颜小白的篮球梦
2026-09-23 19:37:48
北理工女老师开“女权课”冲上热搜:公开叫嚣让男性低人一等,特殊性选修课,扬言修学分自觉退出

北理工女老师开“女权课”冲上热搜:公开叫嚣让男性低人一等,特殊性选修课,扬言修学分自觉退出

李晚书
2026-09-23 14:33:49
全球惊愕!哈佛专家研究已证实:中国不是在崛起,而是在逐步回归

全球惊愕!哈佛专家研究已证实:中国不是在崛起,而是在逐步回归

史之韵
2026-09-23 10:30:24
白宫公布接待规格:特朗普到机场迎接,阅兵仪式叠加五架飞机飞越

白宫公布接待规格:特朗普到机场迎接,阅兵仪式叠加五架飞机飞越

光电科技君
2026-09-22 11:47:50
陈皮加一物,化掉一身痰和湿,痰湿没了,湿气少了,肺气足了

陈皮加一物,化掉一身痰和湿,痰湿没了,湿气少了,肺气足了

白米饭怎么吃
2026-07-01 10:42:55
王玉雯杨玏被曝结婚又离不到24小时,荒唐一幕出现,暴露圈子不堪一幕

王玉雯杨玏被曝结婚又离不到24小时,荒唐一幕出现,暴露圈子不堪一幕

一个小豹子
2026-09-23 15:44:07
一批市场流通领域扫黑除恶专项典型案例曝光!

一批市场流通领域扫黑除恶专项典型案例曝光!

中国消费者报
2026-09-23 19:38:56
太讽刺了!自己支持率跌到32%,却平均每天点名拜登3次,特朗普的"甩锅账本"被扒光

太讽刺了!自己支持率跌到32%,却平均每天点名拜登3次,特朗普的"甩锅账本"被扒光

可达鸭面面观
2026-09-22 20:05:12
中国还能再出一个毛主席吗?实际上,基辛格早就已经给出了答案

中国还能再出一个毛主席吗?实际上,基辛格早就已经给出了答案

黑翼天使
2026-09-23 03:23:09
理记:拿“国家大事”当遮羞布的,不是蠢就是坏

理记:拿“国家大事”当遮羞布的,不是蠢就是坏

迷世书童
2026-09-23 15:48:17
央视曝光后,南京立即成立工作组,控制相关人员

央视曝光后,南京立即成立工作组,控制相关人员

新京报政事儿
2026-09-23 12:34:02
随着伊朗1-4、中国0-0,亚运男足八强已全部诞生:6大劲旅在列

随着伊朗1-4、中国0-0,亚运男足八强已全部诞生:6大劲旅在列

侧身凌空斩
2026-09-23 15:26:24
亚运奖牌榜:中国单日狂揽16金碾压日韩 累计48金20银10铜领跑

亚运奖牌榜:中国单日狂揽16金碾压日韩 累计48金20银10铜领跑

醉卧浮生
2026-09-23 20:33:26
沙特的救兵来了,比土耳其还猛,中方已仁至义尽,红海浑水不能蹚

沙特的救兵来了,比土耳其还猛,中方已仁至义尽,红海浑水不能蹚

墨兰史书
2026-09-23 19:50:04
2026-09-23 21:28:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

艺术
家居
数码
房产
健康

艺术要闻

深圳4座新全球总部:大疆尖塔、京东画境、OPPO曲面、科达利窗口

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

国补3299元起 Xiaomi Pad 9 Pro发布:12.5英寸高分高刷护眼屏

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

痘痘没成熟,千万别硬挤!

无障碍浏览 进入关怀版