网易首页 > 网易号 > 正文 申请入驻

像素级对标?智谱、Kimi 底层参数「撞衫」背后,藏着线性注意力的黄金窗口

0
分享至


国产大模型内卷到算子底层。

作者丨高允毅

编辑丨岑 峰

昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。

这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。

它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流形约束超连接(mHC)技术,可以大幅降本提效。

今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.3-Flash 的模型配置文件后,贴出一张 Kimi K3 和 GLM-5.3-Flash 的底层代码对比图。

他发现两者不仅都采用了KDA 线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lower_bound) 同样是 - 5


从 Kimi K3 公开技术报告到智谱上新,还不到一个月。有人感叹:哪怕是参考了 Kimi 的公开参数,短短 20 天内就能推出这么强的模型,也太惊人了。


这背后其实是一种技术必然。在大模型长文本的深水区,KDA,尤其是它的核心参数,一直是实现“长记忆”和“训练稳定性”的关键。线性注意力发展到今天,数值稳定的最优区间本就极度狭窄。即便是顶尖团队各自独立试错,最终也往往会收敛到同一个数值。

-5数值背后,既是Kimi K3在开源领域的巨大辐射力,也揭开了中国最顶尖的大模型团队,正不约而同迈进了同一个底层算子优化的技术深水区。



01


KDA的核心参数,为什么都选择-5?

为什么两家顶尖大模型团队,会不约而同地把 KDA 的核心参数设为 -5?要解答这个问题,得先搞懂大模型在长文本赛道经历了什么。

过去,传统 Transformer 架构用的是 Softmax 注意力机制,它保留了大模型的完整记忆。大模型会把每一个 Token 都存进 KV 缓存,随着对话拉长,计算量会呈平方级()暴涨,KV 缓存的显存占用也随上下文长度线性攀升,当上下文拉到百万级别,光 KV 缓存就能吃掉几十 GB 显存,推理成本高到无法商业化。

为了把成本打下来,行业开始转向“线性注意力”路线。月之暗面的KDA正是其中代表。

它不再保存全量 KV 缓存,而是用一块固定大小的状态矩阵压缩历史信息,模型一边写入新内容,一边用一个名为“遗忘门”的组件来控制旧信息的衰减。这样无论后续涌入多少文本,占用的显存基本保持恒定。这也是近期百万级长文本 API 能卖出“白菜价”的底层逻辑。

但这套 “压缩记忆”的模式 也有自己的天然缺陷,那就是数值溢出

线性注意力靠循环乘法来更新状态,当它每处理一个新 Token,旧状态就要乘一次遗忘门系数。当上下文越来越长,乘法次数多了,数值要么不断变小直到彻底归零,要么反向暴涨成无穷大。这个过程,只要算出一个错误结果(NaN),训练直接崩溃,千万级算力直接打水漂。这就是线性注意力过去没有被广泛使用的原因。

这个瓶颈卡了很多年,直到一个名叫杨松霖的哈佛博士生,发表门控线性注意力(GLA)论文,系统提出门控状态衰减方案,这一问题才有了系统性的学术解决思路。他首次系统提出必须给状态衰减设一个“下限”,不允许它无限趋近于 0。

但从学术成果到大规模工业落地,仍有不少问题。

当月之暗面(Kimi)团队基于 GLA 演进出自研的 KDA 架构,试图将上下文推向 100 万字时,直接撞上了底层芯片的物理极限。

在大规模预训练中,万卡集群普遍使用的是 fp16 或 bf16 半精度浮点数,其数值动态范围极其狭窄。而线性注意力需要对超长序列进行数万次循环累乘,在这种递推计算中,任何微小的数值发散,都会在半精度芯片的反复乘法中被迅速放大。最终触发 NaN(非数)崩溃,导致高昂的训练算力成本折损。

为了规避这种因数值不稳定带来的算力风险,Kimi 的底层架构团队直接下潜到硬件算子层,在自研的 FlashKDA CUDA 内核里,设定 gate_lower_bound = -5。

-5 经过激活函数转换后,大约对应 0.67% 的留存率。这意味着,哪怕模型决定遗忘某段信息,也会被强制保留 0.67% 的旧信息。

至于为何是 - 5 这个数值,这是靠海量工程试错找出的黄金平衡点

如果设得太高,比如设在 - 3,对应的留存比例约为 5%,旧信息在矩阵中过度堆积,会导致网络过载、梯度爆炸或上下文混杂幻觉。


如果数值太低,比如设在 - 8,对应留存比例仅约 0.03%,模型会出现严重的 “健忘症”,长文本读到后面就忘记前面的关键信息,在长代码调试、长财报分析等需要精准召回的任务直接失效。

-5 恰好卡在中间。在预训练中,它为算子底层的稳定性“保驾护航”;在推理端,它则是性价比之王,让线性注意力机制得以在极低的显存开销下稳住长文本召回率,使百万级长文本的商业化落地真正成为可能。


02


同样是 -5,Kimi和智谱又走出不同的路

但同样选择 - 5 的遗忘门下界,对于Kimi 和智谱又是不同的意味。

对于Kimi K3而言,它采用的是混合注意力架构,用线性注意力承接长上下文的记忆压缩,把显存和推理成本打下来;同时,它也用传统 Softmax 注意力,处理复杂逻辑推理,保证核心能力不打折。

在这套架构里,gate_lower_bound=-5从预训练启动的第一天就已嵌入,是原生设计的一部分。这个数值是 Kimi 团队在自身万卡级预训练中,通过大量试错踩出来的稳定解。 这些都在Kimi K3公开技术报告里体现了出来,底层算子怎么实现、配置怎么设、工程上踩过哪些坑,全部公开。

而智谱 GLM-5.3 Flash 的配置文件中,虽然出现了完全一致的 gate_lower_bound=-5,但陈广宇猜测这很有可能是“中途注入”

这种操作在工程逻辑上完全成立,甚至是很高明的策略。在预训练中后期追加门控约束,再用调低后的学习率续训一段时间,不需要推倒重来重置权重,就能让一个原本就在相近区间摸索的模型,快速对齐行业验证过的最佳实践。这种打法省下的是动辄数亿的底层试错算力,体现的是智谱极强的工程落地效率。


当然这并不意味着仅靠改一个数字就能迭代出新模型,智谱本身在线性注意力方向已有数月研发积累,更合理的逻辑是,团队原本就在相近区间内做实验,看到 Kimi 报告明确验证了 - 5 在大参数量级下的稳定性后,直接采用了这一经过工业验证的最佳实践,省去了大量重复试错的成本。

那么,中途加入这样一个底层约束,到底会不会影响模型的实际表现?

评论区有一位开发者Oliver Sieberling认为,这属于 “非侵入式改动”。遗忘门本身是模型自适应学习的结果,加一个下限只是卡住了极端取值,并不会改变遗忘门本身的学习目标,对模型主体的扰动极小,更像加了一道安全护栏,性价比很高。


但这一取舍也有一定的风险,比如隐性分布偏移的危害。 模型经过几千万步预训练,已经形成了 “遗忘门可以调到极低” 的内在行为模式,中途突然锁死下限,相当于半路修改了底层运行规则。表面上看训练损失、公开基准跑分都正常,但模型内部的记忆分布其实已经悄悄发生了偏移。

这种偏移很难通过常规测试发现,但在 50 万字以上的超长代码、超长文档这类极端长尾场景中,可能会因为残留信息持续累积出现 “慢性中毒”,产生一些逻辑错误。

事实上,在长文本底层优化这条赛道上,并非只有这一条路线。国内另一家顶尖玩家DeepSeek,就走出了完全独立的技术路径。

他们没有采用 Delta Rule 谱系下的 - 5 门控方案,而是沿着自研的 MLA(混合潜在注意力)与 NSA(原生稀疏注意力)持续演进,通过低秩压缩和硬件级算子优化,在另一套数学框架里实现了长序列的数值稳定。

为什么中国最顶尖的大模型团队,都集体下潜到算子层,死磕长文本的底层计算瓶颈?答案藏在大推理模型时代的算力账本里。

自 o1 与 DeepSeek-R1 开启强化学习大推理时代以来,模型在后台进行深度推导时需要自主生成几十万字的“思维链(CoT)”Token。如果还固守传统 Transformer 平方级增长的算力成本,超长思维链带来的显存黑洞,会直接吞掉任何一家公司的商业毛利。

谁能用线性的成本守住长文本的体验底线,谁就能在推理时代拿到最高的利润空间。而当行业都在相近的模型规模、相近的训练框架下做超参搜索时,基于 Delta Rule 的线性注意力,其数学收敛的物理极限区间,天然就指向这个窄小的黄金带。

从这个角度看,参数 “撞衫” 从来不是抄袭的佐证,而是行业集体挺进技术深水区时,必然会出现的技术趋同。


03


参数战之后,是品味、效率与创新的真正较量

回到最初的问题:智谱有没有“参考”Kimi的参数?

在“exe文件比txt文件重要”的工业界,这个问题其实已经不重要。大语言模型的技术日新月异,如果一直固守传统Transformer架构,在强调只讲究数学规律和商业ROI的产业界完全行不通。-5这个参数,不是属于谁的专利,而是在攀登技术高峰中,目前唯一一条被探明、不会摔得粉身碎骨的安全道路

当大模型公司的竞争下沉到算子优化、数值边界、训练工程细节这些看不见的底层功夫。参数战之外,还有品味战、效率战、创新之战。这本身就是行业成熟的信号。

任何经受住万卡集群实战检验的“最佳实践”,都会在最短的时间内沦为行业的通用基建。这也解释了为什么国产大模型在长文本处理与超低成本推理上,能在极短时间内逼近甚至斩落国际顶尖闭源模型的身位。

因为在极致的算力压迫下,中国最顶尖的顶尖大脑,正在以一种惊人的敏捷度,最终都会不约而同地攀上统一做山峰的极顶,向物理极限不断发起挑战。

参考链接:https://x.com/nathancgy4/status/2092626984362725877

https://x.com/Zai_org/status/2092616204787626030

上车,雷峰网带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
太揪心了!离出口仅160米,2名工人被泥石流封在隧道9天,靠喝泥坑水活了下来

太揪心了!离出口仅160米,2名工人被泥石流封在隧道9天,靠喝泥坑水活了下来

可达鸭面面观
2026-09-10 11:44:35
脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

火山詩话
2026-09-10 10:40:36
也门胡塞武装攻占红海港口城市穆哈

也门胡塞武装攻占红海港口城市穆哈

新华社
2026-09-10 19:08:09
重磅!美国查封中文电诈“地下淘宝”,涉案84亿美元,FBI远赴非洲端掉13个窝点

重磅!美国查封中文电诈“地下淘宝”,涉案84亿美元,FBI远赴非洲端掉13个窝点

大洛杉矶LA
2026-09-10 06:53:10
扎哈罗娃反问日本:当年屠杀中国、苏联平民时,戴的不正是菊花纹章吗?此前高市早苗要求俄拆除战胜军国主义日本的纪念碑

扎哈罗娃反问日本:当年屠杀中国、苏联平民时,戴的不正是菊花纹章吗?此前高市早苗要求俄拆除战胜军国主义日本的纪念碑

鲁中晨报
2026-09-10 13:43:05
快讯!巴基斯坦可能要打大仗了!

快讯!巴基斯坦可能要打大仗了!

故事终将光明磊落
2026-09-10 10:55:49
美国跟法国“杠上了”

美国跟法国“杠上了”

环球时报国际
2026-09-10 16:28:40
美媒:万斯、鲁比奥等人私下警告特朗普,美伊冲突可能持续到其总统任期结束

美媒:万斯、鲁比奥等人私下警告特朗普,美伊冲突可能持续到其总统任期结束

环球网资讯
2026-09-10 16:14:38
不让员工上厕所,导致失禁后崩溃,在车间边走边投掷!要把人逼成这样?

不让员工上厕所,导致失禁后崩溃,在车间边走边投掷!要把人逼成这样?

走读新生
2026-09-09 22:44:36
人民日报发声!已经不是简单道歉的事,多名律师支持男童一方起诉

人民日报发声!已经不是简单道歉的事,多名律师支持男童一方起诉

放开他让wo来
2026-09-10 10:43:36
5年每月1500元,男子停资助遭女生质问:尽快打过来不然曝光你!最新回应

5年每月1500元,男子停资助遭女生质问:尽快打过来不然曝光你!最新回应

上观新闻
2026-09-10 10:01:26
大陆必须立刻断供!萧旭岑:国民党就是美日的“买办代理人”!

大陆必须立刻断供!萧旭岑:国民党就是美日的“买办代理人”!

小马姨
2026-09-10 13:04:20
央行、证监会送温暖!盘后,A股利好来得太及时了

央行、证监会送温暖!盘后,A股利好来得太及时了

星图金融研究院
2026-09-10 15:42:53
曝网红“深圳六哥”去世!年仅47岁,欠大几百万,张大炮还有30万

曝网红“深圳六哥”去世!年仅47岁,欠大几百万,张大炮还有30万

裕丰娱间说
2026-09-10 06:27:50
养老金定心消息传出!国庆提前发放并非停涨前兆,实情讲明白了

养老金定心消息传出!国庆提前发放并非停涨前兆,实情讲明白了

陈博世财经
2026-09-10 14:22:07
天呢!网传大批00后开始坐牢,原因令人震惊...

天呢!网传大批00后开始坐牢,原因令人震惊...

慧翔百科
2026-09-10 08:27:31
金正恩公开表示:对参与“海外军事行动”的朝军士兵给予赞扬;法国媒体确认了:金正恩所说很可能是被派往俄罗斯参与乌克兰战争的朝鲜部队

金正恩公开表示:对参与“海外军事行动”的朝军士兵给予赞扬;法国媒体确认了:金正恩所说很可能是被派往俄罗斯参与乌克兰战争的朝鲜部队

吉刻新闻
2026-09-10 09:58:21
45年,全国小学从91.7万所降到12.83万所

45年,全国小学从91.7万所降到12.83万所

老郭在学习
2026-09-10 16:32:25
罗永浩连用7个“抄的”痛批iPhone Duo 称仅有一处原创

罗永浩连用7个“抄的”痛批iPhone Duo 称仅有一处原创

CNMO科技
2026-09-10 15:21:12
12岁女生遭围殴调查:施暴学生均不满14周岁,警方不予行政处罚 家属拟提起民事诉讼

12岁女生遭围殴调查:施暴学生均不满14周岁,警方不予行政处罚 家属拟提起民事诉讼

红星新闻
2026-09-10 17:41:28
2026-09-10 20:00:49
雷峰网 incentive-icons
雷峰网
关注智能与未来!
70908文章数 656231关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

初二女生楼道遭殴打 公安局长通宵审问刑拘2人行拘3人

头条要闻

初二女生楼道遭殴打 公安局长通宵审问刑拘2人行拘3人

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

大六座+千匹马力+71度大电池 阿维塔T09曝光/年内上市

态度原创

游戏
数码
健康
旅游
军事航空

粉丝众望所归,《阿斯加德的陨落》1.0正式版于2026年9月9日上线Steam

数码要闻

中兴U15随身WiFi开售:支持10000mAh电池,99元

牙疼,也可能跟心梗有关?!

旅游要闻

@老师们,洛阳这些景区优惠活动延长至周末

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版