网易首页 > 网易号 > 正文 申请入驻

保鲜期才是中国模型的新战场

0
分享至

研究员|卢杨

过去一个月,大模型行业最让人印象深刻的,是变化本身的速度。一款模型发布,数小时内登顶榜单,话题霸屏,但留给它在榜首的时间,变得前所未有的短暂。新的版本很快出现,新的价格表很快出现,新的能力边界很快被重新定义。

在这个节奏里,一个模型从“前沿”到“被超越”,中间隔的时间越来越短。但在这股浪潮中,出现一个例外。7月中旬发布的Kimi K3,在历经一个多月、十余款重磅模型的轮番冲击之后,依然没有掉出全球前沿模型的讨论范围。

发布数小时后,K3登顶Frontend Code Arena榜首——1679分,超越Claude Fable 5的1631分和GPT-5.6 Sol的1618分。这是中国大模型第一次站上那个位置。

但接下来的事情,更像是一场刻意安排的极限压力测试。此后的35天里,AI模型进入了近乎疯狂的发布期,Opus 5、DeepSeek V4 Pro、Qwen 3.8max、GLM5.3等几波冲击接连到来,各大榜单榜首几度易主。

但几轮过后,Kimi K3倒还在原位。在Artificial Analysis Intelligence Index上,K3(max版本)最新评分为60分,与刚刚发布的GLM-5.3同居全球第五,在AA-Briefcase(模拟真实企业知识工作的长程测试,涉及25000多条Slack消息、3500多封邮件、会议纪要和财务报表)中,K3以Elo 1543排名第二,仅次于Claude Fable 5的1574,超过了GPT-5.6 Sol的1501。

在Agent Arena上, K3(max版本)以+10.5%的净提升位列第四,是能力前十中唯一的中国模型。而它的单任务中位成本为0.62美元,仅为Claude Opus 5(3.37美元)的五分之一,是前八名中最低的。截至8月20日,在Code Arena的前端专项榜单及覆盖任务更全的WebDev总榜上,K3仅次于Opus 5位列第二,而这两个位置,都是在Qwen3.8、Grok4.6、GLM-5.3等更晚发布的模型冲击之下保持的。





相比上一代K2,官方称K3整体扩展效率提升了约2.5倍。这个数字不是说“智商提高了2.5倍”,它说明的是,当模型继续扩大时,每增加一单位算力投入,能换来多少真实的能力增量。

这也是K3想解决的核心问题。我们把它的解法简单归纳为三个维度上。这可能也恰恰是大模型继续扩大以后,无法绕开的三座山。

01 长上下文,不只是“装得多”

100万token上下文,听起来只是一个规格数字,在参数表里和“2.8T”并排列着。但当模型面对的是一整个代码仓库(包含数十个文件的依赖关系)、几百页企业尽调材料(含财务附注和法律条款)、或者一套需要连续执行数百步的Agent任务时,“能装下多少信息”和“能不能有效使用这些信息”,已经是两个截然不同的问题。

不同于简单的问答,模型开始被要求“接手一段完整的工作流”:读材料、理解背景、写代码、查资料、执行工具、检查结果、修正错误,再继续往下做。任务越复杂,模型需要维持的有效上下文就越长。

K3使用的是Kimi Delta Attention(KDA)。这不是新概念。月之暗面此前已将KDA定义为一种线性注意力模块,核心是在长序列场景下颠覆传统Attention机制的平方级复杂度:传统Transformer处理长度L的序列需要O(L²)的计算量,当L达到100万时,这个数字将变得不可承受。KDA通过线性复杂度的注意力设计,将计算量降至O(L)。

到了K3,KDA被正式放入百万token的完整架构里,与2.8T参数协同工作。

它的本质是让模型在超长上下文中依然保持“注意力聚焦”。在普通Transformer里,上下文越长,模型越容易“忘记”开头的关键信息,学术界称之为“注意力稀释”。KDA通过线性复杂度的注意力重计算与稀疏注意力模式,让模型在处理第90万个token时,依然能精准调用第1万个token里埋下的隐藏指令。

可以通俗理解为,K3在处理需要连续执行上百步的Agent任务时,不会因为“记忆衰减”而在任务中途跑偏。技术报告也将KDA与长上下文和长程Agent任务直接联系起来,这是AI从“聊天工具”走向“工作伙伴”的关键一步。

模型的“大”不只体现在宽度(专家数量),还体现在深度(层数)。网络越深,理论上能进行的抽象推理越复杂。每一层都可以在前一层的基础上构建更高级的表征:从词汇到短语到语义到逻辑结构。但层数增加后,一个经典难题出现了,梯度消失与信息遗忘。

底层的原始信息,经过数十上百层的传递后,传到顶层时往往已经被“稀释”得面目全非。传统残差连接(Residual Connection)通过“跳跃连接”的方式让信息可以绕过某些层直接向后传递,在一定程度上缓解了这个问题。但当网络深度继续增加时,这种简单粗暴的“整体传递”方式就变得不再高效。

K3使用了Attention Residuals。它的设计思路比传统残差连接更精细,让模型在向更深处计算时,每一层都能“回头看”,有选择地利用此前不同深度产生的信息。

月之暗面相关研究显示,在某些设置下,Block Attention Residuals可以达到相当于额外增加大量训练计算量的效果。

硅谷的投资人也在公开讨论这件事。a16z在社交媒体上写道,“America debates Chinese AI while the rest of the world buys it”(美国人还在争论,世界其他地方已经在下单);知名投资人Jason Calacanis则在一档节目中称,Anthropic的大客户正在认真评估转向Kimi——原因不是性能超越,而是“当性能可以用零头买到时,没有人愿意继续支付溢价”。这些说法带着明显的立场和渲染成分,但K3被列入这种讨论本身,说明它已进入海外机构的投资与采购框架,而不仅是技术圈的话题。

K3在处理极其复杂的逻辑推理,比如数学证明的多步推导、长链条的法律条款比对、或者需要多轮反思的代码调试时不容易在推理的“半路”丢掉关键线索,每一层都在贡献新的信息。

8月初美国白宫闭门会议敲定的“自愿AI安全审查框架”中,只有闭源前沿模型需在发布前送政府审查30天,开源与开放权重模型被排除在外;同期,179家美国中小企业联署反对对中国模型的全面封禁。开放权重正在获得更大的政策与市场空间,而K3恰好站在这个空间的入口处。

02 更宽的模型,2.8万亿参数

K3最容易被注意到的数字还是2.8万亿。它拥有896个路由专家,每个token实际只激活16个专家,激活参数量约1040亿。也就是说,它拥有巨大的“知识容量”,多达2.8万亿参数所代表的记忆和表征空间,每一次计算只调动其中一小部分。这是MoE架构的性感之处,也是它的梦魇。性感在于效率,一个模型可以有2.8万亿的知识储备,却只需要为每次计算支付1040亿的算力成本。

噩梦在于路由。专家越多,路由越难。如何把代码生成任务精准送到“代码专家”手里,把数学推理送到“数学专家”手里,把多语言任务送到对应的语言专家手里?如何避免某些热门专家过载瘫痪,而另一些冷门专家长期闲置“摸鱼”?如何在数万亿参数的分布式训练中保持数值稳定,不出现梯度爆炸或收敛失败?

K3使用Stable LatentMoE,并引入Quantile Balancing等方法处理专家负载。Quantile Balancing的核心思路是监控每个专家的负载分布,当某些专家的负载超过设定分位数时,系统会自动调整路由策略,将部分流量导向负载较低的专家。这套机制确保了896个专家不会出现“少数累死、多数闲死”的局面。

这背后是一套精密的基础设施工程它解决的是万亿参数集群的可操作性问题。没有这套路由稳定机制,2.8万亿参数将只是一堆无法有效调用的数字。所以,2.8万亿所代表的是模型拥有如此巨大的容量后,依然能够精准、稳定、稀疏地调用它。

架构只是容器。K3的性能释放,同样依赖于数据配方与后训练对齐,高质量语料的配比、多阶段预训练的数据调度、基于人类反馈的强化学习(RLHF),这些“看不见的工程”对最终模型质量的影响,丝毫不亚于架构创新。月之暗面技术报告花了大量篇幅描述其数据清洗与对齐策略,这正是K3能稳定输出高质量代码和复杂分析,而非仅仅在静态测试中刷分的关键暗线。

简单来说,KDA负责“长”,Attention Residuals负责“深”,Stable LatentMoE负责“宽”,数据与后训练负责“点燃”。四者同时作用,让K3在规模急剧膨胀时,没有变成一头笨重的巨兽,反而是保持了敏捷与高效。

03 代价:能力越强,瓶颈越深

如果把K3写成无短板的神器,这显然不现实。它最明显的短板是速度。Artificial Analysis数据显示,K3输出速度约为39 token/秒,在统计的101个模型中排名靠后。在AA-Briefcase长程测试中,它完成一个复杂任务平均需要近一个小时,平均83轮交互,单任务成本约10.57美元。

价格则是K3另一个常被开发者提及的痛点。输入每百万token 3美元,输出15美元——在中国同行里不算低价(DeepSeek V4 pro在涨价之后的高峰时段输出也仅需3.98美元)。这注定了K3不是“万金油”模型。对于简单的日常问答,它既慢又贵;它的主战场是那些任务足够复杂、上下文足够长、容错率极低的高价值场景。不过把坐标换到海外,账是另一种算法:Claude Fable 5的输出价格约为每百万token 50美元,K3约为其三分之一。同一价格,放在国内市场是“偏贵”,放进全球前沿模型的定价光谱里,则处于明显的低位。

04 考验在之后

这些技术选择带来的影响,很快溢出评测榜单,蔓延至产业层面。彭博社在7月17日的报道中指出,月之暗面将Kimi K3定价在Anthropic Sonnet的水平,“显示出公司相信凭借其能力可以向其他中国模型收取溢价”。一个月后,又在一篇题为《China’s Kimi K3 Is Closing In on America’s Best AI》的报道中,援引Artificial Analysis等多家测评,在其制作的性能-成本散点图上,K3落在Pareto前沿上——性能逼近Claude Fable 5,完成同等能力基准任务的加权平均成本约为其五分之一。这些信号连起来看:中国AI公司正在从“低价换市场”转向“性能定价格”。

研究机构也在重新评估。美国企业研究所研究员Ryan Fedasiuk在一份题为《中国已追上前沿AI》的报告中指出,过去“中方最强模型落后美国6至8个月”的普遍认知正在被打破,双方差距已“接近按周计算”。布鲁金斯学会研究员Kyle Chan则认为,Kimi K3已经超过了Opus 4.8和GPT-5.5等“理论上可被用作蒸馏来源”的美国模型,这表明中国AI能力并非只是对美国模型的衍生。

所以伴随着k3开源,且其能力逼近闭源模型的时候,一个不得不回答的问题摆在闭源模型面前:用户为什么还要选择你?

硬币的另一面也是商业化的自我博弈。权重完全开放后,具备技术能力的企业完全可以选择本地部署并自行微调,而不必调用月之暗面的官方API。这需要月之暗面在获得生态影响力的同时,也在一定程度上让渡了对商业化通道的独家控制权。

路透社8月报道称,月之暗面已对利用Kimi K3等模型建立大型商业服务的用户设置了相应商业条款;阿里也计划对Qwen新模型的大型商业用户探索新的商业化方式。这说明开放权重并不等于没有商业模式,但如何平衡生态扩张与商业变现、在“开放”与“收费”之间找到可持续的平衡点,是K3开源策略面临的真正考验。这个问题目前还没有答案,整个行业都在看着。

至少在这个月的模型混战中,没有哪个模型能永远SOTA。技术突破的窗口期从几个月缩短到几周,甚至几天。真正的考验是,当下一轮浪潮打来时,是被冲走,还是依然站在决定方向的牌桌上?

K3并不完美,速度慢、成本高,整体性能仍落后于最强的闭源模型,月之暗面在技术报告里也承认这一点。

但K3的上一代K2.6在Frontend Code Arena仅排第18名。从第18名到第1名,隔着的不是渐进改进,而是一次架构层面的重构。更重要的是,经历十多款重磅模型轮番冲击后,K3至今依然留在第一梯队。

这靠的是KDA、Attention Residuals、Stable LatentMoE,以及背后看不见的数据工程与强化学习对齐。

Kimi K3的35天证明了两件事。一是能力没有被时间快速折旧:在经历Opus 5、Qwen、DeepSeek、GLM等多轮冲击后,中国模型首次站上了参与定义“下一阶段前沿标准”的起跑线。二是当能力进入同一区间,竞争的天平开始向成本、部署方式与采购逻辑倾斜——榜单决定话题,账单决定选择。比登顶更难的,是留在牌桌上。K3暂时做到了,但艰难的道路还在后面。

(文中内容和观点仅供参考,不构成投资建议。投资有风险,入市需谨慎。)

编辑|邱慧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不查不知道,一查吓一跳!出场费10万,但节俭的朱之文,私下多壕

不查不知道,一查吓一跳!出场费10万,但节俭的朱之文,私下多壕

兵卒史
2026-09-13 10:55:06
希拉里·克林顿出来谈台湾问题了!9月10日,根据外媒报道,希拉里在接受采访时表示,我们必须审视我们潜在的危险,尤其是中国在想什么

希拉里·克林顿出来谈台湾问题了!9月10日,根据外媒报道,希拉里在接受采访时表示,我们必须审视我们潜在的危险,尤其是中国在想什么

扶苏聊历史
2026-09-12 16:16:15
破防了!输中国46分后,巴林全队拒绝握手,郭士强抗议后仅1人折返

破防了!输中国46分后,巴林全队拒绝握手,郭士强抗议后仅1人折返

多特体育说
2026-09-12 17:56:51
菲政坛大变天?中方出手,莎拉拿到王牌,马科斯表弟成“替罪羊”

菲政坛大变天?中方出手,莎拉拿到王牌,马科斯表弟成“替罪羊”

墨印斋
2026-09-13 06:09:21
台湾退役中将帅化民表示,张学良被关一生不能算冤,因为西安事变那一夜,他差点让蒋介石从奉化带来的嫡系护卫全军覆没

台湾退役中将帅化民表示,张学良被关一生不能算冤,因为西安事变那一夜,他差点让蒋介石从奉化带来的嫡系护卫全军覆没

谈史论今1
2026-09-06 20:22:18
“出卖”父亲后果凄凉?傅作义之女傅冬菊为何至今仍被黑得如此惨?

“出卖”父亲后果凄凉?傅作义之女傅冬菊为何至今仍被黑得如此惨?

舆图看世界
2026-09-06 11:40:12
万万没想到,“十万大军一枪不放就跑光”,胡塞武装自己都懵了:这仗还能这么打?

万万没想到,“十万大军一枪不放就跑光”,胡塞武装自己都懵了:这仗还能这么打?

扶苏聊历史
2026-09-13 09:05:03
亚运两连胜!中国男篮46分狂胜巴林 廖三宁23+6李悦洲18分

亚运两连胜!中国男篮46分狂胜巴林 廖三宁23+6李悦洲18分

醉卧浮生
2026-09-12 16:51:09
陈幸同1比4不敌张本美和,无缘决赛,打法比较保守

陈幸同1比4不敌张本美和,无缘决赛,打法比较保守

子水体娱
2026-09-13 13:23:46
万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

米果说识
2026-08-17 19:17:49
李多海直言在华直播不易,韩国艺人就她与秋瓷炫“有资格”,中文是硬门槛

李多海直言在华直播不易,韩国艺人就她与秋瓷炫“有资格”,中文是硬门槛

喜欢历史的阿繁
2026-09-13 02:44:06
都说美军是少爷兵,为啥日军甲种师团平原死磕,就是打不过?

都说美军是少爷兵,为啥日军甲种师团平原死磕,就是打不过?

莫地方
2026-09-10 21:10:40
中华人民共和国正式宣告两件大事:第一件就是,我们的福建舰航母正式服役了,中国海军从此迈入三航母时代

中华人民共和国正式宣告两件大事:第一件就是,我们的福建舰航母正式服役了,中国海军从此迈入三航母时代

回京历史梦
2026-09-10 14:07:25
男单四强出炉:世界冠军击碎日本垄断冠亚之梦,半决赛或再破瑞典

男单四强出炉:世界冠军击碎日本垄断冠亚之梦,半决赛或再破瑞典

乒烧泳球
2026-09-12 22:19:21
全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

扶苏聊历史
2026-08-27 16:15:02
6TB日志被买下:小米蔚来等19家密钥泄露

6TB日志被买下:小米蔚来等19家密钥泄露

野生运营
2026-09-12 15:10:38
上海男警察A8家庭相亲,准婆婆上阵把高知女驳斥得不要不要的

上海男警察A8家庭相亲,准婆婆上阵把高知女驳斥得不要不要的

道术意义
2026-09-13 06:33:25
2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

非虚构人间
2026-09-11 01:40:57
2027年将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027年将会是中华人民共和国全党、全军、全国各族人民重要的一年

米果说识
2026-09-13 10:06:43
美网新后诞生!莱巴金娜掀翻萨巴,赢麻了:携冠登顶+狂揽3691万

美网新后诞生!莱巴金娜掀翻萨巴,赢麻了:携冠登顶+狂揽3691万

大秦壁虎白话体育
2026-09-13 06:43:09
2026-09-13 14:27:00
第四波
第四波
深度科技资讯,产业一线报告
111文章数 3关注度
往期回顾 全部

艺术要闻

18幅 当代画家油画作品欣赏

头条要闻

小伙获"双一流"硕士学位 求职面试5轮因第一学历被拒

头条要闻

小伙获"双一流"硕士学位 求职面试5轮因第一学历被拒

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

主持人敬一丹去世,女儿悲痛发讣告

财经要闻

“1+N+X”!私募业,监管规则密集落地!

科技要闻

三位AI大佬,罕见呼吁AI减速

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

旅游
本地
亲子
教育
公开课

旅游要闻

中国之巅奏响《共同的节日》,千吨阻尼器光影秀演绎“迎世赛,游上海旅游节”

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

亲子要闻

到底是星期几写的?太逗了

教育要闻

新中考英语变难了?有没有可能是你还没抓住这些关键点!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版