网易首页 > 网易号 > 正文 申请入驻

彻底对标DeepSeek!Kimi把K3的Infra底牌竟然也开源了

0
分享至

7月27号,月之暗面把Kimi K3的模型权重开源了。

这次它还顺手把支撑K3训练和推理的三套基础设施MoonEP、FlashKDA、AgentEnv一起放了出来。

不只是把模型给你,连怎么造出来、怎么让它跑起来的整套东西都摊开了。



在此之前月之暗面已有多次开源动作,但将万亿级大模型配套核心训练框架和权重一并对外,在国内开源圈子里十分少见,等于完整公开了Kimi K3从训练到落地的整套技术实现路径。

如果你对万亿参数已经麻木了,那换个说法可能更直观。

K3的参数规模是前代K2.5的3倍,但规模化效率提升了2.5倍用同样的算力,榨出了2.5倍的智能。



当被问到不怕技术被学走吗,他们的回答大致是:技术可以被复制,但构建技术体系的组织能力和迭代速度才是真正的护城河。
开源的是K3,真正拉开差距的是做出K4、K5的能力。



  • 技术报告PDF:https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
  • Hugging Face链接:https://huggingface.co/moonshotai/Kimi-K3
01 为什么Infra是K3的隐藏王牌?

在媒体沟通会上,月之暗面副总裁黄震昕说了一段话,可以作为理解这份报告的钥匙:

  • 传统大模型遵循算力、数据、参数的缩放定律,但一味堆砌算力早已遇到瓶颈。团队自研的底层技术,能让同等训练数据发挥翻倍效果,把模型训练功耗降低一半。

这种不堆卡、改架构的思路,直接体现在K3的三项开源Infra技术上。

(一)MoonEP

MoE模型的核心挑战之一,是专家并行带来的通信开销。K3拥有896个路由专家,每个Token激活16个。在如此细粒度的MoE架构下,专家之间的通信极易成为训练效率的瓶颈。

MoonEP正是为此而生


MoonEP计算、通信与卸载重叠调度

它是一套面向大规模MoE模型的高性能专家并行通信库,核心价值在于即使在不均衡的通信场景下,仍能实现极致效率

这意味着在万亿参数分布式训练中,跨卡通信的延迟被降到最低,GPU的算力得以充分释放。

月之暗面建议Kimi K3部署在64张以上加速卡组成的超节点环境中,这一要求本身就说明了高速互联和专家并行调度的关键性。

(二)FlashKDA

K3支持100万Token上下文窗口,这背后依赖的是Kimi Delta Attention(KDA)这一架构级创新。

KDA将传统Transformer的O(n²)复杂度降至O(n),使得长文本推理在成本上变得可行。


KDA Lower-bounded Decay对计算的影响

FlashKDA是KDA对应的高性能计算算子(Kernel)。官方数据显示,在英伟达H20上,FlashKDA的Prefill速度相比flash-linear-attention基线提升1.72至2.22倍

简单来说,FlashKDA让KDA的线性复杂度优势在硬件层面真正落地。它可以直接作为flash-linear-attention的替换后端,开发者可以零成本接入这一性能红利。

FlashKDA此前已开源,此次随技术报告一起,其设计思路和实现细节更加透明。

(三)AgentEnv

K3的能力不止于生成文本,更在于执行长时程Agent任务

官方案例显示,K3在生成一份覆盖推理芯片行业42年历史的研究报告时,完成了2800多次网页搜索、1100多次终端数据调用,处理了超过1.1万页资料。


RL FLOPs扩展与各领域能力的关系

这种级别的Agent任务需要一个高保真、强隔离的沙箱环境。传统容器沙箱有个致命问题,Agent探索得太激进,会导致内核崩溃甚至死锁。K3后训练阶段要跑成千上万个Agent并行探索,环境稳定性是刚需。

AgentEnv用Firecracker微虚机提供硬件级隔离

(1)Pause/Resume,暂停时零资源消耗,推理占沙箱98%的寿命,推理期间沙箱可以暂停。

(2)Fork,从当前状态复制新沙箱,做奖励评估时不污染原环境。

(3)Snapshot,定期保存快照,出错后快速回滚。

在K3的整个训练和评估过程中,累计创建了51,219,741个沙箱,跨越1,505,678个镜像。单个沙箱的暂停和恢复延迟分别低至133ms和49ms。

02 Infra之外的组合拳

Infra层保证了训练能跑起来,但真正决定模型能力上限的,是K3的架构设计。


Kimi K3整体架构概览

(一)混合注意力与信息流动

技术报告显示,K3采用了KDA + Gated MLA的混合结构,比例约为3:1。KDA负责高效处理长上下文,而Gated MLA能动态筛选重要信息。

同时,Attention Residuals技术以不到2%的额外成本,提升约25%的训练效率,在2.8万亿参数的训练中保障了稳定性。


GLU、SwiGLU和SiTU-GLU的标量响应对比

(二)稀疏MoE与稳定路由

K3采用Stable LatentMoE框架,896个路由专家中每个Token仅激活16个(激活比例约1.8%)。

为在高稀疏度下保持训练稳定,引入了Quantile Balancing等负载均衡机制,根据路由分数量化分位数直接分配专家,减少启发式更新及敏感超参数。


Quantile Balancing负载均衡示意图

(三)MoonViT-V2视觉编码器

K3具备原生视觉理解能力,为此专门训练了MoonViT-V2视觉编码器,采用Next-Token Prediction的自监督方式从头训练,摆脱了对对比学习预训练的依赖。


视觉编码器梯度范数对比

在训练效率上,规模化效率提升2.5倍,是架构创新、训练方法和数据配方优化共同作用的结果。

03 K3跻身全球第一梯队

K3在近20个内部评测集及多个公开基准上进行了全面评估,对比基线包括Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GLM-5.2等顶级闭源模型。整体定位是略逊于最强的Claude Fable 5与GPT-5.6 Sol,但稳定优于Claude Opus 4.8、GPT-5.5和GLM-5.2。




Kimi K3主要评测结果一览

真实场景下,K3连续48小时自主运行,基于开源EDA工具完成一颗nano推理芯片设计,4mm²内集成1.46M标准单元,仿真吞吐超8,700 tokens/s

它还独立开发了类Triton编译器MiniTriton,从DSL前端到PTX代码生成的完整工具链。


MiniTriton编译器性能

在GPU内核优化任务上,K3同样展现出惊人的工程能力。 K3在AttnRes算子上的优化轨迹59.7%的加速比,远超Claude Fable 5的57.1%和GPT-5.5的30.8%。


GPU kernel 优化(AttnRes)案例研究

另一个值得关注的案例是Camera Repair Management System,一个黑盒系统复制任务。

K3以1.000 的归一化完成率,率先达到终点,Claude Opus 4.8和GPT-5.5分别只能达到0.918 和0.893。


Camera Repair Management System 完成曲线

API输出定价100元/百万Token(约$15),约为Claude Fable 5($50)的三分之一。不过实际单任务成本差距缩小,AA-Briefcase上K3平均83轮调用,耗时56分钟(约Fable 5的2.5倍)。


Score vs. 单任务推理成本对比

04 开源Infra比开源权重更有信号

本次Kimi K3开放万亿级模型权重只是表层看点,三套配套自研基础设施同步开源,才是更关键的行业信号。

算力扩张的边际效益不断衰减,月之暗面选择以架构与工程优化突破性能瓶颈KDA优化长文本计算、Quantile Balancing平衡MoE负载,再由MoonEP、FlashKDA、AgentEnv完成全链路工程落地。

市面上多数开源项目仅放出模型文件,完整训练推理底座极少对外公开。这套可完整复现万亿模型训练的工具链,降低了行业自研大模型的工程门槛。

算法与模型总有被追上的一天,可源源不断迭代底层技术、持续推出新一代模型的完整组织能力,才是难以复制的长期壁垒。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为什么越来越多的人宁愿少拿退休金,也要提前退休?

为什么越来越多的人宁愿少拿退休金,也要提前退休?

巢客HOME
2026-08-19 07:00:09
教育部部长怀进鹏发文,教育或将大洗牌,网友:缩短学制 普及高中

教育部部长怀进鹏发文,教育或将大洗牌,网友:缩短学制 普及高中

混沌录
2026-09-09 10:11:27
月饼引起中国1000万人关注!医生提醒:吃五仁月饼时多注意这5点

月饼引起中国1000万人关注!医生提醒:吃五仁月饼时多注意这5点

看世界的人
2026-09-08 20:56:14
活久见!山东一教学医院提示牌刷屏,普通号就诊或有医学生参与,评论区炸锅:这多好,普通号专家给你看诊,就是容易被参观

活久见!山东一教学医院提示牌刷屏,普通号就诊或有医学生参与,评论区炸锅:这多好,普通号专家给你看诊,就是容易被参观

火山詩话
2026-09-10 15:43:34
赴美定居梦碎!飞机上出手打人,一家三口刚落地就被遣返

赴美定居梦碎!飞机上出手打人,一家三口刚落地就被遣返

社会日日鲜
2026-09-08 13:17:44
马向东为儿子报仇被判死刑,行刑前对妻子说:我去陪孩子了

马向东为儿子报仇被判死刑,行刑前对妻子说:我去陪孩子了

纸鸢奇谭
2025-02-26 20:46:29
WTT澳门赛最新战报:女单爆大冷!陈幸同3-0横扫,周启豪大爆发

WTT澳门赛最新战报:女单爆大冷!陈幸同3-0横扫,周启豪大爆发

面包夹知识
2026-09-10 18:22:33
苹果新机代抢连夜涨价!有黄牛将加价3000到5000元!专家:消费者可能“钱货两空”…

苹果新机代抢连夜涨价!有黄牛将加价3000到5000元!专家:消费者可能“钱货两空”…

北京商报
2026-09-09 15:37:33
库页岛的真相,远比你想象的更复杂:不属于中国、不像俄罗斯、不承认过去

库页岛的真相,远比你想象的更复杂:不属于中国、不像俄罗斯、不承认过去

怪味历史连连看
2026-09-09 12:13:00
微信正式上线私密朋友圈功能 已覆盖iOS和Android

微信正式上线私密朋友圈功能 已覆盖iOS和Android

CNMO科技
2026-09-09 10:15:11
惨!全线跳水!!

惨!全线跳水!!

新浪财经
2026-09-10 21:33:25
巴媒:米内罗3场停赛将在塞阿拉执行,俱乐部已提出申诉

巴媒:米内罗3场停赛将在塞阿拉执行,俱乐部已提出申诉

懂球帝
2026-09-10 21:55:12
董建华夫人赵洪娉:结婚65年生3个子女,为丈夫分忧是顶级贤内助

董建华夫人赵洪娉:结婚65年生3个子女,为丈夫分忧是顶级贤内助

白浅娱乐聊
2026-09-11 00:06:36
中央组织部通知:陈盛燃履新

中央组织部通知:陈盛燃履新

上观新闻
2026-09-10 10:26:37
赖清德终于知道:中方对台亮出的“红线”,足以让美战机打道回府

赖清德终于知道:中方对台亮出的“红线”,足以让美战机打道回府

福建睿平
2026-09-10 06:11:15
长鑫存储与长江存储被曝已准备可用三年的ASML DUV光刻机

长鑫存储与长江存储被曝已准备可用三年的ASML DUV光刻机

cnBeta.COM
2026-09-08 18:16:04
中国最丰满的5位女星,美得各有千秋,她们的身材也太犯规了

中国最丰满的5位女星,美得各有千秋,她们的身材也太犯规了

叹为观止易
2026-09-11 00:22:25
全线跳水!加息25个基点!欧洲央行,重大宣布

全线跳水!加息25个基点!欧洲央行,重大宣布

证券时报
2026-09-10 21:36:04
现在A股,不是牛市也不是熊市,是猪市。

现在A股,不是牛市也不是熊市,是猪市。

流苏晚晴
2026-09-10 14:25:21
疯狂进球大战:总共轰入9球,阿隆索神换人,切尔西奇迹逆袭,1亿巨星梅开二度

疯狂进球大战:总共轰入9球,阿隆索神换人,切尔西奇迹逆袭,1亿巨星梅开二度

足球狗说
2026-09-10 06:15:54
2026-09-11 01:56:49
智猩猩
智猩猩
AI 技术内容与服务平台
91文章数 4关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

艺术
游戏
时尚
家居
公开课

艺术要闻

别再问中国意境是什么了!看完中国古建筑,才知道什么叫惊世之美!

LPL二路主播再惹争议,祸从口出遭iG粉丝举报,口嗨假赛发文道歉!

“蛇精”围攻,葫芦爷爷求饶

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版