网易首页 > 网易号 > 正文 申请入驻

Kimi K3开放权重,引爆海外社区,想本地部署,200万元起

0
分享至


出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

月之暗面没有食言,准时开放了Kimi K3的完整模型权重。

7月27日,在首秀11天后,这家中国AI初创公司将Kimi K3的完整模型权重上传至Hugging Face。


这批总规模约1.56TB的权重文件,很快在开发者社区引发关注,并在短时间内登上平台趋势榜首。不过,权重免费不等于零成本:有人指出想让这个2.8万亿参数模型跑起来,至少需要200万元硬件投入;若要提供商业API服务,门槛则在1500万元左右。

但这次交付的意义仍然远超一次普通的权重释放。

从模型权重到底层算子,从训练沙盒到一份详尽的47页技术报告,月之暗面把构建和训练K3所需的大量工程能力摆上了台面;与此同时,一份精心设计的许可证,也为这场开放划定了商业边界。


热闹的社区狂欢背后,月之暗面试图回答一个更大的问题:开放权重模型,如何在扩大生态的同时,找到可持续的商业回报?

这既是一场技术开放实验,也是一次商业模式探索。


不是只给"鱼",

连"渔具"也一并打包

对于熟悉K3首次亮相的人来说,参数规模(总参数2.8万亿,激活参数1040亿)和跑分已经不是新闻。

此次发布的真正增量,在于月之暗面选择了"给鱼又给渔"的开放策略。它不仅交付了模型权重本身,还将训练和部署这个庞大模型所需的三项核心基础设施(MoonEP、FlashKDA和AgentENV)一并开放,并附上一份47页技术报告。这在当前开放模型生态中并不常见。


首先,核心交付是完整的模型权重文件,包含K3的文本和视觉编码器(MoonViT-V2)的相关参数。拥有足够算力的团队可以自行部署并研究这一模型。

但真正让业界关注的,是随权重一同发布的技术报告。这份报告并非简单展示性能成绩,而是披露了K3从架构设计、训练策略到数据处理的一系列技术细节。

全栈开发者 @TypicalBryan735评论说,放弃注意力内核、MoE通信库和代理沙盒基础设施,同时开放权重,这才是真正推进开放模型生态的方式。


除了权重文件,月之暗面还开放了三项基础设施技术,分别解决通信、算子优化和智能体训练环境问题,对应了训练和部署超大规模混合专家模型时的几个关键瓶颈。

MoonEP瞄准的是混合专家模型训练中常见的"负载不均"问K3内部有896个路由专家,每处理一个token,系统只激活其中16个专家。这种设计能够扩大模型规模,同时控制实际计算量,但也带来新的挑战:不同专家的调用频率不同,可能导致部分GPU负载过高,另一部分资源闲置。

传统方案通常需要额外的数据交换和调度机制。MoonEP通过优化专家分配和通信方式,提升不同计算节点之间的负载均衡效率,减少训练过程中的通信浪费。


在训练超大规模MoE模型时,MoonEP有望提高计算资源利用率,并降低训练成本。

如果说MoonEP解决的是算力调度问题,FlashKDA则聚焦于计算效率。

Kimi Delta Attention(KDA)是K3处理百万token长上下文的重要技术之一,但其计算方式也带来了新的工程挑战。KDA具有"块内并行、块间串行"的特点:块内计算可以并发,但不同计算块之间的信息状态需要连续传递。如果按照传统方式处理,GPU会在计算和状态传递之间产生等待。

FlashKDA是月之暗面针对KDA设计的高性能算子库。它将计算过程拆分成不同流水线,让块内计算和状态传递能够更高效地并行执行。这就像厨房里,一个厨师负责炒菜,另一个厨师负责传菜,而不是同一个人炒完一道菜再端出去。

在英伟达H20芯片测试中,FlashKDA的预填充速度相比相关基线方案提升明显。更重要的是,FlashKDA已经成为相关开源项目可选的后端方案之一,它的价值并不局限于K3本身。

专注AI工具构建的开发者 @Andrii38324276指出,仅开放权重只能让开发者运行模型,而开放底层内核,才真正让社区有机会理解和改进训练效率。


第三项基础设施AgentENV,展示了K3训练中的另一个关键环节:如何为AI智能体提供稳定、可规模化的试错环境。

K3强化学习训练需要智能体在接近真实工作的环境中反复执行任务,例如读写文件、运行代码、调用工具。早期方案采用容器搭建沙盒环境,但团队发现,智能体的一些非预期操作可能导致系统崩溃,隔离能力并不足够。

于是,AgentENV采用了Firecracker microVM作为底层环境。这种轻量级虚拟机技术能够提供更强隔离能力,让智能体拥有类似独立计算环境的空间进行试错。为了支持大规模训练,AgentENV还优化了沙箱创建、暂停和恢复流程。

月之暗面披露,在K3训练和评估过程中,这套系统创建了超过5121万个沙箱,覆盖150多万个镜像。此次开放,意味着开发者不仅可以获得一个模型,也可以参考一套经过大规模验证的智能体训练基础设施。

这三项基础设施的开放,让K3与许多只开放权重的模型有所区别。

过去,开放模型通常意味着开发者"可以使用"模型,但训练和优化模型背后的工程能力,仍然掌握在少数实验室手中。月之暗面此次交出的,不只是模型本身,还包括一部分支撑模型训练和部署的工具链。

对于开发者而言,这意味着他们获得的不只是一个可调用的模型,也是一套可以进一步研究、修改和复用的工程资源。


开放新范式:

营收挂钩许可证,

在开放与商业之间走钢丝

K3的发布,也让"开放权重"和传统意义上的"开源"之间的区别再次成为焦点。

随模型权重一同发布的Kimi K3许可证,因其独特的商业限制条款,迅速成为讨论中心。

这份许可证的大部分内容接近宽松开源许可,允许用户使用、修改、分发甚至基于模型开发产品。但它附加了两个关键条件。

第一,经营模型即服务(Model as a Service)业务,且自身及关联方年营收超过2000万美元的公司,需要另行签订商业协议。

第二,如果任何商业产品或服务的月活跃用户超过1亿,或者月收入超过2000万美元,则需要在界面显著位置展示"Kimi K3"标识。

这两项限制不适用于企业内部自用,也不适用于通过月之暗面官方产品或认证合作伙伴访问模型的场景。也就是说,这套许可证主要针对的是达到一定商业规模、并直接向第三方提供模型推理或微调服务的企业。普通企业内部使用模型,或者将模型能力嵌入自身产品功能的部分场景,并不一定触发额外商业协议。

正如Interconnected Capital的Kevin Xu所指出的,这种做法让人联想到MongoDB等公司为防止云厂商直接转售其成果而采用的定制许可证。


过去,一些开源软件公司曾面临类似问题:代码开放后,云服务商可以直接基于这些成果提供商业服务,而原始开发者却难以获得对应收益。K3许可证的思路,本质上是在开放生态和商业回报之间寻找一个平衡点。

开发者对此总体持积极态度,但也有不同声音。

AI研究者内森·兰伯特(Nathan Lambert)总结道,这份许可证受到MIT许可启发,但加入了明显的商业限制。因此,从严格定义来看,它更接近"开放权重"而非传统意义上的"开源"。

X用户 @peterom则持更务实的观点。他认为,资本主义和开放生态并不一定矛盾,Kimi这种模式可能是一种新的平衡方式。他预测,未来几年可能会出现多家开放模型公司实现大规模商业收入,而"开放模型无法赚钱"的观点也会逐渐被重新审视。


不过,这条精心设计的商业边界,也让K3进入了另一个更复杂的讨论领域:监管。

出口管制专家、前拜登政府官员彼得·哈雷尔(Peter Harrell)曾分析,单纯下载和使用开放权重模型,可能被视为受保护的信息传播,美国政府直接干预的法律基础并不明确。

但K3许可证改变了一部分情况:当一个大型云服务商希望将K3模型能力作为商业服务提供时,它需要与月之暗面建立明确商业关系。一个原本只是"下载模型"的行为,可能转变为商业交易。而商业交易,也意味着更明确的监管边界。

如果美国商务部未来依据相关规则限制某些交易,或者将月之暗面列入制裁名单,这类商业协议可能成为监管关注的对象。

这也构成了K3开放策略中的一个微妙矛盾:开放可以扩大生态,但商业化会带来新的监管关系。当月之暗面希望在保持开放属性的同时获得更多商业回报时,它需要面对一个新的平衡问题:有营收,就意味着更容易进入监管视野。


开放了,然后呢?

从200万到1500万的部署账单

如果说许可证解决的是"谁可以免费使用、谁需要付费"的商业问题,那么接下来面对的是另一个更加现实的问题:即使拿到了免费权重,K3到底有多少人真正跑得起来?

模型权重可以免费下载,但这1.56TB文件一旦落地,就立刻变成了一道昂贵的硬件门槛。

小红书博主"平凡v97"根据公开方案,对K3部署成本进行了估算,并将其分成两个层级。

第一个层级,是"让模型运行起来"。AMD此前公布的验证方案提供了一个参考:8张MI355X,每张拥有288GB显存,总显存约2.3TB。按照当前硬件价格估算,这套配置的服务器成本约为170万至240万元。如果进一步考虑服务器、散热、机房和运维成本,总投入可能超过200万元。

但这解决的只是"能运行"。

如果目标是提供商业API服务,要求会完全不同。商业部署需要考虑多用户并发、百万token上下文处理、稳定响应延迟、故障切换以及长期运行成本。

因此,月之暗面在技术文档中建议,生产环境采用64张以上加速卡组成的部署方案。按照类似硬件规模估算,商业级集群投入可能达到1400万至1900万元。

也就是说:200万元,可能让模型跑起来;1500万元左右,才接近商业化服务的起点。


也有外国网友吐槽:“你只需要每月3万5000美元的GPU预算,或一次性50万美元投资,就能避开Kimi K3的99美元/月订阅。”


不过,开放权重的意义,也正在于它允许不同玩家探索不同路径。

Ning团队展示了一套更偏极客路线的方案:80张RTX 5090消费级显卡(大概需要200万元人民币)组成10个节点,每个节点8张卡,总显存达到2.56TB。这套方案没有采用AI服务器常见的HBM高带宽显存,也没有使用NVLink、InfiniBand等高端互联设备,而是依靠消费级显卡和普通网络完成运行。


测试结果显示,K3在这套系统上实现了约20 tok/s的单流推理速度。虽然距离大型商业服务仍有差距,但它证明:一个2.8万亿参数模型,并非只能存在于少数大型数据中心。

这两条路径的并存,正是开放权重生态的价值所在。一端,是官方推荐的数百万甚至上千万元级数据中心部署;另一端,是开发者基于现有硬件不断尝试的社区方案。

开放权重并不意味着所有人都能低成本运行前沿模型。但它确实让"如何运行模型"这个问题,有了更多探索空间。

而这也进一步引出下一个问题:K3为什么能够在如此庞大的规模下,仍保持接近前沿模型的效率?


架构红利:

K3如何把规模变成效率

答案在于K3的架构设计,它在多个层面降低了单位计算的成本。

从Kimi K2到K3,模型总参数规模扩大到近3倍。月之暗面表示,新架构、训练方法和数据配方共同提升了模型的整体扩展效率,约为上一代的2.5倍。

需要注意的是,这里的"2.5倍"是月之暗面对整体扩展效率的描述,并不等同于训练速度提升2.5倍,也不是某一项技术单独带来的收益,而是多个优化共同作用后的综合结果。

这些优化主要来自KDA、Attention Residuals以及Stable LatentMoE等架构设计。

·KDA:解决百万Token上下文的效率问题

长上下文一直是大模型扩展中的核心挑战。传统Transformer注意力机制的计算成本,会随着序列长度增加而快速增长。当上下文窗口扩大到百万token级别时,如何控制计算成本,就成为模型能否继续扩展的关键。

K3的核心注意力机制KDA(前文已介绍其工程实现FlashKDA)在架构层面的价值在于:它通过递归方式处理长程依赖,避免了传统注意力机制随序列长度平方级增长的计算开销。同时,K3结合Gated MLA等机制,在效率和信息保留之间进行平衡。

月之暗面表示,KDA能够显著提升百万token上下文场景下的推理效率。

·Attention Residuals:让深层网络保持信息流动

传统残差连接主要负责将上一层的信息传递到下一层。但随着模型深度增加,如何避免有效信息逐渐衰减,成为大型模型训练中的重要问题。

Attention Residuals允许模型根据当前任务需要,从不同深度的表示中主动检索信息。它不再依赖固定的信息传递路径,而是让模型拥有更灵活的信息调用方式。对于深层网络而言,这有助于提高信息利用效率。

·Stable LatentMoE:解决专家模型的调度难题

K3采用混合专家架构(MoE)。模型总共有896个专家,但每个token只激活其中16个。这种设计能够让模型拥有更大的参数规模,同时控制实际计算成本。

但MoE架构也带来了新的问题:如果部分专家被大量调用,对应计算资源会出现过载;而其他专家可能长期处于低利用状态。

K3采用"分位数均衡"(Quantile Balancing)方法优化专家路由。它并不是不断人工调整冷门专家权重,而是根据路由分数分布确定专家分配边界,从而减少对启发式更新规则和敏感平衡参数的依赖。

·原生多模态与视觉能力

在视觉能力方面,K3采用MoonViT-V2视觉编码器。

月之暗面表示,K3没有沿用部分模型常见的视觉预训练路径,而是探索通过下一token预测任务训练视觉编码器。这种方式让模型能够在统一架构下处理文本和视觉信息。

这些架构设计最终反映在模型表现上。

在月之暗面公布的基准测试中,K3在BrowseComp等智能体任务评测中表现突出,并在AutomationBench测试中取得最高成绩。在SpreadsheetBench 2中,K3也以微弱优势领先。

在推理能力测试中,K3在GPQA Diamond中获得93.5%的成绩,与GPT-5.6 Sol的最高成绩接近。在更贴近真实软件开发任务的FrontierSWE测试中,K3取得81.2%的成绩,高于GPT-5.6 Sol公布的71.3%。



第三方评测机构Artificial Analysis的Intelligence Index显示,K3获得57.1分,进入全球前列。该榜单中,K3超过Claude Opus 4.8(max)和GPT-5.5(xhigh),排名位于Claude Fable 5和GPT-5.6 Sol之后。

需要注意的是,不同模型评测时使用的配置、工具链和测试方式并不完全一致,因此这些成绩更适合说明K3已经进入全球前沿竞争范围,而不能简单理解为全面超过所有闭源模型。

在WebDev Arena前端代码竞技场中,K3以1678分排名第一,超过Claude Fable 5。这也是目前开放权重模型在该类竞技场中取得的重要突破。


更具冲击力的是成本。K3 API价格低于部分顶级闭源模型,同时推理时只激活部分参数,并通过MoE架构、低精度量化和KDA机制降低运行成本。

一位测试者指出,在智能体工作流中,K3的表现接近Claude Fable 5,但成本显著降低。


这也是开放模型对闭源模型形成挑战的关键:它不一定首先赢在绝对能力,而可能赢在"能力、成本和可获得性"的综合平衡。


中国开放模型的新信号:

从性能竞争到生态竞争

K3的发布,已经不只是一次模型升级。

它同时展示了一个此前开放模型较少呈现的组合:接近全球前沿模型的性能、完整的工程工具链,以及明确的商业授权规则。

过去几年,中国AI公司的竞争重点更多集中在模型能力本身:谁的参数更多,谁的跑分更高,谁的价格更低。而K3此次展示出的变化在于:竞争开始从"模型能力"延伸到"围绕模型建立的生态"。

过去,开放模型通常意味着开发者可以下载权重、进行微调或者开发应用。但模型训练背后的工程能力(例如超大规模MoE训练、推理优化、智能体训练环境)往往仍然掌握在少数大型AI实验室手中。

K3此次开放的不同之处,在于它同时提供了一部分支撑模型训练和部署的基础设施:MoonEP解决MoE训练通信问题,FlashKDA提供针对KDA架构的优化实现,AgentENV提供智能体训练环境。

这些工具是否会形成长期生态,还需要时间验证。但至少,它让开发者获得的不只是一个模型,而是一套可以继续研究和改造的工程资源。

Hugging Face首席执行官Clement Delangue也注意到了社区反应。他表示,K3发布后很快登上Hugging Face趋势榜首,社区反响非常强烈。


风险投资机构Air Street的Nathan Benaich则认为,当前AI竞争环境正在发生变化。美国长期占据开放模型生态优势,而中国公司正在快速缩小差距。


不过,K3是否意味着中国开放模型生态已经完成质变,目前仍然需要更多观察。

真正的生态形成,需要开发者持续采用、第三方应用出现、工具链被广泛复用、商业模式得到验证。这些都不是一次模型发布能够立即证明的。

Kimi K3的权重现在已经公开。任何拥有足够算力的团队,都可以下载、研究和修改它。

但从下载到部署,需要数百万元级别的硬件投入;从部署到商业服务,需要稳定的基础设施和运营能力;从商业服务到规模化竞争,还需要面对许可证、市场环境以及政策因素。

这也是K3最有意思的地方:它把AI产业链中此前分散的问题,同时摆到了台面上。

模型可以开放。但算力不会免费。工程能力不会自动复制。商业价值也不会凭空产生。

月之暗面试图探索的,并不是简单回答"AI应该开源还是闭源"。它更像是在回答另一个问题:当越来越多前沿模型走向开放,创造这些模型的公司,如何在生态扩散和商业回报之间找到新的平衡?

K3给出了一个新的尝试。

但这个答案,最终仍需要市场和时间验证。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
特斯拉中国官宣大降价,实在是太狠了!

特斯拉中国官宣大降价,实在是太狠了!

XCiOS俱乐部
2026-09-07 11:19:28
重磅:俄罗斯正式开通图们江大桥!德国将向乌克兰提供情报

重磅:俄罗斯正式开通图们江大桥!德国将向乌克兰提供情报

项鹏飞
2026-09-07 20:55:21
美网官方把郑钦文连续0-5翻盘,比成乔丹G6和伍兹周日

美网官方把郑钦文连续0-5翻盘,比成乔丹G6和伍兹周日

懂球帝
2026-09-08 01:17:40
昔日巴萨“子弹”退役:86场20球 曾上演帽子戏法 梅西3助攻

昔日巴萨“子弹”退役:86场20球 曾上演帽子戏法 梅西3助攻

叶青足球世界
2026-09-07 15:12:40
9月7日,人社部与财政部正式出炉关于2026年调整退休人员基本养老金的通知文件了吗?

9月7日,人社部与财政部正式出炉关于2026年调整退休人员基本养老金的通知文件了吗?

扶苏聊历史
2026-09-07 14:06:15
中国女篮VS意大利,开球时间确定,输球打欧亚冠军,张子宇成难题

中国女篮VS意大利,开球时间确定,输球打欧亚冠军,张子宇成难题

体育大学僧
2026-09-07 10:58:29
不怕秋老虎,就怕晚白露!今年是晚白露,接下来2个月,是热是冷

不怕秋老虎,就怕晚白露!今年是晚白露,接下来2个月,是热是冷

周哥一影视
2026-09-07 11:04:02
随着郑钦文2-0斯瓦泰克,诞生2个不可思议,排名升前60,创造历史

随着郑钦文2-0斯瓦泰克,诞生2个不可思议,排名升前60,创造历史

侃球熊弟
2026-09-08 00:46:05
伟伟道来 | 美伊三轮冲突,油价为什么没有冲上100美元

伟伟道来 | 美伊三轮冲突,油价为什么没有冲上100美元

经济观察报
2026-09-07 15:38:12
官方通报!郭德纲改编红歌事件结案,两家企业合计罚近 65 万

官方通报!郭德纲改编红歌事件结案,两家企业合计罚近 65 万

乡野异闻录
2026-09-07 18:38:39
曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

可达鸭面面观
2026-09-06 15:14:05
上海男子飞美国航班上挥拳打人,落地被捕次日凌晨全家遭遣返,一拳打没了全家美国签证

上海男子飞美国航班上挥拳打人,落地被捕次日凌晨全家遭遣返,一拳打没了全家美国签证

Mr王的饭后茶
2026-09-07 20:07:14
湖南自媒体人因文获刑:为弱者发声是否触及刑法红线?

湖南自媒体人因文获刑:为弱者发声是否触及刑法红线?

兵叔评说
2026-09-07 15:59:17
周三、四陪上司睡,周五上海睡丈夫,朱某真面目被老公揭开:下流

周三、四陪上司睡,周五上海睡丈夫,朱某真面目被老公揭开:下流

江山挥笔
2026-09-06 15:51:56
特斯拉新车官宣:9月18日,国内亮相

特斯拉新车官宣:9月18日,国内亮相

科技堡垒
2026-09-07 11:39:20
特朗普真的去世了?9月4日,社交平台上又一次传出"特朗普已经死亡、白宫隐瞒消息"的说法!

特朗普真的去世了?9月4日,社交平台上又一次传出"特朗普已经死亡、白宫隐瞒消息"的说法!

扶苏聊历史
2026-09-07 17:39:23
快观察 泽连斯基“忙碌的一天”:与美特使首轮谈3小时,还密商“冬季方案”

快观察 泽连斯基“忙碌的一天”:与美特使首轮谈3小时,还密商“冬季方案”

上观新闻
2026-09-07 15:44:19
“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

新民周刊
2026-09-07 16:55:42
美网超级冷门!郑钦文2-0晋级八强,奖金532万,斯瓦泰克被打崩溃

美网超级冷门!郑钦文2-0晋级八强,奖金532万,斯瓦泰克被打崩溃

侃球熊弟
2026-09-08 01:44:47
凤姐评论景甜,太敢说了……

凤姐评论景甜,太敢说了……

麦杰逊
2026-09-07 11:33:34
2026-09-08 03:23:00
星海情报局 incentive-icons
星海情报局
关注“中国制造”的星辰大海
1431文章数 2031关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

房产
游戏
手机
旅游
军事航空

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

鸣潮费大劲捏出来的清冷师尊,咋就变成了哦齁剑仙?

手机要闻

九月机圈大战!小米发布18 Fold、华为全新三折叠亮相,苹果紧随其后

旅游要闻

走进合川涞滩古镇 探寻三江之畔的人文底蕴

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版