网易首页 > 网易号 > 正文 申请入驻

Kimi K3 深度解读,国产开源 AI 逼近国际巨头

0
分享至

热点分析 · Kimi K3

Kimi K3深度分析2.8万亿参数登顶编程榜,国产开源追到门口了

全球最大开源模型 · 前端编程Arena全球第一
实测3D惊艳但速度拉胯 · 月之暗面的IPO前哨战

喜欢文章,想了解更多相关知识的朋友欢迎关注我

AI前沿模型分析



先说结论:能力上限高,但体验还没跟上

7月16日深夜,月之暗面在WAIC开幕前夜扔出了一颗炸弹——Kimi K3,2.8万亿参数,全球最大开源模型,前端编程盲测世界第一。

消息一出,智谱市值当天蒸发了2053亿港币,跌了28%。Minimax也跟着跌了15.6%。信号很明确:基础大模型的竞争远没到终局,落后和领先都可能是暂时的。

但别急着吹。我把官方技术博客、第三方评测、各路开发者实测全看了一遍,结论比较克制:K3确实是月之暗面迄今最强的模型,最有说服力的进步不是"聊天更聪明",而是把代码、研究、文档和工具调用串成了一条更长、更稳定的任务链。它有资格进入全球第一梯队,但速度、输出长度、成本和事实可靠性,决定了它并不适合所有场景。

这篇文章就来拆解K3到底强在哪、弱在哪、值不值得用。

一、2.8万亿参数:全球最大开源模型的分量

先看基本参数。

总参数:2.8万亿(2.8T)

架构:MoE混合专家,896个专家,每次激活16个

上下文窗口:100万Token(约75万字)

模态:原生支持文本+图像输入,文本输出

思考模式:始终开启,默认max档

权重开放:2026年7月27日前发布完整权重

2.8万亿参数是什么概念?目前全球开源模型里最大的。此前Kimi自己的K2是1万亿级别,DeepSeek V3是6710亿。K3直接把开源模型的天花板拉到了近3万亿。

但参数大不等于一切。月之暗面自己也说了,K3的研发重点不是简单堆参数,而是通过架构、训练方法和数据配方的协同优化,把规模优势转化为能力提升。这话不是吹——他们确实在架构上做了真东西,后面细说。

有个细节值得一提:K3发布时的官方宣传视频,是K3自己剪辑的。它在56段原始素材里完成了选片、卡点、动作匹配和音频处理。月之暗面用这种方式传递了一个信号——它能做出完整的、让人满意的复杂作品。



K3与主流模型参数规模对比,全球首个3T级开源模型

二、架构创新:KDA+AttnRes,不是只靠堆参数

K3能处理100万Token上下文还能保持质量,靠的不是暴力堆算力,而是两个自研的架构创新。

第一个叫KDA(Kimi Delta Attention)。传统Transformer的注意力计算复杂度是O(n²)——上下文越长,计算量呈平方级增长。这就是为什么很多模型号称支持长上下文,实际用起来要么慢得要死,要么后半段就"失忆"了。KDA的核心思路是把注意力计算线性化,通过细粒度逐通道门控机制,选择性地聚焦关键信息,不再对所有位置做全量计算。

实测效果:在100万Token全量加载场景下,解码速度最高提升6.3倍。这意味着百万Token上下文不再只是纸面参数——它是真的能用的。

第二个叫AttnRes(Attention Residuals)。传统残差连接以固定权重累加各层输出,每层贡献固定。AttnRes用学习到的、依赖输入的注意力机制取代固定权重——模型自己决定从前面各层提取多少信息,像一个"动态记忆管理器"。

关键数据:额外训练成本不到2%,训练效率提升约25%。在大规模MoE模型中,训练成本是限制规模发展的核心瓶颈,能在几乎不增加预算的情况下提升训练效率,意味着同样算力可以训练出更强的模型。

再加上Stable LatentMoE框架——896个专家里只激活16个,激活比例不到2%,在超大参数量和推理成本之间实现了平衡。整体扩展效率比K2提升约2.5倍。



KDA线性注意力+AttnRes注意力残差+MoE稀疏激活

说人话:K3不是靠蛮力堆参数,而是在"怎么让信息在超长文本和超深网络里高效流动"这个问题上做了真正的架构创新。这是它和很多"只堆参数"的模型本质区别。

三、前端编程Arena登顶:1679分力压Claude和GPT

这是K3发布后传播最广的一个数据。

Frontend Code Arena是加州大学伯克利分校研究人员创建的第三方盲测平台。规则很简单:同一道前端编程任务交给两个匿名模型,用户体验两个结果后投票,投票完成才公布模型身份。累计约48万次投票。

Kimi K3以1679分排名全球第一,超过了Claude Fable 5的1631分和GPT-5.6 Sol的1618分。在7个前端编程细分领域中,K3拿下6个第一——品牌与营销、基于参考的设计、数据与分析、消费产品、模拟、内容创建工具,全部榜首。

从上一代K2.6的第18名直接跃升到第1名,这个飞跃幅度确实惊人。

但得说清楚一个事:Frontend Code Arena考察的是前端编程能力,不是综合智能。K3的综合智能指数(Artificial Analysis)是57分,整体表现仍落后于Claude Fable 5和GPT-5.6 Sol这两个最强闭源模型。月之暗面在官方博客里也坦诚写了这一点。

更准确的说法是:K3在前端编程这个垂直赛道上做到了全球第一,综合能力进入第一梯队但还不是最强。这已经是非常大的突破了——一年前国产开源模型在这个榜单上连前20都进不去。



K3以1679分登顶前端编程Arena,7个细分领域6个第一

四、实测表现:3D生成惊艳,速度是最大短板

K3正式上线不到24小时,各路开发者的实测就密集到可以按场景分类了。出现频率最高的三个测试方向:3D交互生成、前端编程、视觉设计。

3D生成本是最突出的亮点。有人让它用Three.js生成一个可探索的微型城市,要求高低错落的建筑、街道、树木、河流和昼夜循环系统。K3的画面配色和谐,设计有心思,但细节不够到位——会出现树和路灯挡在路中间的情况。

科技博主Chris在发布前就拿到了匿名测试版,让K3和GPT-5.6 Sol分别做体素死星壕沟飞行。他的评价是GPT-5.6光照和特效更好,但K3画面更流畅。正式发布后,他又用K3构建了一个CS:GO×Portal克隆游戏,三轮对话、约60万Token,按API定价算只花了3.24美元。他配文:"免费独立游戏开发的时代比你想象的还要近。"

有人用樱花盆景测试SVG视觉生成,发现K3在树干扭曲、分层树冠等细节上甚至比Fable 5更贴合要求。水流效果也能模拟出逼真的水波纹,保持物理连贯性。

但速度是绕不过去的硬伤。同一场景生成时间约为GPT-5.6 Sol的两到三倍。瀑布场景近半小时,视频剪辑近两小时。Artificial Analysis测得K3输出约62 tokens/秒,低于同类模型约70 tokens/秒的中位水平。

关于速度慢的原因,官方未作说明。可能的因素包括:2.8万亿参数推理计算量大、max档位默认开启深度思考、推理基础设施尚未充分扩容。后续开放low和high档位后可能会有所改善。



3D交互生成能力突出,但生成时间是竞品的2-3倍

五、K3 vs GPT-5.6 Sol:Sol赢在可靠,K3赢在审美

被用来和海外最强旗舰对比,K3实际表现到底怎么样?有媒体做了三个场景的正面PK,同一套提示词分别喂给两个模型。

场景一:3D迷宫游戏。要求第一人称视角、WASD控制、小地图、火炬照明、60秒倒计时。GPT-5.6 Sol干活非常快,K3还在加载时Sol已经能开始玩了。但K3交付的成果整体视觉带有像素风,火炬和墙面纹理更有设计感,光线更暗,可玩性更高。Sol快且稳,K3慢但有辨识度。

场景二:杯子倒水物理仿真。这道题考察数学建模、物理直觉和图形学处理。GPT-5.6 Sol交了合格答案——水粒子老老实实待在杯子里,倒水从杯口流出,符合物理规律。K3在这道题上"翻车"了:装水时水粒子穿透杯壁漏出去了,倒水时水从杯底流出。经提醒后K3做出了改正,但改得也很慢。这个场景Sol完胜。

场景三:尼亚加拉大瀑布全景。GPT-5.6 Sol功能完整但有点"敷衍"——提示词要的玻璃质感绿水和透光白色水幕,拿到手的是一大片白色粒子糊在悬崖面上,提示词里提到的彩虹也没出现。K3更用心:画面更精美,彩虹没落下,水的渲染更接近真实瀑布水汽氤氲的视觉体验。当然,K3花了近半小时。这个场景K3胜在审美。

三轮测试的结论:要又快又稳的成品选Sol,要视觉上有辨识度的成品选K3,但得付出两到三倍的时间成本。



三轮PK:Sol赢在速度和可靠性,K3赢在视觉审美

六、定价策略:不便宜,但复杂任务可能值

K3的API定价比上一代涨了不少,先看数字。

国内API:输入2元/百万Token(缓存命中),20元/百万Token(未命中),输出100元/百万Token

国际API:输入3美元/百万Token,输出15美元/百万Token,缓存命中0.3美元

对比GPT-5.6 Sol:输入5美元,输出30美元

对比Claude Fable 5:输入10美元,输出50美元

跟海外旗舰比,K3确实便宜——输出单价折合不到14美元,比GPT-5.6 Sol便宜一半,比Fable 5便宜三分之二。

但跟自家上一代比,K3的API输入价格涨了3倍多,输出价格涨了近4倍。这个涨幅相当激进。

关键问题不是单价贵不贵,而是完成一次可靠交付需要多少总成本。如果任务只是摘要和改写,这个价格缺乏优势。但如果一次调用能完成过去需要多轮模型切换、人工检索和反复修改的复杂任务——比如让K3先查50份材料,列出矛盾证据,生成数据表和图表,再写成不同平台版本——单位"成功任务"的成本反而可能合理。

还有个隐形成本:K3"话多"。完成Artificial Analysis整套评测用了约1.3亿输出Token,接近同类中位数6300万的两倍。相比K2.6,Token效率已有提升(完成同样九项任务,K3约消耗132M输出Token,K2.6约消耗166M,减少约21%),但和市场横向比较仍然偏冗长。这会同时影响阅读体验、延迟和账单。



K3 API定价:比海外旗舰便宜,但比自家上代涨了3-4倍

七、局限短板:官方自己都承认的三个问题

月之暗面在官方博客里坦诚地写了三个局限,这点值得点赞——很多模型发布时只报喜不报忧。

第一,对历史思考内容敏感。如果Agent框架没有完整回传历史,或在一个进行中的会话里从其他模型切换到K3,生成质量可能明显波动。换句话说,100万窗口提供了容量,但真正决定体验的仍是上下文管理和Agent框架是否适配。别指望随便接个框架就能跑出最佳效果。

第二,训练偏向长程高难任务,简单问题容易"过度主动"。面对小问题或模糊意图时,K3会替用户做出意外决定。对于自动发邮件、改数据库、部署代码等高风险动作,这不是性格问题,而是权限控制问题。使用K3做Agent时,必须明确写出可执行范围、必须确认的动作、禁止访问的资源和失败后的停止条件。

第三,与Fable 5和GPT-5.6 Sol相比,在用户体验上仍有差距。

除了官方承认的,第三方评测还暴露了更多问题:

速度慢——前面说了,62 tokens/秒,低于行业中位数

幻觉率高——准确率从K2.6的33%提升到46%,但幻觉率也从39%上升到51%。模型回答了更多问题,但也更愿意在不知道时给出答案。用于新闻、法律、医疗、金融时,来源核验仍是硬要求

物理仿真不够可靠——杯子倒水测试翻车说明,K3在物理直觉方面还不是一次到位,需要多轮提醒修正

本地部署门槛极高——2.8万亿参数的完整权重,全精度约1.7TB,2-bit量化约950GB-1TB,最激进的1.8-bit压缩也要650-700GB。512GB的Mac Studio都不够。月之暗面自己建议用64+加速器的超节点配置,这只有企业数据中心才有



速度慢、话多、幻觉率高、部署门槛极高

八、市场影响:估值飙升,开源改写格局

K3不只是一次产品更新,它的发布节点和背后的商业故事同样值得关注。

融资和估值方面,月之暗面近半年动作频频。2025年12月完成C轮5亿美元融资,投后估值43亿美元。今年5月完成约20亿美元融资,投后估值突破200亿美元。6月底又启动新一轮,投前估值升至315亿美元——年内第6轮融资。

收入增速方面,3月Kimi的ARR(年度经常性收入)突破1亿美元,6月中旬达到3亿美元,三个月增至3倍。API贡献了Kimi总收入的七成以上,海外API收入已超过国内。个人订阅用户1月支付订单数环比增长8280%,2月再涨123.8%,进入Stripe全球榜单前十,成为首个闯入前十的中国AGI产品。

竞争格局方面,K3发布当天智谱市值蒸发28%,这不是巧合。月之暗面试图构建的路径是:用开源模型吸引全球开发者,通过开发者工具进入真实工作流,再将对稳定性、速度和服务要求更高的用户转化为API客户。理论上可以形成飞轮效应——模型能力带来开源影响力,开源带来开发者,开发者转化为API收入,收入再支持训练和推理投入。

开源意义方面,K3计划7月27日前发布完整权重。即使大多数人没有能力本地部署,开放权重的意义依然重大——它消除了"模型被下架"的依赖风险,允许研究者检视、微调和改进,让高校和小公司也能在先进模型基础上构建应用。这是开源生态第一次在长程代码和知识工作上逼近最强闭源产品。

还有一个不能忽视的背景:月之暗面正在筹备港股IPO。K3的发布不只是一轮产品更新,也像一次上市前的能力宣示。但IPO最终检验的不会是榜单成绩,还有3亿美元ARR能否持续、客户是否留存、推理成本能否控制,以及技术优势能保持多久。



估值315亿美元,ARR三个月增至3倍,IPO前哨战

K3到底适合谁用

说了这么多,落到实际——K3适合什么场景,不适合什么场景?

适合的场景:

大型代码仓库理解和修改——K3的长程编程能力是核心卖点,能读懂大型仓库、操作终端、修改代码、运行测试、根据结果继续修正

复杂研究任务——先查大量材料,列出矛盾证据,生成数据表和图表,写成不同版本交付物

前端开发与视觉迭代——上传设计截图,让K3根据视觉反馈持续优化页面,形成"视觉在环路"的开发闭环

3D交互内容生成——Three.js微型城市、3D游戏、物理仿真(但需要多轮提醒修正)

图文混合交付——生成包含表格、图表、幻灯片和交互式网站的综合成果

不适合的场景:

日常问答和短文润色——K3偏冗长,简单问题也容易"过度主动",用K2.6或专用小模型更划算

低延迟客服——速度是硬伤,62 tokens/秒的输出速度不适合实时对话场景

大规模便宜调用——价格涨了3-4倍,大规模调用成本不低

事实可靠性要求极高的场景——幻觉率51%,新闻、法律、医疗、金融必须配合来源核验

一句话建议

不要立刻把所有工作迁移到K3。挑选三个真实任务进行测试:一个大型代码修改、一个多来源研究、一个图文混合交付。记录成功率、人工接管次数、总耗时和总成本,再决定是否替换现有模型。

K3已经进入第一梯队。接下来真正决定它位置的,不是下一张榜单,而是能否在真实工作里更稳定地把任务做完。

几个值得关注的后续节点

7月27日——完整模型权重发布。届时开发者可以下载、研究、微调。社区能否以可接受成本部署,才是"开放"价值的真正检验。

low和high思考档位——目前K3默认max档,后续会增加低档和高档模式。速度问题可能会随之改善。

港股IPO进程——K3是上市前的能力宣示,但IPO检验的是持续收入和成本控制,不是榜单成绩。

智谱和Minimax的反扑——K3发布当天智谱跌了28%,但智谱的ARR已达10亿美元,半年增长15倍。竞争远没到终局。

社区独立评测——目前很多数据来自月之暗面自己的评测,完整权重发布后,研究社区的独立验证会给出更客观的画像。

总结

把时间轴拉到18个月前,当时国产大模型的话题还是"能不能追上GPT-4"。现在K3在前端编程盲测上力压Claude Fable 5和GPT-5.6 Sol登顶全球第一,综合能力稳定超越GPT-5.5和Opus 4.8。

国产开源与海外旗舰的差距,至少已经大幅压缩了。

但K3给人的整体感觉是:能力上限高,但体验还没完全跟上。3D和视觉生成能力最突出,前端UI设计水准接近Fable 5,编码能力强但还没超过最强闭源模型,速度是最大短板。它不是"所有任务的新默认",而是复杂任务的新候选。

月之暗面用K3证明了:中国开源大模型正在从"单点亮相"走向"群体突破"。接下来真正重要的不是下一个参数纪录,而是开源模型能否在真实工作流中持续创造价值——从榜单第一走向日常可靠。

这一点,K3开了个好头,但路还很长。

AI前沿模型分析 · Kimi K3专题

2026年7月

喜欢文章,想了解更多相关知识的朋友欢迎关注我

声明:内容由AI生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“小宝探花”案件回顾:疯狂约会上百名女性,一人拍摄,一人贩卖

“小宝探花”案件回顾:疯狂约会上百名女性,一人拍摄,一人贩卖

就一点
2025-12-30 21:32:02
仅21岁广西姑娘凌晨去世,男友三次改婚期,最后聊天记录看哭全网

仅21岁广西姑娘凌晨去世,男友三次改婚期,最后聊天记录看哭全网

青杉依旧啊啊
2026-10-02 16:04:23
俄军钻26公里管道偷袭,滑板车代步潜伏6天,结局被4人乌军一锅端

俄军钻26公里管道偷袭,滑板车代步潜伏6天,结局被4人乌军一锅端

老马拉车莫少装
2026-09-28 23:02:32
年轻的福耀科技大学要学会辨别院士的真假

年轻的福耀科技大学要学会辨别院士的真假

刁博
2026-10-03 00:46:32
大姑姐请全家聚餐我故意不带卡,结账笑着问我:弟妹,怎么不买单

大姑姐请全家聚餐我故意不带卡,结账笑着问我:弟妹,怎么不买单

匹夫来搞笑
2026-10-02 18:39:01
没想到,郑钦文回国短短几小时后,令人担心的事还是发生了

没想到,郑钦文回国短短几小时后,令人担心的事还是发生了

博卜talk
2026-09-19 05:09:34
阿尔特塔偷着乐!曼联 5800 万巨星彻底失宠!阿森纳趁机抄底抢人

阿尔特塔偷着乐!曼联 5800 万巨星彻底失宠!阿森纳趁机抄底抢人

奶盖熊本熊
2026-10-03 07:58:36
“甘油三酯大户”被揪出,提醒:50岁后,这7种食物建议少吃

“甘油三酯大户”被揪出,提醒:50岁后,这7种食物建议少吃

岐黄传人孙大夫
2026-06-18 20:35:05
国庆节丨传统文化润假期 解锁假日新体验

国庆节丨传统文化润假期 解锁假日新体验

国际在线
2026-10-02 20:34:28
欧文正式回应马刺招募!湖人马刺二选一,联手文班还是留守独行

欧文正式回应马刺招募!湖人马刺二选一,联手文班还是留守独行

篮球小方
2026-10-03 07:40:18
刚刚!苹果2款新品突然上架,298 元起!

刚刚!苹果2款新品突然上架,298 元起!

科技堡垒
2026-10-02 10:03:33
为什么这几年感觉,韩国越来越像大型精神病院了?

为什么这几年感觉,韩国越来越像大型精神病院了?

叹为观止易
2026-10-03 07:47:27
针织裙不但保暖效果好,优点也是很明显的

针织裙不但保暖效果好,优点也是很明显的

穿的像个人样
2026-10-02 08:46:47
吴宜泽:和袁思俊会师决赛就圆满了!直言小特很强但自己有备而来

吴宜泽:和袁思俊会师决赛就圆满了!直言小特很强但自己有备而来

排球黄金眼
2026-10-03 00:28:51
40岁郑恺大秀腹肌,这个肌肉在普通人中算什么水平?

40岁郑恺大秀腹肌,这个肌肉在普通人中算什么水平?

小方说跑步
2026-10-02 15:35:03
“足够先进,可以展示”

“足够先进,可以展示”

都市快报橙柿互动
2026-10-01 18:13:31
不再替全球培养对手!三条铁令落地,方博梁靖崑被逼入绝境

不再替全球培养对手!三条铁令落地,方博梁靖崑被逼入绝境

策前论
2026-08-17 14:25:56
2.9万人!非农“爆冷”,黄金瞬间拉升40美元,美联储10月剧本已被改写?

2.9万人!非农“爆冷”,黄金瞬间拉升40美元,美联储10月剧本已被改写?

汇通网
2026-10-02 20:51:07
“大明湖最有腔调爷爷”国庆夜现身大明湖畔,再现火爆全网的萨克斯版《小苹果》,还奏了一曲《我爱你中国》,有外地粉丝特意来蹲他,本人回应

“大明湖最有腔调爷爷”国庆夜现身大明湖畔,再现火爆全网的萨克斯版《小苹果》,还奏了一曲《我爱你中国》,有外地粉丝特意来蹲他,本人回应

极目新闻
2026-10-01 23:10:19
菲律宾为什么在南海越闹越孤立?

菲律宾为什么在南海越闹越孤立?

小眼睛小世界
2026-10-03 07:30:11
2026-10-03 08:24:49
欧阳让你懂AI
欧阳让你懂AI
每天分享一些AI的实用小知识
268文章数 330关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

男子错订机票3分钟内申请退款被扣90%手续费 多方回应

头条要闻

男子错订机票3分钟内申请退款被扣90%手续费 多方回应

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

潘玮柏老婆被猜怀二胎 中秋vlog露馅

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
房产
手机
本地
军事航空

艺术要闻

法国画家德尔芬笔下的女子,肌肤白皙光泽诱人,美到惊艳,看一眼就沦陷!

房产要闻

三亚楼市炸了!首个空中泳池平层+CBD独一份洋房同时爆出!

手机要闻

三星Exynos 2700或已进入量产阶段 有望让Galaxy产品线进一步减少对骁龙依赖

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

军事要闻

胡塞武装:24小时内沙特空袭也门47次

无障碍浏览 进入关怀版