网易首页 > 网易号 > 正文 申请入驻

Kimi K3 深度解读,国产开源 AI 逼近国际巨头

0
分享至

热点分析 · Kimi K3

Kimi K3深度分析2.8万亿参数登顶编程榜,国产开源追到门口了

全球最大开源模型 · 前端编程Arena全球第一
实测3D惊艳但速度拉胯 · 月之暗面的IPO前哨战

喜欢文章,想了解更多相关知识的朋友欢迎关注我

AI前沿模型分析



先说结论:能力上限高,但体验还没跟上

7月16日深夜,月之暗面在WAIC开幕前夜扔出了一颗炸弹——Kimi K3,2.8万亿参数,全球最大开源模型,前端编程盲测世界第一。

消息一出,智谱市值当天蒸发了2053亿港币,跌了28%。Minimax也跟着跌了15.6%。信号很明确:基础大模型的竞争远没到终局,落后和领先都可能是暂时的。

但别急着吹。我把官方技术博客、第三方评测、各路开发者实测全看了一遍,结论比较克制:K3确实是月之暗面迄今最强的模型,最有说服力的进步不是"聊天更聪明",而是把代码、研究、文档和工具调用串成了一条更长、更稳定的任务链。它有资格进入全球第一梯队,但速度、输出长度、成本和事实可靠性,决定了它并不适合所有场景。

这篇文章就来拆解K3到底强在哪、弱在哪、值不值得用。

一、2.8万亿参数:全球最大开源模型的分量

先看基本参数。

总参数:2.8万亿(2.8T)

架构:MoE混合专家,896个专家,每次激活16个

上下文窗口:100万Token(约75万字)

模态:原生支持文本+图像输入,文本输出

思考模式:始终开启,默认max档

权重开放:2026年7月27日前发布完整权重

2.8万亿参数是什么概念?目前全球开源模型里最大的。此前Kimi自己的K2是1万亿级别,DeepSeek V3是6710亿。K3直接把开源模型的天花板拉到了近3万亿。

但参数大不等于一切。月之暗面自己也说了,K3的研发重点不是简单堆参数,而是通过架构、训练方法和数据配方的协同优化,把规模优势转化为能力提升。这话不是吹——他们确实在架构上做了真东西,后面细说。

有个细节值得一提:K3发布时的官方宣传视频,是K3自己剪辑的。它在56段原始素材里完成了选片、卡点、动作匹配和音频处理。月之暗面用这种方式传递了一个信号——它能做出完整的、让人满意的复杂作品。



K3与主流模型参数规模对比,全球首个3T级开源模型

二、架构创新:KDA+AttnRes,不是只靠堆参数

K3能处理100万Token上下文还能保持质量,靠的不是暴力堆算力,而是两个自研的架构创新。

第一个叫KDA(Kimi Delta Attention)。传统Transformer的注意力计算复杂度是O(n²)——上下文越长,计算量呈平方级增长。这就是为什么很多模型号称支持长上下文,实际用起来要么慢得要死,要么后半段就"失忆"了。KDA的核心思路是把注意力计算线性化,通过细粒度逐通道门控机制,选择性地聚焦关键信息,不再对所有位置做全量计算。

实测效果:在100万Token全量加载场景下,解码速度最高提升6.3倍。这意味着百万Token上下文不再只是纸面参数——它是真的能用的。

第二个叫AttnRes(Attention Residuals)。传统残差连接以固定权重累加各层输出,每层贡献固定。AttnRes用学习到的、依赖输入的注意力机制取代固定权重——模型自己决定从前面各层提取多少信息,像一个"动态记忆管理器"。

关键数据:额外训练成本不到2%,训练效率提升约25%。在大规模MoE模型中,训练成本是限制规模发展的核心瓶颈,能在几乎不增加预算的情况下提升训练效率,意味着同样算力可以训练出更强的模型。

再加上Stable LatentMoE框架——896个专家里只激活16个,激活比例不到2%,在超大参数量和推理成本之间实现了平衡。整体扩展效率比K2提升约2.5倍。



KDA线性注意力+AttnRes注意力残差+MoE稀疏激活

说人话:K3不是靠蛮力堆参数,而是在"怎么让信息在超长文本和超深网络里高效流动"这个问题上做了真正的架构创新。这是它和很多"只堆参数"的模型本质区别。

三、前端编程Arena登顶:1679分力压Claude和GPT

这是K3发布后传播最广的一个数据。

Frontend Code Arena是加州大学伯克利分校研究人员创建的第三方盲测平台。规则很简单:同一道前端编程任务交给两个匿名模型,用户体验两个结果后投票,投票完成才公布模型身份。累计约48万次投票。

Kimi K3以1679分排名全球第一,超过了Claude Fable 5的1631分和GPT-5.6 Sol的1618分。在7个前端编程细分领域中,K3拿下6个第一——品牌与营销、基于参考的设计、数据与分析、消费产品、模拟、内容创建工具,全部榜首。

从上一代K2.6的第18名直接跃升到第1名,这个飞跃幅度确实惊人。

但得说清楚一个事:Frontend Code Arena考察的是前端编程能力,不是综合智能。K3的综合智能指数(Artificial Analysis)是57分,整体表现仍落后于Claude Fable 5和GPT-5.6 Sol这两个最强闭源模型。月之暗面在官方博客里也坦诚写了这一点。

更准确的说法是:K3在前端编程这个垂直赛道上做到了全球第一,综合能力进入第一梯队但还不是最强。这已经是非常大的突破了——一年前国产开源模型在这个榜单上连前20都进不去。



K3以1679分登顶前端编程Arena,7个细分领域6个第一

四、实测表现:3D生成惊艳,速度是最大短板

K3正式上线不到24小时,各路开发者的实测就密集到可以按场景分类了。出现频率最高的三个测试方向:3D交互生成、前端编程、视觉设计。

3D生成本是最突出的亮点。有人让它用Three.js生成一个可探索的微型城市,要求高低错落的建筑、街道、树木、河流和昼夜循环系统。K3的画面配色和谐,设计有心思,但细节不够到位——会出现树和路灯挡在路中间的情况。

科技博主Chris在发布前就拿到了匿名测试版,让K3和GPT-5.6 Sol分别做体素死星壕沟飞行。他的评价是GPT-5.6光照和特效更好,但K3画面更流畅。正式发布后,他又用K3构建了一个CS:GO×Portal克隆游戏,三轮对话、约60万Token,按API定价算只花了3.24美元。他配文:"免费独立游戏开发的时代比你想象的还要近。"

有人用樱花盆景测试SVG视觉生成,发现K3在树干扭曲、分层树冠等细节上甚至比Fable 5更贴合要求。水流效果也能模拟出逼真的水波纹,保持物理连贯性。

但速度是绕不过去的硬伤。同一场景生成时间约为GPT-5.6 Sol的两到三倍。瀑布场景近半小时,视频剪辑近两小时。Artificial Analysis测得K3输出约62 tokens/秒,低于同类模型约70 tokens/秒的中位水平。

关于速度慢的原因,官方未作说明。可能的因素包括:2.8万亿参数推理计算量大、max档位默认开启深度思考、推理基础设施尚未充分扩容。后续开放low和high档位后可能会有所改善。



3D交互生成能力突出,但生成时间是竞品的2-3倍

五、K3 vs GPT-5.6 Sol:Sol赢在可靠,K3赢在审美

被用来和海外最强旗舰对比,K3实际表现到底怎么样?有媒体做了三个场景的正面PK,同一套提示词分别喂给两个模型。

场景一:3D迷宫游戏。要求第一人称视角、WASD控制、小地图、火炬照明、60秒倒计时。GPT-5.6 Sol干活非常快,K3还在加载时Sol已经能开始玩了。但K3交付的成果整体视觉带有像素风,火炬和墙面纹理更有设计感,光线更暗,可玩性更高。Sol快且稳,K3慢但有辨识度。

场景二:杯子倒水物理仿真。这道题考察数学建模、物理直觉和图形学处理。GPT-5.6 Sol交了合格答案——水粒子老老实实待在杯子里,倒水从杯口流出,符合物理规律。K3在这道题上"翻车"了:装水时水粒子穿透杯壁漏出去了,倒水时水从杯底流出。经提醒后K3做出了改正,但改得也很慢。这个场景Sol完胜。

场景三:尼亚加拉大瀑布全景。GPT-5.6 Sol功能完整但有点"敷衍"——提示词要的玻璃质感绿水和透光白色水幕,拿到手的是一大片白色粒子糊在悬崖面上,提示词里提到的彩虹也没出现。K3更用心:画面更精美,彩虹没落下,水的渲染更接近真实瀑布水汽氤氲的视觉体验。当然,K3花了近半小时。这个场景K3胜在审美。

三轮测试的结论:要又快又稳的成品选Sol,要视觉上有辨识度的成品选K3,但得付出两到三倍的时间成本。



三轮PK:Sol赢在速度和可靠性,K3赢在视觉审美

六、定价策略:不便宜,但复杂任务可能值

K3的API定价比上一代涨了不少,先看数字。

国内API:输入2元/百万Token(缓存命中),20元/百万Token(未命中),输出100元/百万Token

国际API:输入3美元/百万Token,输出15美元/百万Token,缓存命中0.3美元

对比GPT-5.6 Sol:输入5美元,输出30美元

对比Claude Fable 5:输入10美元,输出50美元

跟海外旗舰比,K3确实便宜——输出单价折合不到14美元,比GPT-5.6 Sol便宜一半,比Fable 5便宜三分之二。

但跟自家上一代比,K3的API输入价格涨了3倍多,输出价格涨了近4倍。这个涨幅相当激进。

关键问题不是单价贵不贵,而是完成一次可靠交付需要多少总成本。如果任务只是摘要和改写,这个价格缺乏优势。但如果一次调用能完成过去需要多轮模型切换、人工检索和反复修改的复杂任务——比如让K3先查50份材料,列出矛盾证据,生成数据表和图表,再写成不同平台版本——单位"成功任务"的成本反而可能合理。

还有个隐形成本:K3"话多"。完成Artificial Analysis整套评测用了约1.3亿输出Token,接近同类中位数6300万的两倍。相比K2.6,Token效率已有提升(完成同样九项任务,K3约消耗132M输出Token,K2.6约消耗166M,减少约21%),但和市场横向比较仍然偏冗长。这会同时影响阅读体验、延迟和账单。



K3 API定价:比海外旗舰便宜,但比自家上代涨了3-4倍

七、局限短板:官方自己都承认的三个问题

月之暗面在官方博客里坦诚地写了三个局限,这点值得点赞——很多模型发布时只报喜不报忧。

第一,对历史思考内容敏感。如果Agent框架没有完整回传历史,或在一个进行中的会话里从其他模型切换到K3,生成质量可能明显波动。换句话说,100万窗口提供了容量,但真正决定体验的仍是上下文管理和Agent框架是否适配。别指望随便接个框架就能跑出最佳效果。

第二,训练偏向长程高难任务,简单问题容易"过度主动"。面对小问题或模糊意图时,K3会替用户做出意外决定。对于自动发邮件、改数据库、部署代码等高风险动作,这不是性格问题,而是权限控制问题。使用K3做Agent时,必须明确写出可执行范围、必须确认的动作、禁止访问的资源和失败后的停止条件。

第三,与Fable 5和GPT-5.6 Sol相比,在用户体验上仍有差距。

除了官方承认的,第三方评测还暴露了更多问题:

速度慢——前面说了,62 tokens/秒,低于行业中位数

幻觉率高——准确率从K2.6的33%提升到46%,但幻觉率也从39%上升到51%。模型回答了更多问题,但也更愿意在不知道时给出答案。用于新闻、法律、医疗、金融时,来源核验仍是硬要求

物理仿真不够可靠——杯子倒水测试翻车说明,K3在物理直觉方面还不是一次到位,需要多轮提醒修正

本地部署门槛极高——2.8万亿参数的完整权重,全精度约1.7TB,2-bit量化约950GB-1TB,最激进的1.8-bit压缩也要650-700GB。512GB的Mac Studio都不够。月之暗面自己建议用64+加速器的超节点配置,这只有企业数据中心才有



速度慢、话多、幻觉率高、部署门槛极高

八、市场影响:估值飙升,开源改写格局

K3不只是一次产品更新,它的发布节点和背后的商业故事同样值得关注。

融资和估值方面,月之暗面近半年动作频频。2025年12月完成C轮5亿美元融资,投后估值43亿美元。今年5月完成约20亿美元融资,投后估值突破200亿美元。6月底又启动新一轮,投前估值升至315亿美元——年内第6轮融资。

收入增速方面,3月Kimi的ARR(年度经常性收入)突破1亿美元,6月中旬达到3亿美元,三个月增至3倍。API贡献了Kimi总收入的七成以上,海外API收入已超过国内。个人订阅用户1月支付订单数环比增长8280%,2月再涨123.8%,进入Stripe全球榜单前十,成为首个闯入前十的中国AGI产品。

竞争格局方面,K3发布当天智谱市值蒸发28%,这不是巧合。月之暗面试图构建的路径是:用开源模型吸引全球开发者,通过开发者工具进入真实工作流,再将对稳定性、速度和服务要求更高的用户转化为API客户。理论上可以形成飞轮效应——模型能力带来开源影响力,开源带来开发者,开发者转化为API收入,收入再支持训练和推理投入。

开源意义方面,K3计划7月27日前发布完整权重。即使大多数人没有能力本地部署,开放权重的意义依然重大——它消除了"模型被下架"的依赖风险,允许研究者检视、微调和改进,让高校和小公司也能在先进模型基础上构建应用。这是开源生态第一次在长程代码和知识工作上逼近最强闭源产品。

还有一个不能忽视的背景:月之暗面正在筹备港股IPO。K3的发布不只是一轮产品更新,也像一次上市前的能力宣示。但IPO最终检验的不会是榜单成绩,还有3亿美元ARR能否持续、客户是否留存、推理成本能否控制,以及技术优势能保持多久。



估值315亿美元,ARR三个月增至3倍,IPO前哨战

K3到底适合谁用

说了这么多,落到实际——K3适合什么场景,不适合什么场景?

适合的场景:

大型代码仓库理解和修改——K3的长程编程能力是核心卖点,能读懂大型仓库、操作终端、修改代码、运行测试、根据结果继续修正

复杂研究任务——先查大量材料,列出矛盾证据,生成数据表和图表,写成不同版本交付物

前端开发与视觉迭代——上传设计截图,让K3根据视觉反馈持续优化页面,形成"视觉在环路"的开发闭环

3D交互内容生成——Three.js微型城市、3D游戏、物理仿真(但需要多轮提醒修正)

图文混合交付——生成包含表格、图表、幻灯片和交互式网站的综合成果

不适合的场景:

日常问答和短文润色——K3偏冗长,简单问题也容易"过度主动",用K2.6或专用小模型更划算

低延迟客服——速度是硬伤,62 tokens/秒的输出速度不适合实时对话场景

大规模便宜调用——价格涨了3-4倍,大规模调用成本不低

事实可靠性要求极高的场景——幻觉率51%,新闻、法律、医疗、金融必须配合来源核验

一句话建议

不要立刻把所有工作迁移到K3。挑选三个真实任务进行测试:一个大型代码修改、一个多来源研究、一个图文混合交付。记录成功率、人工接管次数、总耗时和总成本,再决定是否替换现有模型。

K3已经进入第一梯队。接下来真正决定它位置的,不是下一张榜单,而是能否在真实工作里更稳定地把任务做完。

几个值得关注的后续节点

7月27日——完整模型权重发布。届时开发者可以下载、研究、微调。社区能否以可接受成本部署,才是"开放"价值的真正检验。

low和high思考档位——目前K3默认max档,后续会增加低档和高档模式。速度问题可能会随之改善。

港股IPO进程——K3是上市前的能力宣示,但IPO检验的是持续收入和成本控制,不是榜单成绩。

智谱和Minimax的反扑——K3发布当天智谱跌了28%,但智谱的ARR已达10亿美元,半年增长15倍。竞争远没到终局。

社区独立评测——目前很多数据来自月之暗面自己的评测,完整权重发布后,研究社区的独立验证会给出更客观的画像。

总结

把时间轴拉到18个月前,当时国产大模型的话题还是"能不能追上GPT-4"。现在K3在前端编程盲测上力压Claude Fable 5和GPT-5.6 Sol登顶全球第一,综合能力稳定超越GPT-5.5和Opus 4.8。

国产开源与海外旗舰的差距,至少已经大幅压缩了。

但K3给人的整体感觉是:能力上限高,但体验还没完全跟上。3D和视觉生成能力最突出,前端UI设计水准接近Fable 5,编码能力强但还没超过最强闭源模型,速度是最大短板。它不是"所有任务的新默认",而是复杂任务的新候选。

月之暗面用K3证明了:中国开源大模型正在从"单点亮相"走向"群体突破"。接下来真正重要的不是下一个参数纪录,而是开源模型能否在真实工作流中持续创造价值——从榜单第一走向日常可靠。

这一点,K3开了个好头,但路还很长。

AI前沿模型分析 · Kimi K3专题

2026年7月

喜欢文章,想了解更多相关知识的朋友欢迎关注我

声明:内容由AI生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
拿3小时生命换257元!底层老百姓的命到底多不值钱?

拿3小时生命换257元!底层老百姓的命到底多不值钱?

小鹿姐姐情感说
2026-10-02 19:58:33
11岁小孩哥夺亚运冠军!家长:绝对高风险,这块金牌不要也罢

11岁小孩哥夺亚运冠军!家长:绝对高风险,这块金牌不要也罢

史海流年号
2026-09-30 00:39:30
名记怒批“邵佳一把国足当强队” 董路:这么踢日本可能要输0-15

名记怒批“邵佳一把国足当强队” 董路:这么踢日本可能要输0-15

风过乡
2026-10-02 22:08:27
有车主凌晨排到140号,“充到80%必须离场”,国庆高速服务区排队叫号充电再现:一车辆仅剩1%电量后“趴窝”;10个充电特别繁忙服务区公布

有车主凌晨排到140号,“充到80%必须离场”,国庆高速服务区排队叫号充电再现:一车辆仅剩1%电量后“趴窝”;10个充电特别繁忙服务区公布

扬子晚报
2026-10-02 11:32:14
60年首败!国足热身赛0比5不敌巴勒斯坦

60年首败!国足热身赛0比5不敌巴勒斯坦

澎湃新闻
2026-10-02 21:54:08
国足0-5遭连败!队史首负巴勒斯坦 4次失误送礼 王上源+刘洋中柱

国足0-5遭连败!队史首负巴勒斯坦 4次失误送礼 王上源+刘洋中柱

我爱英超
2026-10-02 21:41:31
扎心!6条人命!10月1日沪昆高速货车疲劳肇事:交强险仅20万分摊,商业险或拒赔,上千万赔偿找谁要?

扎心!6条人命!10月1日沪昆高速货车疲劳肇事:交强险仅20万分摊,商业险或拒赔,上千万赔偿找谁要?

火山詩话
2026-10-02 05:42:09
风暴已经来了,中国必须正面应对!40年来从未出现的4种情况到来

风暴已经来了,中国必须正面应对!40年来从未出现的4种情况到来

旧窗老街
2026-10-02 00:05:18
中国科学家发现会飞的新恐龙,独立于鸟类演化出飞行能力

中国科学家发现会飞的新恐龙,独立于鸟类演化出飞行能力

澎湃新闻
2026-10-01 10:52:12
北京一女孩15万买下二手奔驰,保养时发现多50公斤,拆开后惊呆

北京一女孩15万买下二手奔驰,保养时发现多50公斤,拆开后惊呆

侃故事的阿庆
2026-10-03 00:42:38
疑点重重!上海33岁音乐老师偷偷出境飞往曼谷后失联,更多细节披露,“一个人独自前往”成舆论焦点

疑点重重!上海33岁音乐老师偷偷出境飞往曼谷后失联,更多细节披露,“一个人独自前往”成舆论焦点

火山詩话
2026-10-02 15:25:44
乌克兰之所以落到今天这步田地,罪魁祸首不是北约,不是欧盟

乌克兰之所以落到今天这步田地,罪魁祸首不是北约,不是欧盟

西楼知趣杂谈
2026-09-13 21:45:49
上海降31%、广州降32%、杭州降39%! 不是房子卖光了, 是房东不卖了

上海降31%、广州降32%、杭州降39%! 不是房子卖光了, 是房东不卖了

史之铭
2026-10-02 03:12:58
震惊!有大学生提议室友上交全部生活费统一保管遭拒,发帖人不解之余,室友视作“舍敌”

震惊!有大学生提议室友上交全部生活费统一保管遭拒,发帖人不解之余,室友视作“舍敌”

火山詩话
2026-10-02 08:52:28
Google前高管预言:2027年AI将引发15年失业潮

Google前高管预言:2027年AI将引发15年失业潮

火锅局
2026-10-02 22:17:16
日方发现不对劲:中日一旦交战,就算日本投降,中国也不一定答应

日方发现不对劲:中日一旦交战,就算日本投降,中国也不一定答应

阿嬍体育评论
2026-08-13 11:38:12
说谁呢?可能是他!赛后邵佳一语出惊人:也许有的国脚还在想着联赛和亚冠

说谁呢?可能是他!赛后邵佳一语出惊人:也许有的国脚还在想着联赛和亚冠

足球大腕
2026-10-02 23:15:48
邵佳一为0-5致歉:我没有更多解释!接受一切批评 全队想法不统一

邵佳一为0-5致歉:我没有更多解释!接受一切批评 全队想法不统一

我爱英超
2026-10-02 22:38:21
离大谱!“小孩姐”原声是“爸爸我有出息了”,多家媒体字幕改成妈妈!

离大谱!“小孩姐”原声是“爸爸我有出息了”,多家媒体字幕改成妈妈!

小椰的奶奶
2026-10-02 12:16:25
刘欢去世7天,何赛飞病情曝光令人揪心,与恩师之子离婚真相大白

刘欢去世7天,何赛飞病情曝光令人揪心,与恩师之子离婚真相大白

娱妮啵啵啊
2026-10-02 17:51:35
2026-10-03 04:59:00
欧阳让你懂AI
欧阳让你懂AI
每天分享一些AI的实用小知识
274文章数 330关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

李在明:若乌克兰拒不道歉 将采取进一步措施

头条要闻

李在明:若乌克兰拒不道歉 将采取进一步措施

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

潘玮柏老婆被猜怀二胎 中秋vlog露馅

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

手机
亲子
本地
公开课
军事航空

手机要闻

创维F3 Pro闺蜜机新增12GB RAM + 256GB存储空间版本,6099元

亲子要闻

网传多地幼儿园男女比例失衡,男孩比女孩多3倍,网友说:以后性资源会出现巨大缺口!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装:24小时内沙特空袭也门47次

无障碍浏览 进入关怀版