热点分析 · Kimi K3
Kimi K3深度分析2.8万亿参数登顶编程榜,国产开源追到门口了
全球最大开源模型 · 前端编程Arena全球第一
实测3D惊艳但速度拉胯 · 月之暗面的IPO前哨战
喜欢文章,想了解更多相关知识的朋友欢迎关注我
AI前沿模型分析
![]()
先说结论:能力上限高,但体验还没跟上
7月16日深夜,月之暗面在WAIC开幕前夜扔出了一颗炸弹——Kimi K3,2.8万亿参数,全球最大开源模型,前端编程盲测世界第一。
消息一出,智谱市值当天蒸发了2053亿港币,跌了28%。Minimax也跟着跌了15.6%。信号很明确:基础大模型的竞争远没到终局,落后和领先都可能是暂时的。
但别急着吹。我把官方技术博客、第三方评测、各路开发者实测全看了一遍,结论比较克制:K3确实是月之暗面迄今最强的模型,最有说服力的进步不是"聊天更聪明",而是把代码、研究、文档和工具调用串成了一条更长、更稳定的任务链。它有资格进入全球第一梯队,但速度、输出长度、成本和事实可靠性,决定了它并不适合所有场景。
这篇文章就来拆解K3到底强在哪、弱在哪、值不值得用。
一、2.8万亿参数:全球最大开源模型的分量
先看基本参数。
总参数:2.8万亿(2.8T)
架构:MoE混合专家,896个专家,每次激活16个
上下文窗口:100万Token(约75万字)
模态:原生支持文本+图像输入,文本输出
思考模式:始终开启,默认max档
权重开放:2026年7月27日前发布完整权重
2.8万亿参数是什么概念?目前全球开源模型里最大的。此前Kimi自己的K2是1万亿级别,DeepSeek V3是6710亿。K3直接把开源模型的天花板拉到了近3万亿。
但参数大不等于一切。月之暗面自己也说了,K3的研发重点不是简单堆参数,而是通过架构、训练方法和数据配方的协同优化,把规模优势转化为能力提升。这话不是吹——他们确实在架构上做了真东西,后面细说。
有个细节值得一提:K3发布时的官方宣传视频,是K3自己剪辑的。它在56段原始素材里完成了选片、卡点、动作匹配和音频处理。月之暗面用这种方式传递了一个信号——它能做出完整的、让人满意的复杂作品。
![]()
K3与主流模型参数规模对比,全球首个3T级开源模型
二、架构创新:KDA+AttnRes,不是只靠堆参数
K3能处理100万Token上下文还能保持质量,靠的不是暴力堆算力,而是两个自研的架构创新。
第一个叫KDA(Kimi Delta Attention)。传统Transformer的注意力计算复杂度是O(n²)——上下文越长,计算量呈平方级增长。这就是为什么很多模型号称支持长上下文,实际用起来要么慢得要死,要么后半段就"失忆"了。KDA的核心思路是把注意力计算线性化,通过细粒度逐通道门控机制,选择性地聚焦关键信息,不再对所有位置做全量计算。
实测效果:在100万Token全量加载场景下,解码速度最高提升6.3倍。这意味着百万Token上下文不再只是纸面参数——它是真的能用的。
第二个叫AttnRes(Attention Residuals)。传统残差连接以固定权重累加各层输出,每层贡献固定。AttnRes用学习到的、依赖输入的注意力机制取代固定权重——模型自己决定从前面各层提取多少信息,像一个"动态记忆管理器"。
关键数据:额外训练成本不到2%,训练效率提升约25%。在大规模MoE模型中,训练成本是限制规模发展的核心瓶颈,能在几乎不增加预算的情况下提升训练效率,意味着同样算力可以训练出更强的模型。
再加上Stable LatentMoE框架——896个专家里只激活16个,激活比例不到2%,在超大参数量和推理成本之间实现了平衡。整体扩展效率比K2提升约2.5倍。
![]()
KDA线性注意力+AttnRes注意力残差+MoE稀疏激活
说人话:K3不是靠蛮力堆参数,而是在"怎么让信息在超长文本和超深网络里高效流动"这个问题上做了真正的架构创新。这是它和很多"只堆参数"的模型本质区别。
三、前端编程Arena登顶:1679分力压Claude和GPT
这是K3发布后传播最广的一个数据。
Frontend Code Arena是加州大学伯克利分校研究人员创建的第三方盲测平台。规则很简单:同一道前端编程任务交给两个匿名模型,用户体验两个结果后投票,投票完成才公布模型身份。累计约48万次投票。
Kimi K3以1679分排名全球第一,超过了Claude Fable 5的1631分和GPT-5.6 Sol的1618分。在7个前端编程细分领域中,K3拿下6个第一——品牌与营销、基于参考的设计、数据与分析、消费产品、模拟、内容创建工具,全部榜首。
从上一代K2.6的第18名直接跃升到第1名,这个飞跃幅度确实惊人。
但得说清楚一个事:Frontend Code Arena考察的是前端编程能力,不是综合智能。K3的综合智能指数(Artificial Analysis)是57分,整体表现仍落后于Claude Fable 5和GPT-5.6 Sol这两个最强闭源模型。月之暗面在官方博客里也坦诚写了这一点。
更准确的说法是:K3在前端编程这个垂直赛道上做到了全球第一,综合能力进入第一梯队但还不是最强。这已经是非常大的突破了——一年前国产开源模型在这个榜单上连前20都进不去。
![]()
K3以1679分登顶前端编程Arena,7个细分领域6个第一
四、实测表现:3D生成惊艳,速度是最大短板
K3正式上线不到24小时,各路开发者的实测就密集到可以按场景分类了。出现频率最高的三个测试方向:3D交互生成、前端编程、视觉设计。
3D生成本是最突出的亮点。有人让它用Three.js生成一个可探索的微型城市,要求高低错落的建筑、街道、树木、河流和昼夜循环系统。K3的画面配色和谐,设计有心思,但细节不够到位——会出现树和路灯挡在路中间的情况。
科技博主Chris在发布前就拿到了匿名测试版,让K3和GPT-5.6 Sol分别做体素死星壕沟飞行。他的评价是GPT-5.6光照和特效更好,但K3画面更流畅。正式发布后,他又用K3构建了一个CS:GO×Portal克隆游戏,三轮对话、约60万Token,按API定价算只花了3.24美元。他配文:"免费独立游戏开发的时代比你想象的还要近。"
有人用樱花盆景测试SVG视觉生成,发现K3在树干扭曲、分层树冠等细节上甚至比Fable 5更贴合要求。水流效果也能模拟出逼真的水波纹,保持物理连贯性。
但速度是绕不过去的硬伤。同一场景生成时间约为GPT-5.6 Sol的两到三倍。瀑布场景近半小时,视频剪辑近两小时。Artificial Analysis测得K3输出约62 tokens/秒,低于同类模型约70 tokens/秒的中位水平。
关于速度慢的原因,官方未作说明。可能的因素包括:2.8万亿参数推理计算量大、max档位默认开启深度思考、推理基础设施尚未充分扩容。后续开放low和high档位后可能会有所改善。
![]()
3D交互生成能力突出,但生成时间是竞品的2-3倍
五、K3 vs GPT-5.6 Sol:Sol赢在可靠,K3赢在审美
被用来和海外最强旗舰对比,K3实际表现到底怎么样?有媒体做了三个场景的正面PK,同一套提示词分别喂给两个模型。
场景一:3D迷宫游戏。要求第一人称视角、WASD控制、小地图、火炬照明、60秒倒计时。GPT-5.6 Sol干活非常快,K3还在加载时Sol已经能开始玩了。但K3交付的成果整体视觉带有像素风,火炬和墙面纹理更有设计感,光线更暗,可玩性更高。Sol快且稳,K3慢但有辨识度。
场景二:杯子倒水物理仿真。这道题考察数学建模、物理直觉和图形学处理。GPT-5.6 Sol交了合格答案——水粒子老老实实待在杯子里,倒水从杯口流出,符合物理规律。K3在这道题上"翻车"了:装水时水粒子穿透杯壁漏出去了,倒水时水从杯底流出。经提醒后K3做出了改正,但改得也很慢。这个场景Sol完胜。
场景三:尼亚加拉大瀑布全景。GPT-5.6 Sol功能完整但有点"敷衍"——提示词要的玻璃质感绿水和透光白色水幕,拿到手的是一大片白色粒子糊在悬崖面上,提示词里提到的彩虹也没出现。K3更用心:画面更精美,彩虹没落下,水的渲染更接近真实瀑布水汽氤氲的视觉体验。当然,K3花了近半小时。这个场景K3胜在审美。
三轮测试的结论:要又快又稳的成品选Sol,要视觉上有辨识度的成品选K3,但得付出两到三倍的时间成本。
![]()
三轮PK:Sol赢在速度和可靠性,K3赢在视觉审美
六、定价策略:不便宜,但复杂任务可能值
K3的API定价比上一代涨了不少,先看数字。
国内API:输入2元/百万Token(缓存命中),20元/百万Token(未命中),输出100元/百万Token
国际API:输入3美元/百万Token,输出15美元/百万Token,缓存命中0.3美元
对比GPT-5.6 Sol:输入5美元,输出30美元
对比Claude Fable 5:输入10美元,输出50美元
跟海外旗舰比,K3确实便宜——输出单价折合不到14美元,比GPT-5.6 Sol便宜一半,比Fable 5便宜三分之二。
但跟自家上一代比,K3的API输入价格涨了3倍多,输出价格涨了近4倍。这个涨幅相当激进。
关键问题不是单价贵不贵,而是完成一次可靠交付需要多少总成本。如果任务只是摘要和改写,这个价格缺乏优势。但如果一次调用能完成过去需要多轮模型切换、人工检索和反复修改的复杂任务——比如让K3先查50份材料,列出矛盾证据,生成数据表和图表,再写成不同平台版本——单位"成功任务"的成本反而可能合理。
还有个隐形成本:K3"话多"。完成Artificial Analysis整套评测用了约1.3亿输出Token,接近同类中位数6300万的两倍。相比K2.6,Token效率已有提升(完成同样九项任务,K3约消耗132M输出Token,K2.6约消耗166M,减少约21%),但和市场横向比较仍然偏冗长。这会同时影响阅读体验、延迟和账单。
![]()
K3 API定价:比海外旗舰便宜,但比自家上代涨了3-4倍
七、局限短板:官方自己都承认的三个问题
月之暗面在官方博客里坦诚地写了三个局限,这点值得点赞——很多模型发布时只报喜不报忧。
第一,对历史思考内容敏感。如果Agent框架没有完整回传历史,或在一个进行中的会话里从其他模型切换到K3,生成质量可能明显波动。换句话说,100万窗口提供了容量,但真正决定体验的仍是上下文管理和Agent框架是否适配。别指望随便接个框架就能跑出最佳效果。
第二,训练偏向长程高难任务,简单问题容易"过度主动"。面对小问题或模糊意图时,K3会替用户做出意外决定。对于自动发邮件、改数据库、部署代码等高风险动作,这不是性格问题,而是权限控制问题。使用K3做Agent时,必须明确写出可执行范围、必须确认的动作、禁止访问的资源和失败后的停止条件。
第三,与Fable 5和GPT-5.6 Sol相比,在用户体验上仍有差距。
除了官方承认的,第三方评测还暴露了更多问题:
速度慢——前面说了,62 tokens/秒,低于行业中位数
幻觉率高——准确率从K2.6的33%提升到46%,但幻觉率也从39%上升到51%。模型回答了更多问题,但也更愿意在不知道时给出答案。用于新闻、法律、医疗、金融时,来源核验仍是硬要求
物理仿真不够可靠——杯子倒水测试翻车说明,K3在物理直觉方面还不是一次到位,需要多轮提醒修正
本地部署门槛极高——2.8万亿参数的完整权重,全精度约1.7TB,2-bit量化约950GB-1TB,最激进的1.8-bit压缩也要650-700GB。512GB的Mac Studio都不够。月之暗面自己建议用64+加速器的超节点配置,这只有企业数据中心才有
![]()
速度慢、话多、幻觉率高、部署门槛极高
八、市场影响:估值飙升,开源改写格局
K3不只是一次产品更新,它的发布节点和背后的商业故事同样值得关注。
融资和估值方面,月之暗面近半年动作频频。2025年12月完成C轮5亿美元融资,投后估值43亿美元。今年5月完成约20亿美元融资,投后估值突破200亿美元。6月底又启动新一轮,投前估值升至315亿美元——年内第6轮融资。
收入增速方面,3月Kimi的ARR(年度经常性收入)突破1亿美元,6月中旬达到3亿美元,三个月增至3倍。API贡献了Kimi总收入的七成以上,海外API收入已超过国内。个人订阅用户1月支付订单数环比增长8280%,2月再涨123.8%,进入Stripe全球榜单前十,成为首个闯入前十的中国AGI产品。
竞争格局方面,K3发布当天智谱市值蒸发28%,这不是巧合。月之暗面试图构建的路径是:用开源模型吸引全球开发者,通过开发者工具进入真实工作流,再将对稳定性、速度和服务要求更高的用户转化为API客户。理论上可以形成飞轮效应——模型能力带来开源影响力,开源带来开发者,开发者转化为API收入,收入再支持训练和推理投入。
开源意义方面,K3计划7月27日前发布完整权重。即使大多数人没有能力本地部署,开放权重的意义依然重大——它消除了"模型被下架"的依赖风险,允许研究者检视、微调和改进,让高校和小公司也能在先进模型基础上构建应用。这是开源生态第一次在长程代码和知识工作上逼近最强闭源产品。
还有一个不能忽视的背景:月之暗面正在筹备港股IPO。K3的发布不只是一轮产品更新,也像一次上市前的能力宣示。但IPO最终检验的不会是榜单成绩,还有3亿美元ARR能否持续、客户是否留存、推理成本能否控制,以及技术优势能保持多久。
![]()
估值315亿美元,ARR三个月增至3倍,IPO前哨战
K3到底适合谁用
说了这么多,落到实际——K3适合什么场景,不适合什么场景?
适合的场景:
大型代码仓库理解和修改——K3的长程编程能力是核心卖点,能读懂大型仓库、操作终端、修改代码、运行测试、根据结果继续修正
复杂研究任务——先查大量材料,列出矛盾证据,生成数据表和图表,写成不同版本交付物
前端开发与视觉迭代——上传设计截图,让K3根据视觉反馈持续优化页面,形成"视觉在环路"的开发闭环
3D交互内容生成——Three.js微型城市、3D游戏、物理仿真(但需要多轮提醒修正)
图文混合交付——生成包含表格、图表、幻灯片和交互式网站的综合成果
不适合的场景:
日常问答和短文润色——K3偏冗长,简单问题也容易"过度主动",用K2.6或专用小模型更划算
低延迟客服——速度是硬伤,62 tokens/秒的输出速度不适合实时对话场景
大规模便宜调用——价格涨了3-4倍,大规模调用成本不低
事实可靠性要求极高的场景——幻觉率51%,新闻、法律、医疗、金融必须配合来源核验
一句话建议
不要立刻把所有工作迁移到K3。挑选三个真实任务进行测试:一个大型代码修改、一个多来源研究、一个图文混合交付。记录成功率、人工接管次数、总耗时和总成本,再决定是否替换现有模型。
K3已经进入第一梯队。接下来真正决定它位置的,不是下一张榜单,而是能否在真实工作里更稳定地把任务做完。
几个值得关注的后续节点
7月27日——完整模型权重发布。届时开发者可以下载、研究、微调。社区能否以可接受成本部署,才是"开放"价值的真正检验。
low和high思考档位——目前K3默认max档,后续会增加低档和高档模式。速度问题可能会随之改善。
港股IPO进程——K3是上市前的能力宣示,但IPO检验的是持续收入和成本控制,不是榜单成绩。
智谱和Minimax的反扑——K3发布当天智谱跌了28%,但智谱的ARR已达10亿美元,半年增长15倍。竞争远没到终局。
社区独立评测——目前很多数据来自月之暗面自己的评测,完整权重发布后,研究社区的独立验证会给出更客观的画像。
总结
把时间轴拉到18个月前,当时国产大模型的话题还是"能不能追上GPT-4"。现在K3在前端编程盲测上力压Claude Fable 5和GPT-5.6 Sol登顶全球第一,综合能力稳定超越GPT-5.5和Opus 4.8。
国产开源与海外旗舰的差距,至少已经大幅压缩了。
但K3给人的整体感觉是:能力上限高,但体验还没完全跟上。3D和视觉生成能力最突出,前端UI设计水准接近Fable 5,编码能力强但还没超过最强闭源模型,速度是最大短板。它不是"所有任务的新默认",而是复杂任务的新候选。
月之暗面用K3证明了:中国开源大模型正在从"单点亮相"走向"群体突破"。接下来真正重要的不是下一个参数纪录,而是开源模型能否在真实工作流中持续创造价值——从榜单第一走向日常可靠。
这一点,K3开了个好头,但路还很长。
AI前沿模型分析 · Kimi K3专题
2026年7月
喜欢文章,想了解更多相关知识的朋友欢迎关注我
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.