网易首页 > 网易号 > 正文 申请入驻

Kimi K3很厉害,但没到DeepSeek 2.0时刻

0
分享至

上个周末,Kimi K3的发布占领了海外AI圈。

一个还没有成为世界第一的中国模型,却让开发者、投资人和整个市场同时紧张起来。有人测试它的能力,有人拿它挑战Claude;有人担心闭源模型的生意;还有人已经拿它讨论中美AI竞争。

评测机构arena.ai整理出了中美各个时期代表大模型的前端代码能力差距。25年1月,DeepSeek的得分第一次和Claude持平;而这一次,Kimi K3作为中国大模型的代表第一次超过了美国大模型。

DeepSeek时刻2.0,好像真的来了。


01 K3刷屏,市场先动了

上周末打开X,刷十条消息,八条都在聊K3。

有人让它写游戏、做网页、改代码;有人只用三轮对话,就生成了一座小镇,有人用一个提示词直接做了个自己的《我的世界》;还有人把它接入Claude Code,和Claude对比后当场改口:“我看错K3了。”


有人说,K3的进步之快看起来已经不是蒸馏能完成的了;有人说,K3的开源对整个AI产业都是好消息,唯独对OpenAI和Anthropic这样的闭源模型公司不是;有人说,中国模型远远落后的时代结束了;有人开始重新审视美国的算力护城河;还有人把K3的出现直接上升到美国的数据中心政策和中美AI竞争。

开发者还在测试,社区还在讨论,资本市场已经先做出了反应。K3发布之后,美国半导体、存储等AI硬件股大跌。纳斯达克和纽交所的官方复盘,都把K3列进了当周市场担忧的解释。


看到这一幕,很难不想起2025年初。DeepSeek-R1发布一周后,英伟达一天之内下跌16.97%,市值减少5940亿美元。纳德拉承认它做出了“真正的创新”,扎克伯格希望把其中一些进展用进Meta的系统,Azure、GitHub、AWS和NVIDIA也迅速接入了R1。

而现在,根据彭博社消息爆料,微软已经开始测试Kimi K3,以替代目前 Copilot 接入的GPT和Claude。

Kimi K3的出现,又一次缩小了中美大模型能力的差距,那K3到底已经追到哪了?

02 美国的领先,可能只剩下几周了

长期研究中美科技竞争的 Jimmy Goodrich 说,美国人原以为自己领先两年,现在看,在模型、尤其算法层面,更像三到六个月。

K3发布后,美国企业研究所研究员 Ryan Fedasiuk 已经把差距描述为“只落后几周”。另一个更直观的参照是 Sol:GPT-5.6 Sol 在 7 月 9 日发布,K3 在 7 月 16 日上线;Artificial Analysis 的榜单给了 Sol 59 分、K3 给了57 分。在GPT-5.6 Sol发布的一周后,K3就已经追上了他的脚步。


震惊之余,很多人给它的实际表现画上了问号。K3的能力,到底强到什么地步?

Kimi 官方公布了 35 项测试,覆盖代码、Agent、推理、知识和视觉。在它列出的头部模型中,K3 有 26 项进入前两名。

模型评测领域最重要的参考之一 Artificial Analysis 把代码、Agent、科学推理等多项能力合成一个综合指数。K3 发布时拿到 57 分,排在第三,只落后 Fable 5 和 GPT-5.6 Sol。

在另一家独立评测机构 Vals 的榜单上,K3同样排到了第二。拆开来看,它在公共福利任务上拿到第一,在Vibe Code、企业金融上排名第二,在法律研究中排名第三。换了一套题,也换了一家评测机构,K3依然反复出现在榜单前列。

至于代码能力。DeepSWE 让各种模型去完成 113 个真实的工程任务。K3 得分 69%,最高的 Sol 是 73%,Fable 5 是 70%。

可是这些分数会不会是刷出来的?

当然可能。公开题会进入训练数据,厂商可以针对题型优化,也可以给自己的模型更多思考时间和重试机会,再挑出最漂亮的项目发布。因此,任何一张榜单都不值得单独迷信。


但 K3 面对的,不只是一张榜。官方测试、第三方综合评测、持续更新的新题,再加上各种复杂的工程任务,几套测试给出的结论其实差不多:它已经站进了第一梯队。这些测试并不完全独立,也不能保证每一个分数都没有水分。但如果 K3 只是背过题,一旦题目、评分方式和运行环境都换掉,就很难还在这么多榜单上反复靠前。一两个榜单的前列会让人怀疑是不是刷榜,但是三四个呢?五六个呢?K3在六个榜单评测都取得了前三名,只是靠刷榜,很难做出这样的成绩。

榜单里的能力,也已经有人拿到真实项目里试了。跑分之外,公开实测里的任务更杂:从零开始写2D物理引擎和游戏,完成Next.js项目生成与迁移,搭建并部署IMDb台词找片网站、arXiv检索站和Three.js游戏,分析足足82万行的代码库,从头制作一条包含研究、配音、双语字幕和剪辑的宣传片,还有人一口气让它做了50个前端创意项目。K3已经不只会解一道代码题,而是能在一部分长任务里持续调用工具、修改代码,最后交出能运行的成品。

K3的发布,真的让国产大模型和美国顶级模型梯队的差距缩减到了几周的时间。可是Kimi为什么能追得这么快?如果模型能力只由芯片和算力决定,K3本不该这么快追进第一梯队。它真正动摇的,不只是榜单上的名次,而是人们对大模型护城河的判断。

03 大模型训练,真的有护城河吗?

硬件的工艺和系统是有护城河的,阿斯麦的光刻机其他公司做不出来,台积电量产2nm的工艺也是独一无二的,至于英伟达,GPU架构的成功难以复制,CUDA和整套开发生态也建立了一条非常深的护城河。


如果模型、数据、训练量和计算设置完全相同,芯片的差距会导致的是速度变慢,并不会让同一个模型天然变笨。今年年初Heehoon Kim, Jaehwan Lee等的研究也证明了,相同训练配置下,用不同GPU芯片训练同一个LLaMA-1B模型,模型的最终效果基本一致,差的更多只是速度。

但是实际情况是:团队运转的预算有限、模型发布的日期也是越快越好,所以团队可能只能缩小模型、减少训练数据,或者少做几轮实验,导致模型的效果变得不及预期。

不只是模型的训练阶段会受到芯片算力不足的限制。当模型上线后,如果芯片算力不足,也会导致回答更慢,或是思考变短、进一步导致回答的正确率变低。这也是Kimi现在面临的真实困境——算力不足,所以只能暂停新用户的订阅,保证已经订阅了的用户能体验到更快的、回答更正确的模型。

但大模型领域的护城河似乎不那么牢靠。论文的发布会公开新的训练方法,开源模型的发布也会公开模型权重。一个新方法只要被证明有效,很快就会被研究、复现、改造,再用到下一批模型上。

这种事情已经发生过不止一次。2022年,OpenAI把InstructGPT的训练流程写进论文:先做监督微调,再训练奖励模型,最后利用人类反馈做强化学习。第二年,Meta在Llama 2的技术报告里也公开采用了监督微调和强化学习。方法一旦被写清,就很难继续只留在一家公司的训练室里。


DeepSeek-R1之后,这个过程更快。DeepSeek公开论文和权重一周后,Hugging Face便启动Open-R1,开始补齐DeepSeek没有公开的训练代码和数据。后来这个项目又公开了自己的训练脚本和蒸馏模型。领先者走通一条路,后来者就可以从这条路的中间继续往前走。

可见,模型的训练、优化方法很难建立起牢靠的护城河,所以 OpenAI、Anthropic 这些顶级闭源大模型公司需要时刻紧绷神经、持续防守他们的优势。更麻烦的是,闭源也不能完全阻止能力扩散。论文和权重可以不公开,但模型只要向外提供服务,它的输出就可能成为竞争者研究和训练的材料。Anthropic从数百个“欺诈账户”里发现了超过 340 万次 Claude 交互,并把这些活动归因于 Moonshot。它为此部署分类器、跨账户识别,甚至会把部分可疑请求交给旧模型回答。

Anthropic 的这份指控非常能说明他们在担心什么:竞争者很可能快速追赶自己,而这种风险需要长期投入资源防守。


Claude 和 ChatGPT 当然仍有护城河。它们有更多算力、更成熟的产品、更稳定的服务和更大的用户入口。但这些优势能守住公司,不一定能永远锁住某一种模型能力。

物理世界的领先,可以被工厂、供应链和生产经验固定很多年。模型能力的领先,却只能靠更快的下一次迭代继续维持。因为领先者每一次公开、交付和使用自己的模型,也可能给后来者留下一条更清楚的路。

K3 确实还不是世界第一,但它只要追得足够近,让开发者有了个可以离开第一的选择,就已经改变了这场竞争。

顶尖大模型的王座,攻下确实不易,但是守住更难。

来源 | 硬核看板(ID:yinghekb)

作者 | 王芮 ; 编辑 | 虾饺

内容仅代表作者独立观点,不代表早读课立场


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
雷军官宣:电池起火就赔新车!半个月过去了,为什么只有雷军敢“兜底”?

雷军官宣:电池起火就赔新车!半个月过去了,为什么只有雷军敢“兜底”?

DeepAuto车探
2026-09-18 11:25:57
当年为什么查办褚时健?

当年为什么查办褚时健?

百晓生谈历史
2025-08-20 21:55:53
印度“加尔各答”号驱逐舰抵近挑衅,把自己撞出大片破损

印度“加尔各答”号驱逐舰抵近挑衅,把自己撞出大片破损

三叔的装备空间
2026-09-18 06:18:47
小县城的工资开始崩塌了。

小县城的工资开始崩塌了。

老陆不老
2026-08-26 08:38:49
西班牙专家:中日摩擦不断,非实力差距,而是80年4笔血债未清算

西班牙专家:中日摩擦不断,非实力差距,而是80年4笔血债未清算

小豫讲故事
2026-08-18 06:00:26
伦纳德:我不是那种为了追戒指 就设法加盟夺冠概率最高球队的人

伦纳德:我不是那种为了追戒指 就设法加盟夺冠概率最高球队的人

北青网-北京青年报
2026-09-17 19:57:02
广东宏远重磅引援掀热议!如果这波运作成功落地,CBA其他球队难道只能继续陪跑?

广东宏远重磅引援掀热议!如果这波运作成功落地,CBA其他球队难道只能继续陪跑?

冷桂零落
2026-09-18 09:56:21
原来王尔晴最大的依靠,不是富豪父亲,不是英国丈夫,而是他们

原来王尔晴最大的依靠,不是富豪父亲,不是英国丈夫,而是他们

九天揽月1
2026-09-18 04:32:09
“老媪”的“媪”,不读“yùn”或“wēn”,这样读太丢人

“老媪”的“媪”,不读“yùn”或“wēn”,这样读太丢人

语丝纪
2026-09-17 11:39:33
令人惋惜!2次救命机会没抓住,敬一丹遭遇,给广大老年人提个醒

令人惋惜!2次救命机会没抓住,敬一丹遭遇,给广大老年人提个醒

大鱼简科
2026-09-17 10:15:19
葡萄牙欧国联大名单将公布,曝41岁C罗不退队,距1000球仅差21球

葡萄牙欧国联大名单将公布,曝41岁C罗不退队,距1000球仅差21球

小火箭爱体育
2026-09-17 20:17:27
禁令之下,这门生意彻底转入地下

禁令之下,这门生意彻底转入地下

中国新闻周刊
2026-09-18 07:30:07
再添头衔!54岁奥尼尔获颁荣誉FBI特工 球员时期曾担任预备警官

再添头衔!54岁奥尼尔获颁荣誉FBI特工 球员时期曾担任预备警官

罗说NBA
2026-09-18 08:02:48
色是一把刀,“医美手术”缠身的王鹤棣,还是走到了这一步

色是一把刀,“医美手术”缠身的王鹤棣,还是走到了这一步

橙星文娱
2026-09-17 11:49:03
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
彻底看透!美联储加息早已不是救经济,是一场骗全世界的世纪骗局

彻底看透!美联储加息早已不是救经济,是一场骗全世界的世纪骗局

牛锅巴小钒
2026-09-17 13:39:34
深圳男子称妻子转移1400万财产?妻子:不属实,用于生活和工作必要支出了

深圳男子称妻子转移1400万财产?妻子:不属实,用于生活和工作必要支出了

封面新闻
2026-09-17 20:09:08
钱再多又有何用65岁刘德华的现状,给娱乐圈所有明星敲响警钟

钱再多又有何用65岁刘德华的现状,给娱乐圈所有明星敲响警钟

无人倾听无人倾听
2026-09-17 06:40:37
特朗普:美伊战争迎来关键节点 我面临一个重大决定

特朗普:美伊战争迎来关键节点 我面临一个重大决定

财联社
2026-09-18 02:44:03
伯恩茅斯成英超黑店,为3名球员标价3亿英镑,阿森纳冬窗有意身价1亿英镑20岁前锋

伯恩茅斯成英超黑店,为3名球员标价3亿英镑,阿森纳冬窗有意身价1亿英镑20岁前锋

福酱的小时光
2026-09-18 09:39:13
2026-09-18 12:00:49
互联网早读课 incentive-icons
互联网早读课
专注互联网产品、运营、交互
9879文章数 55228关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

数码
家居
房产
亲子
公开课

数码要闻

千元价位32寸2K 100Hz屏!联想来酷XQ32q显示器上市

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

突发!三亚安居房出台新政!

亲子要闻

愈见你|我的剖腹产纪事

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版