![]()
这几天,全球AI圈都被中国爆出两大新闻给震住了。
屏幕上,中国大模型Kimi K3突然冲到前端编程盲测榜第一,把美国头部模型压到身后。
展馆里,中国首个全国产十万卡AI超集群“曙光8000”正式亮相,上线第一周就进入满载状态。
![]()
一个是写代码的软件,一个是装满计算卡的机房,看起来互不相干。可把它们放到一起,味道就变了。
过去几年,美国限制先进计算芯片对华出口,核心算盘很简单:没有足够多的高端GPU,中国就很难训练出最先进的大模型,更难搭建超大规模AI集群。
现在,中国模型开始冲击全球榜首,国产十万卡集群也真的开机运行。
美国原本想锁住的那扇门,已经没那么牢了。
美国模型守了三年的榜首,被Kimi K3挤开了一条缝
7月16日,月之暗面发布Kimi K3。
没过多久,Frontend Code Arena的榜单发生了变化。
在这项测试中,不会直接告诉评审,左右两边的网页分别由哪个模型生成。开发者只看最终效果,然后用鼠标选出自己认为更好的那一个。
没有品牌滤镜,也不管背后是哪家大厂。
Kimi K3最终拿到1679分,超过Anthropic的Claude Fable 5,排到第一。
![]()
更夸张的是,上一代Kimi K2.6在这张榜单上还排在第18位。一次换代,直接向前跳了17个位置。
前端编程看起来只是写网页,实际很考验模型的综合能力。
用户只给一句要求,模型要自己理解布局、调用工具、编写代码、检查页面效果,再根据画面不断修改。按钮放错位置、颜色搭配难看、页面不能交互,都会影响最终投票。
Kimi K3在7个细分项目中拿下6个第一,说明它已经不只是“会答题”,而是能够连续完成一段比较长的工作。
在独立评测机构Artificial Analysis的综合智能指数中,Kimi K3得到57分,位于全球第一梯队,但仍落后于Claude Fable 5和GPT-5.6 Sol。
过去大家讨论中国模型时,常用的说法还是“距离美国最先进水平还有半年左右”。
现在,这个差距已经缩小到一张榜单上的几个分数。某些具体项目,中国模型甚至已经坐到了第一名的位置。
Kimi K3不是赢下所有榜单,而是中国模型已经能在美国最擅长的编程赛道上抢到第一排。
最好的卡拿不到,中国就先把每张卡的活干满
Kimi K3有2.8万亿个总参数,是目前全球规模最大的开放权重模型之一。
2.8万亿是什么概念?
如果每次回答问题都把这些参数全部调用一遍,计算量和电费都会非常惊人,再大的服务器也得喘粗气。
Kimi K3采用了混合专家架构,内部共有896个“专家”,每次只激活其中16个。
可以把它想象成一栋坐着896名专家的办公楼。
![]()
用户问编程问题,系统不会让896个人全部跑进会议室,而是挑出最合适的16个人干活。知识容量还在,实际计算量却被压了下来。
它还使用Kimi Delta Attention和Attention Residuals等新架构,处理长文本时,不需要反复翻遍前面的全部内容。
这也是Kimi K3能够支持100万token上下文的重要原因。
一个大型代码仓库、几十份报告,甚至一本很厚的技术资料,都可以直接塞进工作区。这套思路与美国AI公司的传统打法有些不同。
美国拥有大量顶级GPU,习惯用更强的芯片、更大的集群把模型能力往上堆。中国拿不到同等数量的最新GPU,只能在模型结构、训练方法和推理效率上多动脑筋。
![]()
卡不够强,就少做无用计算;显存有限,就想办法压缩权重;单个节点装不下,就把任务拆开,让更多机器协同工作。
Kimi K3甚至在训练阶段就考虑了低精度部署和不同硬件的兼容问题。官方建议运行这款模型时,使用64张以上加速卡组成的超节点,尽量把高频数据交换留在高速互联范围内。
这说明中国大模型公司已经不满足于“把模型做出来”,还得考虑它能不能在不同计算卡上跑起来,企业能不能承担调用价格。
当最好的计算卡不够多,中国模型首先学会的,就是别让手里的计算卡白忙。
十万张国产卡放进机房,最难的不是插上电源
就在Kimi K3发布前几天,中科曙光宣布“曙光8000”正式落成。
这是中国首个全国产十万卡AI超集群,并已接入国家超算互联网。
十万张计算卡摆在一起,听上去像是一道简单的加法题,但实际运作完全不是这么回事。
假如把一张计算卡看成一名工人,十万卡集群就相当于同时安排十万名工人施工。
![]()
工人再多,如果材料送不过来、不同工位之间无法交流、仓库读写太慢,现场照样会堵成一团。
大模型训练时,类似的事情每秒都在发生。
一部分计算卡刚算出结果,马上要把数据发给另一部分计算卡。如果网络慢了一点,后面的卡就只能干等。等待时间积累起来,十万张卡可能只有几万张真正干活。
所以曙光8000真正难的不是“凑够十万张卡”,而是把芯片、服务器、存储、网络、散热和调度系统连接起来,让它们像一台机器一样工作。
在芯片方面,系统以海光等国产芯片作为底层支撑。
在网络方面,它使用自研scaleFabric类IB高速网络,负责十万卡之间的数据交换。
在存储方面,ParaStor分布式存储负责给计算卡不断送数据。它此前已经在2026年IO500生产型全节点和10节点榜单中拿下两项第一。
还有一个容易被忽略的问题:散热。
十万张计算卡同时运行,机房里的热量非常惊人。普通风扇已经很难处理如此密集的功耗,曙光8000使用浸没式相变液冷,让设备直接在冷却介质中运行。
系统上线后,第一周就进入满载状态。
目前它日均处理作业超过15万个,单日峰值超过50万个。已有70多项应用实现万卡规模扩展,任务包括大模型、机器人、药物研发、蛋白质折叠和超大规模流体模拟。
![]()
这些作业未必都要一次使用十万张卡。
有的任务需要几十张,有的需要几千张,也有一些科研模拟要调用上万张。调度系统要像机场塔台一样,把不同任务分配到合适的跑道,不能让大任务互相撞车,也不能让小任务长期排队。
单卡决定一台服务器跑多快,系统工程决定十万张卡能不能一起跑。
中国还没有全面反超,但美国的护城河已经出现变化
中国AI已经超过美国了吗?还没有!
在模型端,Kimi K3拿下了前端编程盲测第一,但综合能力仍排在美国最强模型之后。完整权重和更大规模的第三方部署,也需要继续验证。
在硬件端,曙光8000是中国首个全国产十万卡集群,却不是全球规模最大的AI集群。
马斯克旗下xAI的Colossus 1已经拥有超过22万张英伟达GPU。xAI还宣称,其算力资源在2025年底已超过100万张H100 GPU的等效规模。
美国在单卡性能、高带宽显存、CUDA软件生态和大规模集群运行经验上,仍然保持明显优势。
但Kimi K3和曙光8000在接近的时间出现,却依然有着标志性意义。
因为美国过去试图卡住的,并不只是一款芯片,而是中国构建先进AI系统的能力。
以前,中国可能有不错的模型,却缺少稳定的大规模国产算力;也可能建起算力中心,却没有足够强的模型把机器用起来。
![]()
现在,软件端出现了接近世界最前沿的Kimi K3,硬件端出现了能够连接十万张国产卡的曙光8000。
下一代中国大模型能否直接在国产十万卡集群上完成训练,能否保持稳定收敛,能否把成本压到企业愿意长期使用的水平。
如果这一步走通,美国面对的就不再是偶尔冒出来的一款中国模型。
而是一套能够自己制造算力、训练模型、部署应用,再用市场收入继续升级的AI循环。
这场反超还没有完成,但中国AI的软件和硬件,已经开始同时向前走了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.