网易首页 > 网易号 > 正文 申请入驻

AI自己榨干算力!让Kimi K3自己写「超级算子」,推理快了3倍

0
分享至


新智元报道


大模型提速,原来还有这条路!

上一周,vLLM原班人马创办的Inferact,开源了一套TPU Megakernels(巨型算子)。

他们把Kimi K3的92个MoE层一层不落地写进同一个程序,扔到16颗谷歌TPU v7上跑:

开着投机解码,单用户输出速度达到709 tokens/s;同样16块英伟达GB200,用vLLM跑,是452 tokens/s。

关掉投机解码,在1到8的并发下,它也都是GB200的1.4到2倍。

最扎心的是,按纸面参数,TPU v7的显存带宽(7380GB/s)还比GB200(8000GB/s)低一截。

硬件没占到便宜,赢在了写法上。


还有个彩蛋,这套巨型算子从零编译只要不到90秒。以前在TPU上编译一个同量级的大模型,动辄半小时起步。

同一周,国内也传来进展。

在AICC2026上,浪潮信息发布元脑SD200 Ultra超节点AI服务器,用128芯的本土AI芯片,单机跑起同一个K3,Token生成时延压到5.85毫秒。

他们的招数叫「超级算子」。

一个用谷歌TPU,一个用本土AI芯片,同一周、同一个模型,都在拆算子之间的那堵墙。

更有意思的是,浪潮信息的超级算子,有一大块是让K3自己写的。

大模型吐字慢

到底卡在哪儿

很多人以为大模型吐字慢是算力不够。其实芯片大部分时间闲着,在等数据。

模型每生成一个token,都要把用到的参数从显存(HBM)里搬一遍。算得再快,货没到也只能干等。

所以推理速度的天花板,很多时候由显存带宽说了算。

很多时候,麻烦出在「算子」上。算子可以理解成一个个小程序,做一次矩阵乘、做一次归一化,各管一摊。

传统推理框架里,生成一个token要依次启动一长串算子,每个都走一遍「搬数据—计算—写回去」。

据统计,K3单步推理要调用数千次算子。

打个比方,这就像坐老式绿皮火车从北京到广州,一路几百个小站,每站都要停车、卸货、装货、再启动,两天两夜才到。

车停着的那几分钟,铁轨是空的。换到芯片上,就是显存带宽在算子切换的空档里被白白浪费。

一个空档不起眼,几千个攒起来,就是理论速度和实际速度之间那道大坑。

英伟达这些年也在补坑,CUDA Graphs、PDL这些技术能让车停得短一点。可站还在,车就得停。

那就把站撤了,改高铁,一站直达。这就是算子融合。

整个模型,就是一个算子

Inferact的做法最狠:既然边界是浪费的源头,那就一个边界都不留。

92层全装进一个kernel,程序按层号自己判断这一层该走KDA还是MLA(K3用的两种注意力机制)。

所有层都在同一个程序里,上一层还在算,下一层的权重就已经在搬运的路上了。等轮到它,货早就码在芯片手边。


这招能成,得感谢TPU的一个设计。

TPU v7每个核心自带64MiB的片上高速内存(VMEM),数据搬进来放多久、什么时候腾地方,全由程序说了算。

GPU的片上内存要分给一百多个计算单元,每个单元只摊到两百多KB,想提前囤货都没地方放。

TPU给了一个大仓库,还把钥匙交给了写程序的人。

至于编译为什么快得离谱,Inferact的解释很实在:

原来编译器每次都要在成百上千个操作里反复摸索怎么排顺序、怎么重叠,现在这些活儿,工程师一次性手工做完了。

注意这个「手工」一词,四位作者都是顶尖的推理工程师,写这样一个巨型算子,门槛高得吓人。

Inferact在博文里也留了一句:以后会有更多这样的kernel,由编程智能体(coding agent)来写。


写算子这门手艺

AI正在接手

这句话可不是客套。

9月14日,DeepSeek的算子工程师刘胜与发了一篇长文,跟自己「手写算子的时光」告别。

他给DeepSeek V4.1写过主注意力算子,是真正在一线拧螺丝的人。他在文中预计,半年到一年内,AI写的算子就会追上甚至超过他。

一年前,他的AI助手还只能帮忙找bug;现在已经能自己读CUDA、PTX、SASS这些底层代码,动手调优。

他还写了一句很扎心的话:自己算子写得越好,新模型训练和推理就越快,他被替代得也越快。

大洋彼岸也在跑同一条路。今年4月,Cursor和英伟达合作,用一套多智能体系统优化了235个CUDA算子,三周跑下来,平均提速38%。


为什么偏偏是算子最先被AI接手?

因为它有标准答案:结果对不对,一跑就知道;快了多少,秒表说了算。

AI可以没日没夜地写、测、改,人熬不过它。

浪潮信息,已经把这件事用在了K3身上。

让K3优化K3,系统级破局

面对同样的Kimi K3,国内的浪潮信息也在做算子融合,同时把优化延伸到整个超节点系统。

两家的共同点很明确:把细粒度的小算子融合成大算子,减少启动和数据搬运的开销。

区别就在于粒度。Inferact把整个解码过程融合成一个算子;浪潮信息的粒度相对较小,围绕KDA、Gated MLA、MoE等模块做融合,形成超级算子。

也就是说,两家都在减少中间停靠,只是合并的范围不同。

在不久前的AICC 2026上,浪潮信息直接亮出了元脑SD200 Ultra超节点AI服务器。


它的底层逻辑很务实:在单卡显存和制造工艺存在现实约束的客观环境下,想要承载2.8万亿参数、还要把时延降下来,必须走系统级创新。

元脑SD200 Ultra采用3D Hyper Mesh架构,将128颗AI芯片组织成协同计算的整体,提供8TB统一编址显存,并配合64TB内存,为模型权重和不断增长的KV Cache提供承载空间。

这样,前沿模型就能够充分利用多颗芯片的计算和显存资源,支持10万亿参数模型在单机上部署和运行。

紧接着,他们在这个底座上干了三件非常狠的事:

  • 搞定「对称内存」,实现显存直接串门

在传统集群里,GPU之间互通数据,必须由CPU充当中介打报告、做调度,层层转手。

这就像同一个小区的邻居互相串门,过去非得先跑一趟物业,办个进门条才能去隔壁单元。

而SD200 Ultra通过对称内存技术,彻底踢开了中间层,显存统一编址,GPU直接点对点访问远端显存,相当于推门就进邻居家。

这一招,直接把跨卡通信时延压到0.69微秒,AllReduce通信时间骤降3.5倍!


  • 通算融合,把绿皮车升级成直达高铁

数据通路打通后,接下来超级算子的优化分三步展开。

第一步,把小算子变成大算子,减少中间停靠。

具体做法是,把KDA、Gated MLA、MoE等模块中的细粒度算子融合成超级算子。结果,算子数量减少到原来的约十分之一。

关键在于,合并之后,数据怎么留在芯片手边。

工程师会根据片上存储容量,把数据切成合适大小的块。前一步算出的结果,尽量直接留在寄存器或片上缓存中,交给后一步接着用。

就像几个工位连在一起,半成品顺手递过去,省掉了每做一道工序都送回仓库、再取出来的折腾。这样既减少了kernel的启动次数,也减少了中间结果反复写入、读取HBM的开销。

第二步,把通信和计算融合,让搬数据与做计算同步进行。

大算子内部也要「排好班」。团队按Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让不同数据处在不同的处理阶段——

当前块正在计算,下一块提前搬进来,已经算完的块则写回结果。

缓冲区轮流接力,芯片就能少一些等数据的空档。


  • 用K3优化K3,超级算子智能体的诞生

第三步,就是让K3参与优化K3,把调优做成持续迭代的闭环。

人工手写深度融合的Kernel,复杂度高到非普通人所能承受。

浪潮信息的办法,是让K3自己上手。他们用K3搭了一个「超级算子智能体」,让它在一个「生成—验证—测量—迭代」的闭环里一圈圈转:

K3先看运行画像,哪一步在等数据、哪块缓存没用满,心里有数;再据此提出怎么并算子、怎么切数据块、怎么排流水线,自动写出一批候选超级算子。

候选版本先过正确性校验,再拉到真实负载上跑分。延迟多少、显存读写了多少、占了多少资源,这些数字再喂回给K3,当作下一轮改进的依据。

只有算得对、又确实更快的版本,才会被部署上线。

在闭环迭代的最后阶段,算子性能直接进入正向循环,性能硬生生再拉升了50%,综合推理效能提升了3倍以上!

最终成绩单出炉,单机稳稳吃下2.8万亿参数的Kimi K3,Token生成时延首度杀进5.85毫秒,单用户吞吐突破170 tokens/s,跑出了业界平均水平的5倍速度。

大家都在盯的,是Token速度

芯片的纸面参数越来越接近,拉开差距的是软件和系统:

算子边界在消失,通信和计算在合流,写算子的活儿,越来越多交给AI。

对国产算力来说,这条路尤其实在。

SD200 Ultra这回摆出来的是另一种解法:靠系统级的紧耦合,加上算子层的深度优化,基于本土AI芯片的超节点照样能把2.8万亿参数的模型跑进毫秒级时延。

模型一个字不改,光靠算子融合和内存管理就能拿到几倍提升,比干等下一代芯片快,也便宜。

更深的变化,发生在买算力的人身上。

以前来买AI服务器的多是专业用户,开口就是要多少卡、多少网络、多少存储。现在客户上来先问一句:这个模型,在你机器上能跑多快?

背后的推手是Agent。聊天的时候,回答慢两秒无所谓。可一个Agent任务要经历上百轮「推理—调工具—看结果—重新规划」,每一轮慢一点,整条链路就能慢出好几分钟。

这种时候,卡有多少张、峰值算力多高,普通用户根本摸不着。

每秒吐多少token、一个token要等多久,才是直接落在体验上的东西。

浪潮信息把这类需求叫「能力型智算」:让最前沿、最大的模型跑得起来,还得跑得快,去啃过去啃不动的问题。

SD200 Ultra给10万亿参数的模型留足了空间,按浪潮信息首席AI战略官刘军的判断,一两年内顶尖开源模型就会走到这个量级。K3只是第一个被它跑快的模型。

所以下回再有人拿「多少张卡、多少P算力」跟你介绍一台AI服务器,不妨多问一句:

最前沿的模型,在上面Token生成速度有多快?

SD200 Ultra交出的答案是:K3,5.85毫秒一个。

AI下一站:

拼系统,拼AI写算子

这一场围绕K3的推理极速战,折射出整个AI计算产业正在发生的剧烈质变。

提速的主战场,从芯片挪到了系统。

过去两年,推理加速主要靠算法:量化、投机解码、压缩KV Cache。这一轮的提速,模型一个字没改。

Inferact手里的TPU,显存带宽比GB200还低,照样跑赢;浪潮信息靠超级算子,在同一套硬件上把K3的推理性能拉高3倍以上。

同样的芯片,组织得好不好,能差出好几倍。

墙会一堵一堵地被拆掉。

推理说到底是在搬数据,时间都耗在各种「边界」上。算子和算子之间有墙,于是有了算子融合;计算和通信之间有墙,于是有了通算融合;芯片和芯片之间有墙,于是有了统一编址和显存直连。

写算子这门手艺,正在交给Agent。

Inferact的巨型算子还是人手写的,但他们自己也说,以后这活儿更多归编程智能体。

浪潮信息走得更靠前,已经让K3给K3写了超级算子。

算子交给AI,最大的变化是定制化变便宜了。以前给一个模型专门手写一套算子太贵,模型一换代就白干,大家只能做通用优化。

刘军说,Agent时代反倒给了机会:针对具体模型,从芯片、系统、通信到算子进行协同调优,让Kimi K3模型的推理效率不断逼近系统的极限。

更有意思的是,现在新模型一发布,就能让它带着智能体给自己写一套专属算子,跑一遍,测一遍,再改一遍。

模型越强,写出的算子越好;推理越快,下一轮迭代也越快。

大模型时代的下半场,拼的早就不再是一两句惊艳的对话,而是实打实解决问题、完成任务的执行力。

每一次Agent的任务拆解、每一次工具的自动调用、每一个长程逻辑的自我纠偏,背后都在疯狂燃烧着推理Token。

在这场关乎生产力重构的竞赛中,时延和吞吐已经不仅是体验问题,而是直接决定了Agent能否在现实世界中完成闭环。

从硅谷的Megakernels,到中国超节点上的超级算子,全球顶尖工程师们正在沿着相似的路径,解决同一个问题:怎样让每一个Token更快地产生,让有限的算力转化为更多可用的智能。

推理的效率革命才刚刚拉开大幕,这场好戏,正越来越精彩。

编辑:桃子

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
严格!前NBA内线因入狱黑历史无缘签约上海男篮,大麦基因此获利

严格!前NBA内线因入狱黑历史无缘签约上海男篮,大麦基因此获利

林小湜体育频道
2026-10-01 22:55:43
你见过最不讲卫生的女生是怎样的?网友:下回不准描述这么细致了

你见过最不讲卫生的女生是怎样的?网友:下回不准描述这么细致了

夜深爱杂谈
2026-09-14 20:38:40
“鸡娃不如鸡己”!一张清华录取通知书,一栋6500万西三环别墅:两代人的时代际遇,掀起阶层话题热议

“鸡娃不如鸡己”!一张清华录取通知书,一栋6500万西三环别墅:两代人的时代际遇,掀起阶层话题热议

火山詩话
2026-10-01 05:59:30
刚刚,猛烈抛售!欧洲“大风暴”,席卷股市债市!

刚刚,猛烈抛售!欧洲“大风暴”,席卷股市债市!

证券时报
2026-10-01 19:45:10
首日票房直破8000万,国庆档断崖领跑,陈思诚把悬疑片大门踹烂了

首日票房直破8000万,国庆档断崖领跑,陈思诚把悬疑片大门踹烂了

悬崖边上的爱情
2026-10-02 02:55:52
彻底摊牌了!台积电重磅突破:不止2nm、3nm,硅芯片时代结束了?

彻底摊牌了!台积电重磅突破:不止2nm、3nm,硅芯片时代结束了?

疯狂小菠萝
2026-09-30 12:38:47
金鹰奖合照:秦海璐一脸不屑,蒋欣靠边站被翻白眼,宋佳又被曝瓜

金鹰奖合照:秦海璐一脸不屑,蒋欣靠边站被翻白眼,宋佳又被曝瓜

娱圈办事处
2026-10-01 15:33:23
卢璐痛别刘欢!未来的岁月里,她会做好3件事

卢璐痛别刘欢!未来的岁月里,她会做好3件事

细品名人
2026-10-02 06:13:32
WTT中国大满贯:国乒全主力出征,有一人被寄予厚望,不是王楚钦

WTT中国大满贯:国乒全主力出征,有一人被寄予厚望,不是王楚钦

云景侃记
2026-10-02 09:26:21
“拖鞋军”神话的终结:也门政府军反攻与胡塞的真实底色

“拖鞋军”神话的终结:也门政府军反攻与胡塞的真实底色

民间胡扯老哥
2026-10-01 02:14:09
我们都被课本骗了几十年:白求恩根本不是普通好人,当拨开课本简略的文字才发现,这段传奇不能只用善良概括

我们都被课本骗了几十年:白求恩根本不是普通好人,当拨开课本简略的文字才发现,这段传奇不能只用善良概括

回京历史梦
2026-10-02 08:35:16
正式退出,王楚钦主动,孙颖莎被动,递补球员曝光,王励勤安排或太坑

正式退出,王楚钦主动,孙颖莎被动,递补球员曝光,王励勤安排或太坑

喜欢体育的猫
2026-10-02 09:19:15
我国现役上将多少人?都担任什么职务

我国现役上将多少人?都担任什么职务

袁老师说历史
2026-10-01 19:36:22
那英悼念刘欢事态升级!官方介入,荒谬事出现 恐步入郭德纲后尘

那英悼念刘欢事态升级!官方介入,荒谬事出现 恐步入郭德纲后尘

江启
2026-09-30 13:48:58
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
51岁林志玲杂志封面近照引热议,网友:变化太大,差点不敢认

51岁林志玲杂志封面近照引热议,网友:变化太大,差点不敢认

韩小娱
2026-10-02 09:38:44
普京签署法令限制俄公民携带现金出境

普京签署法令限制俄公民携带现金出境

名人苟或
2026-10-01 14:36:16
孩子3年里频繁生病查不出原因,家长拆开衣柜全家人傻眼……很多人家里都有,隐蔽不起眼,赶紧自查!

孩子3年里频繁生病查不出原因,家长拆开衣柜全家人傻眼……很多人家里都有,隐蔽不起眼,赶紧自查!

新民晚报
2026-09-27 09:48:58
盘一盘主持人阿丘背后的中华文促会,相当劲爆……

盘一盘主持人阿丘背后的中华文促会,相当劲爆……

基本常识
2026-10-02 08:40:08
普京召见各派领导人,俄罗斯三号人物已定,梅德韦杰夫也没意见

普京召见各派领导人,俄罗斯三号人物已定,梅德韦杰夫也没意见

旧史新谭
2026-10-01 17:13:06
2026-10-02 10:08:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16325文章数 67101关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

迪拜航空安全事件疑点重重 副驾驶用何物刺伤机长未知

头条要闻

迪拜航空安全事件疑点重重 副驾驶用何物刺伤机长未知

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

手机
时尚
亲子
游戏
本地

手机要闻

缓解折痕加深:苹果首款折叠iPhone Duo支持更换保护膜

在米兰,用时装唤醒内心的自我

亲子要闻

鼓吹国外选精生子,收割大龄剩女的又一利器

《GTA6》十大新情报汇总 天气载具多结局等

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版