网易首页 > 网易号 > 正文 申请入驻

AI自己榨干算力!让Kimi K3自己写「超级算子」,推理快了3倍

0
分享至


新智元报道


大模型提速,原来还有这条路!

上一周,vLLM原班人马创办的Inferact,开源了一套TPU Megakernels(巨型算子)。

他们把Kimi K3的92个MoE层一层不落地写进同一个程序,扔到16颗谷歌TPU v7上跑:

开着投机解码,单用户输出速度达到709 tokens/s;同样16块英伟达GB200,用vLLM跑,是452 tokens/s。

关掉投机解码,在1到8的并发下,它也都是GB200的1.4到2倍。

最扎心的是,按纸面参数,TPU v7的显存带宽(7380GB/s)还比GB200(8000GB/s)低一截。

硬件没占到便宜,赢在了写法上。


还有个彩蛋,这套巨型算子从零编译只要不到90秒。以前在TPU上编译一个同量级的大模型,动辄半小时起步。

同一周,国内也传来进展。

在AICC2026上,浪潮信息发布元脑SD200 Ultra超节点AI服务器,用128芯的本土AI芯片,单机跑起同一个K3,Token生成时延压到5.85毫秒。

他们的招数叫「超级算子」。

一个用谷歌TPU,一个用本土AI芯片,同一周、同一个模型,都在拆算子之间的那堵墙。

更有意思的是,浪潮信息的超级算子,有一大块是让K3自己写的。

大模型吐字慢

到底卡在哪儿

很多人以为大模型吐字慢是算力不够。其实芯片大部分时间闲着,在等数据。

模型每生成一个token,都要把用到的参数从显存(HBM)里搬一遍。算得再快,货没到也只能干等。

所以推理速度的天花板,很多时候由显存带宽说了算。

很多时候,麻烦出在「算子」上。算子可以理解成一个个小程序,做一次矩阵乘、做一次归一化,各管一摊。

传统推理框架里,生成一个token要依次启动一长串算子,每个都走一遍「搬数据—计算—写回去」。

据统计,K3单步推理要调用数千次算子。

打个比方,这就像坐老式绿皮火车从北京到广州,一路几百个小站,每站都要停车、卸货、装货、再启动,两天两夜才到。

车停着的那几分钟,铁轨是空的。换到芯片上,就是显存带宽在算子切换的空档里被白白浪费。

一个空档不起眼,几千个攒起来,就是理论速度和实际速度之间那道大坑。

英伟达这些年也在补坑,CUDA Graphs、PDL这些技术能让车停得短一点。可站还在,车就得停。

那就把站撤了,改高铁,一站直达。这就是算子融合。

整个模型,就是一个算子

Inferact的做法最狠:既然边界是浪费的源头,那就一个边界都不留。

92层全装进一个kernel,程序按层号自己判断这一层该走KDA还是MLA(K3用的两种注意力机制)。

所有层都在同一个程序里,上一层还在算,下一层的权重就已经在搬运的路上了。等轮到它,货早就码在芯片手边。


这招能成,得感谢TPU的一个设计。

TPU v7每个核心自带64MiB的片上高速内存(VMEM),数据搬进来放多久、什么时候腾地方,全由程序说了算。

GPU的片上内存要分给一百多个计算单元,每个单元只摊到两百多KB,想提前囤货都没地方放。

TPU给了一个大仓库,还把钥匙交给了写程序的人。

至于编译为什么快得离谱,Inferact的解释很实在:

原来编译器每次都要在成百上千个操作里反复摸索怎么排顺序、怎么重叠,现在这些活儿,工程师一次性手工做完了。

注意这个「手工」一词,四位作者都是顶尖的推理工程师,写这样一个巨型算子,门槛高得吓人。

Inferact在博文里也留了一句:以后会有更多这样的kernel,由编程智能体(coding agent)来写。


写算子这门手艺

AI正在接手

这句话可不是客套。

9月14日,DeepSeek的算子工程师刘胜与发了一篇长文,跟自己「手写算子的时光」告别。

他给DeepSeek V4.1写过主注意力算子,是真正在一线拧螺丝的人。他在文中预计,半年到一年内,AI写的算子就会追上甚至超过他。

一年前,他的AI助手还只能帮忙找bug;现在已经能自己读CUDA、PTX、SASS这些底层代码,动手调优。

他还写了一句很扎心的话:自己算子写得越好,新模型训练和推理就越快,他被替代得也越快。

大洋彼岸也在跑同一条路。今年4月,Cursor和英伟达合作,用一套多智能体系统优化了235个CUDA算子,三周跑下来,平均提速38%。


为什么偏偏是算子最先被AI接手?

因为它有标准答案:结果对不对,一跑就知道;快了多少,秒表说了算。

AI可以没日没夜地写、测、改,人熬不过它。

浪潮信息,已经把这件事用在了K3身上。

让K3优化K3,系统级破局

面对同样的Kimi K3,国内的浪潮信息也在做算子融合,同时把优化延伸到整个超节点系统。

两家的共同点很明确:把细粒度的小算子融合成大算子,减少启动和数据搬运的开销。

区别就在于粒度。Inferact把整个解码过程融合成一个算子;浪潮信息的粒度相对较小,围绕KDA、Gated MLA、MoE等模块做融合,形成超级算子。

也就是说,两家都在减少中间停靠,只是合并的范围不同。

在不久前的AICC 2026上,浪潮信息直接亮出了元脑SD200 Ultra超节点AI服务器。


它的底层逻辑很务实:在单卡显存和制造工艺存在现实约束的客观环境下,想要承载2.8万亿参数、还要把时延降下来,必须走系统级创新。

元脑SD200 Ultra采用3D Hyper Mesh架构,将128颗AI芯片组织成协同计算的整体,提供8TB统一编址显存,并配合64TB内存,为模型权重和不断增长的KV Cache提供承载空间。

这样,前沿模型就能够充分利用多颗芯片的计算和显存资源,支持10万亿参数模型在单机上部署和运行。

紧接着,他们在这个底座上干了三件非常狠的事:

  • 搞定「对称内存」,实现显存直接串门

在传统集群里,GPU之间互通数据,必须由CPU充当中介打报告、做调度,层层转手。

这就像同一个小区的邻居互相串门,过去非得先跑一趟物业,办个进门条才能去隔壁单元。

而SD200 Ultra通过对称内存技术,彻底踢开了中间层,显存统一编址,GPU直接点对点访问远端显存,相当于推门就进邻居家。

这一招,直接把跨卡通信时延压到0.69微秒,AllReduce通信时间骤降3.5倍!


  • 通算融合,把绿皮车升级成直达高铁

数据通路打通后,接下来超级算子的优化分三步展开。

第一步,把小算子变成大算子,减少中间停靠。

具体做法是,把KDA、Gated MLA、MoE等模块中的细粒度算子融合成超级算子。结果,算子数量减少到原来的约十分之一。

关键在于,合并之后,数据怎么留在芯片手边。

工程师会根据片上存储容量,把数据切成合适大小的块。前一步算出的结果,尽量直接留在寄存器或片上缓存中,交给后一步接着用。

就像几个工位连在一起,半成品顺手递过去,省掉了每做一道工序都送回仓库、再取出来的折腾。这样既减少了kernel的启动次数,也减少了中间结果反复写入、读取HBM的开销。

第二步,把通信和计算融合,让搬数据与做计算同步进行。

大算子内部也要「排好班」。团队按Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让不同数据处在不同的处理阶段——

当前块正在计算,下一块提前搬进来,已经算完的块则写回结果。

缓冲区轮流接力,芯片就能少一些等数据的空档。


  • 用K3优化K3,超级算子智能体的诞生

第三步,就是让K3参与优化K3,把调优做成持续迭代的闭环。

人工手写深度融合的Kernel,复杂度高到非普通人所能承受。

浪潮信息的办法,是让K3自己上手。他们用K3搭了一个「超级算子智能体」,让它在一个「生成—验证—测量—迭代」的闭环里一圈圈转:

K3先看运行画像,哪一步在等数据、哪块缓存没用满,心里有数;再据此提出怎么并算子、怎么切数据块、怎么排流水线,自动写出一批候选超级算子。

候选版本先过正确性校验,再拉到真实负载上跑分。延迟多少、显存读写了多少、占了多少资源,这些数字再喂回给K3,当作下一轮改进的依据。

只有算得对、又确实更快的版本,才会被部署上线。

在闭环迭代的最后阶段,算子性能直接进入正向循环,性能硬生生再拉升了50%,综合推理效能提升了3倍以上!

最终成绩单出炉,单机稳稳吃下2.8万亿参数的Kimi K3,Token生成时延首度杀进5.85毫秒,单用户吞吐突破170 tokens/s,跑出了业界平均水平的5倍速度。

大家都在盯的,是Token速度

芯片的纸面参数越来越接近,拉开差距的是软件和系统:

算子边界在消失,通信和计算在合流,写算子的活儿,越来越多交给AI。

对国产算力来说,这条路尤其实在。

SD200 Ultra这回摆出来的是另一种解法:靠系统级的紧耦合,加上算子层的深度优化,基于本土AI芯片的超节点照样能把2.8万亿参数的模型跑进毫秒级时延。

模型一个字不改,光靠算子融合和内存管理就能拿到几倍提升,比干等下一代芯片快,也便宜。

更深的变化,发生在买算力的人身上。

以前来买AI服务器的多是专业用户,开口就是要多少卡、多少网络、多少存储。现在客户上来先问一句:这个模型,在你机器上能跑多快?

背后的推手是Agent。聊天的时候,回答慢两秒无所谓。可一个Agent任务要经历上百轮「推理—调工具—看结果—重新规划」,每一轮慢一点,整条链路就能慢出好几分钟。

这种时候,卡有多少张、峰值算力多高,普通用户根本摸不着。

每秒吐多少token、一个token要等多久,才是直接落在体验上的东西。

浪潮信息把这类需求叫「能力型智算」:让最前沿、最大的模型跑得起来,还得跑得快,去啃过去啃不动的问题。

SD200 Ultra给10万亿参数的模型留足了空间,按浪潮信息首席AI战略官刘军的判断,一两年内顶尖开源模型就会走到这个量级。K3只是第一个被它跑快的模型。

所以下回再有人拿「多少张卡、多少P算力」跟你介绍一台AI服务器,不妨多问一句:

最前沿的模型,在上面Token生成速度有多快?

SD200 Ultra交出的答案是:K3,5.85毫秒一个。

AI下一站:

拼系统,拼AI写算子

这一场围绕K3的推理极速战,折射出整个AI计算产业正在发生的剧烈质变。

提速的主战场,从芯片挪到了系统。

过去两年,推理加速主要靠算法:量化、投机解码、压缩KV Cache。这一轮的提速,模型一个字没改。

Inferact手里的TPU,显存带宽比GB200还低,照样跑赢;浪潮信息靠超级算子,在同一套硬件上把K3的推理性能拉高3倍以上。

同样的芯片,组织得好不好,能差出好几倍。

墙会一堵一堵地被拆掉。

推理说到底是在搬数据,时间都耗在各种「边界」上。算子和算子之间有墙,于是有了算子融合;计算和通信之间有墙,于是有了通算融合;芯片和芯片之间有墙,于是有了统一编址和显存直连。

写算子这门手艺,正在交给Agent。

Inferact的巨型算子还是人手写的,但他们自己也说,以后这活儿更多归编程智能体。

浪潮信息走得更靠前,已经让K3给K3写了超级算子。

算子交给AI,最大的变化是定制化变便宜了。以前给一个模型专门手写一套算子太贵,模型一换代就白干,大家只能做通用优化。

刘军说,Agent时代反倒给了机会:针对具体模型,从芯片、系统、通信到算子进行协同调优,让Kimi K3模型的推理效率不断逼近系统的极限。

更有意思的是,现在新模型一发布,就能让它带着智能体给自己写一套专属算子,跑一遍,测一遍,再改一遍。

模型越强,写出的算子越好;推理越快,下一轮迭代也越快。

大模型时代的下半场,拼的早就不再是一两句惊艳的对话,而是实打实解决问题、完成任务的执行力。

每一次Agent的任务拆解、每一次工具的自动调用、每一个长程逻辑的自我纠偏,背后都在疯狂燃烧着推理Token。

在这场关乎生产力重构的竞赛中,时延和吞吐已经不仅是体验问题,而是直接决定了Agent能否在现实世界中完成闭环。

从硅谷的Megakernels,到中国超节点上的超级算子,全球顶尖工程师们正在沿着相似的路径,解决同一个问题:怎样让每一个Token更快地产生,让有限的算力转化为更多可用的智能。

推理的效率革命才刚刚拉开大幕,这场好戏,正越来越精彩。

编辑:桃子

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
"林诗栋击败中国选手王楚钦":央视解说被骂上热搜,张继科回应

"林诗栋击败中国选手王楚钦":央视解说被骂上热搜,张继科回应

寒士之言本尊
2026-10-01 15:13:57
10月1日,大家盼了许久的2026年退休人员基本养老金不涨了吗?

10月1日,大家盼了许久的2026年退休人员基本养老金不涨了吗?

老酖说体育
2026-10-01 21:22:09
东航空姐下跪反转!知情人曝细节,并非故意刁难,真相不简单

东航空姐下跪反转!知情人曝细节,并非故意刁难,真相不简单

寒士之言本尊
2026-10-01 15:15:46
只剩九指!手术直接生涯报销!伦纳德,你赢了...

只剩九指!手术直接生涯报销!伦纳德,你赢了...

柚子说球
2026-10-01 10:48:37
AI“砸饭碗”担忧暂缓!埃森哲845亿年订单创纪录、指引超预期,股价盘中暴涨超20%|财报见闻

AI“砸饭碗”担忧暂缓!埃森哲845亿年订单创纪录、指引超预期,股价盘中暴涨超20%|财报见闻

华尔街见闻官方
2026-10-02 06:36:03
驻日武官王庆简:潜伏在日本20年,出卖了无数军情,没料到最后竟被一个老习惯断送了性命

驻日武官王庆简:潜伏在日本20年,出卖了无数军情,没料到最后竟被一个老习惯断送了性命

磊子讲史
2026-09-16 18:16:40
苦战163分钟!中网金花德比:郑钦文2-1险些爆冷,下一轮对手出炉

苦战163分钟!中网金花德比:郑钦文2-1险些爆冷,下一轮对手出炉

侃球熊弟
2026-10-01 12:18:01
10月1日,财政部发布重要消息,2026年养老金调整确定了吗?

10月1日,财政部发布重要消息,2026年养老金调整确定了吗?

虎哥闲聊
2026-10-01 14:23:06
舆论反转!Tiffany月饼风波引爆全网,涉事富婆组20个群上万人声讨,网友:人家丢了工作还不罢休,至于把销售往死里整吗

舆论反转!Tiffany月饼风波引爆全网,涉事富婆组20个群上万人声讨,网友:人家丢了工作还不罢休,至于把销售往死里整吗

火山詩话
2026-10-01 21:23:19
全网群嘲的“穷人吃超长蛋挞”文案,炸出多少炫耀上瘾的有毒群体

全网群嘲的“穷人吃超长蛋挞”文案,炸出多少炫耀上瘾的有毒群体

小椰子专栏
2026-10-01 13:00:31
以色列:以方今后将掌握所有飞往以色列航班飞行员身份,并进行一定程度安全审查

以色列:以方今后将掌握所有飞往以色列航班飞行员身份,并进行一定程度安全审查

新京报
2026-10-01 15:49:35
新加坡仇印情绪爆发,7%人口霸占31%高位,不干活光摘桃终遭反噬

新加坡仇印情绪爆发,7%人口霸占31%高位,不干活光摘桃终遭反噬

叹为观止易
2026-09-12 21:00:00
维蒂尼亚:很高兴打进葡萄牙队首球,我们踢得很出色

维蒂尼亚:很高兴打进葡萄牙队首球,我们踢得很出色

懂球帝
2026-10-02 05:08:09
全体退休人员好消息!正式决定:2026年70岁以上高龄的老人或迎…

全体退休人员好消息!正式决定:2026年70岁以上高龄的老人或迎…

小虎新车推荐员
2026-10-01 21:28:23
请维护宪法尊严,查明人大代表多吉扎西被非法拘留、逮捕问题

请维护宪法尊严,查明人大代表多吉扎西被非法拘留、逮捕问题

老镡讲故事
2026-10-01 19:09:10
赛力斯为什么又回来了,不是想复合,是没准备好

赛力斯为什么又回来了,不是想复合,是没准备好

风风顺
2026-10-02 00:00:06
牡丹花下死!管不住“下半身”的张本智和,终为自己的荒唐买了单

牡丹花下死!管不住“下半身”的张本智和,终为自己的荒唐买了单

傲傲讲历史
2026-10-02 04:11:53
网传二三线城市上演中产大撤退,评论区炸锅...

网传二三线城市上演中产大撤退,评论区炸锅...

慧翔百科
2026-09-30 11:30:59
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
最坏结果来了,专家预判曼城本赛季扣分,最重处罚直接踢英乙

最坏结果来了,专家预判曼城本赛季扣分,最重处罚直接踢英乙

飘逸语人
2026-10-02 08:06:45
2026-10-02 09:08:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16325文章数 67100关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

健康
手机
教育
房产
军事航空

刷酸祛痘,为什么有人翻车?

手机要闻

荣耀Magic9用户反馈盘点,想种草的可以看看

教育要闻

六年级竞赛题:难住不少真学霸

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版