网易首页 > 网易号 > 正文 申请入驻

硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!

0
分享至


智东西
作者 李水青
编辑 漠影

2.8万亿参数的大模型,究竟要怎么跑快?

近日,海内外团队盯上了全球最大参数量的开源模型——Kimi K3。K3凭借2.8万亿总参数、104B激活参数,刷新了开源模型的性能上限。但普通的AI服务器难以承载这么大参数量的模型,Kimi官方推荐64卡甚至更大规模的AI服务器才能装得下。有业内人士表示,一般未经优化的超节点跑Kimi K3,初始性能可能仅在10 tokens/s左右。


面对如何让2.8万亿参数的Kimi K3跑得更快这一难题,国内外团队几乎同时交出了答卷。

9月21日,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,通过紧耦合128芯本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首破5.85毫秒。


9月23日,海外TPU推理优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到709 tokens/s。


一个用本土芯片做商业化超节点,一个用Google TPU做开源推理项目,指向了同一个技术思路:打破算子边界,把大模型推理的计算过程融合到极致。

大模型推理的竞争,正从模型算法层,深入到系统软件、芯片互联和内存管理层。

一、万亿MoE太难跑,海内外团队同时盯上算子融合

万亿参数大模型推理为什么慢?

很多人以为是算力不够,而实际瓶颈更在于数据搬运和内存带宽。

据知名半导体行研机构SemiAnalysis分析,K3一次前向计算的HBM带宽需求约1.5TB,896个专家需要分布到多张芯片上,每次前向还会触发超过120次All-to-All通信。即便芯片具备强大算力,数据传输跟不上节奏,大量计算能力也会被白白闲置。

对于Decode(解码)阶段而言,问题尤其明显。每生成一个Token,模型都需要持续读取大量权重。vLLM、TensorRT-LLM等传统推理框架往往需要启动大量Kernel,每个Kernel完成自己的加载、计算和写回,然后再启动下一个Kernel。

于是,计算之间出现了大量细小的“空泡”。这些碎片化空泡累积起来,就是实际速度与理论峰值之间的鸿沟。

既然kernel边界是浪费来源,那是否可以尝试消灭边界?

Inferact的思路是整个模型就是“一个kernel”。其megakernel方案使用Google Pallas,把K3的92个MoE层放进一个Pallas调用,在一个Kernel内部完成整个解码过程。当前层计算时,下一层权重就可以通过异步DMA提前从HBM搬运到片上VMEM。

这套打法成立的关键是TPU v7的架构特性。每个TensorCore自带64 MiB VMEM,数据进入VMEM后,其生命周期可以由程序显式控制。于是,Kernel作者可以主动安排哪些权重提前搬运,哪些激活继续驻留,哪些数据在使用结束后立即释放。换句话说,Inferact做的是把整个模型看成一个连续的数据流。


浪潮信息没有把整个模型彻底压成一个Kernel。

团队把众多基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。针对K3推理特点,他们把KDA、Gated MLA、MoE中众多基础算子融合为计算与通信协同执行的大算子,算子数量降低10倍,模型推理性能提升3倍以上。


具体来看,第一步是把小算子“焊成”大算子,减少中间停靠。按片上存储容量划分数据块,让前一步的结果直接留在寄存器或片上缓存中供后一步使用,减少kernel launch次数,也避免中间结果反复写入和读取HBM。

第二步,把通信和计算融合,让数据传输和计算同步进行。超级算子按照Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让下一块数据预取、当前数据计算和上一块结果写回同时进行。跨芯片通信也按照Tile推进,把通信延迟尽可能藏到计算过程里。

可以看到,前者把整个Decode过程放进一个megakernel,后者把大量细粒度算子融合成超级算子。

它们共同指向的,是传统“一个Op(算子)对应一个Kernel”的计算方式正在松动。

二、用K3优化K3:让AI参与超级算子优化

超级算子能够减少推理过程中的数据搬运与等待,但其设计和优化本身也是一项复杂的工程。数据如何复用、计算与通信如何衔接、不同阶段如何形成流水,都需要结合具体模型和硬件条件进行设计与验证。

这些工作需要大量人工投入。能否让AI参与其中,提高超级算子的生成与优化效率?

为此,浪潮信息在元脑SD200 Ultra适配Kimi K3的过程中引入“超级算子智能体”,让Kimi K3参与自身的推理优化。针对K3的推理特点,智能体生成通算融合、Tile级流水的超级算子,推动计算、通信与数据搬运协同执行。


浪潮信息首席AI战略官刘军在采访中打了个比方:过去大模型推理由数百个算子串联执行,如同绿皮火车途经数百个小站,反复启停装卸数据,整体效率低下;而超级算子就像一站直达的高铁,省去中间停靠开销。

刘军谈道,以往行业清楚这套模式的短板,但人工算子优化调度的工作量巨大。如今Agent带来解法,浪潮信息采用“用K3优化K3”的思路,依托超节点系统架构,由AI智能体自动生成超级算子,再经由模型校验迭代,性能较此前再度提升50%,形成循环加速。

可以看到,模型已经不只是被优化的对象,也开始成为优化基础设施的工具。这可能会成为下一代推理优化的重要范式。

三、芯片一张牌,系统一张牌:超节点打的是系统战

Agent时代,Token消耗增长数百万倍。据Gartner 2026年3月报告,一个Agent工作流每任务消耗的Token量是标准聊天机器人的5到30倍;高盛预测,到2030年全球Token消耗量将较2026年增长24倍,达到每月约120000万亿Token。


需求侧爆发,算力供给如何接住?

这里可以看到两个典型困境。

第一个是Kimi K3代表的“向上”。模型越来越大,推理能力越来越强,长上下文、复杂推理、多Agent协同越来越多,单机越来越难承载,算力系统需要不断突破模型能力上限。

第二个是DeepSeek代表的“向广”。当越来越多用户开始调用低成本模型,Token需求会迅速扩张。模型本身可能已经足够便宜,但如果算力供给跟不上,低价Token就很难持续。

浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算),两条线齐头并进。

向上,SD200 Ultra用5.85ms/token、单用户170 tokens/s,让前沿模型跑得起、跑得快。向广,HC2000多元算力机组用DirectCom 2.0极速架构,Prefill、Decode、FFN按负载匹配多元芯片,同等投资Token产能提升10倍。


中国玩家的护城河在哪里?

单看芯片,其与NVIDIA仍有差距,单卡算力、生态、工具链都有明显短板。但到了超节点层面,靠系统级创新可以追平甚至超越单卡更强但系统松散的方案。

以浪潮信息SD200 Ultra为例,其用3D Hyper Mesh架构紧耦合128芯本土AI芯片,提供8TB统一编址显存和64TB内存,通信时延低至0.69微秒。通过对称内存技术,首次在基于本土AI芯片的超节点上实现GPU显存直连,AllReduce通信时间降低3.5倍。

刘军谈道,超节点最基本的特征是显存要统一寻址,这一点做到了,才能把这么大的模型放进去,否则就只能叫节点集群,还是需要把模型拆分成若干段。

总的来说,芯片是一张牌,系统工程则是另一张牌。

当芯片之间能够形成更紧密的连接,内存能够形成统一空间,通信可以藏进计算过程,算子又可以由AI持续优化,单芯片性能之外的系统红利就开始释放。对于本土算力而言,这条路径尤其重要。

结语:万亿模型推理需求爆发,效率革命才刚刚开始

AI算力竞争,正从造出更快的芯片变为把现有芯片组织到极致。Inferact用16颗TPU证明一个kernel可以装下2.8万亿参数;浪潮信息用128颗本土芯片证明系统级紧耦合加超级算子,可以让本土算力跑进第一梯队。

两条路线,一个方向。大模型推理的效率革命,才刚刚开始。对中国AI产业,这个方向的特殊意义在于,在芯片工艺受限的约束下,系统级创新是确定性最高的追赶路径。浪潮信息迈出的这一步,值得被更多人看见。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
东航回应空姐下跪道歉事件:旅客情绪激动言语过激 曾威胁脚踢乘务员 正全面复盘取证

东航回应空姐下跪道歉事件:旅客情绪激动言语过激 曾威胁脚踢乘务员 正全面复盘取证

快科技
2026-09-30 16:21:03
江苏省委常委张文兵,添新职

江苏省委常委张文兵,添新职

极目新闻
2026-09-30 12:16:22
何猷君够不着蛋糕顶层,奚梦瑶一个动作出圈,豪门媳妇不是一般人

何猷君够不着蛋糕顶层,奚梦瑶一个动作出圈,豪门媳妇不是一般人

感恩每一刻
2026-09-30 06:07:27
丰田章男:若纯电成了唯一选择,那干了一辈子发动机的人怎么办?

丰田章男:若纯电成了唯一选择,那干了一辈子发动机的人怎么办?

笑熬浆糊111
2026-09-30 08:36:03
中日关系迎来变局,安倍心腹出山,68岁高龄,对高市早苗火力全开

中日关系迎来变局,安倍心腹出山,68岁高龄,对高市早苗火力全开

点燃好奇心
2026-09-29 20:46:26
潮水退去,所有资产都会露出真实价值。上海杨浦老破小如今挂牌价跌仅3万/㎡,其他区二手房同比持续下跌,曾经暴涨神话难以重现

潮水退去,所有资产都会露出真实价值。上海杨浦老破小如今挂牌价跌仅3万/㎡,其他区二手房同比持续下跌,曾经暴涨神话难以重现

捣蛋窝
2026-09-30 06:05:08
看完国足1-2输韩国后,让球迷认清三个不争事实,真不怪安东尼奥

看完国足1-2输韩国后,让球迷认清三个不争事实,真不怪安东尼奥

侃球熊弟
2026-09-30 15:54:36
真不愧是“化痰冠军”!才喝两回,痰根拔掉,润喉又顺畅

真不愧是“化痰冠军”!才喝两回,痰根拔掉,润喉又顺畅

健身狂人
2026-09-29 11:56:58
医生发现:大量喝茶的糖尿病患者,用不了多久,身体或有5大变化

医生发现:大量喝茶的糖尿病患者,用不了多久,身体或有5大变化

任医生聊健康
2026-09-30 17:20:08
对表现不满,金玟哉被换下后在替补席闭眼不看比赛

对表现不满,金玟哉被换下后在替补席闭眼不看比赛

懂球帝
2026-09-30 11:11:12
油价下跌!如火如荼,9月30日全国92,95汽油“大涨近2.03元/升”,95汽油接近9.2元/升后,下次10月15日调价,预跌220元/吨!

油价下跌!如火如荼,9月30日全国92,95汽油“大涨近2.03元/升”,95汽油接近9.2元/升后,下次10月15日调价,预跌220元/吨!

猪友巴巴
2026-09-30 15:35:20
家中漏水,维修人员灌了50多斤胶水,报价9000多元协商后业主支付6000元,结果4天后又漏了;商家登记地址为居民楼,无人居住

家中漏水,维修人员灌了50多斤胶水,报价9000多元协商后业主支付6000元,结果4天后又漏了;商家登记地址为居民楼,无人居住

91.6陕西交通广播
2026-09-29 21:03:32
黄仁勋回应“AI模型蒸馏即盗窃”争议;曝华为Mate 90系列全系支持eSIM,预计支持四卡双待;OpenAI推出全天候自主智能体Dots | 极客头条

黄仁勋回应“AI模型蒸馏即盗窃”争议;曝华为Mate 90系列全系支持eSIM,预计支持四卡双待;OpenAI推出全天候自主智能体Dots | 极客头条

CSDN
2026-09-30 10:18:50
被指是不雅视频当事人,成都一女生遭遇黄谣后两次报警:网友帮忙收集证据,警方立案

被指是不雅视频当事人,成都一女生遭遇黄谣后两次报警:网友帮忙收集证据,警方立案

潇湘晨报
2026-09-30 15:08:32
四川宜宾地震

四川宜宾地震

第一财经资讯
2026-09-30 07:55:20
亚奥理事会官宣评选男女MVP:7金王张展硕+5金王余依婷李冰洁领跑

亚奥理事会官宣评选男女MVP:7金王张展硕+5金王余依婷李冰洁领跑

醉卧浮生
2026-09-30 13:12:20
中国球迷意难平!不止因为国足1:2遭韩国逆转,更多在于这五点!

中国球迷意难平!不止因为国足1:2遭韩国逆转,更多在于这五点!

田先生篮球
2026-09-30 16:48:08
四平溃败东北濒临崩盘,无人敢战之际,却被闲置时的陈光一战翻盘

四平溃败东北濒临崩盘,无人敢战之际,却被闲置时的陈光一战翻盘

纪史行者
2026-09-27 06:35:06
139票赞成,0票反对,匈牙利传来新消息!

139票赞成,0票反对,匈牙利传来新消息!

故事终将光明磊落
2026-09-30 16:26:44
金鹰奖这一夜,人情冷暖,江湖地位,在朱亚文身上体现得淋漓尽致

金鹰奖这一夜,人情冷暖,江湖地位,在朱亚文身上体现得淋漓尽致

陈意小可爱
2026-09-30 07:17:52
2026-09-30 20:52:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12688文章数 117176关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

7旬兄弟抢母亲20万遗产 哥哥把弟弟打进ICU终身瘫痪

头条要闻

7旬兄弟抢母亲20万遗产 哥哥把弟弟打进ICU终身瘫痪

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

游戏
本地
手机
房产
公开课

PS三款经典老游戏突遭下架 无提前说明 或迎重制版

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

手机要闻

iQOO 16超广角传感器确认:格科GC50F0加持

房产要闻

自贸启新境,安居在海口!2026 海口好房子金秋购房节盛大启幕

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版