网易首页 > 网易号 > 正文 申请入驻

深度解读:智谱为什么要在 Infra 层搞 RSI?

0
分享至


电话会揭秘智谱策略,以递归式优化跑赢300亿算力成本战。

作者丨高允毅

编辑丨岑 峰

9月17日,唐杰罕见的发了一条长推,这次他聊的是最近最火的话题之一:RSI

智谱也在暗暗发力RSI,他们已经把RSI放到了Infra层面,做出一套由GLM-5.3驱动的推理基础设施。正是这套Infra系统,让 GLM-5.3-Flash,即前段时间火遍全球的匿名模型 Ox-Alpha,在发布一周内,就迅速成为了全网使用最广泛的模型之一,短短六天内处理了超过 62万亿个 Token。


更具有里程碑意义的是,这一切,全是在十万张国产芯片上跑出来的。

要知道,我们过去一直难以摆脱对英伟达的依赖,正在于国产芯片底层软件生态的薄弱,这中间有无数难以想象的算子兼容与通信难题。再加十万张芯片这个量级,难度是呈指数级上升的,在这样的集群里,每天都可能有几百张卡发生硬件故障、网络掉线或数据丢包。

而唐杰透露,从第一次全量跑通到把全部的真实生产流量切过去,智谱居然只用了短短两周。这在以往,需要一支经验丰富的基础设施工程师团队花费数周甚至数月才能完成。

面对硬件生态的不完美,智谱用软件给硬件“打补丁”并做到了极致优化。不仅让大模型顺利跑通,更使端到端吞吐量直接提升了3.2 倍

这背后体现了智谱的一个核心判断:在算力受到外部严格限制的情况下,中国 AGI 能否取得突破,关键 除了拥有 多少芯片,而在于能否通过软件更高效地调动和利用算力。智谱此举,实质上是希望借助 RSI 建立一种“底层解耦”的能力,使 AI 能够自主适配不同硬件生态,跨越硬件之间的兼容障碍。

也就是说,智谱正试图把“国产算力不好用”这一行业难题,转变为“由 AI 自动挖掘硬件极限”的技术主动权。

国产芯片集群、由 AI 深度参与的 Infra 系统、全球出圈模型,这三件事组合在一起,连唐杰忍不住感慨:我们距离RSI的终局还相差甚远,但那个 “模型优化系统、系统反哺模型” 的最小循环,已经真实地转动了起来。

01


十万张国产芯片集群:

一场没有参考答案的部署硬仗

唐杰表示要在十万张国产芯片,把一个大模型真正跑通、部署好,这并非易事。

这个事至少有三个坎,每个都足以拖垮一支经验丰富的工程团队。

首先,国产芯片的内存和数据传输速度天生就有限,不能直接照搬英伟达那套成熟经验。

其次是软件栈极不成熟,很多底层组件缺失。这里缺乏现成的运维手册,很多关键算子没有现成实现,大量底层文档甚至常常只能靠“猜”去推测和验证。

此外,还要考虑模型本身的负载极限。GLM-5.3-Flash 是全新架构,既要同时处理文字和图像,还要处理 100 万 token 的超长上下文。这意味着 KV 缓存的容量压力会呈几何级暴涨。

智谱的解法是用 GLM-5.3 驱动的Infra Agent,把几个关键技术融合一处,用软件工程能力补硬件短板。

比如,用通信换内存。采用节点内张量并行”与“层分割”,把模型按层拆分,同时在单个服务器内让多张芯片共同分担最核心的注意力和输出计算。

用计算换内存。开启 ReplaySSM 策略,内存装不下时先把数据丢掉,等用到的时候再让芯片当场现算,用极短的计算时间换取宝贵的内存空间。

用精度换容量。采用 W8A8 量化,把模型权重和激活都压缩到 8 位,直接砍掉一半以上的存储和带宽占用;再把最占空间的 KV 缓存,根据数据重要程度混用 INT8、FP8、BF16 三种精度进行动态压缩,把每一卡显存都利用到极致。

在此基础上,他们进一步把编码、预填充、解码三个阶段彻底解耦,用解耦换调度自由度。再加上 Infra Agent 的快速迭代,使得国产芯片利用率、单 Token 成本逼近英伟达的水平。

但最重要的问题在于,当 Infra Agent 陷入停滞时,往往不是因为写不出代码,而是它不知道 “为什么情况变得更糟了”

真实的推理系统不是一段静态的代码,而是从底层芯片、网络通信、内存分配到上层服务动态交织的“复杂生态”,任何一个微小的环节偏差都会引发连锁反应。在系统工程里,这被称为“稀疏反馈”

系统只会甩出一个结果,“吞吐量下降 20%”。但你并不知道,问题究竟出在底层代码、内存调度,还是数据传输?是哪一次改动引发了崩溃?下一步又该往哪走?

如果让AI去找问题,每次都要耗费数小时跑一遍完整的测试,极高的试错成本让 AI 的探索过程极其漫长。

传统的系统优化其实不缺工具,日志、测试、性能分析满天飞,但它们全都分散在不同的工程阶段里。如果是有经验的Infra工程师,他们会有“工程直觉”判断问题所在。

智谱想做的,就是把这个“工程直觉”逻辑量化,做成一套反馈机制,让AI可以追踪溯源问题所在。这个定位要足够精准,成本低廉且及时,还经得起验证。

在智谱看来,未来大厂之间的代际差距,将由“模型参与构建自身系统的深度”来决定。谁能率先跑通“模型训练 Infra”的闭环,谁就能获得智力增长的复利,从而在物理算力受限的情况下实现非线性的超车。

对此,智谱给出的答案,是一套叫“密集反馈”(Dense Feedback)的分层验证体系。

02


密集反馈:AI版Infra工程师

智谱把“密集反馈”拆成三部分,分别是正确性反馈、系统行为反馈、性能反馈。它们对应的是Infra系统中三个底层问题,“算得对不对”、“卡在哪一步” 以及 “哪种解法最优”


这就像一个资深的推理工程师,突然遇到告警,他会脑中自动弹出一条排查路径。要想理解智谱这套体系,我们不妨跟着三个真实的工程案例,看看人类工程师的工程直觉,是怎么被编码成 AI 的能力的。

案例一:长上下文精度漂移(正确性反馈)

在处理长上下文时,为了让多张芯片同时干活,系统会把长文字切成好几段,每张芯片算一段,最后再把各段的结果“拼接”起来。这种情况容易出现“长上下文精度漂移”,模型输出的结果偏差越大。

如果是资深Infra工程师,会顺着执行链路一步步去抓中间结果、拉误差曲线,排查到底是哪一次“拼接”污染了数据。

智谱把这套排查逻辑,沉淀成了正确性反馈体系。AI 像拿着显微镜一样,一眼看到是 KDA 内核在底层默认采用的计算精度,导致了舍入误差“滚雪球”累积。锁定问题后,AI 自动从开源经验库中匹配方案,把计算显式升级为更高精度的组合算法,从而解决问题。

案例二:KV 传输并发瓶颈(系统行为反馈)

系统在做大模型推理时,有一步叫“Prefill(预填充)”,就是先把用户的提示词理解一遍,并生成需要的缓存。理想情况下,系统应该“一边用 GPU 计算,一边跨节点搬运缓存数据”。

然而结果显示,两者加起来的总时间,比单独做计算慢了整整 20%。这意味着搬运基本是在“排队等”,没有和计算同步进行。

面对这种问题,传统的排查方式极其痛苦。工程师需要拉出一张巨幅的“全链路时序图”去人眼检查时间线,甚至得跨语言去翻看底层通信库(DeepEP)的 C++ 源码,盲猜是不是全局解释器锁(GIL)忘了释放,导致负责搬运的 Python 线程被卡死。

智谱把这套排查逻辑做成了“系统行为反馈体系”,相当于给 AI 装了一台“全链路 X 光机”:

它会自动拉取执行时序,看计算和通信有没有重叠。一旦发现该重叠的没重叠,直接在时序图上把异常时间片标红。

发现异常后,AI 会顺着调用链一路往下追,跨过 Python 和 C++ 的语言边界,直接钻到最底层的接口实现里去检查锁的状态。

定位到问题后,它会自动给出修复方案,并且用“时序 + 性能”两个标准一起验证:既要看时间片有没有真的重叠起来,也要看端到端性能有没有真的提上去。

这样原本需要数天才能解决并发问题,AI几秒内就能快速解决。

案例三:解码内核冗余计算(性能反馈)

模型在生成文字时,会调用一个核心计算模块(解码内核)。如果这个模块跑得不够快,会拖慢整体速度。

资深的Infra工程师会去肉眼翻看底层的汇编或算子代码。为了让多张芯片同时以最高速干活,系统通常会采用“分块(Tiling)”策略,把一个庞大的计算任务切成四个小块同时推进。这会导致一些本来只需要算一次的公共步骤,可能会重复计算四次。这是典型的“为了并行而并行”。

智谱把大量内核优化里的通用套路,变成了可复用的“优化模板库”,再配合性能反馈体系,让 AI 拥有了一套自动化搜索引擎:

首先,性能反馈会先判断瓶颈在哪。然后,AI 会去“优化模板库”里找匹配的套路。这个库是 AI 读遍了 SGLang、Flash Linear Attention、DeepGEMM 这些项目里高手手写的内核,提炼出来的通用优化骨架。

当匹配到对应场景后,AI 直接套用这个思路重构代码,跑个小规模测试验证效果,把有效的保留下来,并反哺回模板库,让它变得越来越强。

从定位问题、检查问题到解决问题,在工程层面,AI 的排障能力已经深入算子精度层,跨越了语言边界,而那些成功优化出的经验,正在以前所未有的速度形成复利效应。

Infra的RSI将是如此景象,AI工程师具备了资深系统工程师的诊断能力,可以在工程层面,更快更细致地去执行。而人类工程师把关风险和业务决策,Infra系统进化成可以高速运转流水线。

03


从“卖工具”到“卖效率”:

被订单倒逼出的 RSI

智谱过去一直凭借强悍的 Coding 能力被称为 “国内版 Claude”,瓜分了国内大部分Coding市场。但今年以来,这家大模型公司明显把大量精力砸向了底层 Infra。

为什么智谱今年会做出如此重大的战略转向?从9月16日,智谱面向投资者举行电话沟通会中,我们可以窥见一二。

智谱高层表示,今年 2 月 GLM-5 发布后,市场需求迎来大井喷,调用量瞬间暴增 10 倍,导致发布当周的算力储备就被彻底耗尽。受限于极度紧缺的算力,智谱甚至被迫紧急停售了其主力赚钱产品 Coding Plan。

受限于算力紧缺,智谱只能选择 “All-in-Infra” 策略,并火速收购了中科加禾,把整体算力使用效率提升了 2-3 倍。但即便如此,依然填不上 Coding 需求暴涨的缺口。

智谱的核心增长约束就是算力,只要给它足够的算力,它就能立刻把产品卖出去换成真金白银。

事实也很快验证了市场的预判。7 月,智谱 40 亿美元融资到位后,智谱立刻全面重启 Coding Plan 销售。这是停售半年后首次完全开放,销量直接增长超过 15 倍,再次验证了“有多少算力,就有多少收入”的逻辑。

智谱高层算过“算力”这笔账。如果前期采取饱和投入,重金砸下 300亿元 算力,其中40%用于模型训练、60%用于推理服务。一旦这60%的推理算力全价打满,凭借 GLM-5.3 理论上高达 80% 的超高毛利率,年营收能直接冲上 400 亿元。这意味着,仅需一年,智谱就能不仅收回全部算力成本,还能顺便覆盖掉训练研发的费用。

对比来看,如果只保守投入 100 亿元,必然会导致研发受阻、订单流失,陷入“两头落空”的窘境。因此,对大模型公司而言,必须坚定选择算力的规模化扩张(Scaling),没有退路。

为此,智谱布了三层牌。

首先,智谱搭建 1GW 级的超大算力数据中心,解决算力“有没有”的问题,另一方面用全国产芯片,控成本,解决自主可控的长期风险。

其次,采用云分成模式,把开源模型变成云货架上的商品。智谱已经和多家海外巨头云服务商、国内头部云厂商签署了收入分成协议:GLM 系列开源模型以托管 API 的形式上架各大云平台,收入从 10 月起正式确认。

这相当于把算力压力、运维成本、全球分发全部外包出去,智谱自己轻资产变现。

另外,在企业级 Co-work(协同工作)赛道上,GLM-5.3 最先跑通网络安全场景。目前已有 100 家安全企业接入 GLM 模型,覆盖主流安全厂商、互联网大厂、研究机构、金融机构。根据 Gartner 的预测,2026 年全球信息安全终端支出将达 2489 亿美元,2030 年更将达到 3726 亿美元,这给智谱留下了巨大的想象空间。

说到底,智谱重投 Infra,正是 Coding 需求爆发后的必然延伸。

参考链接:https://z.ai/blog/glm-built-its-inference-infrastructure

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
iPhone 17 Pro突然降价,这可能是目前最值得买的苹果手机了

iPhone 17 Pro突然降价,这可能是目前最值得买的苹果手机了

刘奔跑
2026-09-23 18:22:06
拜仁加入哈兰德争夺战,将和皇马、巴萨竞争哈兰德,作为凯恩的长期接班人

拜仁加入哈兰德争夺战,将和皇马、巴萨竞争哈兰德,作为凯恩的长期接班人

福酱的小时光
2026-09-23 09:01:35
林诗栋打疯了!单局轰11-1,3-0速胜!侯英超:这状态谁见谁怕!

林诗栋打疯了!单局轰11-1,3-0速胜!侯英超:这状态谁见谁怕!

田先生篮球
2026-09-23 21:53:27
中国是否继续允许伊朗航班降落?外交部回应

中国是否继续允许伊朗航班降落?外交部回应

看看新闻Knews
2026-09-23 17:21:18
41岁薇娅二胎得子,一家四口同框;薇娅淡出直播行业5年多,丈夫董海锋一直活跃在台前

41岁薇娅二胎得子,一家四口同框;薇娅淡出直播行业5年多,丈夫董海锋一直活跃在台前

台州交通广播
2026-09-23 13:18:03
金建宇不幸离世,年仅28岁

金建宇不幸离世,年仅28岁

上观新闻
2026-09-23 13:07:49
无锡市委书记杜小刚卸任,去向未明

无锡市委书记杜小刚卸任,去向未明

张嘴说财经
2026-09-23 21:01:14
日本3-0击败韩国,率先晋级亚运会乒乓球男团决赛

日本3-0击败韩国,率先晋级亚运会乒乓球男团决赛

懂球帝
2026-09-23 18:45:10
简约半高领无袖上衣,日常居家也能勾勒柔和曲线

简约半高领无袖上衣,日常居家也能勾勒柔和曲线

只要高兴就好
2026-09-23 13:39:54
伊朗代表团抵美 其总统安全由美特勤局负责 美方设限:从开市客、山姆购物及购买奢侈品须获批准#伊朗代表团在美购物被限制

伊朗代表团抵美 其总统安全由美特勤局负责 美方设限:从开市客、山姆购物及购买奢侈品须获批准#伊朗代表团在美购物被限制

每日经济新闻
2026-09-23 11:46:58
女子晒出与释永信合照:带十几个姐妹花一万进少林寺求财,最后真有人发了

女子晒出与释永信合照:带十几个姐妹花一万进少林寺求财,最后真有人发了

砼话里都是骗人的
2026-09-23 08:42:17
马斯克称只要有时间,就应该尽可能去中国,推荐体验中国高铁:别总盯着手机,一定要往窗外看,中国那种令人难以置信的壮丽无法用言语表达

马斯克称只要有时间,就应该尽可能去中国,推荐体验中国高铁:别总盯着手机,一定要往窗外看,中国那种令人难以置信的壮丽无法用言语表达

极目新闻
2026-09-23 08:02:11
再见巴特勒?史诗级3方交易方案,库里联手班切罗,让其他队怎么打

再见巴特勒?史诗级3方交易方案,库里联手班切罗,让其他队怎么打

篮球扫地僧
2026-09-23 20:20:38
一场3-0,中国男足亚运会冲4强对手产生,赛程调整,CCTV5直播!

一场3-0,中国男足亚运会冲4强对手产生,赛程调整,CCTV5直播!

大秦壁虎白话体育
2026-09-23 21:14:27
富养女的福报来了!江苏一男子跟女儿说等自己老了以后送养老院就行,女儿的回复震撼在场所有人

富养女的福报来了!江苏一男子跟女儿说等自己老了以后送养老院就行,女儿的回复震撼在场所有人

火山詩话
2026-09-22 14:29:25
特朗普:与伊朗领导人密谈三小时非常顺利,他们可选择伟大或毁灭

特朗普:与伊朗领导人密谈三小时非常顺利,他们可选择伟大或毁灭

阿尔卑斯瞭望
2026-09-23 18:26:40
国羽女团决赛迎战日本:王祉怡任一单,将对阵山口茜

国羽女团决赛迎战日本:王祉怡任一单,将对阵山口茜

懂球帝
2026-09-23 19:05:29
穿职业装的小姐姐,也很有魅力

穿职业装的小姐姐,也很有魅力

美女穿搭分享
2026-09-22 17:06:38
王钰栋暴怒!被撞翻后锁喉对手,主裁连出3黄,7分钟两次冲突

王钰栋暴怒!被撞翻后锁喉对手,主裁连出3黄,7分钟两次冲突

奥拜尔
2026-09-23 14:51:15
万科4天3板,刚刚炸板!逻辑搞不懂,段子刷屏了:RuBin要在万科起量

万科4天3板,刚刚炸板!逻辑搞不懂,段子刷屏了:RuBin要在万科起量

金石随笔
2026-09-23 11:00:24
2026-09-23 22:31:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

焕新价17.78万起 长城猛龙PLUS力魂版与Hi4 255 Ultra上市

态度原创

手机
数码
房产
本地
公开课

手机要闻

时隔6年透明版再度回归!小米18 Pro透明特别版发布:9999元起

数码要闻

小米首款RGB-Mini LED电视!S Pro RGB 2027正式发布:65英寸5099元起

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版