网易首页 > 网易号 > 正文 申请入驻

刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM

0
分享至


两周时间,10 万颗国产 AI 加速器,一个开始优化自己的模型。

就在刚刚,智谱 GLM 首席科学家唐杰在 X 平台分享了一项关于 GLM-5.3-Flash 推理系统优化的研究。

他透露,从 GLM-5.3-Flash 首次运行在国产 AI 加速器上,到完成全部生产流量承载,仅用了两周时间。在这个过程中,系统端到端吞吐能力提升了 3.2 倍。

最让唐杰印象深刻的是,完成大量优化工作的并非只有基础设施工程师,还有一个由 GLM-5.3 驱动的 Infra Agent。

「一个帮助优化服务自身的模型。」唐杰这样描述这一变化。


在他看来,这意味着 AI 开始参与优化承载自身运行的系统。虽然距离真正意义上的递归自我改进(Recursive Self-Improvement,RSI)仍然很远,但一种早期形态已经出现。

智谱团队也提到,过去一年里,他们观察到 GLM 的角色正在发生变化。

最初,团队探索 GLM 在代码理解和网络安全领域的能力,希望让模型帮助分析复杂代码中的漏洞。但随着模型能力提升,GLM 开始参与构建 AI 系统本身。

团队表示,他们曾观察到模型完成一些过去需要资深基础设施工程师团队花费数周才能完成的任务,而这些工作又会直接影响下一代模型训练和部署方式。

两周完成国产算力集群部署

将一个大模型从新硬件上的首次运行,推进到能够稳定承载生产请求的推理服务,需要大量系统工程工作。

GLM-5.3-Flash 此次部署运行在超过 10 万颗国产 AI 加速器组成的集群上。智谱团队表示,这是一次此前缺少成熟经验参考的大规模部署。

团队需要解决多个问题,包括国产芯片显存容量和互联带宽限制、新模型架构适配、100 万 token 长上下文支持,以及多模态请求处理等。与此同时,国产 AI 加速器的软件生态仍处于发展阶段,部分 Kernel 支持不足,很多资料也需要工程团队自行探索。

唐杰表示,在这些限制条件下,GLM-5.3 驱动的 Infra Agent 参与了推理系统优化过程,帮助分析性能瓶颈、提出优化方案,并完成部分代码修改。

整个优化过程并不是简单增加计算资源,而是在算力、内存、通信和调度之间寻找新的平衡。

智谱团队采用了一系列优化方案。例如,通过 ReplaySSM 用计算换取内存空间,通过节点内张量并行降低显存压力,通过 INT8、FP8、BF16 混合精度缓存提高容量利用率,同时引入 Encode-Prefill-Decode(EPD)分离式架构,让不同推理阶段能够更加灵活地调度。

最终,GLM-5.3-Flash 的端到端服务性能相比初始版本提升约 3 倍,硬件利用率和单 token 成本达到接近主流 NVIDIA GPU 平台的水平。


部署完成后,GLM-5.3-Flash 还进入真实使用环境测试。智谱团队介绍,该模型曾以匿名模型名 Ox-Alpha 运行在 OpenCode 和 OpenRouter 平台,一周内成为两个平台使用量最高的模型之一,六天处理超过 62 万亿 token。

不过,这次实验真正的变化,并不只是让 AI 写代码,而是让 AI 能够理解复杂系统为什么出现性能变化。

唐杰提到,Infra Agent 遇到困难时,很少是因为无法编写代码,而是无法判断「为什么结果变差」。

例如,当系统反馈「吞吐下降 20%」时,它只能说明某个地方出现异常,却无法直接告诉 Agent 哪一层出了问题,当前假设是否错误,以及下一步应该验证什么。

对于资深工程师来说,这类判断依赖长期经验。工程师知道什么时候查看执行时间线,什么时候运行微基准测试,以及应该比较哪个模块的输出。

智谱团队希望把这种工程经验转化为 AI 可以调用的反馈机制,并将其称为「dense feedback」。


这套机制的核心,是让 Agent 获得更加接近工程判断过程的信息。

当模型需要确认计算是否正确时,它可以获得对应的正确性反馈;当模型需要分析性能下降原因时,它可以查看系统运行过程中的时间消耗;当模型尝试新的优化方案时,它可以通过实验判断该方案是否适用于当前场景。

智谱团队认为,真正有效的反馈需要满足几个条件,它必须足够接近具体问题,能够快速获得,同时能够通过客观实验验证。否则,大量日志和指标反而可能让 Agent 难以判断下一步行动方向。

「模型优化系统,系统服务模型」

在 dense feedback 的帮助下,Infra Agent 开始参与定位推理系统中的隐藏问题。

在 KDA 的上下文并行路径中,Agent 发现了一个影响长上下文计算精度的问题。

由于不同上下文分片之间需要不断合并状态矩阵,TF32 计算产生的舍入误差会随着序列长度增加不断累积,最终导致计算结果偏差。

Agent 通过比较不同执行路径的结果,将问题定位到状态传播和合并过程中的精度处理。相关修复已经合并到 Flash Linear Attention 项目 PR #1180。

另一个问题出现在 KV Transfer 与 DeepEP 调度之间。

测试过程中,Agent 发现 KV Transfer 没有与 DeepEP Dispatch 形成有效重叠,导致部分场景下传输开销超过 30%。

随后,Agent 沿着 Python 与 C++ 调用链继续分析,发现节点内路径没有及时释放 Python GIL,使传输任务无法及时推进。

完成修改后,KV Transfer 带来的额外开销从超过 30% 降低到 1% 以下。


此外,Agent 还优化了一个 Decode Kernel。

它发现,由于 Kernel 切分方式的问题,同一组归一化计算被重复执行四次。通过重新组织计算结构,减少重复计算,该 Kernel 最终获得 1.71 倍性能提升。

这一优化思路来自 Agent 对 SGLang、Flash Linear Attention 和 DeepGEMM 等项目现有 Kernel 的学习。它将这些代码中的优化经验提炼成「optimization skeleton」,再结合当前系统反馈判断是否适用。


过去,类似优化经验主要依赖工程师个人积累。

而在这一过程中,Agent 开始能够从已有代码中学习优化方法,再通过实验验证这些方法是否适合新的硬件和模型环境。

唐杰表示,人类工程师仍然负责设定目标、搭建反馈环境,以及审核高风险修改。

但工程师的角色正在变化,从直接解决每一个问题的人,逐渐转向设计反馈系统的人。

智谱团队认为,建立在真实基础设施任务上的可验证反馈环境,可能也是训练下一代模型的重要基础。每一次 Agent 完成工程任务,都可能成为下一代模型学习的数据。

目前,GLM-5.3-Flash 的案例距离真正意义上的递归自我改进仍然存在距离。

但唐杰认为,一个最小规模的循环已经出现。

模型优化系统,而系统服务模型。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
你参加过最垃圾的婚礼是什么样的?网友:我结婚如果在老家,要请一些保镖保护人身安全

你参加过最垃圾的婚礼是什么样的?网友:我结婚如果在老家,要请一些保镖保护人身安全

解读热点事件
2026-09-16 00:05:11
世界斯诺克巡回赛:正与艾伦保持沟通,他的连续退赛引发球迷担忧

世界斯诺克巡回赛:正与艾伦保持沟通,他的连续退赛引发球迷担忧

创造精彩剧情
2026-09-17 09:59:55
三角杯最适合小胖子,想要线条收着点就行

三角杯最适合小胖子,想要线条收着点就行

飛尚日记
2026-09-17 06:40:02
4-0零封碾压!马竞豪取两连胜,全场最大功臣根本不是李刚仁

4-0零封碾压!马竞豪取两连胜,全场最大功臣根本不是李刚仁

透视到底
2026-09-17 09:36:34
盛宣怀三计搞垮胡雪岩,五十二年之后,其子冻毙于仇家老宅门外

盛宣怀三计搞垮胡雪岩,五十二年之后,其子冻毙于仇家老宅门外

唠叨说历史
2026-07-02 16:37:51
1953年,许世友回乡去枪毙亲叔叔,见母亲落泪,他收枪了,后续呢

1953年,许世友回乡去枪毙亲叔叔,见母亲落泪,他收枪了,后续呢

简史档案馆
2026-09-14 11:05:03
原来他俩是敬一丹弟弟!如今身居高位,手足四人名字细品大有乾坤

原来他俩是敬一丹弟弟!如今身居高位,手足四人名字细品大有乾坤

大鱼简科
2026-09-17 11:53:44
网传日本女优高桥来中国仙人跳,与客人钱色交易后又顺走50万日元

网传日本女优高桥来中国仙人跳,与客人钱色交易后又顺走50万日元

雪峰说法
2026-09-15 08:05:03
12306新增购票弹窗提醒:选“泸州东站”请注意实际位置

12306新增购票弹窗提醒:选“泸州东站”请注意实际位置

观察者网
2026-09-17 10:41:16
最新消息!事关职工退休!

最新消息!事关职工退休!

句容日报
2026-09-17 18:20:29
上海动迁格局已定!未来五年这些地方要动

上海动迁格局已定!未来五年这些地方要动

童童聊娱乐啊
2026-09-17 11:38:07
新疆生产建设兵团卫生健康委员会原副主任刘惟被查

新疆生产建设兵团卫生健康委员会原副主任刘惟被查

新京报
2026-09-17 11:40:11
巴菲特:要选一个比自己优秀的人结婚——选处处不如你的人,是一辈子的麻烦

巴菲特:要选一个比自己优秀的人结婚——选处处不如你的人,是一辈子的麻烦

杏花烟雨江南的碧园
2026-08-20 16:15:03
你在哪一刻意识到了贫富差距?网友:家庭累死累活一年收入不如朋友银行的利息

你在哪一刻意识到了贫富差距?网友:家庭累死累活一年收入不如朋友银行的利息

解读热点事件
2026-09-12 00:09:04
国少选拔,4名乒二代亮相!王皓马琳俩儿子一轮游、王楠之女收获亚军

国少选拔,4名乒二代亮相!王皓马琳俩儿子一轮游、王楠之女收获亚军

十点街球体育
2026-09-16 22:35:00
国乒7胜3负!19岁小将逆转韩国世界冠军,王艺迪兼三项女双过关

国乒7胜3负!19岁小将逆转韩国世界冠军,王艺迪兼三项女双过关

乒烧泳球
2026-09-17 18:59:43
又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

汉史趣闻
2026-09-10 18:28:47
大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

大家发现没,王楚钦越来越不对劲,不是球技断崖下滑,也不是长相变化,而是精气神肉眼可见地被透支

乒乓助手
2026-08-21 00:37:44
姜子牙因封神榜无名痛哭,元始天尊大笑着说:早就给你留好了位置

姜子牙因封神榜无名痛哭,元始天尊大笑着说:早就给你留好了位置

千秋文化
2026-09-05 20:20:39
中国男足亚运形势:下轮赢伊朗仍未确保出线!极端情况2连胜出局

中国男足亚运形势:下轮赢伊朗仍未确保出线!极端情况2连胜出局

我爱英超
2026-09-16 20:39:18
2026-09-17 19:55:00
爱范儿 incentive-icons
爱范儿
消费科技第一媒体
39436文章数 2602526关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

小伙拍母亲最后14天看哭网友:从"铿锵有力"到天人永隔

头条要闻

小伙拍母亲最后14天看哭网友:从"铿锵有力"到天人永隔

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰正式公开 华为技术加持打造家庭泛越野智能座舱

态度原创

家居
艺术
亲子
时尚
手机

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

深圳第二座机场,5张效果图透露新地标样貌!

亲子要闻

宝蓝盲猜糖果还是冰淇淋大挑战,快看看谁赢了~

初秋衣服不用买得太多,准备几件针织衫,温柔大方又显气质

手机要闻

华为nova 16系列销量突破200万台:麒麟9系+红枫影像

无障碍浏览 进入关怀版