网易首页 > 网易号 > 正文 申请入驻

GLM 5.2 开源,技术博客详览

0
分享至

国产模型的高光时刻

GLM-5.2 现已开源,技术博客同步放出:

744B MoE,40B 激活,1M 上下文,MIT 协议

模型已纳入 GLM Coding Plan,API 同步上线,全量可用,价格跟 5.1 保持一致

在大家最为关心的 Coding 领域,GLM-5.2 在 Arena 上以 1595 分拿下第二,也是这个Coding 榜单上最强的【可用模型】

考虑到最近 Gemini 不尽如人意,可以说...GLM 挤掉哈基米,荣登 coding 御三家


Code Arena: Frontend(来源:arena.ai)

还有就是:今晚在有 GLM 开发者见面会,欢迎大家来玩(见文末)

Benchmark 总览


GLM-5.2 Full Benchmark Table

GLM-5.2 专为长程任务能力(Long Horizon Task)而生,全新特色包括:

- Solid 1M 上下文,稳定支撑长程任务

- 更强体感\更实用的 Coding 能力

- 极致 Infra 优化,Day 0 运行在国产算力平台

- MIT 开源协议,允许美国人民使用

长程任务

三个基准均跑在 1M 上下文、Max 档位、128K 最大输出下,GLM-5.2 在所有开源模型中排名第一


Long-Horizon Task Evaluation

FrontierSWE(20 小时级复杂工程)

Opus 4.8:75.1%,GLM-5.2:74.4%,GPT-5.5:72.6%。差 0.7 个百分点

PostTrainBench(给 Agent 一块 H100,10 小时内做 post-training)

Opus 4.8:37.2%,GLM-5.2:34.3%,GPT-5.5:25.0%

SWE-Marathon(编译器、内核优化等超长周期工程)

Opus 4.8:26.0%,Opus 4.7:16.0%,GLM-5.2:13.0%,GPT-5.5:12.0%。差了一倍,排在 Opus 4.7 后面

Coding 评测

8 项 Coding + Agentic 评测中,GLM-5.2 保持开源 SOTA,相比 5.1 跨代提升明显


LLM Performance Evaluation

Terminal-Bench 2.1:GLM-5.2 拿 81.0,Opus 4.8 是 85.0,GPT-5.5 是 84.0(5.1 是 63.5)

MCP-Atlas:77.0 vs 77.8。SWE-bench Pro:62.1 vs 69.2。NL2Repo:48.9 vs 69.7,这项差距最大

值得注意的是 HLE with Tools:GLM-5.2 拿了 54.7,Opus 4.8 是 52.3,GPT-5.5 是 52.2

效率曲线

在 Claude Code 上跑 Terminal-Bench 2.1、DeepSWE、SWE-Atlas 的平均分,GLM-5.2 的 High 档跟 Opus 4.8 的 High 基本重合(约 73%),Max 档 GLM-5.2 约 75%,Opus 4.8 约 78%


Agentic Coding Performance by Effort Level

对比 GLM-5.1:Non-Thinking 到 Max 全程低 15 到 20 个百分点,代际提升很大

1M 上下文架构

为了让 1M 上下文在工程上真正可用,GLM-5.2 在架构和推理引擎上做了系统优化


GLM-5.2 Architecture for 1M Context

IndexShare for DSA

每 4 层 transformer 共享一个轻量 indexer,top-k 索引复用到后续 3 层,省掉 3/4 的 indexer 点积和 top-k 计算。从 mid-training 阶段就用 IndexShare 训练

MTP with IndexShare and KVShare

改进 MTP 层用于投机解码:indexer 只在第一步放置,后续步骤复用 top-k 索引。这样第二步的 KV cache 只包含来自 target model 的隐状态,消除了 GLM-5.1 中的训练和推理不一致


MTP Inference with IndexShare

四步叠加效果:baseline 4.56 > +IndexShare+KVShare 5.10 > +Rejection Sampling 5.29 > +End-to-end TV Loss 5.47(+20%)

Serving 1M

上下文从 200K 扩到 1M 后,推理瓶颈转向 KV-cache 容量、长上下文 kernel 开销和 CPU 侧开销。三个方向优化:基于 LayerSplit 的细粒度内存管理和并行策略,长上下文 kernel 与 cache 传输 pipeline 协同,CPU 侧缓存管理和请求调度


随上下文长度增长,GLM-5.2 的吞吐优势更大

Agentic RL 训练

GLM-5.2 的 agentic RL post-training 涉及更大规模、更多领域、更复杂的执行模式。长程交互、工具调用、子任务拆解、多轮环境反馈都对 rollout 和训练编排提出了更高要求。两个核心改动:一是用 slime 框架统一训练和大规模推理 rollout,二是针对 coding RL 的 reward hacking 问题引入 anti-hack 模块

slime 框架

slime 是从训练到大规模推理 rollout 的一体化基础设施,支持 white-box / black-box rollout、compact trajectory、sub-agent workflow。GLM-5.2 的 post-training 用 slime 做并行 OPD 训练,将 10+ 个专家模型合并为最终模型,整个 OPD 过程约两天完成

长程 RL + Anti-Hack

长程任务的执行轨迹更长,经过 compaction 后子轨迹数量和长度差异很大。GLM-5.2 从 group-wise 优化转向基于 critic 的 PPO,用 token-level advantage 适配不等长子轨迹

Coding RL 容易 reward hacking:读取受保护评测文件、从上游 commit 复制答案、直接 curl 拉取目标代码。GLM-5.2 引入 anti-hack 模块,两阶段检测(rule-based filter + LLM judge),在线拦截 hack 行为并返回 dummy 信息,让 rollout 继续而非中断

开源与使用方式

模型权重遵循 MIT License,GitHub / Hugging Face / ModelScope 均已上线,vLLM、SGLang、transformers 等主流推理框架已支持

- BigModel 开放平台:docs.bigmodel.cn/cn/guide/models/text/glm-5.2

- Z.ai:docs.z.ai/guides/llm/glm-5.2

- 技术博客:z.ai/blog/glm-5.2

今晚 7 点,z.ai 团队讲来到 AGI Bar(上海),带一场「开发者面对面」活动。你能看到 5.1 和 5.2 的对比测试,还能听 Builder 们激情开麦

无需预约,直接 walk-in

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国内多家大厂赴美适配 iPhone Duo,太双标了!

国内多家大厂赴美适配 iPhone Duo,太双标了!

芝麻科技讯官方号
2026-09-16 09:17:43
男生4次考公失败,花2.2万旅行6国17座城市,途中看到妈妈朋友圈:“老娘扛你看世界,你替老娘圆梦”,顿时五味杂陈

男生4次考公失败,花2.2万旅行6国17座城市,途中看到妈妈朋友圈:“老娘扛你看世界,你替老娘圆梦”,顿时五味杂陈

背包旅行
2026-09-15 11:30:07
美联储加息收割全球,特朗普反向喊话!美国已没有退路了

美联储加息收割全球,特朗普反向喊话!美国已没有退路了

李云飞Afey
2026-09-17 11:24:42
美国精英意识到,伊朗战争的失败比越战更可怕,后果美国无法承受

美国精英意识到,伊朗战争的失败比越战更可怕,后果美国无法承受

执笔写思念
2026-09-17 05:40:13
女儿踩坏床头柜怕被骂悄悄扔掉,两天后母亲想起:有370多克黄金铂金和190余万银行存单全在床头柜里;安徽当地警方连夜追回,分毫未少

女儿踩坏床头柜怕被骂悄悄扔掉,两天后母亲想起:有370多克黄金铂金和190余万银行存单全在床头柜里;安徽当地警方连夜追回,分毫未少

三湘都市报
2026-09-17 21:32:50
李小龙当年在武术界声名赫赫,妻子琳达却在晚年自传里提到:李小龙曾跟我坦言,世上存在一类对手会让他发自内心感到忌惮

李小龙当年在武术界声名赫赫,妻子琳达却在晚年自传里提到:李小龙曾跟我坦言,世上存在一类对手会让他发自内心感到忌惮

唠叨说历史
2026-09-16 18:12:37
中国必须高度警惕越南将发生的分裂危机!

中国必须高度警惕越南将发生的分裂危机!

叶老四
2026-08-31 08:51:57
“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

熙熙说教
2026-09-10 13:21:21
哈里梅根用孩子倒逼王室让步,借生日重翻旧账,王室态度已说明一切

哈里梅根用孩子倒逼王室让步,借生日重翻旧账,王室态度已说明一切

小鱼爱鱼乐
2026-09-17 18:35:13
“大国重器”,上市首日大涨374%!

“大国重器”,上市首日大涨374%!

上市之家
2026-09-18 00:15:30
一浙传媒学霸为拿到澳洲永居身份,竟在澳洲工地贴瓷砖,还兼职开uber

一浙传媒学霸为拿到澳洲永居身份,竟在澳洲工地贴瓷砖,还兼职开uber

小徐讲八卦
2026-09-15 09:43:50
欧洲人都快被中国整崩溃了

欧洲人都快被中国整崩溃了

乌克兰小静
2026-09-15 07:59:44
甲钴胺单吃太浪费,记好这3种巧妙搭配,调理全身多种疼痛

甲钴胺单吃太浪费,记好这3种巧妙搭配,调理全身多种疼痛

薛医生课堂
2026-09-17 19:21:06
当“混子”成为一门玄学:论中国女足的“洋相自由”

当“混子”成为一门玄学:论中国女足的“洋相自由”

姜大叔侃球
2026-09-17 19:14:08
扔掉12斤水果,赔掉10万元,中国式自我感动有多可怕!

扔掉12斤水果,赔掉10万元,中国式自我感动有多可怕!

夜深爱杂谈
2026-09-05 21:28:52
新一代国产宝马X5申报图曝光!

新一代国产宝马X5申报图曝光!

汽车消费Pro
2026-09-16 09:11:35
谈判破裂,菲财长离开香港,马科斯拒绝中方贷款,经济崩盘倒计时

谈判破裂,菲财长离开香港,马科斯拒绝中方贷款,经济崩盘倒计时

墨兰史书
2026-09-18 02:30:04
4年1.86亿!NBA探花秀!大合同彻底泡汤

4年1.86亿!NBA探花秀!大合同彻底泡汤

篮球教学论坛
2026-09-18 00:21:32
崔永元曝敬一丹抢救过程,熬过18天凶险期,曾一度恢复自主呼吸

崔永元曝敬一丹抢救过程,熬过18天凶险期,曾一度恢复自主呼吸

小虎新车推荐员
2026-09-18 00:23:14
鲍蕙荞没想到,去世13年的前夫庄则栋,竟给86岁的她留下一手好牌

鲍蕙荞没想到,去世13年的前夫庄则栋,竟给86岁的她留下一手好牌

听栀子说
2026-09-17 19:35:04
2026-09-18 07:24:49
赛博禅心
赛博禅心
拜AI古佛,修赛博禅心
557文章数 58关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

本地
家居
亲子
数码
房产

本地新闻

不止胖东来!许昌藏着半部三国史

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

小恐龙选择了紫色的旺旺碎冰冰

数码要闻

苹果Apple Watch Series 12与Ultra 4今日开售,2999/6499元起

房产要闻

突发!三亚安居房出台新政!

无障碍浏览 进入关怀版