网易首页 > 网易号 > 正文 申请入驻

爆料一个新模型,平替 Opus 4.8 的国产之光来了

0
分享至

今天有个重磅消息,智谱正式发布了 GLM-5.2 模型,同时也开源了。

在全球百万用户参与盲测的前端开发评估系统 Code Arena 上,GLM-5.2 取得目前可用模型第一的成绩。


有一说一,国产模型这次真的站在了世界前列,属于我们普通人能用得上用得起的国产之光了。

这次 GML-5.2 有两个关键信息,我觉得应该重点聊聊。

第一,Coding 继续保持国产第一、开源第一。

在 FrontierSWE、SWE-Marathon、PostTrainBench 等多个长程任务基准上,GLM-5.2 的表现介于 Claude Opus 4.8 与 GPT 5.5 之间,是排名最高的开源模型。


我在网上看到一个 AI 博主说,如果你是通过中转服务使用 Opus,那你可能分不出有可能是 GLM-5.2 冒充的。

第二,1M token 上下文。

注意,不是标称 1M,是真正能用的 1M。

现在市面上标称 1M 的模型不少,但大部分到了长上下文后半段效果衰减得厉害。

GLM-5.2 通过注意力结构层面的创新,把 1M 长度下的效果衰减和推理成本同时压了下来。

说人话,就是它在处理超长任务时不会到后面就开始犯糊涂、忘前面说过什么。

这个能力为什么重要?我换个说法你就明白了。

现在用 AI 写代码最大的痛点不是它写不出来,而是任务一长它就忘了。

你让它改一个大项目,改到第 30 步的时候它忘了第 2 步定下的规则。你不得不反复提醒它、反复把上下文喂回去,累的不是 AI,是你。

说白了,就是「能干活,但记性差」。

因此,1M 上下文解决的就是这个问题。

一个持续工作数小时的 AI 要经历几千次工具调用、读写数万行代码、积累大量中间状态。

如果上下文窗口不够长,模型就被迫不断压缩、丢弃、再回忆,每一次压缩都是信息损耗,每一次遗忘都可能让任务在第 N 步偏离第 2 步的约束。

长程任务的失败,很多时候不是模型不够聪明,而是它忘了。

GLM-5.2 做到的是在一次任务中完整持有整个项目的全部代码、全部决策历史、全部约束条件。

这个过程,就像一个不会忘事的工程师,从头推进到尾。

这里说个案例。

之前我自己用其他模型结合 Claude Code 开发了一个小程序,当时光是 PRD 文档就有 5000 多字,因为单个文件太大,还是拆分上传的。


这次我换成 GLM-5.2 试了下,试图让它重构这个项目,还是同一份 PRD 文档。

开启 CC 的 Plan Mode 模式后,我先让模型自己加载分析需求文档并制定开发计划,然后再进入开发阶段。

过程中,我还加了一些需求,并且对一开始的信息做了修改。此时,GLM-5.2 的 1M 上下文优势就出来了,全程无纰漏。


大概用了 25 分钟左右,这个基于 PRD 的项目就全部开发完了,而且自己调起了本地的微信开发者工具。

我让它统计了代码量,总共 16000 行代码,而且能成功预览。

不过有一说一,我觉得 GLM-5.2 在前端页面的设计美观度上还有提升空间,现在属于可用,但还不是绝对好的状态。


如果是用来做一些大型项目的重构或者开发,这种 1M 上下文空间的体验就会明显好很多。

在 Terminal-Bench 2.1 上,这是一个评测 Agent 通过命令行操作一台计算机的数据集,GLM-5.2仅比Opus 4.8低4%,相比GLM-5.1提升了17.5%。

在 MCP-Atlas 上(工具使用tool-use评测的数据集),GLM-5.2仅比Opus 4.8 低 0.8%。


此外,能做的事情也变了。

整个代码库扔进去做跨文件重构,一句话需求直接出完整全栈项目,大型 SaaS 级工程持续推进不跑偏。

这些场景以前只能拆成无数个小任务反复喂上下文,现在可以一次性给完、一次性干完。

我自己也测了一个场景,就是优化我之前用 Agent 开发的个人网站。

先说下,如果你们想用上 GLM-5.2,就得去抢智谱的 Coding Plan,不过这个现在很紧俏,你们可以每天去盯一盯官方放量的时间。

如果抢到了配额,就可以配置到你的 Agent 里直接开始用,我是用 Claude Code 配合 GLM-5.2 用的。

之前开发这个网站我用了几个模型混合完成,包括 GLM-5.1、Claude Opus 4.6 和 4.8。

从前端开发质量来看,Claude 的模型确实做得更好,但是在代码本身的开发质量上,我觉得 GLM 和 Claude 的差距并没有那么大。

这次优化,我完全用 GLM-5.2 来完成,核心就是优化我之前觉得别扭的几个模块。

第一个问题就是我网站上案例墙这部分,现在的问题就是重点不突出、没有数据、视觉不美观。


我跟 GLM-5.2 提的需求并没有那么明确,只是表达了一句话需求。

但是,它的分析和问题拆解却很精准,而且还发现了代码中存在的命名问题。

讲真,它跟我说话真的是毫不客气。


不仅找准了问题,而且还给出了方案。


不仅按照这个新方案做了重新开发,还对我原有的代码结构做了优化,整个网站的代码都有被它 review。

我有一个很直观的感觉,就是一次性成功率更高,而且模型在需求理解、代码执行、完成质量上做得都不错。

优化后的最终效果,明显比之前好太多。


说实话,结果超出预期。

从实际体感来看,我觉得写出来的代码质量和最终呈现的效果跟之前我用的 Claude 模型差异并不是很大。

还是我之前说的,现在 GLM 系列的模型在国产 coding 领域的确是做得非常好的一家。

说实话,对于我们这些每天重度使用 AI 的人来说,智谱的操作是值得点赞的。

之前大家选模型默认选海外的,Claude、GPT,能力确实强。

但稳定性呢?可用性呢?账号说封就封,模型说停就停,上周 Anthropic 的事就是最好的例子。

现在,国产开源模型的价值正在被重新评估。

不是说它今天在所有维度上都比 Claude 好,而是它稳定、可控、不会哪天突然告诉你「因为政策原因,你不能用了」。

还有一点,现在国产 AI 都在不同程度上被限卡,如果这个环节能突破,我觉得不会比国外差。

GLM-5.2 这次的做法也值得一说,Coding Plan 全量用户直接可用,包括免费的 Lite 版。

这种发布方式本身就是一种态度,不搞花活,你自己试,数据说话。

最后,说下我自己的判断。

过去一年,行业衡量模型的标准正在迁移。以前比的是谁完成任务更好,谁的 benchmark 分高谁就牛。

现在比的是「能独立干多久」,谁能持续工作、不跑偏、不忘事,谁才是真正能用的生产力工具。

上下文长度的可用性和长程任务能力,正在成为下一阶段模型竞争的主线。

技术要真正普及成生产力,就一定是开放的。

所有的不开放和限制,本身其实就是对生产力进步的一种束缚。

智谱在他们官宣内容的最后提到两句英文:

A step closer to frontier intelligence for everyone.

The future of AI is open, and it is for the people.

翻译过来就是:

向前沿智能再近一步,为每一个人。

AI的未来是开放的,它属于所有人。

国产模型走到这一步,值得被看见。

················· 唐韧出品 ·················

用AI思维发现下一个机会

安可时刻

如果国产模型能解决被限卡的瓶颈,那速度和质量又会上去一个台阶。

其实对于大多数任务来说,现在国产模型已经表现不错了。从我的日常 coding 场景来看,GLM-5.2 基本也能满足大多数需求。

国外模型是很强,但我们也要给国产模型一些时间让他们成长。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
斯诺克5冠军掉队!2场4-0,墨菲错失147,16进8迎3场冠军PK!

斯诺克5冠军掉队!2场4-0,墨菲错失147,16进8迎3场冠军PK!

刘姚尧的文字城堡
2026-09-10 07:58:40
93岁原卫生部副部长曹泽毅:我从不养生,只做7件事,比补品管用

93岁原卫生部副部长曹泽毅:我从不养生,只做7件事,比补品管用

小方说跑步
2026-08-22 09:10:06
不查不知道,一查吓一跳,身价上亿的郭德纲,私下的生活壕到离谱

不查不知道,一查吓一跳,身价上亿的郭德纲,私下的生活壕到离谱

一些小事
2026-09-09 08:59:44
与克林顿的那场著名事件过去23年,曾被世界羞辱的莱温斯基如今怎么样了?

与克林顿的那场著名事件过去23年,曾被世界羞辱的莱温斯基如今怎么样了?

历史龙元阁
2026-09-09 08:50:20
0 球 0 助却全场最佳!巴萨隐藏真核炸穿!完美复刻诺坎普传奇

0 球 0 助却全场最佳!巴萨隐藏真核炸穿!完美复刻诺坎普传奇

澜归序
2026-09-10 08:37:04
云南网红去世,年仅16岁,生前全身发黑掉皮,做骨髓移植也没用

云南网红去世,年仅16岁,生前全身发黑掉皮,做骨髓移植也没用

风月得自难寻
2026-09-09 20:57:22
回旋镖到了!美国可以不让中国进国际空间站,不让荷兰卖光刻机给中国,可以不让伊朗卖石油给中国,但是不允许中国稀土不卖给美国!

回旋镖到了!美国可以不让中国进国际空间站,不让荷兰卖光刻机给中国,可以不让伊朗卖石油给中国,但是不允许中国稀土不卖给美国!

扶苏聊历史
2026-09-08 18:16:38
高芙挽救两赛点逆转安德列娃,半决赛将战莱巴金娜

高芙挽救两赛点逆转安德列娃,半决赛将战莱巴金娜

体坛周报
2026-09-10 08:08:11
郭德纲风波尘埃落定!央视新闻通报钧正平定调,郭德纲这回真悬了

郭德纲风波尘埃落定!央视新闻通报钧正平定调,郭德纲这回真悬了

离离言几许
2026-09-09 08:43:01
布朗:NBA是工作不是热爱,场外博弈会消磨纯粹

布朗:NBA是工作不是热爱,场外博弈会消磨纯粹

温柔且自由
2026-09-10 09:47:53
河南老牌国企洛轴股份,上市!

河南老牌国企洛轴股份,上市!

大象新闻
2026-09-09 12:51:04
当年我养猪供侄子上大学,他当上官再没回老家,直到我被村霸欺负

当年我养猪供侄子上大学,他当上官再没回老家,直到我被村霸欺负

五元讲堂
2025-08-21 15:12:14
父母绿卡终于办下来了:接来美国第一年,我算了8笔账

父母绿卡终于办下来了:接来美国第一年,我算了8笔账

Decade视角
2026-09-09 20:03:09
手机和宽带还绑在一起的家庭,建议认真看一下

手机和宽带还绑在一起的家庭,建议认真看一下

李博世财经
2026-09-09 10:14:24
海航的短发空姐,又火一个,穿的是海航第五套制服“海天祥云”旗袍。

海航的短发空姐,又火一个,穿的是海航第五套制服“海天祥云”旗袍。

毒舌八卦
2026-09-09 21:18:11
幼童无意触碰闹上热搜!胡锡进精准预判,这场官司注定零胜率

幼童无意触碰闹上热搜!胡锡进精准预判,这场官司注定零胜率

一口娱乐
2026-09-09 08:23:18
爸爸点外卖备注“孩子化疗煎饼一半不辣一半微辣”,谁料店主看到后,悄悄往里加了点东西…

爸爸点外卖备注“孩子化疗煎饼一半不辣一半微辣”,谁料店主看到后,悄悄往里加了点东西…

黎兜兜
2026-09-08 22:56:41
警方回应港铁36人集体冲闸 :案件已跟进

警方回应港铁36人集体冲闸 :案件已跟进

中国能源网
2026-09-09 11:14:18
女篮八强赛,中国女篮VS法国开球时间敲定,央视直播,宫鲁鸣争胜

女篮八强赛,中国女篮VS法国开球时间敲定,央视直播,宫鲁鸣争胜

富贵体坛说
2026-09-10 01:59:54
跟何超琼同住14载,至今没领证没生娃没名分,地位早已超越陈百强

跟何超琼同住14载,至今没领证没生娃没名分,地位早已超越陈百强

荒野老五
2026-09-10 06:26:55
2026-09-10 10:08:49
唐韧 incentive-icons
唐韧
用产品思维解决难题
1539文章数 2046关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲被处罚2天,身边人传出好消息

财经要闻

银行新高!新一轮周期,刚开始!

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

亲子
本地
时尚
教育
公开课

亲子要闻

媳妇说以后她来管钱,每个月给我200零花钱,还得戒烟戒酒才行

本地新闻

宁波,中国制造的隐藏大佬

女人不管多大,都可以看看这些“条纹T恤”,非常减龄又简约

教育要闻

教师节不送礼、不讨好,看我用“打游戏的思维”跟老师搞好关系

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版