网易首页 > 网易号 > 正文 申请入驻

爆料一个新模型,平替 Opus 4.8 的国产之光来了

0
分享至

今天有个重磅消息,智谱正式发布了 GLM-5.2 模型,同时也开源了。

在全球百万用户参与盲测的前端开发评估系统 Code Arena 上,GLM-5.2 取得目前可用模型第一的成绩。


有一说一,国产模型这次真的站在了世界前列,属于我们普通人能用得上用得起的国产之光了。

这次 GML-5.2 有两个关键信息,我觉得应该重点聊聊。

第一,Coding 继续保持国产第一、开源第一。

在 FrontierSWE、SWE-Marathon、PostTrainBench 等多个长程任务基准上,GLM-5.2 的表现介于 Claude Opus 4.8 与 GPT 5.5 之间,是排名最高的开源模型。


我在网上看到一个 AI 博主说,如果你是通过中转服务使用 Opus,那你可能分不出有可能是 GLM-5.2 冒充的。

第二,1M token 上下文。

注意,不是标称 1M,是真正能用的 1M。

现在市面上标称 1M 的模型不少,但大部分到了长上下文后半段效果衰减得厉害。

GLM-5.2 通过注意力结构层面的创新,把 1M 长度下的效果衰减和推理成本同时压了下来。

说人话,就是它在处理超长任务时不会到后面就开始犯糊涂、忘前面说过什么。

这个能力为什么重要?我换个说法你就明白了。

现在用 AI 写代码最大的痛点不是它写不出来,而是任务一长它就忘了。

你让它改一个大项目,改到第 30 步的时候它忘了第 2 步定下的规则。你不得不反复提醒它、反复把上下文喂回去,累的不是 AI,是你。

说白了,就是「能干活,但记性差」。

因此,1M 上下文解决的就是这个问题。

一个持续工作数小时的 AI 要经历几千次工具调用、读写数万行代码、积累大量中间状态。

如果上下文窗口不够长,模型就被迫不断压缩、丢弃、再回忆,每一次压缩都是信息损耗,每一次遗忘都可能让任务在第 N 步偏离第 2 步的约束。

长程任务的失败,很多时候不是模型不够聪明,而是它忘了。

GLM-5.2 做到的是在一次任务中完整持有整个项目的全部代码、全部决策历史、全部约束条件。

这个过程,就像一个不会忘事的工程师,从头推进到尾。

这里说个案例。

之前我自己用其他模型结合 Claude Code 开发了一个小程序,当时光是 PRD 文档就有 5000 多字,因为单个文件太大,还是拆分上传的。


这次我换成 GLM-5.2 试了下,试图让它重构这个项目,还是同一份 PRD 文档。

开启 CC 的 Plan Mode 模式后,我先让模型自己加载分析需求文档并制定开发计划,然后再进入开发阶段。

过程中,我还加了一些需求,并且对一开始的信息做了修改。此时,GLM-5.2 的 1M 上下文优势就出来了,全程无纰漏。


大概用了 25 分钟左右,这个基于 PRD 的项目就全部开发完了,而且自己调起了本地的微信开发者工具。

我让它统计了代码量,总共 16000 行代码,而且能成功预览。

不过有一说一,我觉得 GLM-5.2 在前端页面的设计美观度上还有提升空间,现在属于可用,但还不是绝对好的状态。


如果是用来做一些大型项目的重构或者开发,这种 1M 上下文空间的体验就会明显好很多。

在 Terminal-Bench 2.1 上,这是一个评测 Agent 通过命令行操作一台计算机的数据集,GLM-5.2仅比Opus 4.8低4%,相比GLM-5.1提升了17.5%。

在 MCP-Atlas 上(工具使用tool-use评测的数据集),GLM-5.2仅比Opus 4.8 低 0.8%。


此外,能做的事情也变了。

整个代码库扔进去做跨文件重构,一句话需求直接出完整全栈项目,大型 SaaS 级工程持续推进不跑偏。

这些场景以前只能拆成无数个小任务反复喂上下文,现在可以一次性给完、一次性干完。

我自己也测了一个场景,就是优化我之前用 Agent 开发的个人网站。

先说下,如果你们想用上 GLM-5.2,就得去抢智谱的 Coding Plan,不过这个现在很紧俏,你们可以每天去盯一盯官方放量的时间。

如果抢到了配额,就可以配置到你的 Agent 里直接开始用,我是用 Claude Code 配合 GLM-5.2 用的。

之前开发这个网站我用了几个模型混合完成,包括 GLM-5.1、Claude Opus 4.6 和 4.8。

从前端开发质量来看,Claude 的模型确实做得更好,但是在代码本身的开发质量上,我觉得 GLM 和 Claude 的差距并没有那么大。

这次优化,我完全用 GLM-5.2 来完成,核心就是优化我之前觉得别扭的几个模块。

第一个问题就是我网站上案例墙这部分,现在的问题就是重点不突出、没有数据、视觉不美观。


我跟 GLM-5.2 提的需求并没有那么明确,只是表达了一句话需求。

但是,它的分析和问题拆解却很精准,而且还发现了代码中存在的命名问题。

讲真,它跟我说话真的是毫不客气。


不仅找准了问题,而且还给出了方案。


不仅按照这个新方案做了重新开发,还对我原有的代码结构做了优化,整个网站的代码都有被它 review。

我有一个很直观的感觉,就是一次性成功率更高,而且模型在需求理解、代码执行、完成质量上做得都不错。

优化后的最终效果,明显比之前好太多。


说实话,结果超出预期。

从实际体感来看,我觉得写出来的代码质量和最终呈现的效果跟之前我用的 Claude 模型差异并不是很大。

还是我之前说的,现在 GLM 系列的模型在国产 coding 领域的确是做得非常好的一家。

说实话,对于我们这些每天重度使用 AI 的人来说,智谱的操作是值得点赞的。

之前大家选模型默认选海外的,Claude、GPT,能力确实强。

但稳定性呢?可用性呢?账号说封就封,模型说停就停,上周 Anthropic 的事就是最好的例子。

现在,国产开源模型的价值正在被重新评估。

不是说它今天在所有维度上都比 Claude 好,而是它稳定、可控、不会哪天突然告诉你「因为政策原因,你不能用了」。

还有一点,现在国产 AI 都在不同程度上被限卡,如果这个环节能突破,我觉得不会比国外差。

GLM-5.2 这次的做法也值得一说,Coding Plan 全量用户直接可用,包括免费的 Lite 版。

这种发布方式本身就是一种态度,不搞花活,你自己试,数据说话。

最后,说下我自己的判断。

过去一年,行业衡量模型的标准正在迁移。以前比的是谁完成任务更好,谁的 benchmark 分高谁就牛。

现在比的是「能独立干多久」,谁能持续工作、不跑偏、不忘事,谁才是真正能用的生产力工具。

上下文长度的可用性和长程任务能力,正在成为下一阶段模型竞争的主线。

技术要真正普及成生产力,就一定是开放的。

所有的不开放和限制,本身其实就是对生产力进步的一种束缚。

智谱在他们官宣内容的最后提到两句英文:

A step closer to frontier intelligence for everyone.

The future of AI is open, and it is for the people.

翻译过来就是:

向前沿智能再近一步,为每一个人。

AI的未来是开放的,它属于所有人。

国产模型走到这一步,值得被看见。

················· 唐韧出品 ·················

用AI思维发现下一个机会

安可时刻

如果国产模型能解决被限卡的瓶颈,那速度和质量又会上去一个台阶。

其实对于大多数任务来说,现在国产模型已经表现不错了。从我的日常 coding 场景来看,GLM-5.2 基本也能满足大多数需求。

国外模型是很强,但我们也要给国产模型一些时间让他们成长。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
理想汽车的至暗时刻

理想汽车的至暗时刻

商业研究所
2026-09-08 15:46:48
梅德韦杰夫:俄罗斯有权在安全受到威胁时使用核武器

梅德韦杰夫:俄罗斯有权在安全受到威胁时使用核武器

新京报
2026-09-10 10:49:22
不怕气死黄晓明?李晨baby惊曝恋情,现实版好朋友和前妻在一起了

不怕气死黄晓明?李晨baby惊曝恋情,现实版好朋友和前妻在一起了

八星人
2026-09-08 09:51:13
长鑫存储与长江存储被曝已准备可用三年的ASML DUV光刻机

长鑫存储与长江存储被曝已准备可用三年的ASML DUV光刻机

cnBeta.COM
2026-09-08 18:16:04
乾隆晚年最大的BUG,所有人都合规,帝国却转不动了

乾隆晚年最大的BUG,所有人都合规,帝国却转不动了

考史斋
2026-09-08 22:25:23
盘后,利好来了!北京,重磅发文

盘后,利好来了!北京,重磅发文

数据宝
2026-09-09 21:33:53
又一新股来了,2.5万元顶格申购

又一新股来了,2.5万元顶格申购

第一财经资讯
2026-09-10 09:12:31
罗体:劳塔罗与赫伊森场上各染黄,赛后拥抱化干戈

罗体:劳塔罗与赫伊森场上各染黄,赛后拥抱化干戈

懂球帝
2026-09-09 22:44:17
银行行长酒后漏嘴:六十岁以后存钱,一定别全部存在个人名下

银行行长酒后漏嘴:六十岁以后存钱,一定别全部存在个人名下

奇思妙想生活家
2026-09-05 11:27:06
深圳一公司员工韦某(男,32 岁 ),抢救无效死亡!官方公布调查报告

深圳一公司员工韦某(男,32 岁 ),抢救无效死亡!官方公布调查报告

南方都市报
2026-09-09 15:02:22
这届日本亚运会,给全世界好好上了一课:没有中国,就办不成生意

这届日本亚运会,给全世界好好上了一课:没有中国,就办不成生意

安安说
2026-09-10 10:19:31
“梅姨”真人照曝光!画像师:相似度80%以上;受害者:这张脸等了太久

“梅姨”真人照曝光!画像师:相似度80%以上;受害者:这张脸等了太久

上观新闻
2026-09-10 08:52:39
南北奥迪将分治?多方回应

南北奥迪将分治?多方回应

界面新闻
2026-09-09 20:51:26
刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

看尽落尘花q
2026-08-23 19:28:46
A股:来不及等开盘了,种种迹象表明,今日周四很可能将会这样走

A股:来不及等开盘了,种种迹象表明,今日周四很可能将会这样走

虎哥闲聊
2026-09-10 07:48:56
女篮世界杯,82-80险爆大冷+大逆转,最后一个8强,世界第3险胜!

女篮世界杯,82-80险爆大冷+大逆转,最后一个8强,世界第3险胜!

刘哥谈体育
2026-09-10 05:32:05
1-8决赛签表:丁俊晖对奥康纳,吴宜泽对No86。附比赛时间,交手记录

1-8决赛签表:丁俊晖对奥康纳,吴宜泽对No86。附比赛时间,交手记录

小哆说体育
2026-09-10 07:20:26
“祸”不单行!星宇事件持续发酵,上交所出手发布警示,股价应声下挫3.07%

“祸”不单行!星宇事件持续发酵,上交所出手发布警示,股价应声下挫3.07%

火山詩话
2026-09-10 06:03:57
父亲是知名主持毕福剑,移民加拿大接受西方教育,却变成了不男不女的模样,毕福剑丢掉的不只是事业,还有女儿的二十年

父亲是知名主持毕福剑,移民加拿大接受西方教育,却变成了不男不女的模样,毕福剑丢掉的不只是事业,还有女儿的二十年

品茗赏娱
2026-09-09 08:54:49
最快18分钟送达!iPhone 18 Pro淘宝闪购首发:覆盖超2000个地区

最快18分钟送达!iPhone 18 Pro淘宝闪购首发:覆盖超2000个地区

快科技
2026-09-10 10:37:06
2026-09-10 11:59:00
唐韧 incentive-icons
唐韧
用产品思维解决难题
1539文章数 2046关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

牛弹琴:美官员抹黑中国让全世界看笑话 鲁比奥都不信

头条要闻

牛弹琴:美官员抹黑中国让全世界看笑话 鲁比奥都不信

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

郭德纲被处罚2天,身边人传出好消息

财经要闻

银行新高!新一轮周期,刚开始!

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

本地
家居
手机
游戏
公开课

本地新闻

宁波,中国制造的隐藏大佬

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

全球首款阔直板!华为Pura X View首销当日卖出超18万台

《暗黑破坏神4》双DLC史低!最低187元拿下

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版