网易首页 > 网易号 > 正文 申请入驻

实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键

0
分享至

神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰。

有 Cursor 数据加持的 Grok 4.6 突飞猛进,马斯克还说 4.7 马上就要来;DeepSeek V4 Pro 正式版「虚晃一枪」后正式发布,多项 benchmark 直指 Fable 5;还有一个不能算旗舰的 Gemini Flash。

然后今天,智谱也把 GLM-5.3 端了上来。

这个在 5.2 期间,一直被调侃「我知道很好用,但不给我开会员用」的顶尖国产编程模型,终于迎来了更新。

新的模型继续在编程方面发力。

评测榜单的结果显示,GLM-5.3 在编程能力上比肩 Fable 5 和 GPT-5.6 Sol。在社交媒体上参与内测用户的反馈则提到,使用体感比 Kimi K3、DeepSeek V4-Pro-0813 要更好


能跟 GLM-5.3 上桌对比的模型,在可视化图表中只剩下了 Kimi K3、Fable 5 和 GPT-5.6 Sol。以前是开源自己一堆模型对比,不找闭源自讨苦吃,现在是「对标 Fable 5」成了开源的基本配置。

六个 benchmark,GLM-5.3 的表现都不赖,尤其是由 OpenAI 提出的 GDPVal 评估测试,智谱拿到了第一名。

AutomationBench、Agents' Last Exam,一个是用来测试跨应用工作流编排能力,一个是测试智能体能力,GLM-5.3 的成绩也是数一数二。

和 Kimi K3、Qwen3.8-Max 迈向万亿大参数不同,GLM-5.3 这次参数量和上一版本差不多,同样是 7000 亿参数级别。官方技术博客中提到,此次升级带来的提升主要原因是后训练 Scaling

就是靠着 743B 的基模,智谱训练出来了 Kimi K3 2.8T 级别的大模型。

我们在与 GLM-5.2 完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座(即 GLM-5.2 模型)的智能上界。


更完整的 benchmark 对比,经过后训练的 GLM-5.3 对比 GLM-5.2 提升相当明显,Coding、网络安全和 Agentic 成绩进步都不像是一个基座模型。

不得不说,现在大模型做好后训练在某些程度上比预训练都更好使。就拿四月份发布的 DeepSeek V4 Flash 预览版和 7 月底发布的正式版相比,两个模型的能力几乎是断层的。

智谱这次还开源了名为史莱姆 Slime 的一个后训练框架,直接能覆盖发布级模型后训练所需要的完整工作流。他们说从 GLM 4.5 开始,就一直在用这套框架进行后训练

目前 Slime 支持对 GLM 系列、Qwen 系列以及 DeepSeek 系列的部分模型和 Llama 3 进行后训练。


教你如何用 128xH100 训练 DeepSeek R1,以及如何蒸馏

除了主打编程,GLM-5.3 的另一个重点方向是网络安全。从 Hugging Face 事件开始,。

无论是模型的攻击能力强,能逃出设置的沙箱,还是防守能力强,能监控、抵御和分析复杂的 AI Zero Day 漏洞;这些以前听着离我们普通用户很远的东西,也成了大模型角力的新赛场。

GLM-5.3 在网络安全相关的任务中,表现与 Claude Mythos 5 持平。

其中 ExploitGym 网络安全测试,就是 OpenAI 在评估自己的待发布模型时,为了解决更多问题去攻击了 Hugging Face,GLM-5.3 的表现也非常不错,898 到题,限时 6 小时内完成的情况下,达到了 130 道。


针对模型的网络安全能力,智谱还公开了一项网络安全披露账本,记录模型在不同的项目中找到的各种漏洞。GLM 找到的最古老漏洞,甚至可以追溯到大约 40 年前

40 年都没找到,GLM-5.3 一出手就找到了,放 OpenAI 或者 A 社手里,这不比证明了一个数学难题强吗。


网络安全披露账本 https://cvd.z.ai/

虽然我们普通用户不会拿它去找各种攻防漏洞,但模型的能力提升是实打实的,具体到日常的办公和编程任务上,GLM-5.3 的表现又如何。

APPSO 提前拿到了 GLM-5.3 的测试资格,继续用一些 3D 网页生成、网页应用开发、macOS 小工具开发等任务,来看看 GLM-5.3 的表现是否能快速实现我们的想法。

目前 GLM-5.3 已经上线智谱官方 Agent 应用 Zcode 和效率工具 AutoClaw,同时面向 GLM Coding Plan 用户全量开放并开放订阅


在 Zcode 应用内可以直接选择 GLM-5.3 进行体验

第三方平台像是 WorkBuddy,QwenWork,TraeWork 等应用也已经开放抢先体验。而 API 调用预计在下周二开放,模型的完整权重则会在两周内开源。

当所有 AI 都开始卷编程

相较于写作或者文科领域,那些见仁见智,审美无法统一的任务,编程大概是大模型最适合发力的场景。

简单粗暴的一句提示词丢进去,就等着看它用代码能写出什么好看好玩有意思的画面。

我们先是让它做了一个人体血液循环的 3D 交互仿真系统,原以为它会做一个写实的人体透视,至少像是这种细节满满的 3D 仿真,有真实的身体轮廓,合理排放的血管,真实的肌肉线条。


但不知道是不是提示词不够详细,GLM-5.3 给的交付是看起来比较粗糙的版本。整个人更像是一个火柴人,内部器官也全部堆在了一起。

比较难得的是,整个的演示有较多的自定义,例如视图图层可以选择不同的场景,生理参数也有心率、压力等内容。我们甚至可以选择失血性休克的场景,直接看到血液循环的流向。


提示词:做一个高精度的人体血压循环 3D 可交互仿真系统,使用 GLM-5.3 + Claude Code

总的来说,这个交互网页能够用在教学场景,但就是没有那么好看。

,同样的提示词,GLM-5.3 + Claude Code 最高推理深度给出的结果也不赖——游戏体验好,场景渲染也准确。

如果你不好好操作,可能真的会输,只是这个滑板的残影,过于「亮眼」。

当我们想要它生成一些惊艳的 3D 场景时,像是一个满是水母的湖,数百万只写实的水母在一片翡翠湖泊里飘动。

这个效果确实还挺漂亮的,渲染水母就不会像渲染人体一样,只用一些简单的圆圈,不过这个 3D 水母的提示词也相当长。

在 Claude Code 中使用 GLM-5.3 时,如果你开启了自动审批命令,会经常遇到一个错误,显示「auto mode cannot determine thesafety of Bash right now.」即「自动模式目前无法判断 Bash 命令的安全性。」

这大概是 Claude Code 应用自身的机制来处理自动模式下,如何识别不同的命令是否需要弹窗通知交给我选择,但第三方的模型,暂时还没有适配 Claude Code。

于是我们切换到 ZCode 进行体验,它能像 Codex 一样使用不同的工具,不断对已经生成的网页截图识屏,分析存在的问题,然后持续优化,整个运行时间也比单纯在 Claude Code 中使用会更久。


就像这个行星撞地球的模拟,两个行星碰撞,我们在 Claude Code 中的任务最长没有超过 1h,但这个 3D 网页过了一个小时,ZCode 还在反复地测试检查。

好在最后的效果没有让人失望,我们第一眼就能看到地壳开裂、熔岩喷出、碎片形成行星环等壮观画面。就这些复杂的粒子运动,要面面俱到的编程好,肯定是需要一点模型底子的。

同尺寸里的最强模型

GLM-5.3 的意义,我们测试下来就觉得它还是回到了原本属于它的位置,即同尺寸最强模型,编程开发者的首选。

K3 用了 2.8T,DeepSeek V4 用了 1.6T,而 GLM 5.2 用了不到一半的参数,就实现了同样程度的智能。

所以如果你本来就在用智谱,已经购买了 Coding Plan(今天下午他们也重置了一次),从六月中旬发布的 GLM-5.2 切换到 5.3,是能感受到比较明显的差异。

虽然 API 版本预计要等到下周二更新,目前官网显示的 API 价格也还是 GLM-5.2 版本,但同样的模型尺寸,估计 GLM-5.3 的 API 定价不会有太大的变化。


Kimi K3、Qwen3.8-Max、DeepSeek V4 正式版、Grok 4.6、Gemini 3.7 Flash、GLM-5.3,最近的模型发布节奏几乎是前所未有,每天都有新的模型,新的工具可以测试。

模型之间的区别也随着密集的发布逐渐在缩小。

拿我们自己来说,曾经 Claude 被认为是写作上最好用的模型,优化一些句子的结构,把脑子里乱成一团的想法让它有逻辑的串联起来,Claude 给的文章有时比人类写得还要好。

但频繁封号的 Claude,让我们转到了用 GPT 以及其他的模型,于是发现好像所谓的 Fable 5 和 Opus 5 并不是那么的非它不可。

写作如此,编程、生图、整理文档、做报告、构建知识库也越来越接近这个状态。


GLM-5.3 和最近这一连串新模型一起,把大模型的「最强保质期」压得越来越短。

新发布的 GLM 用了 20 天,就有更强更好的 Kimi,Kimi 用了 20 天,又能换到新发布的 DeepSeek,等 DeepSeek 不好用了,那个时候又可以轮到 GLM 了。

所以当别人问你,现在最好的国产编程模型是什么,你会说 Kimi K3、DeepSeek V4 还是 GLM 5.3?

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
被杨瀚森打爆的黎巴嫩归化中锋芬德伯格到底是什么水平?

被杨瀚森打爆的黎巴嫩归化中锋芬德伯格到底是什么水平?

我们的美学
2026-09-02 09:08:36
云南玉昆队史首进足协杯四强 ,半决赛对阵全部敲定

云南玉昆队史首进足协杯四强 ,半决赛对阵全部敲定

北青网-北京青年报
2026-09-02 23:06:04
“Sell Sell or Sell”!美银警告:9月美股仅剩90亿美元买盘空间 ,一旦下跌或触发1630亿卖盘

“Sell Sell or Sell”!美银警告:9月美股仅剩90亿美元买盘空间 ,一旦下跌或触发1630亿卖盘

华尔街见闻官方
2026-09-02 19:55:27
太期待了!罗永浩放狠话,到年底市面上还没开机就能看的电视,他来做,网友:我年龄不算大,现在的电视机我也不会操作

太期待了!罗永浩放狠话,到年底市面上还没开机就能看的电视,他来做,网友:我年龄不算大,现在的电视机我也不会操作

火山詩话
2026-09-02 09:53:09
又一害惨中国年轻人的网红翻车:新型智商税,早该被曝光了

又一害惨中国年轻人的网红翻车:新型智商税,早该被曝光了

小椰子专栏
2026-09-01 13:00:18
吴兴涵:说实话,进球其实是蒙的;我们得对得起这件球衣

吴兴涵:说实话,进球其实是蒙的;我们得对得起这件球衣

懂球帝
2026-09-02 21:58:23
17.6万 !特斯拉新车突然开售,真的有点香啊

17.6万 !特斯拉新车突然开售,真的有点香啊

科技堡垒
2026-08-31 09:56:30
美网女单第2轮:王欣瑜vs卡琳斯卡娅,历史交锋1 2,美网战绩更好

美网女单第2轮:王欣瑜vs卡琳斯卡娅,历史交锋1 2,美网战绩更好

一世菜鸟a
2026-09-02 22:23:15
Here we go!罗马诺:曼联前锋奥比-马丁将租借加盟威廉二世

Here we go!罗马诺:曼联前锋奥比-马丁将租借加盟威廉二世

懂球帝
2026-09-02 21:58:23
1999年,18岁的陈婷正在上课时,突然感觉一阵恶心 她知道是怀孕了

1999年,18岁的陈婷正在上课时,突然感觉一阵恶心 她知道是怀孕了

三农老历
2026-08-30 09:29:02
几千块真的可以难倒英雄汉!东莞父亲掏不出女儿高中9300元学费急哭,兜里仅剩3000元

几千块真的可以难倒英雄汉!东莞父亲掏不出女儿高中9300元学费急哭,兜里仅剩3000元

捣蛋窝
2026-09-01 17:05:01
以被骂了六百年的陈友谅为例,看懂古代封建王朝修史,是怎么“黑掉”一个失败者?

以被骂了六百年的陈友谅为例,看懂古代封建王朝修史,是怎么“黑掉”一个失败者?

七彩论世
2026-08-31 21:35:12
“真刀真枪”,又打起来了

“真刀真枪”,又打起来了

中国新闻周刊
2026-08-31 18:14:15
27款亚洲龙全新换代!帅到没朋友,该不该等新款、还是抄底现款?

27款亚洲龙全新换代!帅到没朋友,该不该等新款、还是抄底现款?

沙雕小琳琳
2026-09-02 11:59:17
斯诺克战报:彻底失控了!中国双星遭“重创”,赵心童独自扛旗

斯诺克战报:彻底失控了!中国双星遭“重创”,赵心童独自扛旗

帽檐下的阳光
2026-09-02 09:20:18
英媒爆料:俄罗斯一直秘密帮助伊朗研发超音速巡航导弹,能够威胁美国在中东的航母和其他军舰;普京近期表示要与伊朗共同对抗美国和以色列

英媒爆料:俄罗斯一直秘密帮助伊朗研发超音速巡航导弹,能够威胁美国在中东的航母和其他军舰;普京近期表示要与伊朗共同对抗美国和以色列

鲁中晨报
2026-09-02 18:06:04
除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

流史岁月
2026-07-06 18:00:06
“子涵、梓萱”一代结束了?今年新入学的小学生,名字都超惊艳!

“子涵、梓萱”一代结束了?今年新入学的小学生,名字都超惊艳!

铭记历史呀
2026-09-02 02:13:19
内塔尼亚胡:抓到了

内塔尼亚胡:抓到了

陆弃
2026-09-02 11:04:37
孙割被割:1.9亿刀,仅退款、小作文惹毛川普

孙割被割:1.9亿刀,仅退款、小作文惹毛川普

小小河
2026-08-31 16:27:29
2026-09-02 23:27:00
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6759文章数 26904关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

章泽天专访何超琼 后者辟谣"赌王传言"公开成长经历

头条要闻

章泽天专访何超琼 后者辟谣"赌王传言"公开成长经历

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

房产
旅游
家居
亲子
军事航空

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

旅游要闻

忻州荷花开 遍地是吾乡

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

4万余场亲子活动、“京小宝”2.0版可预约,北京托幼服务升级

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版