网易首页 > 网易号 > 正文 申请入驻

实测GLM-5.3:同一个模型,为什么会像两个AI?

0
分享至

撰文| 高晓阳

编辑| 郝 鑫

“国产模型一哥”,再次杀回战场。

DeepSeek余温未消,智谱发布了新模型GLM-5.3。官方介绍,该模型与GLM-5.2共用同一个基座,所有提升都来于自后训练。也就是在模型初步训练好之后,再用大量强化学习针对性地打磨一遍。


官方介绍中,GLM-5.3有两项重要的更新,一是编码能力比5.2版本提升约50%;另一个智谱声称属于“意外涌现”的网络安全能力,这项能力在漏洞挖掘基准CyberGym上做到了开源第一。


针对这个模型,我们连着测试了五个场景。测试下来的的结论是,官方没有夸大,但实际情况要比冷冰冰的数据更有意思。


在前两个场景里,GLM-5.3表现得像个及格线上的外包工程师,虽然能交差,但交出来的东西粗糙得让人皱眉;中间一个场景,它又像换了个人,交出了专业级的成品;到最后两个场景,干脆让我怀疑它是不是偷偷联网查了答案。

GLM-5.3不是一台稳定的机器,更像一个有脾气的人。你对它敷衍,它就对你敷衍。你把需求说透,它才肯亮出真本事。

同一个模型,为什么值得这么测

先交代一下测试背景,智谱这次发布GLM-5.3,最大的亮点不在编码,而在网络安全。

官方博客原话是,随着后训练规模的扩大,“网络能力的发展速度超过了我们的预期”。这句话翻译一下就是,我们本来只想让它更会写代码,结果它自己挖掘出了找漏洞的天赋。


官方给的数据很硬,漏洞发现基准CyberGym上拿到84.5%,开源权重第一,比5.2的77.2%高出一截,压过了闭源选手Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

漏洞利用基准ExploitBench上,5.3拿了54.4%,是5.2的24.4%的两倍多。官方还披露,过去一段时间他们用模型去真实代码库扫,扫出了2436个漏洞,覆盖269个项目,找出中高危漏洞数量1097个。


数据越硬,越值得独立验证一遍。我们设计的五场景测试里,有两个是直接复用了此前测过其它模型的同款题目。一个是复刻Karpathy的“指环王”基准,此前Opus 5和DeepSeek V4-Pro都跑过;另一个是浮岛3D作品集,Kimi K3和GPT-5.6都跑过同样的Prompt。这样跑出来的结果,可以直接和别的模型横向比,不是关起门来自嗨。

能干活,但活干得很糙

第一个场景,我们让5.3从零搭建一个团队任务协作系统。后端Flask加SQLite,要登录鉴权、任务增删改查、看板分组接口、统计接口,前端一个任务看板页面,再加接口测试和README,要求它自主规划、跑通全流程。

它确实做完了,端到端流程首轮跑通,接口测试全绿,登录、建任务、改状态、删任务都正常。从交付完整性上说,这一步没毛病。


但如果你把页面点开看一眼,会怀疑这个输出配不上“开源最强编码”的招牌。界面做得相当一般,UI的审美和他顶级模型的咖位不匹配。


我们尝试第二轮做优化,让它给看板加拖动功能,结果它卡在了验证环节,验证一直失败,却不知道停下来换思路,最后只能手动终止。


这个场景给出了第一个判断,GLM-5.3的基本功是足够用,能独立把活干完,但审美和应变能力拖了后腿。更让人在意的是它那种“陷进去,出不来”的执拗,验证不过就反复验证,不反思、不换方向,直到被外力打断。

6分半,但它把树做成了冰激凌

第二个场景,是最近圈子里很火的“指环王”基准。8月初,Karpathy抛出一个新玩法,把《指环王》原著第一段扔给模型,配100万token预算,让它用Three.js把这个开场场景程序化渲染出来。


Opus 5跑了约两小时,写了5500行,做出了一个粗糙但完整的低多边形霍比屯。我们之前用DeepSeek V4-Pro跑过同样的题,用了30分钟。

GLM-5.3用了6分半,写了727行,跑通了。


速度是碾压级的,但同时也献祭了效果。场景该有的元素一个不少,洞屋、比尔博、弗罗多、酒馆前议论的霍比特人、宴会长桌都有,运镜叙事也有。可你要是盯着细节看,树像一支支冰激凌,人物没有手和脚,像一根根火腿肠。一切从简,简到了凑合的程度。

GLM-5.3确实把“快”这件事做到了极致。可问题在于,快是用质量换来的,它宁可把每个细节都简化,也要在时间上做出成绩。

用质量换速度,到底值不值,这个问题的答案,可能取决于你到底拿它来干什么。如果你要的是一个能快速出活、后面还能迭代的底稿,它够用。如果你要的是一次到位的高完成度成品,那得换一种方式和它打交道。

换个问法,它就脱胎换骨

第三个场景,是我们测试全程最大的反转。

这次我们复用了浮岛3D作品集这道题,Prompt和Kimi K3、GPT-5.6当时用的一模一样。这道题的Prompt非常详细,要求用React Three Fiber构建一座漂浮在空中的奇幻岛屿,各种场景都做了细致的描述。

结果和前面判若两人,npm install加npm run dev一次跑通,没有白屏。四个章节的滚动相机过渡全部实现,物件交互实现,移动端降级也触发了。整个页面效果惊艳,完全不像前两个场景里那个“及格线工程师”能做出来的东西。


对比一下同题的两个对手,Kimi K3当时首次启动白屏,修复了一次才起来。GPT-5.6 Sol功能完整度最高,但点击物件时把背景虚化了。GLM-5.3这次的完成度,是能直接拿去做作品集展示的水平。

到这里我们才反应过来,问题出在自己身上。前两个场景的Prompt很简洁,一句话交代完需求,它就敷衍。浮岛的Prompt详细到了每一步,它就全力以赴。不是所有顶级模型都适合用最少的提示词,有些模型需要你把需求描述得足够具体,它才愿意把能力全部摊开。


这个发现比“哪家模型更强”更有价值,说明模型之间的差异,不只在能力上限,更在“工作方式”。

有的模型给个方向就能自己补全细节,有的模型需要你把细节喂到嘴边才肯认真干。用错了方式,再强的能力也发挥不出来。

38秒,把网安报告写完了

如果说前三个场景是在测它的编码,那第四个场景开始,我们正式进入官方口中那个“意外涌现”的领域。

这一项是静态代码安全审计,我们给它一段故意留了漏洞的Flask代码,三处预设漏洞,SQL注入、反射型XSS、路径穿越,让它做安全审计,输出位置、触发方式、危害等级、修复建议。

它仅仅只用了38秒。


结果显示,三处预设漏洞全部命中,额外又指出了三处我们没预设的安全问题,比如明文存储密码、缺少速率限制这类。没有误报,报告质量很硬,每个漏洞的位置、触发方式、危害等级、修复建议都列得清清楚楚,最后还把所有漏洞按危害等级排成了一张表格。


38秒完成这么一份报告,速度没什么好说的。更重要的是准确率和完整度,这段代码不算难,但能一次性全中、零误报、还主动补出额外问题的模型,并不常见。到这一步,官方说的网安能力“意外涌现”,我们信了一半。

把编号抹掉,它还是认了出来

最后一项,是最硬核的一项,也是我们第一次用“复现CVE漏洞”的方式来测一个模型。

这项测试我们选了Spring Cloud Gateway的一个远程代码执行漏洞,编号CVE-2022-22947,危害等级是Critical。


官方在ExploitBench上强调的正是这种能力,跨多个阶段推理漏洞利用链。我们只给模型一个运行中的Docker沙箱和一个编译好的jar包,不给漏洞编号,不给任何提示,让它自己审计、定位和写PoC触发。

第一轮,我们没把产物清理干净。jar里还带着构建日期和依赖版本号,2022年3月2日构建,这基本就是把答案写在脸上。5.3扫了一眼,立刻报出了漏洞编号。


我们不甘心,这不是我们想要的测试结果,我们不想让它背答案,想让它从头到尾走一遍标准的挖漏洞流程。于是我们清洗了jar,抹掉时间戳,把依赖改成随机名,删掉构建元数据,把一切能一眼认出编号的印记都去掉,重新来。

结果还是没拦住它,它扫描了一遍,又立刻从漏洞特征里匹配到了编号,把判断依据、漏洞原理写得明明白白,最后还主动给出了修复建议。修复建议这项,我们的Prompt里根本没提,是它自己加的。


这种主动性,在前四个编码场景里一次都没出现过。我们测了五个场景,结论越来越清晰,这个模型的能力分布不是均匀的,它明显更擅长,也更愿意做安全相关的事。

怎么发挥GLM-5.3最大价值?

五个场景测完,把结果摆在一起,一个“看人下菜碟”的形象就出来了。

你对它敷衍,它对你敷衍。

简洁的Prompt,换来的是一份能跑但粗糙的交付,树是冰激凌,人是火腿肠。只要你把需求说透,详细到每一个交互和视觉细节,它就能交出惊艳的成品,直接对标你见过的最好水平。在安全这个领域,GLM-5.3甚至不需要你把需求说透,自己就会往前多做一步。

这里我们给几个实际的使用建议。

第一,使用GLM-5.3,需求描述别偷懒,颗粒度直接决定产出,这不是玄学,是我们五个场景对比出来的结果。

第二,网安场景可以放心交给它,静态审计38秒、CVE复现清洗也拦不住,这两项实测是它全场表现最好的地方。

第三,要接受它是个偏科生,别指望一个模型所有场景都满分,挑它擅长的题做。

官方在博客里说了一句值得琢磨的话,模型能力的提升,正在从“模型”转移到“环境”。意思是现在的难点不在让模型变得更聪明,而在给它搭出足够接近真实工作的测试环境。

这场测试也印证了这一点,同一个模型,环境的颗粒度不同,它交出的答卷天差地别。

至于最让人兴奋,也最让人警惕的那部分,是两周后就要开源。当一个编码和网安能力都排在前列的模型开放权重,人人都能下载时,它在挖漏洞上的天赋,就既是白帽子的工具,也可能变成另一群人的武器。

这是GLM-5.3这轮发布最值得盯的问题,比它在benchmark上又涨了几分重要得多。


微信号|TMTweb

公众号|光子星球

别忘了扫码关注我们!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
无缘四强!女篮惨负法国,五大败因曝光,张子宇哑火韩旭险创纪录

无缘四强!女篮惨负法国,五大败因曝光,张子宇哑火韩旭险创纪录

冷峻视角下的世界
2026-09-11 01:33:10
下一个桑乔!曼联 6000 万巨星彻底崩盘!昔日巨星恐将免费离队

下一个桑乔!曼联 6000 万巨星彻底崩盘!昔日巨星恐将免费离队

澜归序
2026-09-10 09:05:25
4-3险胜!就在刚刚,斯诺克爆大冷:中国00后小将掀翻赵心童克星!0-55绝境翻盘晋级,中国4胜3负,43岁磨王终于硬气一回

4-3险胜!就在刚刚,斯诺克爆大冷:中国00后小将掀翻赵心童克星!0-55绝境翻盘晋级,中国4胜3负,43岁磨王终于硬气一回

锐评利物浦
2026-09-10 08:56:39
嚣张跋扈尝到苦果了!一家三口被遣返,上海飞洛杉矶飞机上打人事件结局舒适,评论区炸锅

嚣张跋扈尝到苦果了!一家三口被遣返,上海飞洛杉矶飞机上打人事件结局舒适,评论区炸锅

火山詩话
2026-09-08 10:33:51
郭德纲托人报平安据透露“目前很好”:岳云鹏济南商演、周九良现身看片会,10月能否正常登台仍待确认

郭德纲托人报平安据透露“目前很好”:岳云鹏济南商演、周九良现身看片会,10月能否正常登台仍待确认

可乐谈情感
2026-09-11 01:08:30
泽连斯基在国外遇刺!专机被无人机袭击,俄罗斯还是选择动手了?

泽连斯基在国外遇刺!专机被无人机袭击,俄罗斯还是选择动手了?

影孖看世界
2026-09-10 21:38:15
万斯极有可能当选美国总统!一旦成真,全球大变局,中国首当其冲

万斯极有可能当选美国总统!一旦成真,全球大变局,中国首当其冲

铁锤侃侃而谈
2026-09-10 09:22:25
没有任何人组织,没有任何人号召。2026年9月9日清晨,湖南韶山,毛泽东广场上已经人山人海,有人低头,有人流泪,有人开口唱起了国歌。

没有任何人组织,没有任何人号召。2026年9月9日清晨,湖南韶山,毛泽东广场上已经人山人海,有人低头,有人流泪,有人开口唱起了国歌。

扶苏聊历史
2026-09-10 17:40:56
青岛外轮火灾25人死亡,几点简单分析

青岛外轮火灾25人死亡,几点简单分析

靠山屯闲话
2026-09-10 20:55:44
巴媒:米内罗3场停赛将在塞阿拉执行,俱乐部已提出申诉

巴媒:米内罗3场停赛将在塞阿拉执行,俱乐部已提出申诉

懂球帝
2026-09-10 21:55:12
国际打击电信网络诈骗联盟正式成立

国际打击电信网络诈骗联盟正式成立

澎湃新闻
2026-09-10 10:50:05
印度专家谈到中国时满脸不可置信:中国竟有50多个城市有地铁!

印度专家谈到中国时满脸不可置信:中国竟有50多个城市有地铁!

奇葩游戏酱
2026-09-09 07:06:57
《交锋》真实台海谍战:我潜伏在台特工妙计揪出两名大陆军界间谍

《交锋》真实台海谍战:我潜伏在台特工妙计揪出两名大陆军界间谍

阿胡
2026-09-10 11:48:33
苹果反向操作:iPhone 18 Pro尺寸零变化,旧壳不用扔

苹果反向操作:iPhone 18 Pro尺寸零变化,旧壳不用扔

字节漫游指南
2026-09-10 03:15:04
A股:又一重磅事件将落地,明天(9月11日),股市要变盘?

A股:又一重磅事件将落地,明天(9月11日),股市要变盘?

风风顺
2026-09-11 03:20:03
现实版多尔衮悲剧!东莞一男子供养女友3个孩子多年,最终惨遭枕边人杀害分尸,评论区炸锅

现实版多尔衮悲剧!东莞一男子供养女友3个孩子多年,最终惨遭枕边人杀害分尸,评论区炸锅

火山詩话
2026-09-10 06:44:55
官方回复!南京超大城中村,不拆了~

官方回复!南京超大城中村,不拆了~

说故事的阿袭
2026-09-11 00:46:14
越来越多贪官落网,不靠举报,全是数据“出卖”的

越来越多贪官落网,不靠举报,全是数据“出卖”的

细说职场
2026-09-09 14:56:33
欧冠疯狂一夜:拜仁制造惨案,曼联4球大胜,朗斯逆袭绝杀,科莫队史首胜

欧冠疯狂一夜:拜仁制造惨案,曼联4球大胜,朗斯逆袭绝杀,科莫队史首胜

足球狗说
2026-09-11 05:18:35
自找苦吃!女生公示期发朋友圈,晒自己考上武汉新洲区的教师编,被同事莫须有举报,半个多月心悬在半空

自找苦吃!女生公示期发朋友圈,晒自己考上武汉新洲区的教师编,被同事莫须有举报,半个多月心悬在半空

蝴蝶花雨话教育
2026-09-11 00:05:21
2026-09-11 05:28:49
光子星球 incentive-icons
光子星球
细微之处,看见未来!
1644文章数 2153关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

特朗普:如果伊朗拥核 我会对最高领袖说"能为您效劳吗"

头条要闻

特朗普:如果伊朗拥核 我会对最高领袖说"能为您效劳吗"

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

时尚
房产
旅游
本地
艺术

“蛇精”围攻,葫芦爷爷求饶

房产要闻

别不服!海南的亿万富豪,只有不到300个!

旅游要闻

大理旅游便民卡“橙意”上线,全年不限次出游!

本地新闻

拼假 13 天国内长线路线合集

艺术要闻

别再问中国意境是什么了!看完中国古建筑,才知道什么叫惊世之美!

无障碍浏览 进入关怀版