网易首页 > 网易号 > 正文 申请入驻

实测提升50%的“国模一哥”,不用去上海也能畅游陆家嘴了

0
分享至



作者|周末

原创首发|蓝字计划

“国产模型一哥”,又杀回战场了。

两个月前,唐杰还在马斯克面前放话:国产模型超越Claude Fable 5,不会太久。现在两个月过去,智谱立马就把对标把Fable 5的GLM-5.3端了上来。



图源:智谱官方账号

来得虽快,GLM-5.3出手却一点都不含糊。

根据智谱自建的Z.ai Code Bench,GLM-5.3编程能力较GLM-5.2提升了50%,官方也将其称为目前最强的开源权重编程模型

在漏洞挖掘上,GLM-5.3同样不弱。据智谱披露,它一口气找出2436个漏洞,其中1097个属于中高危漏洞,白盒代码审查和漏洞发现能力已经可以对标Mythos 5。

智谱把这轮能力提升的主要功劳,归给了后训练。

一般来说,大模型想变得更强,最直接的办法是扩大参数、增加数据,再做一轮大规模预训练,要付出的代价是更多的GPU、更长训练周期,以及大笔算力、电力和资金支出。

但后训练显然不是这么一回事。简单来说,后训练就是模型完成基础训练后,再通过强化学习不断“特训”,针对具体任务进行优化。

也就是说,别人争着给模型补脑,智谱却靠后天补课,把它练成了神童。

后训练真有这么神?

大模型,也成了做题家

要理解GLM-5.3的能力,还得先回到GLM-5.2。

作为智谱上一代旗舰模型,GLM-5.2已经站到了开源模型第一梯队。

今年6月,智谱开源的GLM-5.2采用了混合专家(MoE)架构,总参数规模约7530亿,上下文窗口达到100万Token。在Artificial Analysis综合能力评测中,GLM-5.2拿下51分,成为当时开源模型中的头部选手。



图源:智谱官网(GLM-5.2跑分数据)

而两个月后的GLM-5.3,没有更换底座,也没有继续扩大参数规模。智谱把主要精力放在了后训练上:长程任务环境规模扩大数十倍,任务场景变得更加丰富,后训练的迭代时间也被明显拉长。



图源:智谱官网

这一变化背后,是唐杰对大模型竞争方向的一次判断:Scaling,不只有参数量这一条路子可以走。



图源:智谱AI创始人,唐杰社交账号

过去,模型升级最直观的方式是扩大参数规模。但随着模型能力逐渐接近瓶颈,单纯“堆参数”带来的收益正在下降。

训练过程本身,同样会决定模型的最终能力,这也成了GLM-5.3的重点。

GLM-5.3开始让模型进入更接近真实工作的任务环境。

在一些高难度任务中,GLM-5.3需要面对完整的工程体系,自己分析性能瓶颈、修改方案、运行测试,并根据反馈不断迭代。而这类任务的复杂程度,已经接近一名经验丰富的工程师连续数天的工作量。

这类训练的核心,是让模型不断强化、学习,并学会如何完成一个目标。

为了扩大这种训练规模,GLM-5.3还尝试自动生成更多长周期任务环境,并通过评估系统验证任务是否有效,让模型能够接触更丰富的工作场景。

有没有效果?直接上跑分数据。

在考验真实终端环境复杂操作的Terminal-Bench 3.0里,GLM-5.3的分数提高了一大截,成绩从GLM-5.2的4.6分提升到28.3分,已经逼近Fable 5的33.7。

而在更考验“长期软件代码能力”的DeepSWE v1.1中,GLM-5.3也从46.2分提升到66.9分,距离Fable 5只差不到3分。



图源:智谱官网GLM-5.3跑分数据

更有意思的是,不同类型任务之间出现了反差。

越接近真实工作流、越需要模型长期执行的任务,GLM-5.3提升越明显。比如在Terminal-Bench 3.0中,它的成绩增长了接近6倍。

相比之下,在更偏综合能力和多工具协作的Agents' Last Exam中,GLM-5.3提升幅度相对有限,只涨了4.7分。

这样的成绩变化,其实就可以反映了GLM-5.3这轮训练的重点:让模型学会完成一件复杂的事情:理解目标、拆解任务、调用工具、不断验证,直到交付结果。

而这类任务,正是长周期训练环境最能发挥作用的地方。

不过,跑分终归只是跑分。要看这种训练有没有让模型更会干活,还得给它一项足够复杂的任务。

比如,从零复刻一个能真正开车到处逛的陆家嘴。

疯狂补课,确实有用

在基座参数没变的前提下,GLM-5.3编程能力体感暴涨了50%。那我们就看看,GLM-5.3用代码能写出什么好看好玩有意思的画面。

我们交给GLM-5.3和GLM-5.2的任务是:开发一个上海市陆家嘴和外滩区域的3D驾驶小游戏,需求大致涵盖地理复刻、昼夜灯光、车辆物理、导航存档等等

在实测中,GLM-5.3和GLM-5.2交付出的成品明显不同。

GLM-5.2更倾向于快速完成一个完整Demo。在接收到需求后,它直接围绕功能展开,将场景、车辆、灯光、交互等模块逐步实现。最终生成的代码规模较大,覆盖了大量功能需求。



GLM-5.2实测

实际上,GLM-5.2这种面对复杂任务时能快速过一遍设计方案,然后迅速进入执行阶段的能力,对于快速开发非常重要。例如,在要求加入动态灯光系统时,GLM-5.2能够理解昼夜变化需求,并尝试通过时间系统控制灯光状态;在车辆驾驶部分,也加入了相关控制逻辑。

只是这种追求速度的打法,也带来了明显的问题:模型更关注需求清单里的每个功能有没有跑通,轻视了不同模块之间是否协调,以及项目以后要怎么扩展。

于是,在GLM-5.2交付的这个成品里,城市细节可以说是几乎没有的。所有的建筑、地面和车辆,都是同一套色块,灯光也比较线性。

相比之下,GLM-5.3的表现就有明显进步。

在生成结果中,GLM-5.3采用了更接近真实工程项目的分层方式:配置层、核心层、数据层、世界构建层、系统层、装配层,而很少围绕具体功能。



GLM-5.3

这正是长周期后训练想要强化的能力:先规划整体结构,再分步骤实现,并在更长的任务链中处理好前后的依赖关系。

以后想加入更多城市区域、NPC车辆、天气系统或者AI驾驶,只需要在现有架构上继续增加模块,不用把已有代码推倒重来。

而且干活更细致之后,GLM-5.3确实也能带来更好的效果。

当我们在游戏中驾驶着小车车畅游陆家嘴的时候,随车辆移动所产生的影子变化、写字楼的格子间灯光、色彩较多的城市界面、不同的车辆驾驶视角,GLM-5.3都有在还原。



GLM-5.3

甚至是,车辆刹车时的车尾灯开启、车辆惯性、非路面行驶会限速都有体现;物理反馈、摄像机跟随、状态管理,GLM-5.3都有考虑在内。



GLM-5.3

这可不是单纯多放了几个视觉元素。刹车灯需要车辆状态联动灯光系统,非路面限速也需要地形判断与物理系统配合。能把这些细节串起来,说明GLM-5.3对跨模块关系处理的效果不错。



GLM-5.3

可以说,更细的任务拆解和更完整的工程规划,让GLM-5.3交出的成品更完整,也更接近一个可以继续开发的项目。

不过,GLM-5.3也还是有点愚蠢的地方。除了标志性建筑外,其他建筑几乎一个样。并且,许多建筑直接是在路面上生成,所以能看到很多路面是没法通行的。

这些问题也说明,GLM-5.3虽然能够搭起复杂工程,却还没有把整张地图的空间关系检查好。

总的来说,有这样的提升,其实已经能说明后训练这套的确有两把刷子。但这也留下了一个终极问题:既然后训练效果那么好,为什么其他家不来抄抄?

国模一哥,也有保质期

其实,大家早就在干了。

从OpenAI o1到DeepSeek-R1,强化学习早已被用来提升模型的推理和编程能力。智谱这次的不同,是把长周期任务环境扩大数十倍,专门训练GLM-5.3处理复杂工程。



图源:海外用户发文

这办法听起来一点都不神秘,只是门槛也一点不低。

最先,最容易卡住厂商的就是出题。

一道普通的代码题,提前准备好测试用例就能判断对错。长周期编程任务却要把模型放进真实工程,前面改错一个地方,后面整个项目都有可能出问题。

想大规模生成这类任务,还要保证每道题都能正常运行、反复训练,难度远高于收集一批代码。

光有题还不够,评分也得靠谱。

一旦评分标准存在漏洞,模型就可能学会钻空子。表面上分数越来越高,实际任务却没有完成。这就是强化学习中经常出现的“奖励作弊”。

再加上,后训练其实也没有比预训练便宜多少。

一次长周期任务可能要跑上许多轮。模型不断尝试,失败的过程同样消耗Token和算力。后训练顶多是省下了重做模型基座的钱,但要是真到了算账的时候,能省下多少可能真不好说。



图源:海外用户发文

更别说它还有一个更明显的边界:练什么,就只学什么。

GLM-5.3在Terminal-Bench 3.0中的成绩从4.6分涨到28.3分,接近翻了六倍;在考察综合能力和多工具协作的Agents' Last Exam中,却只提高了4.7分,就是最好的案例。

因此,所谓50%的编程能力提升,主要集中在长周期编程和复杂工程任务上,绝对不能和整个模型的能力提升了50%划等号。

正因如此,后训练更适合把底座已经具备的能力继续补强,要是底座里本来就没有的知识和能力,就没法通过后训练长出来了。

那为什么后训练依然如此受欢迎呢?因为确实高效率啊。

过去,厂商往往要等到下一代基座训练完成,才能迎来一次大升级。现在,同一套基座换一批任务环境、重新训练几个月,也可能推出一个能力明显更强的新版本。

一个模型刚在榜单上冲到前面,对手很快就能用新的训练方法追上来。今天领先的能力,过几个月可能就成了其他模型的基础配置。

智谱在Blog最前面写下“单弦不成音,独木不成林”。这句话听起来很从容,也正好说中了现在的局面:模型厂商各有路线,第一梯队的位置也会反复换人

只是智谱能一直从容吗?这或许是整个大模型行业,都需要自我拷问的问题。

参考资料:

[1]数字生命卡兹克:聊聊唐杰老师对GLM-5.3和Scaling Law的思考

[2]量子位:刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了

[3]APPSO:实测GLM-5.3:在神仙打架的一周杀回国模顶流,还按下了重置键

[4]钛媒体:GLM-5.3发布,基座没变,能力却涨了

[5]AI科技评论:GLM-5.3来了:底座没换,编程暴涨50%,还顺手揪出潜伏40年的世界级漏洞

声明:个人原创,仅供参考

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
穆帅:中场时我们都觉得还能进三四五个,但强度降低给了对手空间

穆帅:中场时我们都觉得还能进三四五个,但强度降低给了对手空间

天光破云来
2026-09-16 06:59:03
比亚迪“巨无霸”SUV降价上市,纯电续航近1000km!

比亚迪“巨无霸”SUV降价上市,纯电续航近1000km!

米粒说车唯一呀
2026-09-15 14:29:22
10月6日主场告别:梅西将踢完阿根廷最后一战

10月6日主场告别:梅西将踢完阿根廷最后一战

体坛观察猿
2026-09-16 06:58:17
穆帅激动不已!花2500万欧淘来福将:4次替补2次绝杀 本季西甲第1人

穆帅激动不已!花2500万欧淘来福将:4次替补2次绝杀 本季西甲第1人

风过乡
2026-09-16 06:08:39
一支仅1.3万人的杂牌军,为什么能在临沂城下狂虐日军王牌师团?

一支仅1.3万人的杂牌军,为什么能在临沂城下狂虐日军王牌师团?

饭小妹说历史
2026-09-13 11:23:21
杨祐宁为三胎儿子庆1岁生日!宝宝肉嘟嘟神似爸爸,五年三娃好温馨

杨祐宁为三胎儿子庆1岁生日!宝宝肉嘟嘟神似爸爸,五年三娃好温馨

阿废冷眼观察所
2026-09-15 12:45:24
康辉哽咽、朱迅痛哭、尼格买提辛酸,他们一生再优秀也对不起父母

康辉哽咽、朱迅痛哭、尼格买提辛酸,他们一生再优秀也对不起父母

莹莹的历史说
2026-09-16 04:13:14
长沙35岁二娃宝妈重新高考读大学,辅导员都喊她“姐姐”,丈夫力挺:她做啥我都支持,5年20万元学费我来出

长沙35岁二娃宝妈重新高考读大学,辅导员都喊她“姐姐”,丈夫力挺:她做啥我都支持,5年20万元学费我来出

极目新闻
2026-09-15 20:47:08
有的高额养老金老人,已经将养老金作为养儿养孙的主要经济来源!

有的高额养老金老人,已经将养老金作为养儿养孙的主要经济来源!

白米饭怎么吃
2026-09-15 21:09:21
越南政府的决议实际上就是要扼杀广西平陆运河出海口

越南政府的决议实际上就是要扼杀广西平陆运河出海口

安安说
2026-08-31 11:15:16
母亲过世要下葬,男子问豆包选“黄道吉日”;办完丧事后亲戚车祸重伤,家人埋怨安葬日不对,男子起诉豆包要求赔礼道歉

母亲过世要下葬,男子问豆包选“黄道吉日”;办完丧事后亲戚车祸重伤,家人埋怨安葬日不对,男子起诉豆包要求赔礼道歉

鲁中晨报
2026-09-16 06:59:15
陈思诚与佟丽娅分开5年多,儿子朵朵不知情!转学就是为避纷扰!

陈思诚与佟丽娅分开5年多,儿子朵朵不知情!转学就是为避纷扰!

丁鸊惊悚影视解说
2026-09-16 01:54:32
显亮白的藏蓝泳衣,这身板还挺争气!

显亮白的藏蓝泳衣,这身板还挺争气!

飛尚日记
2026-09-04 08:45:48
波兰外长:“不用美军,6周击败俄罗斯”,俄罗斯:波兰外长有 “脑部恐俄症”

波兰外长:“不用美军,6周击败俄罗斯”,俄罗斯:波兰外长有 “脑部恐俄症”

蓝星杂谈
2026-09-15 22:32:55
天呢!坐标四川某县城,房地产商盖章承诺,维持房价不低于5000元

天呢!坐标四川某县城,房地产商盖章承诺,维持房价不低于5000元

慧翔百科
2026-09-15 17:39:14
焕新版Model Y曝光,719km续航,4.3秒,超充快,辅助稳

焕新版Model Y曝光,719km续航,4.3秒,超充快,辅助稳

趣味萌宠的日常
2026-09-14 15:02:42
AV仓木华离世!经纪公司悲痛证实死讯「生前承受痛苦」:强烈愤怒

AV仓木华离世!经纪公司悲痛证实死讯「生前承受痛苦」:强烈愤怒

ETtoday星光云
2026-09-15 10:27:27
为什么高认知人群在底层就是一场灾难?命运对一个人的顶级残忍,就是给了你清醒的大脑,而你却不具备改变现实的能力

为什么高认知人群在底层就是一场灾难?命运对一个人的顶级残忍,就是给了你清醒的大脑,而你却不具备改变现实的能力

微微笑了
2026-09-03 21:25:05
理想回应“i8车主等智驾自己避让被撞”:NOA只是L2辅助,司机须及时接管;律师:辅助驾驶不是自动驾驶,商家不担责

理想回应“i8车主等智驾自己避让被撞”:NOA只是L2辅助,司机须及时接管;律师:辅助驾驶不是自动驾驶,商家不担责

大风新闻
2026-09-15 16:05:15
1-0,西甲倒数第一掀翻西甲第4,瓦伦西亚终结4连败+逃离降级区

1-0,西甲倒数第一掀翻西甲第4,瓦伦西亚终结4连败+逃离降级区

侧身凌空斩
2026-09-16 03:59:42
2026-09-16 07:35:00
蓝字计划 incentive-icons
蓝字计划
记录智能时代的每一次浪潮!前沿科技捕手,AI产品深度洞察。
329文章数 3897关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

女子婚后发现单身公公脾气好 将离异母亲嫁给公公

头条要闻

女子婚后发现单身公公脾气好 将离异母亲嫁给公公

体育要闻

AK47到底有多强?

娱乐要闻

谢霆锋示爱王菲、和前妻划清界限

财经要闻

黄仁勋接到特朗普电话:AI风险论是"骗局"

汽车要闻

10.36万元起,2027款埃安i60上市,三大升级一次看懂

态度原创

亲子
数码
本地
时尚
军事航空

亲子要闻

出生仅6天女婴在月子中心窒息死亡,家属质疑工作人员操作不当致呛奶,母亲发声:他们说孩子有基础病,有证据吗?

数码要闻

荣耀AgenticOS亮相,10月面向Magic9系列开放尝鲜招募与推送

本地新闻

不止胖东来!许昌藏着半部三国史

真正会打扮的女人不会总穿黑色,看看这些红色系穿搭,养眼又高级

军事要闻

穆杰塔巴近况披露 地方官员:他身体非常健康

无障碍浏览 进入关怀版