网易首页 > 网易号 > 正文 申请入驻

智谱 VS Deepseek,两条分叉的自进化树

0
分享至



智谱发布GLM-5.1的时候,盘中涨幅一度接近19%,收盘涨幅11.5%。到了GLM-5.2,当天暴涨32.8%,一周后市值突破万亿。按照这个逻辑来看,GLM-5.3发布后,智谱股价不得起飞喽?

可事与愿违,8月14日发布GLM-5.3当天,智谱跌3.57%,日内回撤超11%。

智谱GLM-5.3的成绩单很亮眼。DeepSWE的66.9分超过了V4 Pro的62.7,Terminal Bench 3.0从5.2的4.6分暴涨到 28.3分拿下开源第一,CyberGym以84.5%登顶全球,在高难度编程任务上,只用了不到Claude Opus 4.8一半的 token,就拿到了更高的完成率。

在智谱官方放出的性能图里,编程、终端操作、Agent任务、网络安全等八方面,赢过了DeepSeek V4 Pro正式版七项,对DeepSeek形成了“精准狙击”。



但是却很少有人注意到,GLM-5.3其实并非“新”模型,它和GLM-5.2 用的是同一个7430亿参数基座,所有提升全靠后训练。这和DeepSeek V4 Pro从预览版到正式版的逻辑是一样的,后者也都是同一个1.6T基座,能力跃迁同样来自后训练。

GLM-5.3之于5.2,就是V4 Pro正式版之于预览版。两者的不同在于,智谱没有涨价,DeepSeek却涨了一大截。从8月17日0点开始,DeepSeek API新一轮调价,全面引入峰谷分时定价机制,整体价格较此前出现大幅上调,全计费项涨幅区间为50%至1100%。

还有一点,那就是在自进化这块,智谱已经和DeepSeek形成了初步交锋。GLM-5.3的新后训练方法,本质上是一种模型自进化。而DeepSeek V4 Pro同步发布的DeepSeek Harness,其插件即一切的策略,也是为了自进化。

自进化是公认通往AGI的赛道,眼下国产大模型的 AGI 赛道,本质上就是智谱、DeepSeek、Kimi 三家的竞速。 都喊着 AGI,都在拼谁的模型更像一个能独立干活的 "人"。

01

两家的方法论究竟有何不同?

先看智谱这边。GLM-5.2到5.3最核心的变化是加入了一套“自己出真题自己做”的环境合成流水线。

在GLM-5.2的时期,训练环境还主要靠人工搭建,所以题型有限、场景也偏模拟题。

到了5.3,智谱引入了一个全自动的环境生成机制。

具体来讲,智谱用了一个“AI研究员”(研究Agent)去真实场景里面抄题目。比如它会观察工程师到底怎么干活,把真活儿变成考题。

其实很早之前的生成对抗就采用了类似的逻辑,用机器给机器出题。

可机器出题没法保证每道题都是好题。 有的题可能根本解不出来(出题时条件给错了),有的题可能缺关键信息(做到一半卡死),有的题可能是“无解题”(mission impossible)。如果这些废题混进训练题库,模型辛辛苦苦刷了半天,刷的是一道根本做不出来的题。

因此智谱用了一个AI判卷员(判断Agent),先自己做一遍。 相当于出题人出完卷子,先自己答一遍,确认“这题真的能解出来”,不是道废题。防止出那种连老师都不会做、纯粹难为学生的怪题。

判卷员在做题过程中,不许看参考答案,只看解题过程。

如果是带着答案做题,那么模型可能学会“背答案”或者“抄近路”。表面上得分高,实际啥也没学会。所以判卷员得盯着解题轨迹,看它是不是一步一个脚印真解出来的,有没有钻漏洞、走捷径。只有“题能出、能做、过程干净”三道关卡全过了,这道题才配进训练题库。

这套流水线让训练环境规模扩大了数倍。



除了方法改变以外,刷题的整个基础设施也得到了升级。

slime是智谱从GLM-5时代就一直在用的一套训练框架,你可以把它理解成一个自动化的刷题工厂。

5.3在这套工厂上做了两层大改造。第一层是算法层面,新增了一批技术配置,最关键的一个改动,是让练习和考试的环境几乎完全一致。两者计算结果的平均差异控制在千万分之一的量级,比之前精确了99.99%。

AI的强化学习,本质上是成千上万轮的循环。先考试生成一批答卷,再根据答卷讲课更新模型,然后再考试、再讲课,无限循环。

如果练习和考试的环境有一点点不一样,每一轮都带入一点误差,一万轮下来误差就滚成了大雪球,模型可能学歪甚至直接崩掉。

就好比NBA比赛中,三分线弧顶距离是7.24米,底角是6.7米,但是FIBA国际篮联的三分线是6.75米,如果练习的时候以FIBA的标准,那么到了NBA中就适应不了那么远的三分线。

第二层是系统层面,智谱给这个出题工厂加了一堆效率优化。

常用的数据放到近处缓存,不用每次去远处取。相当于教材室紧挨教室,拿到教材就可以立马发给学生。

多个老师还可以自动切换,还能提前备好课,任务调度让每台机器都不闲着,还能根据题型自动调整到最优配置。这些优化叠在一起,长程编码任务的整体训练速度翻了2.3倍。

在Agent领域影响力最大的Terminal Bench 3.0基准数,得分从5.2的4.6分,暴涨到了5.3的28.3分,拿下开源模型第一。DeepSWE v1.1从46.2涨到66.9,Agents' Last Exam从23.8涨到28.5,AutomationBench从26.2涨到48.2。

再看DeepSeek这边,从预览版到正式版,DeepSeek V4 Pro也强化了后训练。预览版的监督微调数据以通用问答和基础代码为主,而在正式版当中,新增了大量Agent专用的多步骤工具调用对话范例。

以前教模型的例子,是“帮我写封邮件”这种一问一答。现在换成“把文件夹里所有PDF转成Word”这种真活儿。AI得先扫文件夹,然后识别PDF,并逐个进行转换。一切都完成后,汇总报告,一环扣一环。

同时,DeepSeek把GRPO强化学习的奖励函数给重新设计了一遍。

预览版在Agent场景下有两个常见的硬伤,其一是工具调用死循环,反复调用同一工具但提取不到有用信息;其二是参数解析错误,JSON格式错、必填字段漏。

正式版的奖励信号专门针对这两类失败做了惩罚,在需要35次工具调用的复杂任务中,正式版基本可以一次跑通不再卡死。

02

唐杰vs梁文锋+崔添翼

技术路线的背后从来都是人的理念。智谱和DeepSeek这场对抗,本质上是两种AGI路径的对撞。

智谱创始人唐杰在7月11日发布了内部信《巨浪已来》,宣布启动“Touch High(摸高)计划”。信中写到,未来两年不把重心放在商业变现上,集中资源冲AGI的下一个高地。

唐杰把AGI的突破拆解为三座必须翻越的大山,第一座是记忆,长上下文和RAG已经逼近记忆雏形;第二座是完全自治的智能体系统(Autonomous Agent System,即持续学习和自我评判),模型迭代频次的提升本身就在逼近持续学习,前沿模型已显露自我评判的萌芽;第三座是自进化(Self-Evolving)。

唐杰表示,“AI训练AI已经成型,模型自己写代码、自己清洗与合成数据、自己训练自己。这或许会消耗一些算力,却节省了最宝贵的人力与时间。而在大模型时代,速度是最重要的,快速迭代会直接拉开认知的代际差距。”

前文提到的GLM-5.3后训练办法,本质上就是一种自进化。

不过自进化最有魅力的地方,并不在于它如何实现了开发者一开始给它规定的目标。就比如GLM-5.3,的确通过自进化,让性能更强了。但最有魅力的地方在于,GLM-5.3获得了极强的网络安全能力。

智谱给GLM-5.3做后训练时,确实往训练环境里加了一些漏洞挖掘的任务。初衷很简单,让模型找漏洞、分析漏洞的能力强一点。

结果训练规模上去了,事态也跟着失控了。



官方博客中写到,“我们本来以为它只是更会找单个漏洞,但出乎意料的是,它开始跨越漏洞利用的多个阶段,形成完整的攻击链计划。”

在CyberGym测试中,任务要求模型从白盒源码出发识别并验证漏洞,GLM-5.3拿到了84.5%分,全球第一,压过了Anthropic的Claude Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。

DeepSeek在自进化这道题上,给出的答案是“插件”。梁文锋把模型基座冻结在1.6T不动,崔添翼带队的DSH框架则把“自进化”发生的场所,从模型内部搬到了模型外部。

DSH的核心设计原则只有五个字,“一切皆插件”(Everything is a Plugin)。模型接入、工具注册表、会话日志、审批策略、沙箱、存储、上下文管理、甚至驱动 Agent 运转的主循环本身,全都是可以拔插的积木。

底层的Cordis微内核只负责插件的加载、卸载和依赖管理,其他什么都不管。

DSH在GitHub宣布开源的当天,也发布了一篇长达88页的论文《时空可组合性的编程范式》,来阐述DSH的理论基础。

Cordis最关键的特性叫“可逆效应”。它指的是,每个插件注册时产生的所有副作用都被追踪,卸载时自动回收,不留垃圾、不漏内存。

这意味着Agent可以在运行过程中随时更换插件,觉得这个搜索引擎不好用。OK,马上换下一个。甚至可以在Agent跑任务的时候换掉它的决策策略,类似于“热插拔”一样,即便更改插件,运行状态也不会崩。

简单来说,传统的Agent非常死板,师傅怎么教,他就怎么学,只要超出知识点就会无能为力。DSH发现缺扳手时,现场自己锻造一把、插到手上接着拧螺丝,用完还能拆下来。

插件化还有另外一层含义,那就是相互独立。传统软件之间存在强依赖关系,改了A,可能B就会受牵连。插件之间相互独立,因此可以相互演化,进而带动整个模型实现自进化。

DSH发布不到两天,就在GitHub就收获10万颗以上的星星,可见开发者社区对它的青睐。

但智谱和DeepSeek其实是两种完全不同的自进化观。

唐杰追求的是“模型自己变聪明”,进化发生在训练阶段,目标是提升模型本身的智商;梁文锋和崔添翼追求的是 “模型的身体可以无限重组”,进化发生在推理和运行阶段,模型本身的智商不变,但它的“手脚”和“器官”可以随时替换、扩展、升级,能力边界由插件生态的丰富程度决定。

如果说唐杰的自进化是生物学意义上的进化 ,基因在迭代中变得更聪明。那梁文锋+崔添翼的自进化就是工具意义上的进化,人本身没变,但从石器到青铜器到蒸汽机,工具的重组让人的能力指数级扩张。

两条路线谁对谁错,没人能定夺,然而智谱的股价成了这场对抗的风向标,甚至被网友戏称为“衡量DeepSeek模型能力最好的测试集”。

4月24日DeepSeek V4预览版发布当天,智谱暴跌逾9%,随后几个交易日持续下挫,4月28日盘中一度跌超13%、跌破千元大关。

市场的逻辑是,DeepSeek又强又便宜还开源,而智谱这边却在涨价。

从2月开始智谱连续上调API定价,一季度累计涨幅约83%,4月GLM-5.1发布时完成年内第三次提价。

这就导致智谱的商业化空间被挤压,估值逻辑遭到了质疑。

8月13日,V4 Pro正式版遭遇乌龙事件,凌晨静默发布、白天官网横幅撤下公告删除、后端指纹改回Preview状态、不到24小时又重新发布。当天智谱股价反而从开盘1230港元涨到收盘1317港元,涨幅约9%。

对手“翻车”被解读为自身利好,说明市场已经从“DeepSeek出模型 = 智谱利空”的简单零和逻辑,转向了对两家路线可持续性的更微妙博弈。

8月14日GLM-5.3发布当天,智谱股价高开低走,开盘1356港元、盘中最高冲到1435港元,收盘却跌到1270港元,跌幅3.57%,从日内最高点算回撤超过11%。

这可能意味着投资者不再只看模型的性能本身,而是唐杰的“自进化闭环”和梁文锋+崔添翼的“插件化生态”之间,哪条路更可能跑到AGI的终点。

GLM-5.3虽然八项赢七项,但市场认为这是“符合预期”的后训练迭代,没有超出基座不变的框架。V4 Pro+DSH的组合,或许才是长期变量。

03

从“价格屠夫”到集体涨价

前面说完了智谱涨价,现在该说说DeepSeek涨价了。

DeepSeek一直以“价格屠夫”著称,早在V3时代,DeepSeek就用极致的性价比,打穿了整个行业的价格底线。后面到了V4预览版,DeepSeek又延续了这个策略,缓存命中输入低至0.025元/百万token,未命中输入3元,输出6元,几乎是海外旗舰模型的几十分之一。

但8月13日晚间,DeepSeek在发布V4 Pro正式版的同时官宣了API调价,从8月17日零点生效。

在这次价格调整中,DeepSeek首次引入了峰谷分时定价,高峰时段为北京时间9:00-12:00和14:00-18:00,空闲时段价格为高峰的一半。

V4 Pro高峰时段缓存命中输入从0.025元涨到0.3元,涨幅12倍;未命中输入从3元涨到9元,涨幅3倍;输出从6 元涨到27元,是原来的4.5倍。空闲时段则分别为0.15 元、4.5元和13.5元。V4 Flash也同步调价,空闲时段缓存命中0.05元、未命中1.5元、输出4.5元,高峰翻倍。

对于一个以“便宜”为核心竞争力的公司来说,DeepSeek这番涨价势必削弱了公司的吸引力。

开发者圈子里,从“梁文锋的恩情还不完”的论调,变成了“梁圣变梁子”的调侃。社区吐槽称,DeepSeek每贵一块钱,就要破产几百家OPC(单人公司),现在涨了好几倍,几乎已经不给这些独立开发者留退路了。

不过涨价的并非只有DeepSeek和智谱,全行业都在涨价。

DeepSeek作为最后一个坚持低价的头部玩家,它的涨价标志着一个时代的结束。用低价换规模、用补贴换市场份额的阶段,正式落幕了。



涨价的本质不是算力贵了,这是所有人都能用的借口。真正的原因是公司长大了。

AGI研发是个无底洞,唐杰的摸高计划要投入百亿级做可解释性、建合成数据工厂、搞自治智能体系统,梁文锋要除了迭代模型以外,现在还要养DSH的开源生态。

不能一直靠融资和烧钱,终究得靠自己造血。当模型能力逼近海外第一梯队,而模型价格却继续保持海外头部的几十分之一出售时,本质上是在贱卖自己的技术溢价,也是在告诉资本市场我还没准备好挣钱。

涨价是从成本加成定价转向价值定价,模型值多少钱,应该由它能替用户创造多少价值决定。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
斯诺克最新战报!姚朋成1-4被逆转,龙泽煌夺赛点,雷佩凡范争一暂平!

斯诺克最新战报!姚朋成1-4被逆转,龙泽煌夺赛点,雷佩凡范争一暂平!

刘姚尧的文字城堡
2026-09-02 18:40:39
中日若开战,将是地狱模式!全球终于清醒了:中国这次不是在演戏

中日若开战,将是地狱模式!全球终于清醒了:中国这次不是在演戏

叶葉夜
2026-08-31 11:23:21
40天养大外甥,40年后反目!5场官司后,75岁刘晓庆:全捐给国家

40天养大外甥,40年后反目!5场官司后,75岁刘晓庆:全捐给国家

玥来玥好讲故事
2026-09-02 20:37:32
广东佛山一工厂发生火灾,夜幕中火光冲天,火势迅猛,当地消防:火已灭,未收到人员伤亡信息,原因还在调查

广东佛山一工厂发生火灾,夜幕中火光冲天,火势迅猛,当地消防:火已灭,未收到人员伤亡信息,原因还在调查

潇湘晨报
2026-09-02 12:01:08
“大B哥”吴志雄也学好了,杭州修改纹身内容,曝古天乐每一年都会送其劳力士手表

“大B哥”吴志雄也学好了,杭州修改纹身内容,曝古天乐每一年都会送其劳力士手表

裕丰娱间说
2026-09-02 10:29:11
40亿!地震级大交易达成,真大魔王来了

40亿!地震级大交易达成,真大魔王来了

贵圈真乱
2026-09-02 12:52:33
4年1.5亿敲定!签约达成,恭喜尼克斯,东部直接大结局了

4年1.5亿敲定!签约达成,恭喜尼克斯,东部直接大结局了

远梦归晓r
2026-09-02 11:58:38
孙宇晨 VS 胡锡进:最高明的舆论转移,遇上不跳坑的明白人

孙宇晨 VS 胡锡进:最高明的舆论转移,遇上不跳坑的明白人

浪子说
2026-09-02 17:07:47
将赴大陆参加APEC,深绿政客表态不一般,黄国昌将赖清德一军

将赴大陆参加APEC,深绿政客表态不一般,黄国昌将赖清德一军

林子说事
2026-09-02 01:08:12
28岁内地女主播诬告强奸在澳门被捕,因与男子发生性关系索2万港元未果

28岁内地女主播诬告强奸在澳门被捕,因与男子发生性关系索2万港元未果

可达鸭面面观
2026-08-31 13:50:36
大S闺房曝光!太过诡异像灵堂引人不适,难怪大师预言她活不过50岁

大S闺房曝光!太过诡异像灵堂引人不适,难怪大师预言她活不过50岁

瞎说娱乐
2026-08-27 11:09:48
两性关系:如果还想多活几年,70岁以后必须牢记这几句

两性关系:如果还想多活几年,70岁以后必须牢记这几句

荔子言
2026-06-05 23:10:00
体检出问题?美国国脚巴尔贡临时反悔,放弃埃弗顿40万镑周薪合同

体检出问题?美国国脚巴尔贡临时反悔,放弃埃弗顿40万镑周薪合同

甜度百分百21
2026-09-02 09:13:47
女星深夜爆猛料:4女共侍1夫,连61岁也不放过

女星深夜爆猛料:4女共侍1夫,连61岁也不放过

让心灵得以栖息
2026-07-29 12:05:14
太可惜了,雷佩凡无缘爆冷,塞尔比惊险逆转,中国选手2胜2负

太可惜了,雷佩凡无缘爆冷,塞尔比惊险逆转,中国选手2胜2负

南海浪花
2026-09-02 20:47:41
潮酷穿搭视感极佳!个性背心配牛仔裤,青春动感魅力四射

潮酷穿搭视感极佳!个性背心配牛仔裤,青春动感魅力四射

独角showing
2026-09-01 18:41:30
曼城压哨官宣恩佐,哈兰德评论:好,我现在可以去睡觉了

曼城压哨官宣恩佐,哈兰德评论:好,我现在可以去睡觉了

懂球帝
2026-09-02 07:43:06
烟草系统拉响警报:再这样下去,中国烟草真要出大问题

烟草系统拉响警报:再这样下去,中国烟草真要出大问题

阿振观点
2026-08-25 05:56:32
疯了吗?5个月大跌60%,中报业绩大亏,却被5家外资集体重仓持有

疯了吗?5个月大跌60%,中报业绩大亏,却被5家外资集体重仓持有

财经智多星
2026-09-02 09:22:58
45岁桑兰和老公黄健在北京逛超市买菜被偶遇,她坐在轮椅上,穿着一条碎花长裙,脸色红润,状态超好,气质出众!

45岁桑兰和老公黄健在北京逛超市买菜被偶遇,她坐在轮椅上,穿着一条碎花长裙,脸色红润,状态超好,气质出众!

背包旅行
2026-07-09 18:22:42
2026-09-02 21:43:00
字母榜 incentive-icons
字母榜
让未来不止于大。
2743文章数 8091关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

全新理想MEGA售50.98万 这一次“移动的家”更舒适更灵活

态度原创

健康
游戏
教育
旅游
亲子

越吃越爆痘?医生讲清7大真相

《GTA6》新截图暗示坏结局?主角穷途末路 绝境相拥

教育要闻

不要给孩子太多消费性快乐

旅游要闻

「侠客岛」7500公里外遥远的相似

亲子要闻

我在韩国差点想打人 怎么回事? 小朋友来韩国能玩什

无障碍浏览 进入关怀版