网易首页 > 网易号 > 正文 申请入驻

唐杰的新判断:Scaling 不止是把模型做大

0
分享至

★ 设为星标 | 只讲人话,带你玩转AIGC。

GLM-5.3 的第三方测评出来了。

在 Artificial Analysis Intelligence Index 上,它拿到 60 分,和 Kimi K3 并列,距离榜首只有 3 分。

上一代 GLM-5.2 是 53 分。

底座没换,架构没换,参数没增加,只靠一个月的后训练,涨了整整 7 分,直接飙到总榜第四。


当然,一个榜单不能代表全部能力。但这套测试同时覆盖真实工作、工具调用、终端编程、科学推理、知识和长上下文,不是只刷几套数学题。

所以,60 分至少说明:GLM-5.3 的增长不是完全靠发布会滤镜。

今天智谱联合创始人、首席科学家唐杰老师在 X 上写了一篇《Thoughts About Scaling Law》,专门解释这件事。


他的核心观点不是“参数已经不重要了”。

而是:Scaling 没有固定配方,模型发展到不同阶段,最值得扩大的东西也会变化。

Scaling 一直在换答案

大模型早期遇到的第一个问题很直接:如果训练算力增加了,到底应该拿来扩大参数,还是增加训练数据?

2020 年,OpenAI 的 Kaplan 团队给出了一套答案。

按照他们拟合出的规律,算力增加 10 倍,最优模型的参数量大约扩大 5.4 倍,训练数据只扩大约 1.9 倍。

参数和数据的增长指数分别是 0.73 和 0.27,前者约为后者的 2.7 倍。

这里特别容易看错。

2.7:1 不是参数数量与 token 数量的比例,而是两者随算力增长的速度之比。

Kaplan 的结论可以理解为:有了更多算力,优先把模型做大。

于是,大模型进入了疯狂长身体的阶段。

GPT-3 做到 1750 亿参数,Gopher 做到 2800 亿,MT-NLG 做到 5300 亿。

模型发布越来越像健身房称重,数字先报出来,体脂率以后再聊。

很快,问题出现了。

模型虽然越来越大,却没有获得足够的数据训练。参数很多,见过的世面不够,多少有点五大三粗。

2022 年,DeepMind 训练了 400 多个不同规模的模型,重新计算参数、数据与算力之间的关系。

Chinchilla 给出的答案是:当训练算力固定时,模型应该做得小一点,同时多喂数据。

他们得到的经验值更加直观:对于稠密模型,训练 token 数大约是参数量的 20 倍。

一个 700 亿参数的模型,大约需要 1.4 万亿个训练 token。

这里的 20:1 和前面的 2.7:1 不是同一种东西。

2.7:1 描述参数和数据各自增长的速度;20:1 则是训练 token 数与参数量的直接比例。

Chinchilla 自身只有 700 亿参数,却在很多任务上超过了 2800 亿参数的 Gopher。

行业终于发现,与其造一个巨大的模型然后匆匆停训,不如把模型做小一点,让它多读点书。

但 Chinchilla 解决的仍然只是训练阶段的问题:给定一笔训练算力,怎样获得最好的模型?

模型投入使用之后,新问题又来了。

一个模型只训练一次,却可能被调用几十亿次。模型越大,每次调用的成本越高。

调用量足够大时,训练阶段省下来的钱,很快又会在推理阶段加倍交回去。

于是,新的思路出现了:选择一个更小的模型,花更多算力把它训练得更充分,从而降低此后每一次调用的成本。

Llama 2 7B 使用了约 2 万亿个训练 token,平均每个参数对应约 290 个 token。

Gemma 2 9B 使用了约 8 万亿个训练 token,平均每个参数对应约 889 个 token。不过,Gemma 2 还使用了知识蒸馏,不能只凭这个比例与 Chinchilla 直接比较。

从 20 到 290,再到 889,确实是训练数据相对参数规模的大幅增加。

但它不是同一个最优比例被不断刷新,而是优化目标变了。

Chinchilla 追求的是训练一次时最划算;Llama 2 7B 和 Gemma 2 9B 还要考虑模型上线后的长期调用成本。

模型小一点,训练狠一点,以后每次运行都便宜一点。只要练不死,就往死里练。

接下来,MoE 又让原来的计算方法不够用了。

稠密模型每次运行都会使用全部参数,因此“一个参数对应多少 token”比较容易计算。

MoE 不一样。

一个 MoE 模型可能拥有 7000 亿总参数,但处理一个 token 时,只激活其中几百亿参数。

此时,“参数量”已经分成两个数字:

总参数决定模型大约能装下多少知识,激活参数决定每次运行实际使用多少计算。

总参数像图书馆的藏书量,激活参数像处理当前问题时真正搬到桌上的书。

藏书多,有利于覆盖冷门知识;每次能调用的专家更多、计算路径更深,则更有利于处理复杂推理。

所以,稠密模型的每参数 20 个 token,不能直接套在 MoE 身上。究竟该除以总参数,还是激活参数,答案会差几十倍。

唐杰老师引用的研究还指出,不同任务需要的 Scaling 配方也不同。

记忆事实更依赖总参数和模型容量;代码与推理则更依赖训练数据、激活计算和有效深度。

即使保持相同的 token 参数比,盲目增加总参数,也不一定能改善推理能力。

到这里,Scaling 已经从一道算术题,变成了一张控制台。

参数、数据、架构和激活计算,每一个都是单独的旋钮。

智谱这次转了后训练

沿着这条线,唐杰老师把话题带回 GLM-5.3。

GLM-5.3 和 GLM-5.2 使用相同的底座、架构、总参数和激活参数。智谱没有扩大模型,而是用一个月时间,增加长程任务环境和强化学习训练。

结果是,Artificial Analysis 的得分从 53 分提高到 60 分。

这相当于一次受控实验:其他条件不变,只转动后训练这个旋钮。

唐杰老师特别提到漏洞发现。

它不是从记忆里检索几个 CVE,而是要把一条可能长达 20 步的推理链走完,中间不能丢掉线索。这类能力不只取决于模型记住了多少知识,也与每次计算的有效深度和后训练有关。

GLM-5.3 这次扩大的不是参数,而是模型完成长程任务的能力。

不过,这次升级并不能证明后训练已经取代预训练。

唐杰老师强调,模型规模、预训练数据和每次前向计算量仍然有扩展空间。

智谱这次选择后训练,只是因为在 GLM-5.2 当前这个阶段,它剩下的余量最大。

Scaling 还有很多旋钮。上一次最值得转动的那个,未必还是下一次的答案。

同一张控制台,不同旋钮

这个让我最近爆火的另一个国产模型: Qwen3.8-27B。

它只有 270 亿参数,而且是一个稠密模型。每次推理时,全部参数都会参与计算,不存在 MoE 模型的总参数与激活参数之分。

但它的成绩一点也不像小模型。

在 Artificial Analysis Intelligence Index 上,Qwen3.8-27B 拿到 52 分,与 GPT-5.6 Luna 并列,只比 GLM-5.2 和 DeepSeek V4 低 1 分。


更夸张的是 Agent 能力。

在 Artificial Analysis Agentic Index 上,它拿到 51 分,排在榜单第 8 个位置,超过了 GPT-5.6 Terra、DeepSeek V4、Muse Spark 和 GLM-5.2。

剔除并列的,排行总榜第 5!


作为对比,Qwen3.8-Max 拥有 2.4 万亿总参数,每次激活 950 亿参数,在两个榜单上的成绩分别是 58 分和 58 分。

Qwen3.8-27B 的总参数只有它的约九十分之一,综合能力只差 6 分,Agent 能力只差 7 分。

一个 270 亿参数的稠密模型,已经挤进了顶级 Agent 模型所在的区间。

这才是 Qwen3.8-27B 最值得讨论的地方:它不只是模型小,而是在很小的参数规模里,压进了远超体量预期的能力。

如果把它放回前面的 Scaling 演进里,Qwen3.8-27B 对应的不是 MoE,而是 Chinchilla 之后“小模型充分训练”的路线。

模型不一定要无限做大。通过数据、训练方法和后训练,同样可以提高单位参数承载的能力,并降低部署门槛与推理成本。

不过,这里需要只是一个推测。

如果 Qwen 没有公布 Qwen3.8-27B 的训练 token 数,就不能直接把它写成每参数 290 个或 889 个 token 的延续,更不能仅凭榜单成绩断定它只是“喂得更多”。

榜单能够证明的是,参数量已经无法单独解释模型能力。

GLM-5.3 保持底座和参数不变,继续扩大后训练;Qwen3.8-27B 则控制模型规模,在一个较小的稠密底座里追求更高的能力密度。

一个在原来的模型上继续深挖,一个努力把旗舰能力塞进更小的身体。

它们转动的不是同一个旋钮,却共同指向唐杰老师的判断:

今天的 Scaling,已经不只是把模型做得更大,而是找到当前最值得投入算力的地方。

下一轮 Scaling,你更看好继续堆参数,还是把小模型练到极致?

评论区聊聊。

参考: https://x.com/jietang/status/2089941544581403107

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
升职副省长低调开家长会,意外听见班主任嘲笑:儿子不配进重点班

升职副省长低调开家长会,意外听见班主任嘲笑:儿子不配进重点班

红豆讲堂
2025-09-17 20:40:04
2027年将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027年将会是中华人民共和国全党、全军、全国各族人民重要的一年

铁锤侃侃而谈
2026-09-12 00:54:59
OpenAI示警:先进AI可在2台相邻物理隔离PC间“对话”

OpenAI示警:先进AI可在2台相邻物理隔离PC间“对话”

IT之家
2026-09-19 13:22:03
以色列防长公开表示:若土耳其帮助加沙,可以邀请他们迁往土耳其,反正当地因以色列游客减少腾出许多空间,加沙200万人必须全部离开

以色列防长公开表示:若土耳其帮助加沙,可以邀请他们迁往土耳其,反正当地因以色列游客减少腾出许多空间,加沙200万人必须全部离开

吉刻新闻
2026-09-18 11:34:24
因为小时候一次钓鱼体验,丹麦首富摇身一变成为英国地主……

因为小时候一次钓鱼体验,丹麦首富摇身一变成为英国地主……

英国那些事儿
2026-09-18 00:48:29
内行人买手机,为何很少选OPPO、vivo?4个现实原因看完恍然大悟

内行人买手机,为何很少选OPPO、vivo?4个现实原因看完恍然大悟

小蜜情感说
2026-09-18 11:30:53
欧洲,百年的代差红利,吃完了

欧洲,百年的代差红利,吃完了

清沐执笔
2026-09-17 22:28:18
一棍敲死丈夫?2021年四川女子起夜,撞见丈夫在12岁继女屋中,怒火攻心一棍致死

一棍敲死丈夫?2021年四川女子起夜,撞见丈夫在12岁继女屋中,怒火攻心一棍致死

夜话奇谭
2026-09-10 16:30:09
负债人注意!重庆催收已经升级,这4个陷阱,很多人踩进去了

负债人注意!重庆催收已经升级,这4个陷阱,很多人踩进去了

林子说事
2026-09-19 00:17:48
看参数没用!比亚迪天神之眼对比华为乾崑,车主实测才见高低

看参数没用!比亚迪天神之眼对比华为乾崑,车主实测才见高低

刘哥谈体育
2026-09-19 12:52:49
1962年,甘肃常务副省长王秉祥,因拒绝枪毙13位县委书记被撤职,复出后升任省委书记

1962年,甘肃常务副省长王秉祥,因拒绝枪毙13位县委书记被撤职,复出后升任省委书记

方圆文史
2026-09-14 17:29:50
众人皆醉我独醒!海港B队2-0杭州,获4分冲甲优势,3竞争对手掉链子

众人皆醉我独醒!海港B队2-0杭州,获4分冲甲优势,3竞争对手掉链子

实事球是
2026-09-19 21:46:06
万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

米果说识
2026-08-17 19:17:49
“为了点补贴,把孩子未来毁了!”单亲妈妈奇葩操作,网友:他长大肯定恨你!

“为了点补贴,把孩子未来毁了!”单亲妈妈奇葩操作,网友:他长大肯定恨你!

林林先生
2026-09-19 10:00:06
网友搞笑!小米和鸿蒙真的已经撕扯到如此地步了吗?

网友搞笑!小米和鸿蒙真的已经撕扯到如此地步了吗?

慧翔百科
2026-09-18 08:32:14
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
50岁后睾酮下降20%-30%!6个促睾行为,让你找回30多岁的状态

50岁后睾酮下降20%-30%!6个促睾行为,让你找回30多岁的状态

增肌减脂
2026-09-18 21:50:12
邓文迪和印度首富夫人合影,“身子微倾,下巴收着”,网友称:整个人的气场直接瘪了

邓文迪和印度首富夫人合影,“身子微倾,下巴收着”,网友称:整个人的气场直接瘪了

丫头舫
2026-09-17 13:11:45
台湾县市长选举最新预测:国民党独占15席,民进党6席,无党籍1席

台湾县市长选举最新预测:国民党独占15席,民进党6席,无党籍1席

悦心知足
2026-09-20 00:44:08
李咏美国下葬7年后,57岁哈文现状曝光,原来她和姜昆是一类人

李咏美国下葬7年后,57岁哈文现状曝光,原来她和姜昆是一类人

马浵在解说
2026-09-18 12:17:36
2026-09-20 03:12:49
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
842文章数 684关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

厨师被指在餐馆扎血测艾滋病 老板:有关部门已介入

头条要闻

厨师被指在餐馆扎血测艾滋病 老板:有关部门已介入

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

甜度爆表!许嵩冯禧晒婚纱照官宣结婚

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

房产
亲子
游戏
本地
军事航空

房产要闻

海口房价,降不动了!

亲子要闻

从“世界高品质”到“透明真安心”,好奇诠释48年品质坚守

玩家称DLSS5"纯粹是来恶心主机的" 主机或迎成本挑战

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

军事要闻

特朗普再称对伊朗战争将很快结束

无障碍浏览 进入关怀版