网易首页 > 网易号 > 正文 申请入驻

唐杰的新判断:Scaling 不止是把模型做大

0
分享至

★ 设为星标 | 只讲人话,带你玩转AIGC。

GLM-5.3 的第三方测评出来了。

在 Artificial Analysis Intelligence Index 上,它拿到 60 分,和 Kimi K3 并列,距离榜首只有 3 分。

上一代 GLM-5.2 是 53 分。

底座没换,架构没换,参数没增加,只靠一个月的后训练,涨了整整 7 分,直接飙到总榜第四。


当然,一个榜单不能代表全部能力。但这套测试同时覆盖真实工作、工具调用、终端编程、科学推理、知识和长上下文,不是只刷几套数学题。

所以,60 分至少说明:GLM-5.3 的增长不是完全靠发布会滤镜。

今天智谱联合创始人、首席科学家唐杰老师在 X 上写了一篇《Thoughts About Scaling Law》,专门解释这件事。


他的核心观点不是“参数已经不重要了”。

而是:Scaling 没有固定配方,模型发展到不同阶段,最值得扩大的东西也会变化。

Scaling 一直在换答案

大模型早期遇到的第一个问题很直接:如果训练算力增加了,到底应该拿来扩大参数,还是增加训练数据?

2020 年,OpenAI 的 Kaplan 团队给出了一套答案。

按照他们拟合出的规律,算力增加 10 倍,最优模型的参数量大约扩大 5.4 倍,训练数据只扩大约 1.9 倍。

参数和数据的增长指数分别是 0.73 和 0.27,前者约为后者的 2.7 倍。

这里特别容易看错。

2.7:1 不是参数数量与 token 数量的比例,而是两者随算力增长的速度之比。

Kaplan 的结论可以理解为:有了更多算力,优先把模型做大。

于是,大模型进入了疯狂长身体的阶段。

GPT-3 做到 1750 亿参数,Gopher 做到 2800 亿,MT-NLG 做到 5300 亿。

模型发布越来越像健身房称重,数字先报出来,体脂率以后再聊。

很快,问题出现了。

模型虽然越来越大,却没有获得足够的数据训练。参数很多,见过的世面不够,多少有点五大三粗。

2022 年,DeepMind 训练了 400 多个不同规模的模型,重新计算参数、数据与算力之间的关系。

Chinchilla 给出的答案是:当训练算力固定时,模型应该做得小一点,同时多喂数据。

他们得到的经验值更加直观:对于稠密模型,训练 token 数大约是参数量的 20 倍。

一个 700 亿参数的模型,大约需要 1.4 万亿个训练 token。

这里的 20:1 和前面的 2.7:1 不是同一种东西。

2.7:1 描述参数和数据各自增长的速度;20:1 则是训练 token 数与参数量的直接比例。

Chinchilla 自身只有 700 亿参数,却在很多任务上超过了 2800 亿参数的 Gopher。

行业终于发现,与其造一个巨大的模型然后匆匆停训,不如把模型做小一点,让它多读点书。

但 Chinchilla 解决的仍然只是训练阶段的问题:给定一笔训练算力,怎样获得最好的模型?

模型投入使用之后,新问题又来了。

一个模型只训练一次,却可能被调用几十亿次。模型越大,每次调用的成本越高。

调用量足够大时,训练阶段省下来的钱,很快又会在推理阶段加倍交回去。

于是,新的思路出现了:选择一个更小的模型,花更多算力把它训练得更充分,从而降低此后每一次调用的成本。

Llama 2 7B 使用了约 2 万亿个训练 token,平均每个参数对应约 290 个 token。

Gemma 2 9B 使用了约 8 万亿个训练 token,平均每个参数对应约 889 个 token。不过,Gemma 2 还使用了知识蒸馏,不能只凭这个比例与 Chinchilla 直接比较。

从 20 到 290,再到 889,确实是训练数据相对参数规模的大幅增加。

但它不是同一个最优比例被不断刷新,而是优化目标变了。

Chinchilla 追求的是训练一次时最划算;Llama 2 7B 和 Gemma 2 9B 还要考虑模型上线后的长期调用成本。

模型小一点,训练狠一点,以后每次运行都便宜一点。只要练不死,就往死里练。

接下来,MoE 又让原来的计算方法不够用了。

稠密模型每次运行都会使用全部参数,因此“一个参数对应多少 token”比较容易计算。

MoE 不一样。

一个 MoE 模型可能拥有 7000 亿总参数,但处理一个 token 时,只激活其中几百亿参数。

此时,“参数量”已经分成两个数字:

总参数决定模型大约能装下多少知识,激活参数决定每次运行实际使用多少计算。

总参数像图书馆的藏书量,激活参数像处理当前问题时真正搬到桌上的书。

藏书多,有利于覆盖冷门知识;每次能调用的专家更多、计算路径更深,则更有利于处理复杂推理。

所以,稠密模型的每参数 20 个 token,不能直接套在 MoE 身上。究竟该除以总参数,还是激活参数,答案会差几十倍。

唐杰老师引用的研究还指出,不同任务需要的 Scaling 配方也不同。

记忆事实更依赖总参数和模型容量;代码与推理则更依赖训练数据、激活计算和有效深度。

即使保持相同的 token 参数比,盲目增加总参数,也不一定能改善推理能力。

到这里,Scaling 已经从一道算术题,变成了一张控制台。

参数、数据、架构和激活计算,每一个都是单独的旋钮。

智谱这次转了后训练

沿着这条线,唐杰老师把话题带回 GLM-5.3。

GLM-5.3 和 GLM-5.2 使用相同的底座、架构、总参数和激活参数。智谱没有扩大模型,而是用一个月时间,增加长程任务环境和强化学习训练。

结果是,Artificial Analysis 的得分从 53 分提高到 60 分。

这相当于一次受控实验:其他条件不变,只转动后训练这个旋钮。

唐杰老师特别提到漏洞发现。

它不是从记忆里检索几个 CVE,而是要把一条可能长达 20 步的推理链走完,中间不能丢掉线索。这类能力不只取决于模型记住了多少知识,也与每次计算的有效深度和后训练有关。

GLM-5.3 这次扩大的不是参数,而是模型完成长程任务的能力。

不过,这次升级并不能证明后训练已经取代预训练。

唐杰老师强调,模型规模、预训练数据和每次前向计算量仍然有扩展空间。

智谱这次选择后训练,只是因为在 GLM-5.2 当前这个阶段,它剩下的余量最大。

Scaling 还有很多旋钮。上一次最值得转动的那个,未必还是下一次的答案。

同一张控制台,不同旋钮

这个让我最近爆火的另一个国产模型: Qwen3.8-27B。

它只有 270 亿参数,而且是一个稠密模型。每次推理时,全部参数都会参与计算,不存在 MoE 模型的总参数与激活参数之分。

但它的成绩一点也不像小模型。

在 Artificial Analysis Intelligence Index 上,Qwen3.8-27B 拿到 52 分,与 GPT-5.6 Luna 并列,只比 GLM-5.2 和 DeepSeek V4 低 1 分。


更夸张的是 Agent 能力。

在 Artificial Analysis Agentic Index 上,它拿到 51 分,排在榜单第 8 个位置,超过了 GPT-5.6 Terra、DeepSeek V4、Muse Spark 和 GLM-5.2。

剔除并列的,排行总榜第 5!


作为对比,Qwen3.8-Max 拥有 2.4 万亿总参数,每次激活 950 亿参数,在两个榜单上的成绩分别是 58 分和 58 分。

Qwen3.8-27B 的总参数只有它的约九十分之一,综合能力只差 6 分,Agent 能力只差 7 分。

一个 270 亿参数的稠密模型,已经挤进了顶级 Agent 模型所在的区间。

这才是 Qwen3.8-27B 最值得讨论的地方:它不只是模型小,而是在很小的参数规模里,压进了远超体量预期的能力。

如果把它放回前面的 Scaling 演进里,Qwen3.8-27B 对应的不是 MoE,而是 Chinchilla 之后“小模型充分训练”的路线。

模型不一定要无限做大。通过数据、训练方法和后训练,同样可以提高单位参数承载的能力,并降低部署门槛与推理成本。

不过,这里需要只是一个推测。

如果 Qwen 没有公布 Qwen3.8-27B 的训练 token 数,就不能直接把它写成每参数 290 个或 889 个 token 的延续,更不能仅凭榜单成绩断定它只是“喂得更多”。

榜单能够证明的是,参数量已经无法单独解释模型能力。

GLM-5.3 保持底座和参数不变,继续扩大后训练;Qwen3.8-27B 则控制模型规模,在一个较小的稠密底座里追求更高的能力密度。

一个在原来的模型上继续深挖,一个努力把旗舰能力塞进更小的身体。

它们转动的不是同一个旋钮,却共同指向唐杰老师的判断:

今天的 Scaling,已经不只是把模型做得更大,而是找到当前最值得投入算力的地方。

下一轮 Scaling,你更看好继续堆参数,还是把小模型练到极致?

评论区聊聊。

参考: https://x.com/jietang/status/2089941544581403107

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
CPO+先进封装+PCB+液冷,这3家公司凭什么同时踩中四个风口?

CPO+先进封装+PCB+液冷,这3家公司凭什么同时踩中四个风口?

慧眼看世界哈哈
2026-09-19 09:36:17
你是我独一无二的诱惑,无与伦比

你是我独一无二的诱惑,无与伦比

疾跑的小蜗牛
2026-09-19 20:47:31
许晴独居北京大平层57岁未婚,家里请了保姆,一个人早餐吃10道菜

许晴独居北京大平层57岁未婚,家里请了保姆,一个人早餐吃10道菜

椰黄娱乐
2026-09-16 10:20:02
600502,董事长涉嫌严重违纪违法!

600502,董事长涉嫌严重违纪违法!

上市之家
2026-09-19 00:20:46
英国国防参谋长:俄罗斯现在的军事实力比任何时候都更强大

英国国防参谋长:俄罗斯现在的军事实力比任何时候都更强大

梦在深巷aqa
2026-09-18 22:45:46
正事聊着,菲前首席大法官突然开口:你单身,我也是

正事聊着,菲前首席大法官突然开口:你单身,我也是

观察者网
2026-09-18 18:13:14
三十八岁韦雪路人实拍流出 真实状态反差超出预期 生图引发全网讨论

三十八岁韦雪路人实拍流出 真实状态反差超出预期 生图引发全网讨论

草莓解说体育
2026-09-19 09:12:30
哈曼:克洛普现在做啥都被认为对,围绕着他已经形成个人崇拜

哈曼:克洛普现在做啥都被认为对,围绕着他已经形成个人崇拜

懂球帝
2026-09-19 21:42:47
旧将承认!是湖人耽误了威少,他才是球队领袖?

旧将承认!是湖人耽误了威少,他才是球队领袖?

Haviven聊球
2026-09-19 21:30:15
央媒关注实体店压力:房租等成本结构承压是线下零售首要难题

央媒关注实体店压力:房租等成本结构承压是线下零售首要难题

南方都市报
2026-09-18 12:19:10
直到敬一丹火化,才终于想通,为何张泉灵当年要主动离开央视

直到敬一丹火化,才终于想通,为何张泉灵当年要主动离开央视

林轻吟
2026-09-19 10:16:03
房价很大可能重走1998年老路!所有人一定要提前做好心理准备

房价很大可能重走1998年老路!所有人一定要提前做好心理准备

偷喝一口奶
2026-09-11 08:36:30
王思雨张子宇不打!中国女篮狂胜65分!6人上双,全队42板33助13断太强

王思雨张子宇不打!中国女篮狂胜65分!6人上双,全队42板33助13断太强

老吴说体育
2026-09-19 10:51:59
原来一个人睡觉需要2个枕头!医生:一个用来枕头,另一个用来……

原来一个人睡觉需要2个枕头!医生:一个用来枕头,另一个用来……

人民日报健康客户端
2026-09-17 20:40:12
华为Mate90爆料汇总!新机细节一文看懂~

华为Mate90爆料汇总!新机细节一文看懂~

科技美学
2026-09-19 20:10:20
郭希宽感谢许敏暗藏玄机,炫耀儿孙满堂,暗示与郭威关系和谐

郭希宽感谢许敏暗藏玄机,炫耀儿孙满堂,暗示与郭威关系和谐

娱贝勒
2025-02-07 07:24:38
大一女生穿“洛丽塔”报到,本以为能惊艳全场,没想到连行李都没人愿意帮忙搬

大一女生穿“洛丽塔”报到,本以为能惊艳全场,没想到连行李都没人愿意帮忙搬

妍妍教育日记
2026-08-23 10:10:12
累计损失超18亿!俄乌打了4年,俄罗斯到底扣了多少中国飞机?

累计损失超18亿!俄乌打了4年,俄罗斯到底扣了多少中国飞机?

军情观察家
2026-09-17 12:36:46
恒大足校共7人!画面太美:这批球员有望复制当年东亚杯夺冠奇迹

恒大足校共7人!画面太美:这批球员有望复制当年东亚杯夺冠奇迹

足球大腕
2026-09-19 20:58:30
中秋国庆调休再引热议:凑出来的假期,只剩疲惫

中秋国庆调休再引热议:凑出来的假期,只剩疲惫

未曾青梅
2026-09-19 15:30:15
2026-09-19 22:00:49
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
842文章数 684关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

亚运会尴尬频出:住宿差吃得也差 韩国运动员发文"救命"

头条要闻

亚运会尴尬频出:住宿差吃得也差 韩国运动员发文"救命"

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

自毁前途5年赵薇露面!家境被扒出

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

本地
房产
亲子
数码
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

海口房价,降不动了!

亲子要闻

《0帧起手》#内容过于真实#万万没想到#姐弟日常#彩虹糖裴曼伊

数码要闻

荣耀HONOR Life墨水屏官宣,9月28日亮相

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版