网易首页 > 网易号 > 正文 申请入驻

多变量神经缩放定律迈向大一统:Mila联手DeepMind提出UNSL

0
分享至



机器之心编辑部

过去的大模型 scaling law 通常回答的是:当模型参数量、数据量和训练计算量增加后,loss 会如何下降。

但真实训练过程要复杂得多。模型性能不只受参数量和数据量影响,还会受到训练步数、处理 token 数、数据是否被重复使用、batch size、学习率、初始化尺度,以及推理时计算量等因素影响。

更麻烦的是,这些变量之间并不是简单相加关系:某个变量可能在特定区间成为瓶颈,也可能让性能曲线出现阶段性「拐点」,甚至带来非单调变化。比如,训练数据太少或训练超过一定 epoch 后可能出现过拟合;学习率或初始化权重标准差过大,也可能反过来损害性能。

针对这些限制,来自蒙特利尔大学 Mila、Google DeepMind 的研究者提出了一种全新的函数形式,称为统一神经缩放定律(Unified Neural Scaling Law,简称 UNSL),它把多变量同时变化、拐点、瓶颈、过拟合以及超参数带来的反向作用统一纳入 scaling law。

所以,这篇论文的主张可以概括为:神经网络的 scaling behavior 不应该只用「参数量 — 数据量 —loss」这样的二维或三维公式描述,而应该用一个能同时处理多变量、阶段性转折、性能瓶颈、过拟合和超参数影响的统一函数形式。



  • 论文标题:Unified Neural Scaling Laws
  • 论文链接:https://arxiv.org/pdf/2605.26248

论文一作 Ethan Caballero 用一段视频,展示了「统一神经缩放定律」准确建模和外推人工神经网络在多个变量同时变化时呈现出的多变量缩放定律。



UNSL 的函数形式

UNSL 的完整架构是由多个分层函数嵌套而成的,它在多维对数空间中将性能建模为一组平滑连接的超平面:



其中 Q 定义如下:



R 定义如下:



K 为多变量断裂神经缩放定律(Multivariate Broken Neural Scaling Law,MBNSL),定义如下:



整体上可以像下面这样理解:

在函数形式上,UNSL 不是简单把参数量、数据量和训练步数塞进一个幂律公式,而是采用了一套分层结构。

底层的 K 是多变量 broken scaling law,用来描述 log-log 空间中由多个平滑连接超平面构成的 scaling 曲面;其中的 hyperbreak 对应性能曲面中的阶段性转折。

再往上一层,R 将整体 scaling 行为拆成非瓶颈组件和瓶颈组件,分别描述多变量共同作用下的整体趋势,以及某一单独变量限制最终性能的情况。瓶颈组件表示,当其他变量都足够好时,某一个变量仍可能单独限制性能。例如模型够大、训练够久,但数据量不足,数据量就成为瓶颈;或者数据足够多,但模型太小,参数量成为瓶颈。

Q 则进一步引入学习率、初始化尺度等超参数可能带来的反向作用。

最外层公式再加入不可约性能极限、评价指标导致的坏表现极限,以及训练超过一定 epoch 后可能出现的过拟合项。

下图为统一神经缩放定律(Unified Neural Scaling Law,UNSL)的示意图,包含两个输入维度 x_1 和 x_2;中间图和右侧图分别展示了它在各个输入维度上的投影。

在这个具体例子中,一个 UNSL 包含 3 个 hyperbreak,也就是图中用更亮的虚线标出的橙色、黄色和绿色转折结构。Hyperbreak 可以理解为 scaling law 中的「阶段转折」。例如一开始增加数据带来明显收益,过了某个区间收益下降,这个转折就是一种 break;多变量情况下,它不再是一点,而是高维空间里的转折面。

其中,绿色 hyperbreak 由非瓶颈组件产生;橙色 hyperbreak 由 x_1 瓶颈组件产生;黄色 hyperbreak 由 x_2 瓶颈组件产生。



实验结果

在实验部分,研究者对比了以下几类函数形式。

第一类是已有 scaling law 形式,包括 CF 和 DC。CF 接近 Kaplan、Chinchilla 一类常见形式,主要描述参数量、训练数据量或训练 token 数与 loss 之间的关系。DC 来自 Muennighoff 等人的三变量函数形式,考虑参数量、训练 token 数和训练数据集大小。

第二类是作者设计的消融版本:A1、A2、A3。它们可以理解为 UNSL 的逐步简化版。其中 A1 去掉了 additive symmetry,A2 加入了性能下限项,A3 进一步加入部分反向作用结构;完整 UNSL 包含全部 additive symmetry、瓶颈组件、非瓶颈组件、过拟合项和超参数反向作用项。

接下来,研究者主要做了视觉和语言两大类实验。

在视觉任务中,研究者评估了下游少样本图像分类,包括 Birds 200、Cars 196 和 ImageNet。模型包括 ViT、MLP-Mixer 和 BiT,它们在 JFT-300M 子集上预训练。变量包括训练数据集大小、训练步数,以及在三变量设置中的模型参数量。结果显示,在下游图像识别任务中,UNSL 在 60.87% 的任务上取得最好的外推表现,而下一个最好的 A3 是 21.74%

在语言任务中,研究者评估了上游和下游语言表现,变量包括模型参数量、处理 token 数、训练数据 token 数等。下游任务包括 LAMBADA 和 CSR,其中 CSR 是 HellaSwag、ARC、PIQA、WinoGrande、OpenBookQA、SIQA、BoolQ 等常识推理任务的零样本平均错误率。结果显示,在语言任务中,UNSL 在 88.89% 的任务上外推最好,而下一个最好的 A2 是 11.11%



更细化地讲,视觉部分实验分为二变量和三变量两类:二变量设置中同时变化的是训练数据集大小和训练步数,三变量设置中同时变化的是训练数据集大小、训练步数和模型参数量。

在三变量视觉实验中,UNSL 的优势非常直接。以 Birds 和 ImageNet 为例,UNSL 都取得最低 RMSLE。尤其和 DC 相比,误差下降非常明显,说明只靠传统三变量形式不足以描述视觉模型在参数量、训练数据和训练步数同时变化时的外推趋势。



语言部分实验同时覆盖上游语言建模表现和下游任务表现。三变量语言实验使用 Muennighoff 等人的 scaling behavior 数据,三个同时变化的维度是 模型参数量、处理过的 token 数、训练数据集中的 token 数。二变量语言实验则关注模型参数量与训练步数 / 处理 token 数的关系。

在三变量语言实验中,UNSL 的 RMSLE 明显低于 A3、A2 、A1 和 DC。也就是说,在这个设置下,UNSL 的外推误差大约只有 DC 的八分之一左右。



二变量语言实验也体现了类似趋势。在下表 5 中,UNSL 在大多数任务上取得最低误差。



除了主文中的视觉和语言任务,论文还在附录中给出更多场景,试图说明 UNSL 的适用范围更广。UNSL 可以外推强化学习中的多变量 scaling behavior,可以处理宽度和深度同时变化的 scaling,还可以把 batch size 作为输入变量;另外,UNSL 还被用于学习率、初始化权重标准差和训练步数同时变化的三变量 scaling behavior。

一系列实验结果表明,UNSL 的优势不在于简单拟合历史数据,而在于它能在多变量同时变化的情况下,更稳定地预测模型性能随规模扩展的走势

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
揪心!西藏吉隆口岸被抹平,已发现:失联人员被深埋在巨石淤泥下

揪心!西藏吉隆口岸被抹平,已发现:失联人员被深埋在巨石淤泥下

胡侃社会百态
2026-09-02 12:56:20
尼泊尔官员放狠话:中美印三国应对我们进行赔偿!

尼泊尔官员放狠话:中美印三国应对我们进行赔偿!

52赫兹实验室
2026-09-02 15:29:41
全民进入纯过日子模式。

全民进入纯过日子模式。

老陆不老
2026-09-02 08:27:57
乌军正式关闭对俄第144师的包围圈,俄军退路被切断攻守逆转

乌军正式关闭对俄第144师的包围圈,俄军退路被切断攻守逆转

今观天下
2026-09-02 09:12:33
日本政府更新大地震预测:南海海槽与东京直下型地震风险上升

日本政府更新大地震预测:南海海槽与东京直下型地震风险上升

算力游侠
2026-09-01 19:06:28
西方情报头子警告:普京已陷入绝境,俄罗斯政权可能一夜变天

西方情报头子警告:普京已陷入绝境,俄罗斯政权可能一夜变天

民间胡扯老哥
2026-09-02 07:18:33
“车灯女王”终于低头!星宇股份董事长周晓萍公开致歉

“车灯女王”终于低头!星宇股份董事长周晓萍公开致歉

听心堂
2026-09-02 12:23:22
河北高阳警方通报“女子被当街殴打撕扯”:2人被刑拘

河北高阳警方通报“女子被当街殴打撕扯”:2人被刑拘

界面新闻
2026-09-02 16:13:22
账面328亿美元!孙宇晨公开资产估值表引热议,网友:大部分其实都不能变现

账面328亿美元!孙宇晨公开资产估值表引热议,网友:大部分其实都不能变现

火山詩话
2026-09-02 17:12:20
年薪300万!33岁前国足队长:我当年加盟广州恒大 就是因为钱多

年薪300万!33岁前国足队长:我当年加盟广州恒大 就是因为钱多

念洲
2026-09-02 09:55:08
官宣!曼城1.25亿镑签下25岁恩佐:夏窗标王诞生 球员感谢切尔西

官宣!曼城1.25亿镑签下25岁恩佐:夏窗标王诞生 球员感谢切尔西

风过乡
2026-09-02 06:43:53
“希望4个老人长命百岁”,女子晒3万多退休金,普通人的心却凉了

“希望4个老人长命百岁”,女子晒3万多退休金,普通人的心却凉了

番外行
2026-09-02 15:33:01
2026年小学入学人数大降:河南山东近乎腰斩,北方七省超40%

2026年小学入学人数大降:河南山东近乎腰斩,北方七省超40%

老郭在学习
2026-09-02 08:19:50
功夫巨星,突然去世

功夫巨星,突然去世

中国新闻周刊
2026-09-02 16:15:27
加拿大神秘“漂浮小岛” 突然出现,后又从卫星图像中消失,再次发现已漂到约30公里外的岸边;官方警告:如果真的找到它,千万不要上去

加拿大神秘“漂浮小岛” 突然出现,后又从卫星图像中消失,再次发现已漂到约30公里外的岸边;官方警告:如果真的找到它,千万不要上去

扬子晚报
2026-09-02 14:57:08
泥石流灾害939具遗体DNA比对,引争议!网友:让遇难者安息吧,建议就地建一座大的纪念碑供家属凭吊

泥石流灾害939具遗体DNA比对,引争议!网友:让遇难者安息吧,建议就地建一座大的纪念碑供家属凭吊

火山詩话
2026-09-02 07:07:34
孙宇晨当选利伯兰总理,可能在下一盘更大的棋

孙宇晨当选利伯兰总理,可能在下一盘更大的棋

上峰视点
2026-09-02 10:03:57
29.99万!小米新车官宣:9月7日,正式上市!

29.99万!小米新车官宣:9月7日,正式上市!

科技堡垒
2026-09-02 15:44:55
今日股市一片哀嚎!宇树科技市值蒸发超2000亿,中际旭创跌破万亿市值

今日股市一片哀嚎!宇树科技市值蒸发超2000亿,中际旭创跌破万亿市值

金透社
2026-09-02 13:53:23
碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

赶鸭子上架
2026-09-02 12:37:08
2026-09-02 20:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

数码
艺术
游戏
手机
健康

数码要闻

宏碁推出SFF RTX Spark迷你主机,最高128GB内存

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

《FF7》蒂法惨遭DLSS5摧残!变大妈难以接受

手机要闻

泄露的iPhone 18 Pro卡托零部件暗示将推出三种机身配色 或再次取消黑色

越吃越爆痘?医生讲清7大真相

无障碍浏览 进入关怀版