网易首页 > 网易号 > 正文 申请入驻

多变量神经缩放定律迈向大一统:Mila联手DeepMind提出UNSL

0
分享至



机器之心编辑部

过去的大模型 scaling law 通常回答的是:当模型参数量、数据量和训练计算量增加后,loss 会如何下降。

但真实训练过程要复杂得多。模型性能不只受参数量和数据量影响,还会受到训练步数、处理 token 数、数据是否被重复使用、batch size、学习率、初始化尺度,以及推理时计算量等因素影响。

更麻烦的是,这些变量之间并不是简单相加关系:某个变量可能在特定区间成为瓶颈,也可能让性能曲线出现阶段性「拐点」,甚至带来非单调变化。比如,训练数据太少或训练超过一定 epoch 后可能出现过拟合;学习率或初始化权重标准差过大,也可能反过来损害性能。

针对这些限制,来自蒙特利尔大学 Mila、Google DeepMind 的研究者提出了一种全新的函数形式,称为统一神经缩放定律(Unified Neural Scaling Law,简称 UNSL),它把多变量同时变化、拐点、瓶颈、过拟合以及超参数带来的反向作用统一纳入 scaling law。

所以,这篇论文的主张可以概括为:神经网络的 scaling behavior 不应该只用「参数量 — 数据量 —loss」这样的二维或三维公式描述,而应该用一个能同时处理多变量、阶段性转折、性能瓶颈、过拟合和超参数影响的统一函数形式。



  • 论文标题:Unified Neural Scaling Laws
  • 论文链接:https://arxiv.org/pdf/2605.26248

论文一作 Ethan Caballero 用一段视频,展示了「统一神经缩放定律」准确建模和外推人工神经网络在多个变量同时变化时呈现出的多变量缩放定律。



UNSL 的函数形式

UNSL 的完整架构是由多个分层函数嵌套而成的,它在多维对数空间中将性能建模为一组平滑连接的超平面:



其中 Q 定义如下:



R 定义如下:



K 为多变量断裂神经缩放定律(Multivariate Broken Neural Scaling Law,MBNSL),定义如下:



整体上可以像下面这样理解:

在函数形式上,UNSL 不是简单把参数量、数据量和训练步数塞进一个幂律公式,而是采用了一套分层结构。

底层的 K 是多变量 broken scaling law,用来描述 log-log 空间中由多个平滑连接超平面构成的 scaling 曲面;其中的 hyperbreak 对应性能曲面中的阶段性转折。

再往上一层,R 将整体 scaling 行为拆成非瓶颈组件和瓶颈组件,分别描述多变量共同作用下的整体趋势,以及某一单独变量限制最终性能的情况。瓶颈组件表示,当其他变量都足够好时,某一个变量仍可能单独限制性能。例如模型够大、训练够久,但数据量不足,数据量就成为瓶颈;或者数据足够多,但模型太小,参数量成为瓶颈。

Q 则进一步引入学习率、初始化尺度等超参数可能带来的反向作用。

最外层公式再加入不可约性能极限、评价指标导致的坏表现极限,以及训练超过一定 epoch 后可能出现的过拟合项。

下图为统一神经缩放定律(Unified Neural Scaling Law,UNSL)的示意图,包含两个输入维度 x_1 和 x_2;中间图和右侧图分别展示了它在各个输入维度上的投影。

在这个具体例子中,一个 UNSL 包含 3 个 hyperbreak,也就是图中用更亮的虚线标出的橙色、黄色和绿色转折结构。Hyperbreak 可以理解为 scaling law 中的「阶段转折」。例如一开始增加数据带来明显收益,过了某个区间收益下降,这个转折就是一种 break;多变量情况下,它不再是一点,而是高维空间里的转折面。

其中,绿色 hyperbreak 由非瓶颈组件产生;橙色 hyperbreak 由 x_1 瓶颈组件产生;黄色 hyperbreak 由 x_2 瓶颈组件产生。



实验结果

在实验部分,研究者对比了以下几类函数形式。

第一类是已有 scaling law 形式,包括 CF 和 DC。CF 接近 Kaplan、Chinchilla 一类常见形式,主要描述参数量、训练数据量或训练 token 数与 loss 之间的关系。DC 来自 Muennighoff 等人的三变量函数形式,考虑参数量、训练 token 数和训练数据集大小。

第二类是作者设计的消融版本:A1、A2、A3。它们可以理解为 UNSL 的逐步简化版。其中 A1 去掉了 additive symmetry,A2 加入了性能下限项,A3 进一步加入部分反向作用结构;完整 UNSL 包含全部 additive symmetry、瓶颈组件、非瓶颈组件、过拟合项和超参数反向作用项。

接下来,研究者主要做了视觉和语言两大类实验。

在视觉任务中,研究者评估了下游少样本图像分类,包括 Birds 200、Cars 196 和 ImageNet。模型包括 ViT、MLP-Mixer 和 BiT,它们在 JFT-300M 子集上预训练。变量包括训练数据集大小、训练步数,以及在三变量设置中的模型参数量。结果显示,在下游图像识别任务中,UNSL 在 60.87% 的任务上取得最好的外推表现,而下一个最好的 A3 是 21.74%

在语言任务中,研究者评估了上游和下游语言表现,变量包括模型参数量、处理 token 数、训练数据 token 数等。下游任务包括 LAMBADA 和 CSR,其中 CSR 是 HellaSwag、ARC、PIQA、WinoGrande、OpenBookQA、SIQA、BoolQ 等常识推理任务的零样本平均错误率。结果显示,在语言任务中,UNSL 在 88.89% 的任务上外推最好,而下一个最好的 A2 是 11.11%



更细化地讲,视觉部分实验分为二变量和三变量两类:二变量设置中同时变化的是训练数据集大小和训练步数,三变量设置中同时变化的是训练数据集大小、训练步数和模型参数量。

在三变量视觉实验中,UNSL 的优势非常直接。以 Birds 和 ImageNet 为例,UNSL 都取得最低 RMSLE。尤其和 DC 相比,误差下降非常明显,说明只靠传统三变量形式不足以描述视觉模型在参数量、训练数据和训练步数同时变化时的外推趋势。



语言部分实验同时覆盖上游语言建模表现和下游任务表现。三变量语言实验使用 Muennighoff 等人的 scaling behavior 数据,三个同时变化的维度是 模型参数量、处理过的 token 数、训练数据集中的 token 数。二变量语言实验则关注模型参数量与训练步数 / 处理 token 数的关系。

在三变量语言实验中,UNSL 的 RMSLE 明显低于 A3、A2 、A1 和 DC。也就是说,在这个设置下,UNSL 的外推误差大约只有 DC 的八分之一左右。



二变量语言实验也体现了类似趋势。在下表 5 中,UNSL 在大多数任务上取得最低误差。



除了主文中的视觉和语言任务,论文还在附录中给出更多场景,试图说明 UNSL 的适用范围更广。UNSL 可以外推强化学习中的多变量 scaling behavior,可以处理宽度和深度同时变化的 scaling,还可以把 batch size 作为输入变量;另外,UNSL 还被用于学习率、初始化权重标准差和训练步数同时变化的三变量 scaling behavior。

一系列实验结果表明,UNSL 的优势不在于简单拟合历史数据,而在于它能在多变量同时变化的情况下,更稳定地预测模型性能随规模扩展的走势

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
吴兴涵:说实话,进球其实是蒙的;我们得对得起这件球衣

吴兴涵:说实话,进球其实是蒙的;我们得对得起这件球衣

懂球帝
2026-09-02 21:58:23
“没有手艺都是科技”,青岛一烤羊店招牌被六旬师傅装反,店主:主打纯手艺无科技,视频太火了,正在犹豫要不要改过来

“没有手艺都是科技”,青岛一烤羊店招牌被六旬师傅装反,店主:主打纯手艺无科技,视频太火了,正在犹豫要不要改过来

扬子晚报
2026-09-01 12:22:59
“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

妍妍教育日记
2026-08-31 23:54:51
女人最好的状态,从来不止年轻貌美

女人最好的状态,从来不止年轻貌美

娱你同欢
2026-09-02 19:57:31
景甜风波后现身机场,穿露脐短T打扮十分精致,神态略显拘谨

景甜风波后现身机场,穿露脐短T打扮十分精致,神态略显拘谨

吃青菜长高
2026-08-31 13:06:01
A股:下跌到3941,尾盘迹象很明显,明天周四,可能重演熟悉行情

A股:下跌到3941,尾盘迹象很明显,明天周四,可能重演熟悉行情

虎哥闲聊
2026-09-02 15:04:43
胡锡进对孙宇晨《致胡锡进老师》的回复

胡锡进对孙宇晨《致胡锡进老师》的回复

DoNews
2026-09-01 23:16:59
首发中锋要4000万,替补560万却先被保障:活塞这操作看不懂

首发中锋要4000万,替补560万却先被保障:活塞这操作看不懂

晚风知我意21
2026-09-02 23:14:10
王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

可乐谈情感
2026-08-30 07:27:10
极限利用!比永兴岛小一半的马累岛住了24万人!南海能效仿吗?

极限利用!比永兴岛小一半的马累岛住了24万人!南海能效仿吗?

兴趣知识
2026-09-01 19:43:43
华为,谁允许你这么折叠的

华为,谁允许你这么折叠的

机智猫
2026-08-31 16:40:11
许家印大概怎么也没料到,自己刚被判刑才四天,王健林就凭一系列举措让口碑迅速逆势翻红

许家印大概怎么也没料到,自己刚被判刑才四天,王健林就凭一系列举措让口碑迅速逆势翻红

人生录
2026-08-30 00:05:13
江西24岁女子患病,未婚夫垫付30万治疗费!办完后事准备离开,未来岳父递来一个红袋子:定情物+12万彩礼,一句话让他当场泪崩

江西24岁女子患病,未婚夫垫付30万治疗费!办完后事准备离开,未来岳父递来一个红袋子:定情物+12万彩礼,一句话让他当场泪崩

背包旅行
2026-09-02 18:16:44
1.4亿买来坐板凳!三场57分钟,皇马最贵替补,穆帅心里有数

1.4亿买来坐板凳!三场57分钟,皇马最贵替补,穆帅心里有数

林子说事
2026-09-02 01:35:18
为何逝去的亲人不托梦给我们?城隍爷:不是不愿来,而是魂归各处

为何逝去的亲人不托梦给我们?城隍爷:不是不愿来,而是魂归各处

阿郑的读书日常
2025-02-07 08:50:46
孙宇晨向胡锡进开炮了

孙宇晨向胡锡进开炮了

凤眼论
2026-09-01 17:51:39
尼泊尔“楼坚强”走红网络!网友:这个打叉三角结构非常重要,坚固原因就在于此,建议新的海关边检大楼也要这样设计

尼泊尔“楼坚强”走红网络!网友:这个打叉三角结构非常重要,坚固原因就在于此,建议新的海关边检大楼也要这样设计

火山詩话
2026-09-01 16:33:31
北京29岁女子欲捐骨髓救母发现非亲生,替母寻找亲生骨肉,接生医院:已组织工作专班

北京29岁女子欲捐骨髓救母发现非亲生,替母寻找亲生骨肉,接生医院:已组织工作专班

潇湘晨报
2026-09-02 21:23:33
胡锡进哪来的脸批孙宇晨?

胡锡进哪来的脸批孙宇晨?

郁风手记
2026-09-02 20:33:13
三款英特尔MacBook被苹果列入过时名单,官方维修正式终止

三款英特尔MacBook被苹果列入过时名单,官方维修正式终止

算力游侠
2026-09-01 12:04:32
2026-09-03 00:00:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

艺术
教育
健康
旅游
数码

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

教育要闻

幼稚!高考全省260名瞧不上2600名室友要退学,港中深校长当场说:半年后谁厉害还不一定

越吃越爆痘?医生讲清7大真相

旅游要闻

忻州荷花开 遍地是吾乡

数码要闻

华为Watch 6系列手表海外发布

无障碍浏览 进入关怀版