网易首页 > 网易号 > 正文 申请入驻

硅谷炸锅!字节Seed押中OpenAI最强模型Scaling路线

0
分享至

智猩猩AI整理

编辑:BugMaker、林夕、没方

GPT-6 Astra的架构,可能已经被字节提前验证了

最近,围绕OpenAI下一代模型Astra的讨论中,一个关键词频繁出现:Looped Transformer


简单来说,这是一种让模型反复计算的架构思路,不再一直增加Transformer层数,转向让同一组参数循环执行多次,以更少的参数换取更深的计算。

与此同时,一篇来自清华大学与字节Seed研究团队的论文《SMELT:Scaling Laws for Compute-Matched MoE Looped Transformers》,也把目光投向了这条路线。

这篇论文直接把FLOPs、参数量、KV Cache全部拉齐,不给Looped Transformer任何额外的计算和存储优势。实验结果表明,Looped Transformer依然展现出明显的Scaling优势,并且随着模型规模扩大,优势还在持续放大

论文发布后,海外AI研究者Lisan Al Gaib转发论文作者Shaowen Wang的推文并评论:字节Seed研究实验室被严重低估了


01

Transformer不一定需要更多层,

重复利用也能提升能力

传统Transformer模型通常采用“每层不同参数”的设计。例如,一个24层模型需要24组不同的Transformer层参数。

而 Looped Transformer 采用另一种方式,让部分已有层再次运行,相当于让模型对同一段计算进行第二次处理。这种方式可以增加模型的有效深度,但不会同步增加参数数量。

过去研究已经发现,循环结构在数学推理、算法学习等任务中具有潜力,但问题也很明显。

如果一个12层模型将全部层循环一次,实际计算量会接近24层模型,因此此前很多实验无法判断模型提升究竟来自循环结构,还是来自额外计算。

SMELT正是针对这个问题展开研究。

团队认为,公平比较两个模型,需要同时匹配三个指标。

其中包括模型计算量、决定模型容量的参数规模,以及影响长上下文效率的KV缓存占用。

只有这些条件接近,才能真正比较架构差异。


为了实现这种公平比较,研究团队选择了混合专家模型(Mixture-of-Experts,MoE)作为基础架构。

原因在于,MoE模型可以把参数规模和实际计算量分离。模型可以降低隐藏维度减少计算,再通过增加专家数量恢复参数容量。

最终,SMELT的核心设计是让Transformer中间约一半层循环两次,同时保持计算量、参数量和KV缓存规模基本一致。

02

中间层循环两次成为最佳方案,SMELT

扩展到54B规模依然有效

确定整体方向后,研究团队进一步探索了两个问题:哪些层适合循环,以及循环次数是否越多越好。

实验结果显示,相比让整个Transformer全部循环,循环中间区域效果更好。

原因在于Transformer不同位置承担不同功能,靠前层更多负责基础信息处理,靠后层更接近输出生成,而中间层承担更复杂的信息转换,因此重复利用收益最高。

最终,SMELT选择循环模型中间50%的层。

同时,循环次数也不是越多越好。如果循环3次甚至4次,为了保持计算预算不变,模型必须进一步缩小宽度,导致能力下降。

因此,循环两次成为最佳选择。

在这一基础上,研究团队将SMELT扩展到不同规模模型。实验覆盖100M、200M、600M以及1.6B活动参数规模,并进一步扩展验证到最大54B非Embedding参数规模。

结果显示,在测试规模和不同稀疏设置下,SMELT训练损失整体低于普通MoE Transformer。


更关键的是,团队进一步拟合了类似Chinchilla的缩放定律(Scaling Law)

结果显示,在达到相同模型效果时,SMELT需要更少训练计算。

在不同计算预算下,SMELT可以节省6.8%—18.0%的训练计算量(FLOPs)。

这意味着未来训练大型语言模型时,除了扩大规模之外,重新设计计算方式也可能成为降低成本的重要方向。

03

第二次计算不是简单重复,

而是在重新调整注意力

为什么SMELT能够提升效果?研究团队进一步分析模型内部运行过程后发现,第二次经过循环层时,模型并不是简单复制第一次结果,而是在已有表示基础上进一步优化。

其中一个重要现象与注意力汇聚(Attention Sink)有关。

在Transformer中,模型经常会将大量注意力集中到序列开头Token。这些位置本身并不一定包含重要语义,却可能吸收大量注意力权重。

SMELT发现,循环层第二次执行后,模型会减少对这些位置的过度关注。

在Dyck语言匹配实验中,第一次计算时,模型大量关注BOS位置。

第二次计算后,注意力开始转向真正有价值的示例答案区域。具体来看,BOS位置(序列开始符)的注意力权重从0.60下降到0.02。示例答案Token获得的注意力从0.24提升到0.85。


研究团队认为,循环计算更像一次“模型自我修正”。

第一次执行帮助模型建立初步信息检索方向。第二次执行利用更新后的状态,让注意力重新分配。这也是为什么循环结构在需要复杂信息整合的任务中表现更明显。

04

长文本和上下文学习中优势扩大,

SMELT展现循环架构潜力

SMELT还表现出一个明显趋势,输入越长,收益越大。研究团队按照样本长度进行分析发现,在512到4096 Token长度的文本中,SMELT带来的收益约是短文本的1.52倍。

这说明循环结构可能更适合处理需要长期依赖的信息。


同时,在上下文学习(In-Context Learning,ICL)任务中,SMELT优势也进一步扩大。

当输入包含更多示例时,第二次计算能够帮助模型进一步提取其中规律。

在Dyck Languages任务中,提供32个示例时,SMELT准确率达到29.8%。Baseline准确率为26.4%。


过去,大模型优化主要围绕扩大参数、增加数据和提升算力展开。

而SMELT提供了另一种思路。

不一定需要更多参数,也可以通过更有效利用已有计算提升模型能力。

未来,随着大模型训练成本持续增长,如何让每一次计算产生更高价值,可能会成为下一阶段模型架构探索的重要方向。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
前TVB花旦苟芸慧复出拍戏,现身活动秀好身材,大方祝福旧爱罗天宇恋情

前TVB花旦苟芸慧复出拍戏,现身活动秀好身材,大方祝福旧爱罗天宇恋情

TVB剧评社
2026-09-17 00:10:04
苹果车钥匙,即将支持三个新品牌!

苹果车钥匙,即将支持三个新品牌!

花果科技
2026-09-16 13:39:20
来,展示一下我最近的穿搭

来,展示一下我最近的穿搭

林宛央
2026-09-16 14:43:46
金价9月16日,大家注意了,拐点已现,明后两天或将迎来大风暴

金价9月16日,大家注意了,拐点已现,明后两天或将迎来大风暴

花小猫的美食日常
2026-09-16 06:16:51
上海北横通道挖10年,一出隧道就被堵到怀疑人生?

上海北横通道挖10年,一出隧道就被堵到怀疑人生?

刘哥谈体育
2026-09-16 14:56:18
电驴集体大降价!车企利润下滑,买车别急下手

电驴集体大降价!车企利润下滑,买车别急下手

趣味萌宠的日常
2026-09-15 11:32:21
赛季第3人!阿尔卡拉斯锁定年终总决赛席位,连续第5年参赛

赛季第3人!阿尔卡拉斯锁定年终总决赛席位,连续第5年参赛

全景体育V
2026-09-16 20:32:23
仓木华身亡。

仓木华身亡。

孤独的独角兽影视
2026-09-16 10:00:14
灾难事件中的歌颂叙事,越来越让人反感

灾难事件中的歌颂叙事,越来越让人反感

黔有虎
2026-07-10 17:13:47
39岁梅西冲击个人第48冠,迈阿密国际明晨将决战北美足联冠军杯

39岁梅西冲击个人第48冠,迈阿密国际明晨将决战北美足联冠军杯

懂球帝
2026-09-16 14:35:57
红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

垚垚分享健康
2026-09-16 22:30:06
路边碰到一群精神小妹,我想知道他们的出路在哪

路边碰到一群精神小妹,我想知道他们的出路在哪

皮蛋儿电影
2026-09-05 16:09:44
耐人寻味!8月发酵9月外媒再报:孙宇晨和景甜3000万天价彩礼纠纷,文章刨根问底了

耐人寻味!8月发酵9月外媒再报:孙宇晨和景甜3000万天价彩礼纠纷,文章刨根问底了

火山詩话
2026-09-15 12:55:53
郑丽文:百分百把握让国民党2028重返执政

郑丽文:百分百把握让国民党2028重返执政

金牛传声
2026-09-16 15:18:37
A股:今夜重磅,美联储加息没有悬念?明日周四将要迎来暴风雨?

A股:今夜重磅,美联储加息没有悬念?明日周四将要迎来暴风雨?

虎哥闲聊
2026-09-17 00:00:04
蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

LULU生活家
2026-09-02 19:51:47
轰30+7+4!中国男篮25岁新王牌崛起:比肩周琦王治郅,亚运冲冠还靠他?

轰30+7+4!中国男篮25岁新王牌崛起:比肩周琦王治郅,亚运冲冠还靠他?

李喜林篮球绝杀
2026-09-16 18:09:53
江阴已出现!别吃!别碰!寄生虫多达6000条,严重可致死!

江阴已出现!别吃!别碰!寄生虫多达6000条,严重可致死!

最江阴
2026-09-16 10:41:44
英媒:欧美一定要死死守住这5项技术,一旦被中国突破将势不可挡

英媒:欧美一定要死死守住这5项技术,一旦被中国突破将势不可挡

次元君情感
2026-09-16 04:56:04
手机不是越贵越好,2026公认“最值得买”的4款手机,用到2031年

手机不是越贵越好,2026公认“最值得买”的4款手机,用到2031年

小柱解说游戏
2026-09-06 05:31:57
2026-09-17 02:56:49
智猩猩
智猩猩
AI 技术内容与服务平台
124文章数 5关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

3000万房产要拆迁 女子意外发现丈夫有16岁私生子

头条要闻

3000万房产要拆迁 女子意外发现丈夫有16岁私生子

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

邢自强:中美AI决胜点不在算力

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

游戏
本地
教育
艺术
健康

《暗黑4》新赛季正式上线 此前因服务器问题短暂延期

本地新闻

不止胖东来!许昌藏着半部三国史

教育要闻

南京高三零模,明天开考!

艺术要闻

这才是国画!刘佰玥“西遇”山水,治好了我的精神内耗!

亲属查出脑动脉瘤?你也尽快筛查!

无障碍浏览 进入关怀版