网易首页 > 网易号 > 正文 申请入驻

硅谷炸锅!字节Seed押中OpenAI最强模型Scaling路线

0
分享至

智猩猩AI整理

编辑:BugMaker、林夕、没方

GPT-6 Astra的架构,可能已经被字节提前验证了

最近,围绕OpenAI下一代模型Astra的讨论中,一个关键词频繁出现:Looped Transformer


简单来说,这是一种让模型反复计算的架构思路,不再一直增加Transformer层数,转向让同一组参数循环执行多次,以更少的参数换取更深的计算。

与此同时,一篇来自清华大学与字节Seed研究团队的论文《SMELT:Scaling Laws for Compute-Matched MoE Looped Transformers》,也把目光投向了这条路线。

这篇论文直接把FLOPs、参数量、KV Cache全部拉齐,不给Looped Transformer任何额外的计算和存储优势。实验结果表明,Looped Transformer依然展现出明显的Scaling优势,并且随着模型规模扩大,优势还在持续放大

论文发布后,海外AI研究者Lisan Al Gaib转发论文作者Shaowen Wang的推文并评论:字节Seed研究实验室被严重低估了


01

Transformer不一定需要更多层,

重复利用也能提升能力

传统Transformer模型通常采用“每层不同参数”的设计。例如,一个24层模型需要24组不同的Transformer层参数。

而 Looped Transformer 采用另一种方式,让部分已有层再次运行,相当于让模型对同一段计算进行第二次处理。这种方式可以增加模型的有效深度,但不会同步增加参数数量。

过去研究已经发现,循环结构在数学推理、算法学习等任务中具有潜力,但问题也很明显。

如果一个12层模型将全部层循环一次,实际计算量会接近24层模型,因此此前很多实验无法判断模型提升究竟来自循环结构,还是来自额外计算。

SMELT正是针对这个问题展开研究。

团队认为,公平比较两个模型,需要同时匹配三个指标。

其中包括模型计算量、决定模型容量的参数规模,以及影响长上下文效率的KV缓存占用。

只有这些条件接近,才能真正比较架构差异。


为了实现这种公平比较,研究团队选择了混合专家模型(Mixture-of-Experts,MoE)作为基础架构。

原因在于,MoE模型可以把参数规模和实际计算量分离。模型可以降低隐藏维度减少计算,再通过增加专家数量恢复参数容量。

最终,SMELT的核心设计是让Transformer中间约一半层循环两次,同时保持计算量、参数量和KV缓存规模基本一致。

02

中间层循环两次成为最佳方案,SMELT

扩展到54B规模依然有效

确定整体方向后,研究团队进一步探索了两个问题:哪些层适合循环,以及循环次数是否越多越好。

实验结果显示,相比让整个Transformer全部循环,循环中间区域效果更好。

原因在于Transformer不同位置承担不同功能,靠前层更多负责基础信息处理,靠后层更接近输出生成,而中间层承担更复杂的信息转换,因此重复利用收益最高。

最终,SMELT选择循环模型中间50%的层。

同时,循环次数也不是越多越好。如果循环3次甚至4次,为了保持计算预算不变,模型必须进一步缩小宽度,导致能力下降。

因此,循环两次成为最佳选择。

在这一基础上,研究团队将SMELT扩展到不同规模模型。实验覆盖100M、200M、600M以及1.6B活动参数规模,并进一步扩展验证到最大54B非Embedding参数规模。

结果显示,在测试规模和不同稀疏设置下,SMELT训练损失整体低于普通MoE Transformer。


更关键的是,团队进一步拟合了类似Chinchilla的缩放定律(Scaling Law)

结果显示,在达到相同模型效果时,SMELT需要更少训练计算。

在不同计算预算下,SMELT可以节省6.8%—18.0%的训练计算量(FLOPs)。

这意味着未来训练大型语言模型时,除了扩大规模之外,重新设计计算方式也可能成为降低成本的重要方向。

03

第二次计算不是简单重复,

而是在重新调整注意力

为什么SMELT能够提升效果?研究团队进一步分析模型内部运行过程后发现,第二次经过循环层时,模型并不是简单复制第一次结果,而是在已有表示基础上进一步优化。

其中一个重要现象与注意力汇聚(Attention Sink)有关。

在Transformer中,模型经常会将大量注意力集中到序列开头Token。这些位置本身并不一定包含重要语义,却可能吸收大量注意力权重。

SMELT发现,循环层第二次执行后,模型会减少对这些位置的过度关注。

在Dyck语言匹配实验中,第一次计算时,模型大量关注BOS位置。

第二次计算后,注意力开始转向真正有价值的示例答案区域。具体来看,BOS位置(序列开始符)的注意力权重从0.60下降到0.02。示例答案Token获得的注意力从0.24提升到0.85。


研究团队认为,循环计算更像一次“模型自我修正”。

第一次执行帮助模型建立初步信息检索方向。第二次执行利用更新后的状态,让注意力重新分配。这也是为什么循环结构在需要复杂信息整合的任务中表现更明显。

04

长文本和上下文学习中优势扩大,

SMELT展现循环架构潜力

SMELT还表现出一个明显趋势,输入越长,收益越大。研究团队按照样本长度进行分析发现,在512到4096 Token长度的文本中,SMELT带来的收益约是短文本的1.52倍。

这说明循环结构可能更适合处理需要长期依赖的信息。


同时,在上下文学习(In-Context Learning,ICL)任务中,SMELT优势也进一步扩大。

当输入包含更多示例时,第二次计算能够帮助模型进一步提取其中规律。

在Dyck Languages任务中,提供32个示例时,SMELT准确率达到29.8%。Baseline准确率为26.4%。


过去,大模型优化主要围绕扩大参数、增加数据和提升算力展开。

而SMELT提供了另一种思路。

不一定需要更多参数,也可以通过更有效利用已有计算提升模型能力。

未来,随着大模型训练成本持续增长,如何让每一次计算产生更高价值,可能会成为下一阶段模型架构探索的重要方向。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
湖底惊现39年前失踪的运钞车,钞箱毫发无损,撬开后却傻眼了

湖底惊现39年前失踪的运钞车,钞箱毫发无损,撬开后却傻眼了

青青会讲故事
2025-09-17 11:32:38
私有化债务压顶!58系禁售期地板价清仓万物云涉嫌违规,姚劲波称“不知情”,9年获利22亿港元

私有化债务压顶!58系禁售期地板价清仓万物云涉嫌违规,姚劲波称“不知情”,9年获利22亿港元

蓝鲸新闻
2026-09-16 19:41:26
《交锋》大结局:金池中的真实身份曝光,才懂他为何对金丽娜如此“变态”

《交锋》大结局:金池中的真实身份曝光,才懂他为何对金丽娜如此“变态”

肆季娱乐
2026-09-15 00:23:47
一路走好?陈建州传出坏消息,范玮琪崩溃大哭,差点步入大S后尘

一路走好?陈建州传出坏消息,范玮琪崩溃大哭,差点步入大S后尘

萧狡科普解说
2026-09-16 11:10:35
油价将于9月24日24时调整,或有大幅变动

油价将于9月24日24时调整,或有大幅变动

吉刻新闻
2026-09-16 11:23:05
景甜风波后续,华尔街日报下场,言辞犀利,字字戳孙宇晨心窝

景甜风波后续,华尔街日报下场,言辞犀利,字字戳孙宇晨心窝

青橘罐头
2026-09-15 16:33:35
终于不再回避!50岁陈坤自曝健康问题,与周迅结婚早已真相大白

终于不再回避!50岁陈坤自曝健康问题,与周迅结婚早已真相大白

神颜贩卖机
2026-08-28 12:16:26
再不拿下!卡里克帅位不保!曼联头号水货彻底拖死全队

再不拿下!卡里克帅位不保!曼联头号水货彻底拖死全队

澜归序
2026-09-16 08:45:20
曼联小梅西罢训罢赛要求解约,突闹离队原因曝光!俱乐部苦劝恐徒劳无功

曼联小梅西罢训罢赛要求解约,突闹离队原因曝光!俱乐部苦劝恐徒劳无功

罗米的曼联博客
2026-09-16 09:49:07
被日本女生惊艳了!满街都是“宽腿裤+浅口鞋”,却个个时髦高级

被日本女生惊艳了!满街都是“宽腿裤+浅口鞋”,却个个时髦高级

时尚穿搭生活馆
2026-09-02 18:05:15
哈尔滨楼市一边倒:84%的购买力,流向了同一个方向

哈尔滨楼市一边倒:84%的购买力,流向了同一个方向

阿离家居
2026-09-16 13:33:32
岳母把瘫痪岳父丢我家门口,转身就想开溜,我没拦着,掏出手机拨通一个电话,她听见声音吓得当场跪在地上

岳母把瘫痪岳父丢我家门口,转身就想开溜,我没拦着,掏出手机拨通一个电话,她听见声音吓得当场跪在地上

晓艾故事汇
2026-09-16 16:10:20
青岛女职工缴费20年个人账户15.3万元,退休核算却仅领2500多元

青岛女职工缴费20年个人账户15.3万元,退休核算却仅领2500多元

王姐懒人家常菜
2026-09-16 13:57:37
“假村干部”直播带货,宣称“我的村子我代言”,被问身份后立即改名!官方通报:李某某(女,31岁)被立案调查→

“假村干部”直播带货,宣称“我的村子我代言”,被问身份后立即改名!官方通报:李某某(女,31岁)被立案调查→

云南网络广播电视台
2026-09-16 09:52:32
国防部:学生军训内容将有更新 结合新的时代特点,更新训练内容

国防部:学生军训内容将有更新 结合新的时代特点,更新训练内容

每日经济新闻
2026-09-15 17:48:49
张一鸣首次成为亚洲首富,身家超1050亿美元

张一鸣首次成为亚洲首富,身家超1050亿美元

财视传播
2026-09-16 15:12:34
2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

非虚构人间
2026-09-11 01:40:57
1943年,泰国趁中国抗战之际集结三万大军入侵云南,遭远征军痛击

1943年,泰国趁中国抗战之际集结三万大军入侵云南,遭远征军痛击

饭小妹说历史
2026-03-16 09:46:06
“南方医科大学跳楼”霸榜热搜!

“南方医科大学跳楼”霸榜热搜!

新动察
2026-09-16 15:36:16
就在大家都以为中国会坚决回应时,北京却选择了战略克制。

就在大家都以为中国会坚决回应时,北京却选择了战略克制。

回京历史梦
2026-08-22 18:23:43
2026-09-17 03:43:00
智猩猩
智猩猩
AI 技术内容与服务平台
124文章数 5关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

3000万房产要拆迁 女子意外发现丈夫有16岁私生子

头条要闻

3000万房产要拆迁 女子意外发现丈夫有16岁私生子

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

邢自强:中美AI决胜点不在算力

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

教育
家居
时尚
房产
本地

教育要闻

南京高三零模,明天开考!

家居要闻

2026建博会(广州) 公装联探展交流活动

8年没换过|| 每次“垮脸”都靠它救,这笔小投资已值回本

房产要闻

突发!三亚安居房出台新政!

本地新闻

不止胖东来!许昌藏着半部三国史

无障碍浏览 进入关怀版