网易首页 > 网易号 > 正文 申请入驻

GPT-6带火循环Transformer,阿里早已布局

0
分享至

GPT-6 Astra一发布,recurrent depth突然一夜火了!

最早是The Information爆料,Astra使用了这种「循环深度」技术:

让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深

??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。



不出所料,争议很快到来。。。

由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测?

OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。

Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。



边等小作文,边让我们把目光拉回循环Transformer本身:

多循环几圈,模型真的就会更强吗?

学界其实早已踩坑。

同等算力下,省了参数的循环模型,经常打不过普通Transformer。

卡住它的,是一个相当现实的问题:

「计算冗余」

有意思的是,阿里早在11个月前就发了相关论文,靶子正是直指这个问题。

一篇MeSH,解决循环内部怎么管理信息,向行业老大难「循环空转」发起冲击。

一篇SpiralFormer,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。

下一代架构候选,先过「计算冗余」这关

循环Transformer之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。

过去Scaling靠堆参数,24层就得24套参数,现在8层参数跑3遍,也能完成24层深度的计算。

效果能不能追上,还需要实验说话,但需要存储的参数确实少了。

用计算深度换参数规模,这笔账要是算得过来,想象空间可就大了

其实在Astra之前,Claude Mythos就曾把循环架构带火过一轮。

当时最抓眼球的,是一项图搜索成绩。

在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview拿到了80.0%,GPT-5.4是21.4%,自家的Opus 4.6则是38.7%。

Mythos Preview得分接近GPT-5.4的四倍。



这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。

找到一批,记住结果,再继续往下找,很考验连续多步处理信息的能力。

巧的是,循环架构擅长的,恰恰也是在hidden state里连续处理多轮信息。

于是Mythos的成绩一出来,外界很快便把两者联系到了一起。

至于它到底有没有采用循环架构,官方没有明说,答案也就留给了外界猜测。

不过从Mythos到Astra,大家期待的其实是同一件事:

模型不用一直长大,也能靠内部多算几轮,把能力提上去

这也让循环架构成为下一代高效大模型的候选路线之一。

不过问题来了,多算几轮,和多算出点东西,还真是两回事!!

看看这张图就明白了。

横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是core loop。

纵轴表示计算前后hidden state的相对变化幅度。



第一个core loop更新很大,后面两个却迅速缩小。

注意,柱子变矮,并不意味着模型少花了算力,矩阵运算和Attention照样要跑。

这正是计算冗余的尴尬:

循环次数增加了,后续计算带来的增量却越来越小

来自阿里及合作高校的研究团队,正是从这里入手一路深挖。

他们先查清循环为什么空转,再想办法让后面几轮真正干上活。

MeSH:同时解决「计算无分化」和「信息过载」

团队首先给出的解法叫MeSH,现已被ICLR 2026接收。

论文首版在2025年10月公开,等于11个月前,他们就在给循环Transformer做「体检」了。



论文拉到底,先看效果。

在Pythia-1.4B级别的实验中,循环结构通过权重共享,减少了约33%的非嵌入参数。加入MeSH后,零样本下游平均准确率反而从普通Transformer的49.50%提高到50.56%,领先1.06个百分点

少了三分之一的非嵌入参数,成绩反而更好。

而MeSH新增的路由器参数,仅相当于普通Transformer非嵌入参数的约0.005%。

相较基础循环模型,额外计算开销也只有约0.014%,属于花小钱,办大事。



MeSH是怎么做到的?

团队直接钻进模型内部,检查模型每一轮到底干了什么,结果一下子找到了三个「摸鱼证据」。

第一个证据,是后面的循环越来越不爱动

团队比较了hidden state经过每轮计算前后的变化幅度,结果发现第一个core loop承担了绝大部分更新,到了后面几个core loop,状态变化迅速缩小。

第二个证据,是前后几轮越来越像

团队使用CKA分析不同循环之间的表示相似度,然后发现相邻轮次的hidden state高度接近。

同一组网络转了一圈又一圈,吐出来的东西却差不多,啊这!!

更扎心的是,第三个证据显示hidden state还越算越「单一」

奇异值谱分析显示,循环进行之后,模型表示逐渐挤进一个低维空间。

原本可以从多个方向表达的信息,被压缩到少数几个方向上,表达越来越单一。

三个证据摆在一起,模型的摸鱼套路就很清楚了:

第一个core loop猛干,后面几个core loop合着纯纯陪跑。



为什么会这样?这篇论文给出了两个诊断。

一个是「计算无分化」。同一组网络反复使用,又缺少明确的轮次信息,很难在不同阶段形成分工,容易沿用相似的计算方式。

另一个是「信息过载」。同一份hidden state既要保存原始输入,又要装下前几轮结果,还得承担当前计算。长期记忆和临时加工全挤在一起,最后谁也干不好。

说到底,得重新研究循环之间怎么「交接工作」。

传统循环模型里,上一轮算完,直接把hidden state整份递给下一轮,再由同一组网络接着算。

虽然后来大家打过补丁,怕它算着算着忘了原题,就把最初的状态重新加回来,但不管算到第几轮、当前处理哪个token,信息的搭配规则都是写死的。

MeSH想了一招:

不如干脆给模型加一个可以动态存取的「资料柜」?

这个资料柜叫Memory Buffer,由多个记忆槽组成,用来保存原始输入和循环过程中积累的信息,不必全部挤在当前hidden state里。

接着,MeSH给资料柜配了两个管理员。

  • 一个是Write Router,负责决定这一轮的新结果,应该按什么权重分摊到各个记忆槽。
  • 另一个是Read Router,负责在下一轮开始前,按不同权重读取各个槽位,重新组合成新的hidden state。



而且,这些管理员各有各的工作方式。

每轮循环都有自己的路由器,每个token也能得到不同的读写权重。

新信息各存多少,历史信息各取多少,都由模型自己学习。

看到这里,关注过前段时间Hyper-Connections、mHC讨论的朋友,可能已经有点眼熟了。

它们在计算形式上,确实有相似之处

Hyper-Connections把原先单路传递的残差信息扩展成多路,再通过可学习的映射,组合出交给计算层的输入,并把计算结果分配回多路状态。mHC进一步约束这些连接,改善深层传播的稳定性。

MeSH则把类似的信息调配方式用在循环之间,同时缓解了前面两个问题:

Memory Buffer把历史信息分流出去,hidden state终于能专心处理当前轮次。

动态读写路由器则为每轮搭配不同的信息,让共享网络逐渐形成分工,减少重复劳动。

这时候再用同样的三项指标重新检查,模型摸鱼时呈现的三个症状,果然都有了明显改善。



不过,循环之间有了分工,还有一件事没变:

每一轮依然要在完整token序列上计算

这就像明明只想先看清一座城市的整体布局,却还是得沿着每条街挨家挨户走上一遍。

信息会分工了,计算的尺度却还是固定的。

这就轮到第二篇论文SpiralFormer登台了。

SpiralFormer:让每一轮看不同尺度的世界

这篇论文继续往下追问:

既然不同循环可以处理不同信息,为什么还要让每一轮都盯着完整的token序列?

SpiralFormer给出的答案,是把每轮循环的序列长度seq_len也变成可调的。这一成果刚被EMNLP 2026接收。

简单来说,他们受Coconut等隐式思考工作的启发,意识到模型中间的「思考」并不一定每一步都要维持完整、显式的token序列,也可以先压缩成更紧凑的表示,在潜空间中继续计算。



将相关思路运用到SpiralFormer里,效果居然还不错。

在Pythia-1.4B级别的实验中,SpiralFormer-L和普通Transformer的参数量基本相同,计算量却从14.08T FLOPs降到13.13T,5-shot下游平均准确率则从51.93%提高到54.37%

算得更少,成绩反而更高。



具体思路是,别让模型每一轮都用同样的分辨率看问题

它会先把相邻token压缩成更短的序列,再按照从粗到细的顺序循环。

论文采用的一种典型方案,是先从原序列的1/8长度开始,之后依次扩展到1/4、1/2,最后回到完整序列。

举个例子,这就像看地图。

第一轮先看城市全貌,弄清不同区域之间的关系,然后逐步放大,看到街区和道路,最后再落到具体位置。



回到论文就是,SpiralFormer在每轮循环开始前,都会对序列做一次「缩放」:

把相邻token划成一组,通过可学习的权重聚合成一个更粗的表示。压缩完的序列更短,Attention要算的token少了,计算量自然往下掉。

算完之后,再把结果分配回原来的token位置,交给下一轮继续处理。

这里需要注意,考虑到模型生成文本时不能偷看后面的内容,SpiralFormer还对写回结果做了右移,避免压缩操作泄露未来信息。

就这样,压缩、计算、还原……

每循环一轮,序列分辨率就提高一级,模型也从观察整体逐渐转向处理细节。



不过这里还有一个疑问:

这套「先看全局、再抠细节」的说法,到底只是设计者的一厢情愿,还是模型真的学会了?

团队接着钻进Attention里,做了两项probing实验。

先是观察Attention看得有多散

结果显示,早期的低分辨率循环中,注意力分布得更广,会同时关注较大范围的信息,而到了后期的高分辨率循环,注意力开始集中到少数关键位置。

然后直接检查Attention有多关注附近的token

随着分辨率提高,他们发现落在局部范围内的注意力越来越多。

也就是说,模型到了后面几轮,确实更倾向于处理局部关系。

这也就引出了SpiralFormer的核心发现:

循环初期建立global pattern,随着循环推进,再逐渐转向local pattern

相比之下,始终处理完整token序列的普通LoopedFormer,虽然也会出现类似变化,但趋势更弱,也不够稳定。

这说明,从全局到局部的分工并不会随着循环自动出现,多分辨率设计才是关键驱动因素。



团队还保持参数量和训练计算预算不变,只调整循环层所占的比例。

结果形成了一条U形曲线

随着循环比例提高,模型表现先变好,在30%到40%左右达到最佳,继续增加循环,过度共享参数又会拖累效果。



SpiralFormer也由此打开了另一个可以探索的Scaling维度:

除了循环多少次,还能调整每轮把序列压缩到什么尺度

一篇管信息,一篇管尺度

回头再看,这两篇论文其实补上了循环Transformer最缺的东西:

没错,正是分工!!

MeSH解决每轮「拿什么算」,SpiralFormer解决每轮「以什么粒度算」。

两块拼起来,也让循环架构走向下一代高效LLM,多了几分底气。

过去大模型要想Scaling,主要靠参数、数据和训练算力这三大支柱。推理模型兴起后,又多了一种做法,即让模型生成更长的思维链,用更多token换更好的答案。

现在呢?循环Transformer又提供了一种选择:

计算可以在hidden state里继续进行,同一组参数反复使用,模型规模可以不变,内部计算却能一层层加深

虽然这并不意味着可以白捡算力,毕竟循环结构省下的是参数,不是计算。

但只要让多出来的每一轮都算得值,用更少的参数撑起更强的模型,就有了可能。



这也是MeSH和SpiralFormer存在的意义,它们正是在把这种可能一步步做实。

围绕Astra和Mythos,外界还在热议「到底有没有用循环架构」「这会不会成为下一代路线」。

而阿里及合作高校团队已经把问题拆到了循环内部:

从查病因,到改结构,再到验证效果,这条路线上的具体卡点,就这样被逐个拆开了

MeSH获ICLR 2026接收,SpiralFormer获EMNLP 2026接收,顶会的认可也算是给这番持续深挖增加了更多含金量。

只能说,为了走到今天这一步,前人已经在这条路上踩了不少坑,也填了不少坑。

早在2018年的Universal Transformer中,研究者就开始尝试反复使用共享层。

近几年,Looped Transformer、recurrent depth和latent reasoning等研究又陆续出现,背后都是同一个念头:

模型想变强,除了继续长大,能不能也让现有参数多想几轮?

Astra的出现,更是把这条原本偏学术的路线,一把推到了行业聚光灯下。

至于下一代高效大模型会不会从这里长出来,现在下结论确实还有点早。

那就,让子弹再飞一会儿吧。

MeSH:https://arxiv.org/abs/2510.07739
SpiralFormer: https://arxiv.org/abs/2602.11698

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1-2惨遭逆转!五大联赛最惨老牌劲旅?夏窗引进15人=半支球队 3连败1进球垫底

1-2惨遭逆转!五大联赛最惨老牌劲旅?夏窗引进15人=半支球队 3连败1进球垫底

狍子歪解体坛
2026-09-06 00:48:30
68.42米!严子怡勇破纪录 首夺钻石联赛总冠军 改写三大历史数据

68.42米!严子怡勇破纪录 首夺钻石联赛总冠军 改写三大历史数据

郝小小看体育
2026-09-06 01:49:33
高速通行费10月1日改革落地!车主出行费用迎来新变化

高速通行费10月1日改革落地!车主出行费用迎来新变化

娱乐圈的笔娱君
2026-09-05 06:06:20
预警!联合国:史上最强厄尔尼诺降临,概率近100%将失控

预警!联合国:史上最强厄尔尼诺降临,概率近100%将失控

麓谷隐士
2026-09-06 00:10:03
哈兰德一剑封喉,独享队史第1人!1.45亿欧先生首秀,曼城1-0升班马

哈兰德一剑封喉,独享队史第1人!1.45亿欧先生首秀,曼城1-0升班马

钉钉陌上花开
2026-09-05 23:52:19
中国女游客新加坡街头遭抢!刚用4.4万人民币换的8000新币,连古驰包一起没了...

中国女游客新加坡街头遭抢!刚用4.4万人民币换的8000新币,连古驰包一起没了...

新加坡眼
2026-09-05 19:12:22
一辆中国SUV让《纽约时报》实测10天,并推出整版报道;美消费者破防:我们可能永远买不到

一辆中国SUV让《纽约时报》实测10天,并推出整版报道;美消费者破防:我们可能永远买不到

第一财经资讯
2026-09-05 12:44:09
扔掉12斤水果,赔掉10万元,中国式自我感动有多可怕!

扔掉12斤水果,赔掉10万元,中国式自我感动有多可怕!

夜深爱杂谈
2026-09-05 21:28:52
“官宣”只能官宣了?

“官宣”只能官宣了?

圆方你怎么看啊
2026-09-05 20:05:53
悲催!在韩遇难女留学生的国内男友,终究没能去成韩国,连最后送别,都成了他遥不可及的奢望

悲催!在韩遇难女留学生的国内男友,终究没能去成韩国,连最后送别,都成了他遥不可及的奢望

火山詩话
2026-09-06 06:17:32
建议把大学生维权纳入扫黑除恶范围,这得心肠歹毒到啥程度才能想得出?

建议把大学生维权纳入扫黑除恶范围,这得心肠歹毒到啥程度才能想得出?

壹家言
2026-09-05 14:59:26
一场0-1揪出皇马最大罪人,不是姆巴佩,全场隐身,穆里尼奥错信了他

一场0-1揪出皇马最大罪人,不是姆巴佩,全场隐身,穆里尼奥错信了他

零度眼看球
2026-09-06 07:35:18
余承东又官宣享界V8了,说实话,大家真的厌倦鸿蒙智行不停的发布新车

余承东又官宣享界V8了,说实话,大家真的厌倦鸿蒙智行不停的发布新车

春雨说科技
2026-09-05 12:42:22
曾高喊“我希望有生之年看到中国统一”的黄智贤,公开否认自己在反独促统

曾高喊“我希望有生之年看到中国统一”的黄智贤,公开否认自己在反独促统

金牛传声
2026-09-05 17:46:59
阿里巴巴前高管在美国失踪逾半月后确认身亡,死于车内,案件细节正在调查;朋友透露其来自福建,平时很低调,房子是租的,最近才搬家

阿里巴巴前高管在美国失踪逾半月后确认身亡,死于车内,案件细节正在调查;朋友透露其来自福建,平时很低调,房子是租的,最近才搬家

大风新闻
2026-09-05 21:46:31
从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

健身狂人
2026-09-06 02:07:39
潘石屹362亿疯狂抄底

潘石屹362亿疯狂抄底

新浪财经
2026-09-03 10:30:19
美国梦碎、欧洲躺平、中国内卷:普通人阶层跨越的终极真相(2026深度好文)

美国梦碎、欧洲躺平、中国内卷:普通人阶层跨越的终极真相(2026深度好文)

经济学教授V
2026-09-03 19:17:17
武则天第一次临幸“和尚”后,为何会激动不已?

武则天第一次临幸“和尚”后,为何会激动不已?

文史道
2026-08-10 22:36:24
贵中医二附院一医生被患者捅16刀进ICU,嫌犯用锦旗藏刀进入医院,寻找当事医生未果伤及无辜

贵中医二附院一医生被患者捅16刀进ICU,嫌犯用锦旗藏刀进入医院,寻找当事医生未果伤及无辜

Mr王的饭后茶
2026-09-06 00:11:36
2026-09-06 08:23:00
量子位 incentive-icons
量子位
追踪人工智能动态
13270文章数 176550关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

决胜盘一度0比5落后 郑钦文连赢七局上演"史诗级逆转"

头条要闻

决胜盘一度0比5落后 郑钦文连赢七局上演"史诗级逆转"

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

教育
艺术
旅游
亲子
健康

教育要闻

县城理工男最严厉的父亲

艺术要闻

别再说外星人了!三星堆最新发掘,直接实锤“龙的传人”

旅游要闻

让每一次抵达都多一份期待(香江在线)

亲子要闻

AI造娃?生殖专家开发“智能扫精术”,无精症患者都能硬找出蝌蚪生?

脑梗取栓成功≠活下来,还有这三关

无障碍浏览 进入关怀版