网易首页 > 网易号 > 正文 申请入驻

GPT-6带火循环Transformer,阿里早已布局

0
分享至

GPT-6 Astra一发布,recurrent depth突然一夜火了!

最早是The Information爆料,Astra使用了这种「循环深度」技术:

让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深

??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。



不出所料,争议很快到来。。。

由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测?

OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。

Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。



边等小作文,边让我们把目光拉回循环Transformer本身:

多循环几圈,模型真的就会更强吗?

学界其实早已踩坑。

同等算力下,省了参数的循环模型,经常打不过普通Transformer。

卡住它的,是一个相当现实的问题:

「计算冗余」

有意思的是,阿里早在11个月前就发了相关论文,靶子正是直指这个问题。

一篇MeSH,解决循环内部怎么管理信息,向行业老大难「循环空转」发起冲击。

一篇SpiralFormer,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。

下一代架构候选,先过「计算冗余」这关

循环Transformer之所以让大家上头,是因为它给大模型提供了一种新的「变强方式」。

过去Scaling靠堆参数,24层就得24套参数,现在8层参数跑3遍,也能完成24层深度的计算。

效果能不能追上,还需要实验说话,但需要存储的参数确实少了。

用计算深度换参数规模,这笔账要是算得过来,想象空间可就大了

其实在Astra之前,Claude Mythos就曾把循环架构带火过一轮。

当时最抓眼球的,是一项图搜索成绩。

在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview拿到了80.0%,GPT-5.4是21.4%,自家的Opus 4.6则是38.7%。

Mythos Preview得分接近GPT-5.4的四倍。



这个测试,可以理解成给模型一张复杂的关系网,让它从起点出发,一层层找出相连的节点。

找到一批,记住结果,再继续往下找,很考验连续多步处理信息的能力。

巧的是,循环架构擅长的,恰恰也是在hidden state里连续处理多轮信息。

于是Mythos的成绩一出来,外界很快便把两者联系到了一起。

至于它到底有没有采用循环架构,官方没有明说,答案也就留给了外界猜测。

不过从Mythos到Astra,大家期待的其实是同一件事:

模型不用一直长大,也能靠内部多算几轮,把能力提上去

这也让循环架构成为下一代高效大模型的候选路线之一。

不过问题来了,多算几轮,和多算出点东西,还真是两回事!!

看看这张图就明白了。

横轴从左到右,是信息经过模型各个模块的过程,中间三个蓝色柱子对应三次核心循环,也就是core loop。

纵轴表示计算前后hidden state的相对变化幅度。



第一个core loop更新很大,后面两个却迅速缩小。

注意,柱子变矮,并不意味着模型少花了算力,矩阵运算和Attention照样要跑。

这正是计算冗余的尴尬:

循环次数增加了,后续计算带来的增量却越来越小

来自阿里及合作高校的研究团队,正是从这里入手一路深挖。

他们先查清循环为什么空转,再想办法让后面几轮真正干上活。

MeSH:同时解决「计算无分化」和「信息过载」

团队首先给出的解法叫MeSH,现已被ICLR 2026接收。

论文首版在2025年10月公开,等于11个月前,他们就在给循环Transformer做「体检」了。



论文拉到底,先看效果。

在Pythia-1.4B级别的实验中,循环结构通过权重共享,减少了约33%的非嵌入参数。加入MeSH后,零样本下游平均准确率反而从普通Transformer的49.50%提高到50.56%,领先1.06个百分点

少了三分之一的非嵌入参数,成绩反而更好。

而MeSH新增的路由器参数,仅相当于普通Transformer非嵌入参数的约0.005%。

相较基础循环模型,额外计算开销也只有约0.014%,属于花小钱,办大事。



MeSH是怎么做到的?

团队直接钻进模型内部,检查模型每一轮到底干了什么,结果一下子找到了三个「摸鱼证据」。

第一个证据,是后面的循环越来越不爱动

团队比较了hidden state经过每轮计算前后的变化幅度,结果发现第一个core loop承担了绝大部分更新,到了后面几个core loop,状态变化迅速缩小。

第二个证据,是前后几轮越来越像

团队使用CKA分析不同循环之间的表示相似度,然后发现相邻轮次的hidden state高度接近。

同一组网络转了一圈又一圈,吐出来的东西却差不多,啊这!!

更扎心的是,第三个证据显示hidden state还越算越「单一」

奇异值谱分析显示,循环进行之后,模型表示逐渐挤进一个低维空间。

原本可以从多个方向表达的信息,被压缩到少数几个方向上,表达越来越单一。

三个证据摆在一起,模型的摸鱼套路就很清楚了:

第一个core loop猛干,后面几个core loop合着纯纯陪跑。



为什么会这样?这篇论文给出了两个诊断。

一个是「计算无分化」。同一组网络反复使用,又缺少明确的轮次信息,很难在不同阶段形成分工,容易沿用相似的计算方式。

另一个是「信息过载」。同一份hidden state既要保存原始输入,又要装下前几轮结果,还得承担当前计算。长期记忆和临时加工全挤在一起,最后谁也干不好。

说到底,得重新研究循环之间怎么「交接工作」。

传统循环模型里,上一轮算完,直接把hidden state整份递给下一轮,再由同一组网络接着算。

虽然后来大家打过补丁,怕它算着算着忘了原题,就把最初的状态重新加回来,但不管算到第几轮、当前处理哪个token,信息的搭配规则都是写死的。

MeSH想了一招:

不如干脆给模型加一个可以动态存取的「资料柜」?

这个资料柜叫Memory Buffer,由多个记忆槽组成,用来保存原始输入和循环过程中积累的信息,不必全部挤在当前hidden state里。

接着,MeSH给资料柜配了两个管理员。

  • 一个是Write Router,负责决定这一轮的新结果,应该按什么权重分摊到各个记忆槽。
  • 另一个是Read Router,负责在下一轮开始前,按不同权重读取各个槽位,重新组合成新的hidden state。



而且,这些管理员各有各的工作方式。

每轮循环都有自己的路由器,每个token也能得到不同的读写权重。

新信息各存多少,历史信息各取多少,都由模型自己学习。

看到这里,关注过前段时间Hyper-Connections、mHC讨论的朋友,可能已经有点眼熟了。

它们在计算形式上,确实有相似之处

Hyper-Connections把原先单路传递的残差信息扩展成多路,再通过可学习的映射,组合出交给计算层的输入,并把计算结果分配回多路状态。mHC进一步约束这些连接,改善深层传播的稳定性。

MeSH则把类似的信息调配方式用在循环之间,同时缓解了前面两个问题:

Memory Buffer把历史信息分流出去,hidden state终于能专心处理当前轮次。

动态读写路由器则为每轮搭配不同的信息,让共享网络逐渐形成分工,减少重复劳动。

这时候再用同样的三项指标重新检查,模型摸鱼时呈现的三个症状,果然都有了明显改善。



不过,循环之间有了分工,还有一件事没变:

每一轮依然要在完整token序列上计算

这就像明明只想先看清一座城市的整体布局,却还是得沿着每条街挨家挨户走上一遍。

信息会分工了,计算的尺度却还是固定的。

这就轮到第二篇论文SpiralFormer登台了。

SpiralFormer:让每一轮看不同尺度的世界

这篇论文继续往下追问:

既然不同循环可以处理不同信息,为什么还要让每一轮都盯着完整的token序列?

SpiralFormer给出的答案,是把每轮循环的序列长度seq_len也变成可调的。这一成果刚被EMNLP 2026接收。

简单来说,他们受Coconut等隐式思考工作的启发,意识到模型中间的「思考」并不一定每一步都要维持完整、显式的token序列,也可以先压缩成更紧凑的表示,在潜空间中继续计算。



将相关思路运用到SpiralFormer里,效果居然还不错。

在Pythia-1.4B级别的实验中,SpiralFormer-L和普通Transformer的参数量基本相同,计算量却从14.08T FLOPs降到13.13T,5-shot下游平均准确率则从51.93%提高到54.37%

算得更少,成绩反而更高。



具体思路是,别让模型每一轮都用同样的分辨率看问题

它会先把相邻token压缩成更短的序列,再按照从粗到细的顺序循环。

论文采用的一种典型方案,是先从原序列的1/8长度开始,之后依次扩展到1/4、1/2,最后回到完整序列。

举个例子,这就像看地图。

第一轮先看城市全貌,弄清不同区域之间的关系,然后逐步放大,看到街区和道路,最后再落到具体位置。



回到论文就是,SpiralFormer在每轮循环开始前,都会对序列做一次「缩放」:

把相邻token划成一组,通过可学习的权重聚合成一个更粗的表示。压缩完的序列更短,Attention要算的token少了,计算量自然往下掉。

算完之后,再把结果分配回原来的token位置,交给下一轮继续处理。

这里需要注意,考虑到模型生成文本时不能偷看后面的内容,SpiralFormer还对写回结果做了右移,避免压缩操作泄露未来信息。

就这样,压缩、计算、还原……

每循环一轮,序列分辨率就提高一级,模型也从观察整体逐渐转向处理细节。



不过这里还有一个疑问:

这套「先看全局、再抠细节」的说法,到底只是设计者的一厢情愿,还是模型真的学会了?

团队接着钻进Attention里,做了两项probing实验。

先是观察Attention看得有多散

结果显示,早期的低分辨率循环中,注意力分布得更广,会同时关注较大范围的信息,而到了后期的高分辨率循环,注意力开始集中到少数关键位置。

然后直接检查Attention有多关注附近的token

随着分辨率提高,他们发现落在局部范围内的注意力越来越多。

也就是说,模型到了后面几轮,确实更倾向于处理局部关系。

这也就引出了SpiralFormer的核心发现:

循环初期建立global pattern,随着循环推进,再逐渐转向local pattern

相比之下,始终处理完整token序列的普通LoopedFormer,虽然也会出现类似变化,但趋势更弱,也不够稳定。

这说明,从全局到局部的分工并不会随着循环自动出现,多分辨率设计才是关键驱动因素。



团队还保持参数量和训练计算预算不变,只调整循环层所占的比例。

结果形成了一条U形曲线

随着循环比例提高,模型表现先变好,在30%到40%左右达到最佳,继续增加循环,过度共享参数又会拖累效果。



SpiralFormer也由此打开了另一个可以探索的Scaling维度:

除了循环多少次,还能调整每轮把序列压缩到什么尺度

一篇管信息,一篇管尺度

回头再看,这两篇论文其实补上了循环Transformer最缺的东西:

没错,正是分工!!

MeSH解决每轮「拿什么算」,SpiralFormer解决每轮「以什么粒度算」。

两块拼起来,也让循环架构走向下一代高效LLM,多了几分底气。

过去大模型要想Scaling,主要靠参数、数据和训练算力这三大支柱。推理模型兴起后,又多了一种做法,即让模型生成更长的思维链,用更多token换更好的答案。

现在呢?循环Transformer又提供了一种选择:

计算可以在hidden state里继续进行,同一组参数反复使用,模型规模可以不变,内部计算却能一层层加深

虽然这并不意味着可以白捡算力,毕竟循环结构省下的是参数,不是计算。

但只要让多出来的每一轮都算得值,用更少的参数撑起更强的模型,就有了可能。



这也是MeSH和SpiralFormer存在的意义,它们正是在把这种可能一步步做实。

围绕Astra和Mythos,外界还在热议「到底有没有用循环架构」「这会不会成为下一代路线」。

而阿里及合作高校团队已经把问题拆到了循环内部:

从查病因,到改结构,再到验证效果,这条路线上的具体卡点,就这样被逐个拆开了

MeSH获ICLR 2026接收,SpiralFormer获EMNLP 2026接收,顶会的认可也算是给这番持续深挖增加了更多含金量。

只能说,为了走到今天这一步,前人已经在这条路上踩了不少坑,也填了不少坑。

早在2018年的Universal Transformer中,研究者就开始尝试反复使用共享层。

近几年,Looped Transformer、recurrent depth和latent reasoning等研究又陆续出现,背后都是同一个念头:

模型想变强,除了继续长大,能不能也让现有参数多想几轮?

Astra的出现,更是把这条原本偏学术的路线,一把推到了行业聚光灯下。

至于下一代高效大模型会不会从这里长出来,现在下结论确实还有点早。

那就,让子弹再飞一会儿吧。

MeSH:https://arxiv.org/abs/2510.07739
SpiralFormer: https://arxiv.org/abs/2602.11698

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
17个月后欧盟大门或关闭,996就是强迫劳动,9成中小企业却还没醒

17个月后欧盟大门或关闭,996就是强迫劳动,9成中小企业却还没醒

浯江孤舟
2026-08-10 10:00:15
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
iPhone 18 Pro灵动岛大瘦身:屏占比创新高 苹果最美正颜

iPhone 18 Pro灵动岛大瘦身:屏占比创新高 苹果最美正颜

快科技
2026-09-05 22:14:05
婚后二十年从没同房,单位体检时医生一句话,让我当场红了眼眶

婚后二十年从没同房,单位体检时医生一句话,让我当场红了眼眶

墨染尘香
2026-09-02 10:31:40
阿里巴巴前销售总监失联两周后确认死亡!遗体被发现于车内……

阿里巴巴前销售总监失联两周后确认死亡!遗体被发现于车内……

华人生活网
2026-09-06 04:04:33
香奈儿果然不坑穷人,这鞋根本不是给走路的人穿的,是给专车接送、脚几乎不沾地的人设计的

香奈儿果然不坑穷人,这鞋根本不是给走路的人穿的,是给专车接送、脚几乎不沾地的人设计的

背包旅行
2026-09-03 11:56:50
老话:“好男不娶虎刺梅,好女不嫁流光锤”,虎刺梅和流光锤究竟是啥?

老话:“好男不娶虎刺梅,好女不嫁流光锤”,虎刺梅和流光锤究竟是啥?

大运河时空
2026-09-04 08:50:03
观音菩萨到底灵不灵?一位70岁的老和尚用三件事,给出了答案

观音菩萨到底灵不灵?一位70岁的老和尚用三件事,给出了答案

千秋文化
2026-09-05 20:23:05
这些人要发抖了!中纪委再次出动,剑指这些歪风和腐败问题!

这些人要发抖了!中纪委再次出动,剑指这些歪风和腐败问题!

职场资深秘书
2026-09-05 18:17:51
英超转会动态:利物浦或再追萨尔,热刺前锋寻求沙特出路

英超转会动态:利物浦或再追萨尔,热刺前锋寻求沙特出路

体坛观察猿
2026-09-06 04:55:09
李显龙直言不讳地告诫国民:每一个新加坡人都必须明白,本国坚决不承认“华人国家”身份,背后藏着的是全亚洲最为惊心动魄的生存考量

李显龙直言不讳地告诫国民:每一个新加坡人都必须明白,本国坚决不承认“华人国家”身份,背后藏着的是全亚洲最为惊心动魄的生存考量

橙色书卷
2026-07-16 21:35:45
波尔不再隐瞒!终于公开樊振东不回中国队原因,难怪退出世界排名

波尔不再隐瞒!终于公开樊振东不回中国队原因,难怪退出世界排名

做一个合格的吃瓜群众
2026-03-26 11:14:26
世界杯-日本女篮最多落后25分惨负德国 三分27中3吞首败

世界杯-日本女篮最多落后25分惨负德国 三分27中3吞首败

醉卧浮生
2026-09-06 01:48:03
郑钦文第4轮对手出炉!将战大满贯6冠得主 已输7次+奥运夺唯一胜利

郑钦文第4轮对手出炉!将战大满贯6冠得主 已输7次+奥运夺唯一胜利

我爱英超
2026-09-06 04:32:57
买的下铺临期被改为上铺,旅客登车后原车厢没了,“铺位差价也未到账”;12306回复→

买的下铺临期被改为上铺,旅客登车后原车厢没了,“铺位差价也未到账”;12306回复→

封面新闻
2026-09-04 14:09:07
比亚迪秦L被工信部点名:两年前的2.9L油耗争议,又回来了

比亚迪秦L被工信部点名:两年前的2.9L油耗争议,又回来了

趣味萌宠的日常
2026-09-05 10:52:50
为什么澳大利亚是大陆,而不是大岛?

为什么澳大利亚是大陆,而不是大岛?

向航说
2026-09-05 23:51:15
无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

梦史
2026-08-29 06:21:20
实锤!唯一能“涨骨密度”的运动,不是跑步也不是走路

实锤!唯一能“涨骨密度”的运动,不是跑步也不是走路

白宸侃片
2026-08-23 08:27:16
美演员乔治·克鲁尼:美国正由最不称职的人掌管,但我们会熬过去

美演员乔治·克鲁尼:美国正由最不称职的人掌管,但我们会熬过去

新时代精神
2026-09-04 09:14:33
2026-09-06 05:56:49
量子位 incentive-icons
量子位
追踪人工智能动态
13270文章数 176550关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

千里浩瀚H5/30英寸大屏 星越L PLUS让你看到油车越级的一面

态度原创

教育
健康
亲子
艺术
时尚

教育要闻

噩梦!油漆未干开学,学生出现身体不适,教体局:甲醛合格,家长不买账

脑梗取栓成功≠活下来,还有这三关

亲子要闻

AI造娃?生殖专家开发“智能扫精术”,无精症患者都能硬找出蝌蚪生?

艺术要闻

别再说外星人了!三星堆最新发掘,直接实锤“龙的传人”

推广中奖名单-更新至2026年8月25日推广

无障碍浏览 进入关怀版