网易首页 > 网易号 > 正文 申请入驻

Qwen3.8-Flash架构大改,训练FLOPs仅为上一代1/9!

0
分享至

智猩猩AI整理

编辑:林夕

2026 年 8 月 26 日,Qwen 官方账号在 X 上放出一张蓝色海报:

Qwen3.8-Flash 正式上线,而 Qwen3.8-Flash-Next 的开源权重同步放出。


最近,Qwen团队公开了一篇论文,系统介绍了Qwen3.8-Flash-Next的架构设计、训练效率以及稳定性。


官方把它明确定位为Qwen4 架构的早期预览,上一次被这样提前放出的模型是 Qwen3-Next。

按照官方博客的说法,它当时引入的“Gated DeltaNet + Gated Attention”混合结构,后来贯穿了整个Qwen3.5、Qwen3.6、Qwen3.7 与 Qwen3.8 系列。

如今 Qwen3.8-Flash-Next 承担的角色与此相同,把下一阶段的主力架构先交给社区检验,再在之上搭建完整的Qwen4 家族

官方博客的措辞很直接:提前发布是为了让社区独立评估这套架构,正如当年Qwen3-Next所做的那样。

01

125B参数的“低配”玩法

Qwen3.8-Flash-Next采用的是MoE架构主模型参数125B,但每个Token只激活约6B

它没有继续堆叠全量Attention,而是采用Gated DeltaNet(GDN)与全局Attention混合的架构。

论文里的基础设计是:

3层GDN + 1层全局Attention。


GDN负责把前面的上下文压缩进一个固定大小的递归状态里,从而避免传统Attention随着上下文长度增长而产生巨大的计算和KV Cache成本。


但Qwen也没有完全放弃Attention。

原因很简单,压缩记忆很省,但它无法完全替代直接从历史Token里检索信息。

所以每4层保留一层全局Attention。

论文实验也显示,在选定的9项Benchmark中,GDN Hybrid相较Full Attention有8项领先,相较SWA Hybrid有7项领先,并取得最高平均分


到了继续预训练阶段,Qwen进一步把原来的全局Attention替换成了自己的Qwen Sparse Attention(QSA)


它的核心思路是:不要让Attention把整个上下文的每个Token都完整算一遍

QSA先通过轻量级Indexer在micro-block粒度上筛选重要上下文。

论文称,在1M上下文长度下,QSA在Kernel级别:

  • Prefill速度约是Dense Attention的7.6倍

  • Decode速度约是Dense Attention的4.9倍

上下文越来越长,但不能让计算成本也跟着一起膨胀。


Attention之外,Qwen还重新设计了Residual

它把原本单一路径的Residual Stream扩展成4条分支,再通过element-wise gate控制不同分支的信息如何混合,这套设计被称为Gated Residual(GR)

GR并不只是为了增加模型表达能力。

在后面的稳定性测试中,它也是新架构能够承受更高学习率的重要因素。

另外,Qwen还加入了一层N-gram Embedding

这部分额外增加约51B参数,但Embedding表可以放在Host Memory中,并通过异步预取与模型计算重叠,从而减少对加速器显存的占用。

这样一来,模型可以继续增加参数容量,却不用让这部分参数全部参与每个Token的计算。

最后,训练方法也跟着架构一起调整。

Qwen3.8-Flash-Next采用Muon + AdamW的混合优化方案,并重新调整了学习率和Batch Size。

论文还发现,使用Batch Size Warmup反而会多消耗约18.8%的优化器Step


02

算力省下来,

能力没有跟着缩水

如果只看模型规模,Qwen3.8-Flash-Next似乎并不算一个特别大的模型

它的主模型参数只有125B,还不到上一代397B-A17B的一半。

但真正决定训练成本的每个Token到底需要算多少,Qwen3.8-Flash-Next每个Token只激活约6B参数。

相比上一代397B-A17B,激活参数降到约1/3,训练Token也降到约1/3,训练FLOPs则进一步降到了约1/9。


参数、Token、FLOPs同时下降,但模型能力并没有同步掉下去。

在14项预训练Benchmark中,新模型有8项超过上一代,剩余6项的差距也控制在2.6分以内。

03

架构改得越激进,

训练越不能出问题

省算力只是第一步,对于这种规模的模型来说,架构改得越激进,训练稳定性就越难保证。

Qwen专门做了一组压力测试,它把学习率直接拉到最优值的4倍


在这种情况下,上一代结构频繁出现Loss Spike,而加入新架构和训练策略之后,模型依然保持稳定。

进一步拆开来看,GR的gate是稳定性提升的重要来源之一。


它让4条Residual分支不再简单地堆叠,而是通过门控控制信息流。

最终的大规模训练过程中,Qwen3.8-Flash-Next没有出现一次Loss Spike,也没有出现异常的Gradient Norm波动。


论文还测试了不同训练策略对最终效果的影响,这里出现了一个很有意思的现象:Loss更低,不一定意味着模型能力更强


比如扩大N-gram Embedding词表之后,预训练Loss会持续下降,但下游任务准确率很快进入平台期。


Residual也出现了类似现象:有些设计在预训练Loss上差别很小,但随着训练继续进行,下游表现却会逐渐拉开。


如果只看前期训练Loss,限制Residual只使用Top-2分支似乎没有太大问题。

但随着训练继续进行,模型表现会逐渐下降。

还有一些设计,在预训练阶段几乎看不出区别,到了更长上下文和生成任务中,差距才真正出现。

所以Qwen这次没有只盯着训练Loss。

它把模型拆开,一个模块一个模块地测试,观察不同设计在训练后期到底能不能继续发挥作用。

而Qwen3.8-Flash-Next原生支持262K上下文,进一步可以扩展到1M,这也是这套架构最现实的价值之一。

04

大模型开始卷单位FLOP

把眼光放到整个行业,Qwen3.8-Flash-Next的发布并不孤立。

此前,DeepSeek-V4系列同样在探索混合注意力与更高效的残差结构:

V4-Flash以284B总参数、13B激活支持百万Token上下文;在1M上下文场景下,V4-Pro的单Token推理FLOPs约为前代的27%。

两家中国团队正在走向一个相似方向:用稀疏MoE降低激活计算,用混合/稀疏注意力控制长上下文成本,再通过新的残差与优化设计提升训练效率和稳定性

Loss, benchmarks, efficiency and stability form one design problem.

这句话出现在论文摘要末尾,也可以看作是对 2026 年下半年开源模型竞赛走向的概括。

开源模型的竞争,正在从转向单位FLOP能产出多少能力。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

放开他让wo来
2026-09-16 00:05:28
中国28岁留学生嫖娼16岁日本女高中生,被抓狡辩:为了学日语!

中国28岁留学生嫖娼16岁日本女高中生,被抓狡辩:为了学日语!

圆圆神神神
2025-08-09 21:49:27
中央广播电视总台发布声明

中央广播电视总台发布声明

吉刻新闻
2026-09-18 00:24:17
多名教师上班10余天离职、因不满一月拿不到工资?涉事中学通报

多名教师上班10余天离职、因不满一月拿不到工资?涉事中学通报

观察者网
2026-09-15 22:37:14
终于等到了!NBA冠军中锋正式表态,加盟广东队成首选?

终于等到了!NBA冠军中锋正式表态,加盟广东队成首选?

绯雨儿
2026-09-18 13:13:38
台湾退役中将帅化民表示,张学良被关一生不能算冤,因为西安事变那一夜,他差点让蒋介石从奉化带来的嫡系护卫全军覆没

台湾退役中将帅化民表示,张学良被关一生不能算冤,因为西安事变那一夜,他差点让蒋介石从奉化带来的嫡系护卫全军覆没

谈史论今1
2026-09-06 20:22:18
足协官方:女足亚冠有一个直接参赛名额,北京京坛女足参赛

足协官方:女足亚冠有一个直接参赛名额,北京京坛女足参赛

懂球帝
2026-09-18 12:17:21
新瓜,孙宇晨彻底吊打景甜!

新瓜,孙宇晨彻底吊打景甜!

财经要参
2026-08-29 07:05:19
18点20分!中国男篮vs日本,最不利消息传来,郭士强进决赛更难了

18点20分!中国男篮vs日本,最不利消息传来,郭士强进决赛更难了

侃球熊弟
2026-09-18 06:10:05
今夜,大逆转!再来一个利好,科技股集体猛涨

今夜,大逆转!再来一个利好,科技股集体猛涨

中国基金报
2026-09-18 01:13:01
美国7年前“6代机技术验证机”,就已首飞?美媒:6代机原型机设计接近完成,2年后首飞

美国7年前“6代机技术验证机”,就已首飞?美媒:6代机原型机设计接近完成,2年后首飞

蓝星杂谈
2026-09-17 07:55:03
方程豹钛6实车曝光!14.98万起配云辇-C+800V+城市NOA?

方程豹钛6实车曝光!14.98万起配云辇-C+800V+城市NOA?

阿芒娱乐说
2026-09-18 01:05:25
重磅:美国众议院通过格雷厄姆对俄制裁法案!加征100%关税

重磅:美国众议院通过格雷厄姆对俄制裁法案!加征100%关税

项鹏飞
2026-09-17 18:44:26
22岁女大学生独登深圳梧桐山,离奇失联,最后一通是求助电话

22岁女大学生独登深圳梧桐山,离奇失联,最后一通是求助电话

猫咪纪实说
2026-09-18 14:11:11
第24位!王钰栋入选国际榜单,想想冯潇霆,也曾是国际14大新星

第24位!王钰栋入选国际榜单,想想冯潇霆,也曾是国际14大新星

汪星人哟
2026-09-18 15:02:43
3.22亿燃油车迎来“终局信号”!不是禁售,是彻底没有未来了?

3.22亿燃油车迎来“终局信号”!不是禁售,是彻底没有未来了?

趣味萌宠的日常
2026-09-18 05:16:51
现场见过张柏芝的人直言:镜头严重拉宽脸型,真人脸小到超出想象

现场见过张柏芝的人直言:镜头严重拉宽脸型,真人脸小到超出想象

迪迪的娱乐故事
2026-08-01 15:27:01
利好来了!十部门联合发布

利好来了!十部门联合发布

证券时报
2026-09-18 10:26:02
人不会无缘无故患高尿酸!发现:得高尿酸的人,大多离不开这4点

人不会无缘无故患高尿酸!发现:得高尿酸的人,大多离不开这4点

健康科普365
2026-09-18 09:08:13
特斯拉无人驾驶出租车亮相北京 博主:外观一眼极简 但确实非常震撼

特斯拉无人驾驶出租车亮相北京 博主:外观一眼极简 但确实非常震撼

快科技
2026-09-18 16:01:01
2026-09-18 16:48:49
智猩猩
智猩猩
AI 技术内容与服务平台
134文章数 6关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

李在明最新表态不会派兵 特朗普曾多次点名韩国要帮助

头条要闻

李在明最新表态不会派兵 特朗普曾多次点名韩国要帮助

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

字节错过千亿盛宴

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

艺术
健康
教育
家居
时尚

艺术要闻

成都第一高楼“砍高度”刷屏,官方:还是489米!

脑动脉瘤的治疗方法,该选哪一种?

教育要闻

秋日农场,赴一场田园劳动之约

家居要闻

2026建博会(广州) 公装联探展交流活动

没想到这件事,对我的改变这么大!

无障碍浏览 进入关怀版