网易首页 > 网易号 > 正文 申请入驻

Qwen3.8-Flash架构大改,训练FLOPs仅为上一代1/9!

0
分享至

智猩猩AI整理

编辑:林夕

2026 年 8 月 26 日,Qwen 官方账号在 X 上放出一张蓝色海报:

Qwen3.8-Flash 正式上线,而 Qwen3.8-Flash-Next 的开源权重同步放出。


最近,Qwen团队公开了一篇论文,系统介绍了Qwen3.8-Flash-Next的架构设计、训练效率以及稳定性。


官方把它明确定位为Qwen4 架构的早期预览,上一次被这样提前放出的模型是 Qwen3-Next。

按照官方博客的说法,它当时引入的“Gated DeltaNet + Gated Attention”混合结构,后来贯穿了整个Qwen3.5、Qwen3.6、Qwen3.7 与 Qwen3.8 系列。

如今 Qwen3.8-Flash-Next 承担的角色与此相同,把下一阶段的主力架构先交给社区检验,再在之上搭建完整的Qwen4 家族

官方博客的措辞很直接:提前发布是为了让社区独立评估这套架构,正如当年Qwen3-Next所做的那样。

01

125B参数的“低配”玩法

Qwen3.8-Flash-Next采用的是MoE架构主模型参数125B,但每个Token只激活约6B

它没有继续堆叠全量Attention,而是采用Gated DeltaNet(GDN)与全局Attention混合的架构。

论文里的基础设计是:

3层GDN + 1层全局Attention。


GDN负责把前面的上下文压缩进一个固定大小的递归状态里,从而避免传统Attention随着上下文长度增长而产生巨大的计算和KV Cache成本。


但Qwen也没有完全放弃Attention。

原因很简单,压缩记忆很省,但它无法完全替代直接从历史Token里检索信息。

所以每4层保留一层全局Attention。

论文实验也显示,在选定的9项Benchmark中,GDN Hybrid相较Full Attention有8项领先,相较SWA Hybrid有7项领先,并取得最高平均分


到了继续预训练阶段,Qwen进一步把原来的全局Attention替换成了自己的Qwen Sparse Attention(QSA)


它的核心思路是:不要让Attention把整个上下文的每个Token都完整算一遍

QSA先通过轻量级Indexer在micro-block粒度上筛选重要上下文。

论文称,在1M上下文长度下,QSA在Kernel级别:

  • Prefill速度约是Dense Attention的7.6倍

  • Decode速度约是Dense Attention的4.9倍

上下文越来越长,但不能让计算成本也跟着一起膨胀。


Attention之外,Qwen还重新设计了Residual

它把原本单一路径的Residual Stream扩展成4条分支,再通过element-wise gate控制不同分支的信息如何混合,这套设计被称为Gated Residual(GR)

GR并不只是为了增加模型表达能力。

在后面的稳定性测试中,它也是新架构能够承受更高学习率的重要因素。

另外,Qwen还加入了一层N-gram Embedding

这部分额外增加约51B参数,但Embedding表可以放在Host Memory中,并通过异步预取与模型计算重叠,从而减少对加速器显存的占用。

这样一来,模型可以继续增加参数容量,却不用让这部分参数全部参与每个Token的计算。

最后,训练方法也跟着架构一起调整。

Qwen3.8-Flash-Next采用Muon + AdamW的混合优化方案,并重新调整了学习率和Batch Size。

论文还发现,使用Batch Size Warmup反而会多消耗约18.8%的优化器Step


02

算力省下来,

能力没有跟着缩水

如果只看模型规模,Qwen3.8-Flash-Next似乎并不算一个特别大的模型

它的主模型参数只有125B,还不到上一代397B-A17B的一半。

但真正决定训练成本的每个Token到底需要算多少,Qwen3.8-Flash-Next每个Token只激活约6B参数。

相比上一代397B-A17B,激活参数降到约1/3,训练Token也降到约1/3,训练FLOPs则进一步降到了约1/9。


参数、Token、FLOPs同时下降,但模型能力并没有同步掉下去。

在14项预训练Benchmark中,新模型有8项超过上一代,剩余6项的差距也控制在2.6分以内。

03

架构改得越激进,

训练越不能出问题

省算力只是第一步,对于这种规模的模型来说,架构改得越激进,训练稳定性就越难保证。

Qwen专门做了一组压力测试,它把学习率直接拉到最优值的4倍


在这种情况下,上一代结构频繁出现Loss Spike,而加入新架构和训练策略之后,模型依然保持稳定。

进一步拆开来看,GR的gate是稳定性提升的重要来源之一。


它让4条Residual分支不再简单地堆叠,而是通过门控控制信息流。

最终的大规模训练过程中,Qwen3.8-Flash-Next没有出现一次Loss Spike,也没有出现异常的Gradient Norm波动。


论文还测试了不同训练策略对最终效果的影响,这里出现了一个很有意思的现象:Loss更低,不一定意味着模型能力更强


比如扩大N-gram Embedding词表之后,预训练Loss会持续下降,但下游任务准确率很快进入平台期。


Residual也出现了类似现象:有些设计在预训练Loss上差别很小,但随着训练继续进行,下游表现却会逐渐拉开。


如果只看前期训练Loss,限制Residual只使用Top-2分支似乎没有太大问题。

但随着训练继续进行,模型表现会逐渐下降。

还有一些设计,在预训练阶段几乎看不出区别,到了更长上下文和生成任务中,差距才真正出现。

所以Qwen这次没有只盯着训练Loss。

它把模型拆开,一个模块一个模块地测试,观察不同设计在训练后期到底能不能继续发挥作用。

而Qwen3.8-Flash-Next原生支持262K上下文,进一步可以扩展到1M,这也是这套架构最现实的价值之一。

04

大模型开始卷单位FLOP

把眼光放到整个行业,Qwen3.8-Flash-Next的发布并不孤立。

此前,DeepSeek-V4系列同样在探索混合注意力与更高效的残差结构:

V4-Flash以284B总参数、13B激活支持百万Token上下文;在1M上下文场景下,V4-Pro的单Token推理FLOPs约为前代的27%。

两家中国团队正在走向一个相似方向:用稀疏MoE降低激活计算,用混合/稀疏注意力控制长上下文成本,再通过新的残差与优化设计提升训练效率和稳定性

Loss, benchmarks, efficiency and stability form one design problem.

这句话出现在论文摘要末尾,也可以看作是对 2026 年下半年开源模型竞赛走向的概括。

开源模型的竞争,正在从转向单位FLOP能产出多少能力。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
德约的中网之行:一代王者的难言之隐

德约的中网之行:一代王者的难言之隐

网球之家
2026-09-18 10:32:48
随着日本8-0、朝鲜8-0,亚运女足八强已经诞生6席:5大劲旅在列

随着日本8-0、朝鲜8-0,亚运女足八强已经诞生6席:5大劲旅在列

侧身凌空斩
2026-09-17 20:27:18
平壤十万民众参加反美集会  巨型宣传画格外醒目 场面壮观

平壤十万民众参加反美集会 巨型宣传画格外醒目 场面壮观

那些看得见的老照片
2026-09-14 07:00:26
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
为什么如今大家开始抵触“中式恐怖”?网友:没有对比就没有伤害!

为什么如今大家开始抵触“中式恐怖”?网友:没有对比就没有伤害!

小椰的奶奶
2026-09-12 18:15:02
从乌东八州到四州,再到如今的顿巴斯,俄国要的地盘为何越来越少

从乌东八州到四州,再到如今的顿巴斯,俄国要的地盘为何越来越少

历史摆渡
2026-09-16 16:23:35
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
【油价大跌】“3个月降超1.34元/升”的油价,已“大涨4次”,下周(9月24日)油价或“再涨近5毛/升”

【油价大跌】“3个月降超1.34元/升”的油价,已“大涨4次”,下周(9月24日)油价或“再涨近5毛/升”

油价早知道
2026-09-18 09:12:28
杰克逊:麦迪别总是如果论了,当年给了你姚明你还是不行啊

杰克逊:麦迪别总是如果论了,当年给了你姚明你还是不行啊

林子说事
2026-09-18 04:17:06
国家广播电视总局:将机顶盒功能以软件形态内置于电视机,一台电视即可畅享直播等全类型电视业务

国家广播电视总局:将机顶盒功能以软件形态内置于电视机,一台电视即可畅享直播等全类型电视业务

每日经济新闻
2026-09-17 14:39:06
王小丫参加敬一丹遗体告别仪式

王小丫参加敬一丹遗体告别仪式

晓今娱
2026-09-18 11:12:46
不查不知道!原来他也现身敬一丹葬礼,文艺圈大佬,老婆赫赫有名

不查不知道!原来他也现身敬一丹葬礼,文艺圈大佬,老婆赫赫有名

小椰的奶奶
2026-09-18 01:42:16
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
住房城乡建设部:住建事业“十五五”时期面临新形势

住房城乡建设部:住建事业“十五五”时期面临新形势

界面新闻
2026-09-18 10:09:37
敬一丹遗体已火化!女儿和丈夫迟迟不肯离开,父女俩合照让人泪目

敬一丹遗体已火化!女儿和丈夫迟迟不肯离开,父女俩合照让人泪目

凡知
2026-09-18 11:48:16
读懂山姆35城购物车,看清中产消费真相

读懂山姆35城购物车,看清中产消费真相

肖明超趋势观察
2026-09-17 20:28:35
《兰香如故》:直到袁绍辉抬妾进门那一刻才看透凉薄,原来林绣茹早赢了个彻底

《兰香如故》:直到袁绍辉抬妾进门那一刻才看透凉薄,原来林绣茹早赢了个彻底

喜欢历史的阿繁
2026-09-18 09:27:23
55岁港星王贤志欠债跑路到国外,家里有30亿也扛不住,妹妹宣布划清界限

55岁港星王贤志欠债跑路到国外,家里有30亿也扛不住,妹妹宣布划清界限

开开森森
2026-09-17 07:40:02
一家已经消失的手机品牌,做出了史上最好的安卓机

一家已经消失的手机品牌,做出了史上最好的安卓机

灰度测试中
2026-09-17 00:10:07
敬一丹追悼会,哭的最伤心的不是丈夫,不是女儿,而是颤抖的她

敬一丹追悼会,哭的最伤心的不是丈夫,不是女儿,而是颤抖的她

青梅侃史啊
2026-09-18 07:10:50
2026-09-18 12:43:00
智猩猩
智猩猩
AI 技术内容与服务平台
133文章数 6关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

特朗普考虑大规模打击伊朗 媒体:美大致有两种选择

头条要闻

特朗普考虑大规模打击伊朗 媒体:美大致有两种选择

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

本地
房产
教育
健康
艺术

本地新闻

不止胖东来!许昌藏着半部三国史

房产要闻

突发!三亚安居房出台新政!

教育要闻

英国文化教育协会发布BC雅思官方模考系统

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

艺术要闻

韦启美 81岁时画的这幅瓶花,28.75万!

无障碍浏览 进入关怀版