大数跨境

Qwen3.8-Flash架构大改,训练FLOPs仅为上一代1/9!

Qwen3.8-Flash架构大改,训练FLOPs仅为上一代1/9! 智猩猩AI
2026-09-09
3
导读:把更省、更稳、更强当作同一个设计问题~
智猩猩AI整理
编辑:林夕

2026 年 8 月 26 日,Qwen 官方账号在 X 上放出一张蓝色海报:


Qwen3.8-Flash 正式上线,而 Qwen3.8-Flash-Next 的开源权重同步放出。



最近,Qwen团队公开了一篇论文,系统介绍了Qwen3.8-Flash-Next的架构设计、训练效率以及稳定性。



官方把它明确定位为Qwen4 架构的早期预览,上一次被这样提前放出的模型是 Qwen3-Next。


按照官方博客的说法,它当时引入的“Gated DeltaNet + Gated Attention”混合结构,后来贯穿了整个Qwen3.5、Qwen3.6、Qwen3.7 与 Qwen3.8 系列。


如今 Qwen3.8-Flash-Next 承担的角色与此相同,把下一阶段的主力架构先交给社区检验,再在之上搭建完整的Qwen4 家族


官方博客的措辞很直接:提前发布是为了让社区独立评估这套架构,正如当年Qwen3-Next所做的那样。


01

125B参数的“低配”玩法


Qwen3.8-Flash-Next采用的是MoE架构主模型参数125B,但每个Token只激活约6B


它没有继续堆叠全量Attention,而是采用Gated DeltaNet(GDN)与全局Attention混合的架构。


论文里的基础设计是:


3层GDN + 1层全局Attention。



GDN负责把前面的上下文压缩进一个固定大小的递归状态里,从而避免传统Attention随着上下文长度增长而产生巨大的计算和KV Cache成本。



但Qwen也没有完全放弃Attention。


原因很简单,压缩记忆很省,但它无法完全替代直接从历史Token里检索信息。


所以每4层保留一层全局Attention。


论文实验也显示,在选定的9项Benchmark中,GDN Hybrid相较Full Attention有8项领先,相较SWA Hybrid有7项领先,并取得最高平均分



到了继续预训练阶段,Qwen进一步把原来的全局Attention替换成了自己的Qwen Sparse Attention(QSA)



它的核心思路是:不要让Attention把整个上下文的每个Token都完整算一遍


QSA先通过轻量级Indexer在micro-block粒度上筛选重要上下文。


论文称,在1M上下文长度下,QSA在Kernel级别:


  • Prefill速度约是Dense Attention的 7.6倍
  • Decode速度约是Dense Attention的 4.9倍


上下文越来越长,但不能让计算成本也跟着一起膨胀。



Attention之外,Qwen还重新设计了Residual


它把原本单一路径的Residual Stream扩展成 4条分支,再通过element-wise gate控制不同分支的信息如何混合,这套设计被称为Gated Residual(GR)


GR并不只是为了增加模型表达能力。


在后面的稳定性测试中,它也是新架构能够承受更高学习率的重要因素。


另外,Qwen还加入了一层N-gram Embedding


这部分额外增加约51B参数,但Embedding表可以放在Host Memory中,并通过异步预取与模型计算重叠,从而减少对加速器显存的占用。


这样一来,模型可以继续增加参数容量,却不用让这部分参数全部参与每个Token的计算。


最后,训练方法也跟着架构一起调整。


Qwen3.8-Flash-Next采用Muon + AdamW 的混合优化方案,并重新调整了学习率和Batch Size。


论文还发现,使用Batch Size Warmup反而会多消耗约18.8%的优化器Step



02

算力省下来,

能力没有跟着缩水


如果只看模型规模,Qwen3.8-Flash-Next似乎并不算一个特别大的模型


它的主模型参数只有125B,还不到上一代397B-A17B的一半。


但真正决定训练成本的每个Token到底需要算多少,Qwen3.8-Flash-Next每个Token只激活约6B参数。


相比上一代397B-A17B,激活参数降到约1/3,训练Token也降到约1/3,训练FLOPs则进一步降到了约1/9。



参数、Token、FLOPs同时下降,但模型能力并没有同步掉下去。


在14项预训练Benchmark中,新模型有 8项超过上一代,剩余6项的差距也控制在2.6分以内。


03

架构改得越激进,

训练越不能出问题 


省算力只是第一步,对于这种规模的模型来说,架构改得越激进,训练稳定性就越难保证。


Qwen专门做了一组压力测试,它把学习率直接拉到最优值的4倍



在这种情况下,上一代结构频繁出现Loss Spike,而加入新架构和训练策略之后,模型依然保持稳定。


进一步拆开来看,GR的gate是稳定性提升的重要来源之一。



它让4条Residual分支不再简单地堆叠,而是通过门控控制信息流。


最终的大规模训练过程中,Qwen3.8-Flash-Next没有出现一次Loss Spike,也没有出现异常的Gradient Norm波动。



论文还测试了不同训练策略对最终效果的影响,这里出现了一个很有意思的现象:Loss更低,不一定意味着模型能力更强



比如扩大N-gram Embedding词表之后,预训练Loss会持续下降,但下游任务准确率很快进入平台期。



Residual也出现了类似现象:有些设计在预训练Loss上差别很小,但随着训练继续进行,下游表现却会逐渐拉开。



如果只看前期训练Loss,限制Residual只使用Top-2分支似乎没有太大问题。


但随着训练继续进行,模型表现会逐渐下降。


还有一些设计,在预训练阶段几乎看不出区别,到了更长上下文和生成任务中,差距才真正出现。


所以Qwen这次没有只盯着训练Loss。


它把模型拆开,一个模块一个模块地测试,观察不同设计在训练后期到底能不能继续发挥作用。


而Qwen3.8-Flash-Next原生支持 262K上下文,进一步可以扩展到1M,这也是这套架构最现实的价值之一。


04

大模型开始卷单位FLOP


把眼光放到整个行业,Qwen3.8-Flash-Next的发布并不孤立。


此前,DeepSeek-V4系列同样在探索混合注意力与更高效的残差结构:


V4-Flash以284B总参数、13B激活支持百万Token上下文;在1M上下文场景下,V4-Pro的单Token推理FLOPs约为前代的27%。


两家中国团队正在走向一个相似方向:用稀疏MoE降低激活计算,用混合/稀疏注意力控制长上下文成本,再通过新的残差与优化设计提升训练效率和稳定性


Loss, benchmarks, efficiency and stability form one design problem.


这句话出现在论文摘要末尾,也可以看作是对 2026 年下半年开源模型竞赛走向的概括。


开源模型的竞争,正在从转向单位FLOP能产出多少能力


END


关注+星标,获取AI前沿进展与开源一线动态

【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2341
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读2.9k
粉丝0
内容2.3k