论文

Qwen3.8-Next架构设计:评估、效率、训练稳定性

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

模型架构混合架构

摘要

我们描述了 Qwen3.8-Flash-Next 的架构和消融,这是一个稀疏专家混合模型,具有 125B 个参数,每个词元激活 6B 个参数,以及阻止加速器的 n-gram 嵌入表的附加 51B 个参数。在 14 个 预训练 基准测试中,该模型在 8 个基准上领先 397B-A17B 前身,在其余基准上最多落后 2.6 个点,激活参数为 1/3,训练词元为 1/3,训练 FLOP 大约为 1/9。词元混合使用门控 DeltaNet (GDN) 和全局注意力的分层混合,每四个层中有一个全注意力层;在持续预训练时,这些全注意力层被 Qwen Sparse Attention (QSA) 取代,它使用压缩的轻量级索引器以微块粒度对上下文进行评分。残差流被扩展为四个分支并通过元素门读取,我们将这种设计称为门控残差(GR)。通过单个 n-gram 嵌入层在主干网外部添加容量,该嵌入层的表是从主机内存中预取的。我们沿着三个轴评估每个候选者的变化:损失以及下游基准;训练、预填充和解码方面的变更成本;及其对最佳超参数和训练稳定性的影响。损失和下游准确度并不总是一起变化:扩大 n-gram 词汇量会单调降低损失,而下游准确度会饱和。该架构和 Muon 优化器共同提高了最佳学习率和批量大小,使得批量大小预热变得不必要,并显着提高了压力测试下的稳定性。损失、基准、效率和稳定性构成了一个设计问题。通过共同解决,它们产生了一种更高效、更强大、更稳定的配方。