On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

发表时间: 2026-08 · Tech report by Qwen Team (github.com/QwenLM)

原文: https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

Qwen Team

速读

一句话结论 Qwen 团队提出了 125B 参数的稀疏混合专家模型 Qwen3.8-Flash-Next,通过引入混合注意力、门控残差流和 N-gram 嵌入,在仅消耗前代 397B 模型九分之一训练算力的情况下,实现了持平甚至超越前代的各项评测性能。

要解决什么问题 原有的大模型架构在扩展时面临三个核心卡点。首先是注意力机制的效率与长上下文建模的矛盾:全局注意力计算量随序列长度呈平方级增长,而滑动窗口等局部注意力又会导致模型丢失对全局内容的直接检索能力。其次是残差流的信号衰减问题:所有网络层都在同一个残差流上进行读写,导致早期层写入的特征必须与后续所有层的信息竞争,深层网络难以有效获取早期信息。最后是超大规模训练下的稳定性危机:当模型规模和学习率增大时,极易出现梯度范数爆炸和损失值突刺,而常规的激活值截断手段往往治标不治本。此外,如何在不增加单次 Token 计算延迟的前提下,继续扩大模型的参数容量,也是原有架构难以绕开的瓶颈。

怎么做的 核心思路是通过架构解耦,分别针对计算、显存带宽、容量和优化器进行针对性改造。第一,在 Token 混合层,采用 Gated DeltaNet (GDN) 与全局注意力交替的混合架构(每四层中三层 GDN、一层全局注意力)。GDN 是一种线性代价的循环网络,通过数据依赖的衰减门和写入门将前缀压缩为固定大小的隐状态,解决计算开销;而周期性的全局注意力保留了精准的 Token 级检索能力。在长文本继续预训练阶段,全局注意力被替换为 Qwen Sparse Attention (QSA)。QSA 引入了一个轻量级索引器,将键值序列按微块进行压缩,在微块粒度上评估上下文重要性并仅计算得分最高的块,从而将索引成本从 $O(n^2)$ 降至 $O(n^2/r)$($r$ 为压缩率)。第二,设计了门控残差(GR)机制来拓宽残差流。将单一残差流扩展为 $n_r$ 个并行的分支(本文设为 4),为网络增加容量。为了控制显存带宽开销,GR 舍弃了分支间的混合操作,支持 FP8 存储,并让每个网络块通过逐元素门控从所有分支中读取信息:

$$ \pmb{x} = \frac{1}{n_r} \sum_{i=1}^{n_r} G_i \odot \widehat{\pmb{R}}_i $$

其中 $\widehat{\pmb{R}}_i$ 是独立归一化后的分支,$G_i$ 是数据依赖的门控权重。网络块的输出 $\pmb{y}$ 则通过标量权重 $s_i$ 写入各个分支:

$$ \pmb{R}'_i = \pmb{R}_i + s_i \pmb{y} $$
这种设计不仅让早期层的信息能通过特定分支直达深层,其自带的门控归一化还起到了平滑激活值的作用。第三,在骨干网络之外的第二层引入了单一的 N-gram 嵌入层。它根据局部上下文而非单个 Token 进行查表,并将这部分高达 51B 的参数存放在加速器外部的主机内存中进行异步预取,在几乎不增加计算量的情况下大幅提升了模型容量。第四,在优化层面,对二维线性映射权重使用 Muon 优化器,并在正交化前将拼接的参数矩阵拆分,避免不相关子块的奇异方向混合。同时,基于新架构重新拟合了缩放定律,去除了不必要的批次大小预热阶段,直接采用更大的目标批次大小和学习率。

效果如何 实验基于 125B 总参数(每个 Token 激活 6B,外加 51B N-gram 嵌入)的模型规模展开。对比基线为同系列的 Qwen3.8-27B-Base(代表小规模基线)以及上一代旗舰 Qwen3.7-Plus-Base(代表 397B 大规模路线)。在包含 MMLU、MATH、EvalPlus 等 14 个预训练基准测试中,新模型在 8 个任务上超越了 397B 前代模型,在其余 6 个任务上最多落后 2.6 分。达成这一结果仅消耗了前代模型三分之一的激活参数、三分之一的训练数据量以及约九分之一的训练算力。在推理效率上,在 1M 上下文长度下,QSA 在内核层面比稠密注意力在 Prefill 阶段快 7.6 倍,在 Decode 阶段快 4.9 倍。在训练稳定性上,通过在 4 倍最优学习率下进行压力测试,传统的 AdamW 优化器路线频繁出现损失突刺并持续触发梯度截断,而采用门控残差与 Muon 优化器的新架构全程保持稳定,零突刺且未触发截断。作者也坦承了部分设计的局限性:损失值下降与下游任务准确率并不总是正相关,例如无脑扩大 N-gram 词表虽能持续降低损失,但下游准确率会很快饱和;此外,为了进一步降低显存带宽而尝试的稀疏残差读取机制,虽然在预训练时表现正常,但在后训练阶段会导致生成质量明显下降,最终未被采纳。

主要贡献

本文介绍了拥有1250亿参数(每token激活60亿参数)的稀疏混合专家(MoE)模型 Qwen3.8-Flash-Next 的架构和消融实验,该模型还在加速器外保留了510亿参数的n-gram嵌入表。设计的核心目标是在大幅削减计算预算的情况下,保持上一代397B-A17B旗舰模型的能力。在涵盖知识、STEM、推理、编码和多语言能力的14个预训练基准测试中,该模型在8个基准上领先其前代模型,在其余6个基准上最多落后2.6分。而实现这一性能仅使用了约三分之一的激活参数、三分之一的训练token和约九分之一的训练FLOPs。

在架构创新上,本文提出了四个核心组件来解决不同的瓶颈:
1. 混合Token混合机制:按层混合使用门控增量网络(Gated DeltaNet, GDN)和全局注意力机制,每四层中包含一层全注意力层。
2. Qwen稀疏注意力(QSA):在持续预训练阶段,全注意力层被QSA取代。QSA通过压缩的轻量级索引器在微块(micro-block)粒度上对上下文进行评分,使索引成本随序列长度下降。
3. 门控残差(Gated Residual, GR):将残差流拓宽至四个分支,并通过逐元素门控进行读取,该设计不仅增加了残差路径的容量,还提供了保持训练稳定的重缩放机制。
4. N-gram嵌入层:在主干网络外部通过单一的n-gram嵌入层增加模型容量,其表从主机内存中预取。

此外,本文将损失、基准测试、效率和稳定性作为一个联合设计问题进行解决。架构与Muon优化器的结合使最优学习率和批量大小向上偏移,无需进行批量大小预热,并在压力测试下大幅提高了训练稳定性。

图1:Qwen3.8-Flash-Next架构。Token混合在每四个块中交替使用三个GDN层和一个QSA层。每个子层通过GR进行读写,GR拓宽了残差流并对读取进行逐元素门控。第2层的n-gram嵌入层通过主机内存预取在加速器外扩展容量。MTP模块在推测解码步骤中复用QSA索引。
图1:Qwen3.8-Flash-Next架构。Token混合在每四个块中交替使用三个GDN层和一个QSA层。每个子层通过GR进行读写,GR拓宽了残差流并对读取进行逐元素门控。第2层的n-gram嵌入层通过主机内存预取在加速器外扩展容量。MTP模块在推测解码步骤中复用QSA索引。

背景知识与设计原则

架构变更会同时影响三个方面:模型在下游任务上的能力、训练和服务的成本,以及训练过程在规模化时是否保持最优和稳定。因此,本文沿三个维度评估每个候选变更:损失与下游基准测试;在训练、预填充和解码中的成本;及其对最优超参数和训练稳定性的影响。

评估维度的分歧:损失和下游准确率并不总是同步移动。例如,扩大n-gram词表会使损失单调下降,但下游准确率却会饱和;根据残差状态预测残差读写权重仅带来微小的损失降低,但基准测试增益明显。另外,取消全注意力层的位置编码在预训练期间无法区分,但会影响后期的生成质量。

效率维度的考量:在训练中,FlashQLA内核在GPU上实现了显著的前向和后向加速。Muon优化器引入了自身的工程成本(其FLOPs依赖于矩阵形状),因此需要重新划分数据并行梯度缓冲区,并通过CUDA图捕获步骤。在推理阶段,预填充受制于全上下文注意力(通过QSA压缩键序列解决),而解码受制于内存流量(通过GDN固定状态、GR丢弃分支混合操作以及FP8存储解决)。

优化维度的转变:Muon优化器应用于作为线性映射的二维权重,而输入、n-gram嵌入、输出头、MoE路由器等保持使用AdamW。融合参数在正交化前被拆分。新架构和优化器改变了最优超参数,预测出更大的批量大小和学习率,且证明了批量大小预热是不必要的。

方法细节

注意力机制

GDN混合架构

动机: 全自注意力机制能够提供对前面所有token的基于内容的直接访问,但其token混合成本随序列长度呈二次增长,且其键值(KV)缓存在自回归生成期间呈线性增长【引用1,Attention is all you need+2017+NeurIPS】。滑动窗口注意力(SWA)用有界的局部感受野取代了全局访问,减少了计算和缓存消耗,但窗口外的信息只能通过深度间接传播。这在高效局部处理和持久的内容依赖记忆之间产生了矛盾。为了解决这一矛盾,模型采用了门控增量网络(GDN)【引用2,Gated delta networks: Improving mamba2 with delta rule+2024+arXiv】和全局注意力的按层混合设计。GDN将前缀压缩为固定大小的循环状态并根据当前内容更新该状态,而交错的全局注意力层保留了任何有限状态循环记忆都难以精确重现的直接token级检索。

门控增量循环机制: 线性注意力可以被解释为一种快速权重记忆,它将键值关联存储在矩阵状态中【引用3,Linear transformers are secretly fast weight programmers+2021+ICML】。对于每个注意力头,设 $\mathbf{q}_t, \mathbf{k}_t \in \mathbb{R}^{d_k}$ 且 $\mathbf{v}_t \in \mathbb{R}^{d_v}$。遵循实现惯例,GDN维护一个状态 $\mathbf{S}_t \in \mathbb{R}^{d_k \times d_v}$,并应用门控增量规则:

$$\begin{aligned} \begin{array}{rl} & \widetilde{\mathbf{S}}_{t-1} = \alpha_t \mathbf{S}_{t-1}, \\ & \mathbf{e}_t = \mathbf{v}_t - \widetilde{\mathbf{S}}_{t-1}^\top \mathbf{k}_t, \\ & \mathbf{S}_t = \widetilde{\mathbf{S}}_{t-1} + \beta_t \mathbf{k}_t \mathbf{e}_t^\top, \\ & \mathbf{y}_t = \mathbf{S}_t^\top \mathbf{q}_t, \end{array} \end{aligned}$$


其中 $\alpha_t \in (0, 1)$ 是依赖数据的衰减项,$\beta_t \in (0, 1)$ 控制增量更新。等价地:

$$ \mathbf{S}_t = \alpha_t \left( \mathbf{I} - \beta_t \mathbf{k}_t \mathbf{k}_t^\top \right) \mathbf{S}_{t-1} + \beta_t \mathbf{k}_t \mathbf{v}_t^\top. $$
这两个门控发挥互补作用:衰减 $\alpha_t$ 全局控制现有状态的生命周期,而增量项首先估计已经与 $\mathbf{k}_t$ 关联的值,并仅写入残差误差。因此,重复或相似的键会更新现有关联,而不是累积无界的的外积。

GDN参数化: 给定归一化后的残差流输入 $\mathbf{x}_t \in \mathbb{R}^d$,GDN使用学习到的投影和随后的短深度因果卷积来计算内容特征:

$$\begin{aligned} \begin{array}{rl} & \mathbf{q}_t = \mathrm{L2Norm} \left( \mathrm{SiLU} \left( \mathrm{ShortConv} (\mathbf{W}_q \mathbf{x}_t) \right) \right), \\ & \mathbf{k}_t = \mathrm{L2Norm} \left( \mathrm{SiLU} \left( \mathrm{ShortConv} (\mathbf{W}_k \mathbf{x}_t) \right) \right), \\ & \mathbf{v}_t = \mathrm{SiLU} \left( \mathrm{ShortConv} \left( \mathbf{W}_v \mathbf{x}_t \right) \right). \end{array} \end{aligned}$$


短卷积在信息被压缩到循环状态之前提供了显式的局部归纳偏置。L2归一化限制了 $\Delta q/k$ 的幅度并稳定了秩一增量转换。写入强度和衰减参数化为:

$$\begin{aligned} \begin{array}{rl} & \beta_t = \sigma (\mathbf{W}_\beta \mathbf{x}_t), \\ & \alpha_t = \exp \left[ - \exp (\mathbf{A}) \mathrm{softplus} \big (\mathbf{W}_\alpha \mathbf{x}_t + \mathbf{b}_\alpha \big ) \right]. \end{array} \end{aligned}$$
在跨头独立应用循环机制后,头部输出被归一化并由依赖于输入的输出门进行调制:
$$ \mathbf{o}_t = \mathbf{W}_o \left[ \sigma \left( \mathbf{W}_z \mathbf{x}_t \right) \odot \mathrm{RMSNorm} (\mathbf{y}_t) \right]. $$
与使用SiLU输出门的原始GDN不同,这里使用了有界的sigmoid门,并采用以零为中心的RMSNorm来约束权重的增长。在模型级别,混合架构在全注意力层保留了旋转位置嵌入(RoPE)【引用4,Roformer: Enhanced transformer with rotary position embedding+2024+Neurocomputing】。每四层放置一个全注意力层,其余三层使用GDN。

图2:Gated DeltaNet token混合器。投影的查询、键和值流经过短因果卷积;查询和键在门控增量递归之前进行L2归一化。衰减门$\alpha_t$和写入门$\beta_t$控制递归更新,而sigmoid输出门调节以零为中心的RMS归一化输出。
图2:Gated DeltaNet token混合器。投影的查询、键和值流经过短因果卷积;查询和键在门控增量递归之前进行L2归一化。衰减门$\alpha_t$和写入门$\beta_t$控制递归更新,而sigmoid输出门调节以零为中心的RMS归一化输出。

内核效率与架构消融: 通过FlashQLA内核库优化GDN,在NVIDIA GPU上实现了比FLA Triton内核【引用5,FLA: A triton-based library...+2024+URL】$2-3\times$ 的前向加速和约 $2\times$ 的后向加速。消融实验表明,GDN混合架构在9个基准测试中的8个优于全注意力Transformer,在7个基准上超过了SWA混合架构。

Qwen稀疏注意力 (QSA)

动机: 稀疏注意力通过选择性关注重要上下文来缓解长上下文场景下softmax注意力的二次计算瓶颈。DSA【引用6,Deepseek-v3.2+2025+arXiv】使用了轻量级索引器生成token级稀疏掩码,但随序列长度增加,$O(n^2)$ 的索引开销仍然不可忽视。为此,模型采用了Qwen稀疏注意力(QSA),其轻量级索引器在微块(micro-block)粒度上压缩序列并估计重要性,从而降低长输入的索引开销。

图3:Qwen稀疏注意力(QSA)概述。QSA索引器(左)使用压缩的因果注意力掩码对键块进行评分并选择前$k$个索引。这些索引被扩展为微块稀疏注意力掩码,用于稀疏核心注意力(右)。
图3:Qwen稀疏注意力(QSA)概述。QSA索引器(左)使用压缩的因果注意力掩码对键块进行评分并选择前$k$个索引。这些索引被扩展为微块稀疏注意力掩码,用于稀疏核心注意力(右)。

压缩的轻量级索引器: 给定输入隐藏状态 $\mathbf{x}_i$,索引器采用具有 $H$ 个查询头和1个共享键头的MQA【引用7,Fast transformer decoding: One write-head is all you need+2019+arXiv】结构。首先应用独立的轻量级投影:

$$ \widehat{\mathbf{q}}_i^h = \mathrm{RMSNorm} (\mathbf{W}_Q^h \mathbf{x}_i), \qquad \mathbf{k}_i = \mathbf{W}_K \mathbf{x}_i. $$


为了减少序列长度,键被划分为不重叠的 $r$ 个token的块,并通过平均池化进行压缩。设块 $b$ 的起始位置为 $p_b = b \cdot r$,对应的压缩键为:

$$ \widehat{\mathbf{k}}_b = \mathrm{RMSNorm} \left( \mathrm{AvgPool} (\mathbf{k}_{p_b:p_b+r-1}) \right), \qquad 0 \leq b < \left\lfloor \frac{n}{r} \right\rfloor. $$
索引器应用部分RoPE(应用于128维中的64维)。关键的是,键压缩在位置编码之前进行,避免了平均具有不同旋转相位的token表示。每个查询保留其token位置 $i$,而每个压缩键被分配其块的起始位置 $p_b$:
$$ \mathbf{q}_i^h = \mathrm{PRoPE} (\widehat{\mathbf{q}}_i^h, i), \qquad \bar{\mathbf{k}}_b = \mathrm{PRoPE} (\widehat{\mathbf{k}}_b, p_b). $$
块级重要性分数 $I$ 通过块因果评分获得,对查询 $i$ 和压缩块 $b$,对所有索引器头的ReLU激活的查询-键相似度求和:
$$\begin{aligned} I_{ib} = \left\{ \begin{array}{ll} \sum_{h=1}^H \mathrm{ReLU} \left( \mathbf{q}_i^h, \bar{\mathbf{k}}_b \right), & p_b + r - 1 \le i, \\ -\infty, & \mathrm{otherwise}, \end{array} \right. \end{aligned}$$
给定token预算 $K$,每个查询选择得分最高的压缩块,块预算为 $K_B = \lceil K/r \rceil$:
$$ \beta_i = \mathrm{TopK}_{K_B} \left( \{I_{ib}\}_b \right), \qquad K_B = \left\lceil \frac{K}{r} \right\rceil. $$
选定的块被扩展回原始token索引。

训练细节: QSA在持续预训练(CPT)阶段引入。阶段1是密集蒸馏,将主干的全序列注意力分布蒸馏到索引器中。教师分布通过最大池化【引用8,Seerattention...+2024+arXiv;引用9,Proxyattn...+2026+ICLR】与块级索引器分数对齐,以保留显著的token级信号。归一化后的教师分数通过最小化KL散度蒸馏到索引器中。阶段2是稀疏训练,整个主干在索引器的指导下进行训练以适应稀疏注意力模式。QSA选择前 $K_B$ 个块并扩展为token索引,结合最后一个不完整块的尾部token进行核心注意力计算。

图4:使用和不使用QSA的训练语言模型损失。曲线采用200步移动平均进行平滑。阴影区域标记了持续预训练的最后阶段,插图显示了该区域内QSA与全注意力基线之间的每步损失差异。
图4:使用和不使用QSA的训练语言模型损失。曲线采用200步移动平均进行平滑。阴影区域标记了持续预训练的最后阶段,插图显示了该区域内QSA与全注意力基线之间的每步损失差异。

实现与评估: 主干和MTP模块中的所有全注意力层都被QSA替换。索引器采用4个查询头和1个共享键头,预算 $K=2048$,压缩比 $r=4$。评估表明,QSA在短上下文基准上保持了通用能力,并在长上下文(如RULER【引用10,Ruler: What's the real context size...+2024+arXiv】和MRCR【引用11,OpenAI MRCR+2025+Dataset】)上随着上下文增长表现更好。此外,在推测解码中复用QSA索引并未影响MTP性能【引用12,Glm-5...+2026+URL】。

图5:QSA在RULER上的架构消融。(a)不同微块大小的QSA性能;“Keep $x$”表示保留用于计算的IndexShare索引器层数。(b)密集蒸馏和稀疏训练后不同数量索引器查询头的性能。
图5:QSA在RULER上的架构消融。(a)不同微块大小的QSA性能;“Keep $x$”表示保留用于计算的IndexShare索引器层数。(b)密集蒸馏和稀疏训练后不同数量索引器查询头的性能。
图6:QSA在预填充和解码过程中跨上下文长度的内核级延迟。图(a,b)比较了不同压缩比下的索引器延迟,而图(c,d)比较了密集GQA和QSA之间的内核级注意力延迟,包括索引器和稀疏核心注意力。分块预填充使用批大小为1的16K token块;解码使用批大小4和next-n=4,对应三个MTP预测步骤。箭头指示上下文长度为1M时的加速比。
图6:QSA在预填充和解码过程中跨上下文长度的内核级延迟。图(a,b)比较了不同压缩比下的索引器延迟,而图(c,d)比较了密集GQA和QSA之间的内核级注意力延迟,包括索引器和稀疏核心注意力。分块预填充使用批大小为1的16K token块;解码使用批大小4和next-n=4,对应三个MTP预测步骤。箭头指示上下文长度为1M时的加速比。

残差设计

动机: 残差连接为每个块提供了通向网络输出的直接路径【引用13,Deep residual learning...+2016+CVPR】。预归一化(Pre-normalization)能在规模化时保持训练稳定【引用14,On layer normalization...+2020+ICML】,但它会衰减每一层接收到的信号:所有块读取同一个流,早期写入的特征必须与后续写入的所有内容竞争。现有研究通过增加绕过瓶颈的路径来解决此问题,包括密集层间连接【引用15,Densely connected convolutional networks+2017+CVPR】、注意力值的额外残差路径【引用16,Value residual learning+2024+arXiv】以及缓存状态的跨层复用【引用17,You only cache once...+2024+arXiv】。直接修改残差路径的工作分为两类:一是增加读写的表达能力【引用18,Highway networks+2015+arXiv】,二是拓宽流本身(如AltUp【引用19,Alternating updates...+2023+arXiv】和超连接HC【引用20,Hyper-connections+2024+arXiv】)。这两者是互补的:拓宽增加容量,而更丰富的读/写机制决定如何使用这些容量。

拓宽残差流与超连接 (HC): 采用简化版的AltUp,块 $\ell$ 之前的残差状态是 $n_r$ 个分支的集合 $\mathbf{R}^{(\ell)} \in \mathbb{R}^{n_r \times d}$。HC泛化了这一概念,引入了三个可学习算子:读取算子 $\mathbf{H}_{\mathrm{mix}}$、写入算子 $\mathbf{H}_{\mathrm{combine}}$ 和混合算子 $\mathbf{H}_{\mathrm{res}}$:

$$\begin{aligned} \begin{array}{r} \mathbf{x}^{(\ell)} = \mathbf{H}_{\mathrm{mix}}^\top \mathbf{R}^{(\ell)}, \qquad \\ \mathbf{y}^{(\ell)} = \mathcal{F}^{(\ell)} \left( \mathrm{Norm} \left( \mathbf{x}^{(\ell)} \right) \right), \qquad \\ \mathbf{R}^{(\ell+1)} = \mathbf{H}_{\mathrm{res}} \mathbf{R}^{(\ell)} + \mathbf{H}_{\mathrm{combine}} \mathbf{y}^{(\ell)\top}, \end{array} \end{aligned}$$


每个算子都是静态项和数据依赖项的总和:

$$\begin{aligned} \begin{array}{rl} & \mathbf{H}_{\mathrm{mix}} = \mathbf{H}_{\mathrm{mix}}^{\mathrm{s}} + \lambda_m \odot \phi \left( \overline{\mathbf{R}} \mathbf{W}_m \right), \\ & \mathbf{H}_{\mathrm{combine}} = \mathbf{H}_{\mathrm{combine}}^{\mathrm{s}} + \lambda_c \odot \phi \left( \overline{\mathbf{R}} \mathbf{W}_c \right), \\ & \mathbf{H}_{\mathrm{res}} = \mathbf{H}_{\mathrm{res}}^{\mathrm{s}} + \lambda_r \odot \phi \left( \overline{\mathbf{R}} \mathbf{W}_r \right), \end{array} \end{aligned}$$
其中 $\overline{\mathbf{R}}$ 是分支的归一化视图。mHC【引用21,mhc: Manifoldconstrained hyper-connections+2025+arXiv】使用sigmoid并将 $\mathbf{H}_{\mathrm{res}}$ 约束为双随机矩阵。

设计消融与门控残差 (GR): 基于消融实验,形成了最终设计:1) 使用有界的正向门控(sigmoid优于tanh)。2) 数据依赖性:使读取和写入依赖数据比静态变体带来更大的基准测试增益,且读取粒度比写入更重要。3) 预测算子时应读取所有分支并独立归一化。4) 混合算子 $\mathbf{H}_{\mathrm{res}}$ 作用甚微。
门控残差(GR)将拓宽的流与GatedNorm结合。GR首先独立归一化每个分支:

$$ \widehat{\mathbf{R}}_i = \mathrm{RMSNorm} \left( \mathbf{R}_i ; \gamma_i \right), \qquad i = 1, \ldots, n_r, $$


然后根据所有分支预测每个分支和通道的逐元素门控分数,并将门控后的分支平均作为块输入:

$$\begin{aligned} \begin{array}{rl} & \mathbf{G} = \mathrm{unvec} \ \sigma \left( \mathbf{W}_u \mathrm{SiLU} \left( \frac{1}{n_r} \mathbf{W}_d \mathrm{vec} (\widehat{\mathbf{R}}) \right) \right) \in \mathbb{R}^{n_r \times d}, \\ & \mathbf{x} = \frac{1}{n_r} \sum_{i=1}^{n_r} \mathbf{G}_i \odot \widehat{\mathbf{R}}_i, \end{array} \end{aligned}$$
块输出 $\mathbf{y} = \mathcal{F}(\mathbf{x})$ 通过每个分支一个依赖数据的标量写入每个分支:
$$\begin{aligned} \begin{array}{rl} & \mathbf{s} = 2 \sigma \left( \frac{1}{n_r} \mathbf{W}_w \mathrm{vec} (\widehat{\mathbf{R}}) \right) \in \mathbb{R}^{n_r}, \\ & \mathbf{R}_i^\prime = \mathbf{R}_i + s_i \mathbf{y}, \end{array} \end{aligned}$$
GR使用 $n_r = 4$ 个分支。与HC/mHC和VWN【引用22,Virtual width networks+2025+arXiv】不同,GR将表达能力集中在读取上:门控是逐元素的,且完全放弃了 $\mathbf{H}_{\mathrm{res}}$,这不仅消除了每个块对整个残差状态的读取(推理成本的主要来源),还去除了潜在的不稳定源。GR还取代了块的预归一化。与注意力残差(AttnRes)【引用23,Attention residuals+2026+arXiv】相比,GR在性能上与最强的Full AttnRes相当,但计算成本更低。

分支的作用分析: 通过分解每个块的读取贡献,发现拓宽的流被用于特定路径:一个分支在许多层中保留了早期的注意力输出(长程路径),而其他三个分支保持局部作用。长程路径主要保留第0层的信息,并将其传递给后续的softmax注意力层,表明全局注意力是整合显式长程历史上下文的关键枢纽。

图7:GR添加的跨层路径。每一行对应一个残差分支;连接从写入该分支的子层延伸到读取该分支的后续子层。垂直位置编码跳过的层数;线条宽度和不透明度编码$\Delta_{uv}$(公式37),即与单个残差流相比,该写入器提供的读取器输入的额外份额。阴影区域表示softmax注意力层,在这种混合架构中每四层出现一次;其余为GDN,子层相应命名。读取器在softmax注意力子层处被命名,这也是长程路径落脚的地方。一个分支承载长程路径($b_0$上的所有连接源于第0层并落在第10层之后),而其他三个分支保持局部(中位数跳跃1.2-3.5层)。额外宽度被用于少数特定路径,主要是在深度上保留早期GDN输出并将其传递给softmax注意力层。
图7:GR添加的跨层路径。每一行对应一个残差分支;连接从写入该分支的子层延伸到读取该分支的后续子层。垂直位置编码跳过的层数;线条宽度和不透明度编码$\Delta_{uv}$(公式37),即与单个残差流相比,该写入器提供的读取器输入的额外份额。阴影区域表示softmax注意力层,在这种混合架构中每四层出现一次;其余为GDN,子层相应命名。读取器在softmax注意力子层处被命名,这也是长程路径落脚的地方。一个分支承载长程路径($b_0$上的所有连接源于第0层并落在第10层之后),而其他三个分支保持局部(中位数跳跃1.2-3.5层)。额外宽度被用于少数特定路径,主要是在深度上保留早期GDN输出并将其传递给softmax注意力层。

推理效率: GR的推理成本主要由拓宽残差状态的内存流量主导。尝试稀疏读取(仅读取门控值最高的两个分支)会导致后训练质量下降【引用24,xhc: Expanded hyper-connections+2026+arXiv】。最终通过将残差状态保持在FP8格式中,在几乎不损失质量的情况下将内存流量减半。

N-gram嵌入

动机: 基于嵌入的记忆为扩展模型容量提供了补充维度【引用25,Gemma 3n model overview+2025】。N-gram嵌入进一步将单字查找泛化为基于局部上下文的记忆检索【引用26,Conditional memory via scalable lookup...+2026+ACL】。短n-gram作为键检索嵌入表,增强相应的token表示,几乎不增加每token的FLOPs,且确定性寻址允许主机内存卸载和异步预取。

层位置与词表大小: 消融实验表明,单层N-gram嵌入已足够,分布在多层并未带来一致的好处。模型将其放置在第2层,允许主机内存预取与第一层的计算重叠。在固定参数预算下扩展N-gram词表(相应减少MoE专家)并未在下游任务中显示出明显改进;但在额外参数预算下扩展词表(从20V扩展到200V)时,损失单调下降,且在某些基准(特别是中文基准如C-Eval和CMMLU)上性能持续提升。


优化与训练稳定性(补充细节)

优化器

动机与正交化: 模型使用Muon优化器【引用27,Muon: An optimizer for hidden layers...+2024+Blog】计算矩阵参数的更新方向,通过Newton-Schulz (NS) 迭代对动量进行正交化。NS迭代应用了Nesterov加速动量,并采用Polar Express方法【引用28,The polar express...+2025+arXiv】的每步系数调度(设置为8步),以提供更准确的正交化并减少梯度范数尖峰。

参数选择与拆分: Muon应用于真正作为线性映射的二维权重(注意力投影、GDN投影、MoE的fc1/fc2等)。输入/输出嵌入、MoE路由器和GR低秩投影保持使用AdamW。为了避免在正交化过程中混合不相关的奇异方向,融合参数(如qkv投影、SwiGLU的fc1【引用29,Megatron-lm...+2019+arXiv】)在正交化前被拆分为子矩阵独立运行NS。

实现机制: 为了解决NS迭代在分布式训练中的负载不平衡问题,开发了Canzona框架【引用30,Canzona: A unified, asynchronous...+2026+arXiv】,将逻辑优化器分配与物理参数布局解耦,通过静态分区器均衡DP秩间的NS FLOPs,并通过异步微组流水线重构矩阵。此外,通过CUDA图捕获整个步骤以消除小内核的启动开销。

超参数缩放

动机: 新架构和优化器改变了最优超参数,因此重新拟合了Qwen3.5系列【引用31,Qwen3.5: Towards native multimodal agents+2026+URL】使用的缩放定律【引用32,Scaling laws for neural language models+2020+arXiv】。新定律预测出更大的批量大小和学习率。

批量大小与预热: 在4T token预算的测试中,预测的最优批量大小(25.2M)相比之前的配方(12.6M)显著改善了损失。更重要的是,实验表明批量大小预热是不必要的。与逐渐增加批量大小相比,直接使用恒定的目标批量大小表现更好,且预热阶段额外消耗了18.8%的优化器步骤。

图8:4T token预算下的批量大小。20层10.8B-A0.89B MoE的训练损失与消耗token的关系;每个插图解析最后50B token。(a)从之前的配方($B=12.6M$)移动到预测的最优值($B=25.2M$)带来了$7.2 \times 10^{-3}$的收益,而进一步增加到$B=37.7M$会导致轻微退化。损失在预测值以下急剧上升,在预测值以上几乎保持平坦。(b)通过预热达到$B=25.2M$的表现并不比从一开始就使用此批量大小更好,并且需要多消耗18.8%的优化器步骤。
图8:4T token预算下的批量大小。20层10.8B-A0.89B MoE的训练损失与消耗token的关系;每个插图解析最后50B token。(a)从之前的配方($B=12.6M$)移动到预测的最优值($B=25.2M$)带来了$7.2 \times 10^{-3}$的收益,而进一步增加到$B=37.7M$会导致轻微退化。损失在预测值以下急剧上升,在预测值以上几乎保持平坦。(b)通过预热达到$B=25.2M$的表现并不比从一开始就使用此批量大小更好,并且需要多消耗18.8%的优化器步骤。

更大规模下的学习率: 在156B-A7B MoE模型上的测试证实,预测的最优学习率位于一个平坦的盆地底部,不仅在下游基准测试中取得了最高平均准确率,而且训练动态异常稳定。梯度裁剪在预热后从未触发,最大预裁剪梯度范数仅达到阈值的28%。

图9:更大模型规模下的学习率。48层MoE在419B token预算下的五次运行:预测的最优值($B=8.4M, \eta=1.76 \times 10^{-3}$),$\eta$除以和乘以$\sqrt{2}$,增大25%的批量大小及匹配的$\eta$,以及之前的配方(虚线)。(a)插图涵盖了最后10B token。预测最优值与三个相近设置之间的损失差异接近噪声水平,因此预测最优值位于一个平坦盆地的底部。(b)对数刻度下的预裁剪梯度范数,单步轨迹在移动平均线后变淡,预热阶段有阴影,裁剪阈值为虚线。预热后,接近预测最优值的所有运行的预裁剪梯度范数均保持在裁剪阈值的50%以下,包括在$\sqrt{2}$倍预测学习率下的运行。
图9:更大模型规模下的学习率。48层MoE在419B token预算下的五次运行:预测的最优值($B=8.4M, \eta=1.76 \times 10^{-3}$),$\eta$除以和乘以$\sqrt{2}$,增大25%的批量大小及匹配的$\eta$,以及之前的配方(虚线)。(a)插图涵盖了最后10B token。预测最优值与三个相近设置之间的损失差异接近噪声水平,因此预测最优值位于一个平坦盆地的底部。(b)对数刻度下的预裁剪梯度范数,单步轨迹在移动平均线后变淡,预热阶段有阴影,裁剪阈值为虚线。预热后,接近预测最优值的所有运行的预裁剪梯度范数均保持在裁剪阈值的50%以下,包括在$\sqrt{2}$倍预测学习率下的运行。

稳定性压力测试

动机与设计: 大规模训练中会出现小规模实验中不存在的稳定性挑战【引用33,Small-scale proxies for large-scale transformer training instabilities+2023+arXiv】。压力测试通过将学习率保持在最优值的倍数(2倍和4倍)来模拟生产运行中长时间的峰值学习率阶段。

测试结果与机制: 在4倍最优学习率下,AdamW基线频繁出现损失尖峰并持续触发梯度裁剪,而包含门控残差(GR)的Muon配置保持高度稳定,零损失尖峰且从未越过裁剪阈值。隔离门控效果的实验表明,门控通过直接提供重缩放机制,防止了网络通过增加激活异常值来实现缩放,从而避免了脆弱性。

图10:压力下的训练损失。28层25B-A3B MoE在恒定学习率下:AdamW下的Qwen3.5结构,Muon下的相同结构,以及带有GR的Muon。粗线是淡色单步轨迹的移动平均。GR实现了更稳定的训练。
图10:压力下的训练损失。28层25B-A3B MoE在恒定学习率下:AdamW下的Qwen3.5结构,Muon下的相同结构,以及带有GR的Muon。粗线是淡色单步轨迹的移动平均。GR实现了更稳定的训练。
图11:压力下的梯度范数和激活。与图10相同的三个运行。(b)中的激活在层间进行了平均。门控残差降低了梯度范数尖峰的频率和幅度,以及激活异常值的幅度。
图11:压力下的梯度范数和激活。与图10相同的三个运行。(b)中的激活在层间进行了平均。门控残差降低了梯度范数尖峰的频率和幅度,以及激活异常值的幅度。
图12:隔离门控的效果。关闭和开启GatedNorm,同时保持AdamW优化器、结构和数据顺序固定。(a)和(b)是在3倍最优学习率下的一对;粗线是淡色单步轨迹的移动平均。(c)增加了1倍和2倍最优速率下的无门控基线。
图12:隔离门控的效果。关闭和开启GatedNorm,同时保持AdamW优化器、结构和数据顺序固定。(a)和(b)是在3倍最优学习率下的一对;粗线是淡色单步轨迹的移动平均。(c)增加了1倍和2倍最优速率下的无门控基线。

生产运行验证: 在实际生产训练配置下,完整的Flash-Next配方显著降低了损失,梯度范数更小且更平稳,网络中的残差最大值显著降低,允许在没有显式激活控制(如qk-clip【引用34,Kimi K2+2025+arXiv】或SwiGLU-clip【引用35,gpt-oss-120b+2025+arXiv】)的情况下进行稳定训练。

图13:Qwen3.8-Flash-Next在发布学习率下的早期阶段。共享数据顺序、学习率调度和优化器的三个运行的前276B token:带有Muon的Qwen3.5,相同配置加上门控残差,以及Qwen3.8-Flash-Next。阴影带对应学习率预热。(a)中的插图解析了窗口的最后126B token;(b)中的插图是滚动1000步窗口内梯度范数的标准差。
图13:Qwen3.8-Flash-Next在发布学习率下的早期阶段。共享数据顺序、学习率调度和优化器的三个运行的前276B token:带有Muon的Qwen3.5,相同配置加上门控残差,以及Qwen3.8-Flash-Next。阴影带对应学习率预热。(a)中的插图解析了窗口的最后126B token;(b)中的插图是滚动1000步窗口内梯度范数的标准差。

实验环境

  • 模型参数:总参数量1250亿(125B),每token激活参数量60亿(6B),额外包含510亿(51B)参数的N-gram嵌入表。
  • 评测基准:涵盖14个基准测试,包括通用任务(MMLU, MMLU-Pro, MMLU-Redux, BBH, SuperGPQA)、数学与STEM任务(GPQA, GSM8K, MATH)、编码任务(EvalPlus, MultiPL-E, SWEBench-Pretrain)以及多语言任务(MGSM, MMMLU, INCLUDE)。
  • 对比基线:Qwen3.8-27B-Base 和 Qwen3.7-Plus-Base (397B)。

实验结果

评估结果显示,Qwen3.8-Flash-Next-Base 在所有14个基准测试中始终优于 Qwen3.8-27B-Base,在通用知识、推理、数学、编码和多语言能力上均展现出优势。更值得注意的是,它在14个基准测试中的8个上超越了规模大得多的 Qwen3.7-Plus-Base 模型,并在其余测试中保持竞争力。实现这一结果仅使用了约1/3的激活参数、1/3的训练token,相当于约1/9的训练FLOPs。除了训练效率外,架构的改进和较少的激活参数也显著降低了推理成本。


结论

本文详细描述了 Qwen3.8-Flash-Next 的架构设计及消融实验。最终模型在激活三分之一参数、使用三分之一训练token和约九分之一FLOPs的情况下,保持了上一代397B-A17B旗舰模型的质量。该设计反映了一个核心信念:架构、效率和优化构成了一个耦合系统。门控残差(GR)提供的重缩放显著改善了训练稳定性,这种稳定性裕度使得最优学习率和批量大小向上偏移,从而提高了吞吐量和收敛性。基于阶段的成本核算引导了稀疏注意力索引器的设计,并将门控残差的表达能力集中在读取上。联合验证协议成功捕获了预训练指标与后期评估分歧的情况,确保了生产级训练的可靠性。未来,更廉价且能可靠预测后训练排序的中等规模探测器将使设计空间更易于搜索。


方法细节中的引用汇总

  • 【引用1】Vaswani et al., Attention is all you need, 2017, NeurIPS. 引用说明:在指出全自注意力机制的token混合成本随序列长度呈二次增长且KV缓存呈线性增长时引用。
  • 【引用2】Yang et al., Gated delta networks: Improving mamba2 with delta rule, 2024, arXiv. 引用说明:在介绍引入Gated DeltaNet (GDN) 作为混合架构核心组件以压缩前缀时引用。
  • 【引用3】Schlag et al., Linear transformers are secretly fast weight programmers, 2021, ICML. 引用说明:在解释线性注意力可以被视为将键值关联存储在矩阵状态中的快速权重记忆时引用。
  • 【引用4】Su et al., Roformer: Enhanced transformer with rotary position embedding, 2024, Neurocomputing. 引用说明:在说明全注意力层保留了旋转位置嵌入(RoPE)时引用。
  • 【引用5】Yang & Zhang, FLA: A triton-based library for hardware-efficient implementations of linear attention mechanism, 2024, URL. 引用说明:在对比FlashQLA内核效率时,作为基线FLA Triton内核引用。
  • 【引用6】Liu et al., Deepseek-v3.2: Pushing the frontier of open large language models, 2025, arXiv. 引用说明:在提及DSA使用轻量级索引器生成token级稀疏掩码但仍有二次开销时引用。
  • 【引用7】Shazeer, Fast transformer decoding: One write-head is all you need, 2019, arXiv. 引用说明:在说明QSA索引器采用MQA(多查询注意力)结构时引用。
  • 【引用8】Gao et al., Seerattention: Learning intrinsic sparse attention in your llms, 2024, arXiv. 引用说明:在QSA密集蒸馏阶段,说明采用最大池化对齐教师分布与块级索引器分数时引用。
  • 【引用9】Wang et al., Proxyattn: Guided sparse attention via representative heads, 2026, ICLR. 引用说明:同上,支持最大池化对齐策略。
  • 【引用10】Hsieh et al., Ruler: What's the real context size of your long-context language models?, 2024, arXiv. 引用说明:在评估QSA长上下文能力及架构消融时引用RULER基准。
  • 【引用11】OpenAI, OpenAI MRCR: Long context multiple needle in a haystack benchmark, 2025, Dataset. 引用说明:在评估QSA长上下文检索能力时引用MRCR基准。
  • 【引用12】GLM-5-Team, Glm-5: from vibe coding to agentic engineering, 2026, URL. 引用说明:在说明推测解码步骤中复用QSA索引策略时引用。
  • 【引用13】He et al., Deep residual learning for image recognition, 2016, CVPR. 引用说明:在陈述残差连接为每个块提供直接路径的动机时引用。
  • 【引用14】Xiong et al., On layer normalization in the transformer architecture, 2020, ICML. 引用说明:在说明预归一化能在规模化时保持训练稳定时引用。
  • 【引用15】Huang et al., Densely connected convolutional networks, 2017, CVPR. 引用说明:在列举解决信号衰减的方法(密集层间连接)时引用。
  • 【引用16】Zhou et al., Value residual learning, 2024, arXiv. 引用说明:在列举增加注意力值额外残差路径的方法时引用。
  • 【引用17】Sun et al., You only cache once: Decoder-decoder architectures for language models, 2024, arXiv. 引用说明:在列举跨层复用缓存状态的方法时引用。
  • 【引用18】Srivastava et al., Highway networks, 2015, arXiv. 引用说明:在提及增加残差读写表达能力的方法时引用。
  • 【引用19】Baykal et al., Alternating updates for efficient transformers, 2023, arXiv. 引用说明:在介绍拓宽残差流的AltUp方法及其简化变体时引用。
  • 【引用20】Zhu et al., Hyper-connections, 2024, arXiv. 引用说明:在介绍泛化残差流拓宽的超连接(HC)方法时引用。
  • 【引用21】Xie et al., mhc: Manifoldconstrained hyper-connections, 2025, arXiv. 引用说明:在对比mHC使用sigmoid及双随机矩阵约束,以及消融实验有界正向门控时引用。
  • 【引用22】Seed, Virtual width networks, 2025, arXiv. 引用说明:在将GR与保持标量读写并拓宽token嵌入的VWN方法进行对比时引用。
  • 【引用23】Team et al., Attention residuals, 2026, URL. 引用说明:在将GR与注意力残差(AttnRes)进行性能和成本对比时引用。
  • 【引用24】Zhang et al., xhc: Expanded hyper-connections, 2026, URL. 引用说明:在提及探索使用更大分支数进行稀疏分支更新的xHC工作时引用。
  • 【引用25】Google DeepMind, Gemma 3n model overview, 2025. 引用说明:在说明基于嵌入的记忆(及主机内存卸载)为扩展模型容量提供补充维度时引用。
  • 【引用26】Cheng et al., Conditional memory via scalable lookup: A new axis of sparsity for large language models, 2026, ACL. 引用说明:在解释N-gram嵌入将单字查找泛化为基于局部上下文的记忆检索时引用。
  • 【引用27】Jordan et al., Muon: An optimizer for hidden layers in neural networks, 2024, Blog. 引用说明:在介绍采用Muon优化器及Nesterov加速动量时引用。
  • 【引用28】Amsel et al., The polar express: Optimal matrix sign methods and their application to the muon algorithm, 2025, arXiv. 引用说明:在说明NS迭代采用Polar Express方法的每步系数调度时引用。
  • 【引用29】Shoeybi et al., Megatron-lm: Training multi-billion parameter language models using model parallelism, 2019, arXiv. 引用说明:在说明融合参数(如qkv、fc1)在Megatron中的存储方式及拆分动机时引用。
  • 【引用30】Wang et al., Canzona: A unified, asynchronous, and load-balanced framework for distributed matrix-based optimizers, 2026, URL. 引用说明:在介绍为解决NS迭代负载不平衡而开发的Canzona框架时引用。
  • 【引用31】Qwen Team, Qwen3.5: Towards native multimodal agents, 2026, URL. 引用说明:在提及重新拟合Qwen3.5系列使用的超参数配方时引用。
  • 【引用32】Kaplan et al., Scaling laws for neural language models, 2020, arXiv. 引用说明:在说明应用缩放定律预测最优学习率和批量大小时引用。
  • 【引用33】Wortsman et al., Small-scale proxies for large-scale transformer training instabilities, 2023, arXiv. 引用说明:在说明通过提高学习率在小模型中复现大规模不稳定性以设计压力测试时引用。
  • 【引用34】Kimi Team, Kimi K2: Open agentic intelligence, 2025, arXiv. 引用说明:在说明GR允许在没有qk-clip等显式激活控制下稳定训练时引用。
  • 【引用35】Agarwal et al., gpt-oss-120b & gpt-oss-20b model card, 2025, arXiv. 引用说明:在说明GR允许在没有SwiGLU-clip控制下稳定训练时引用。