动机: 全自注意力机制能够提供对前面所有token的基于内容的直接访问,但其token混合成本随序列长度呈二次增长,且其键值(KV)缓存在自回归生成期间呈线性增长【引用1,Attention is all you need+2017+NeurIPS】。滑动窗口注意力(SWA)用有界的局部感受野取代了全局访问,减少了计算和缓存消耗,但窗口外的信息只能通过深度间接传播。这在高效局部处理和持久的内容依赖记忆之间产生了矛盾。为了解决这一矛盾,模型采用了门控增量网络(GDN)【引用2,Gated delta networks: Improving mamba2 with delta rule+2024+arXiv】和全局注意力的按层混合设计。GDN将前缀压缩为固定大小的循环状态并根据当前内容更新该状态,而交错的全局注意力层保留了任何有限状态循环记忆都难以精确重现的直接token级检索。
与使用SiLU输出门的原始GDN不同,这里使用了有界的sigmoid门,并采用以零为中心的RMSNorm来约束权重的增长。在模型级别,混合架构在全注意力层保留了旋转位置嵌入(RoPE)【引用4,Roformer: Enhanced transformer with rotary position embedding+2024+Neurocomputing】。每四层放置一个全注意力层,其余三层使用GDN。
图2:Gated DeltaNet token混合器。投影的查询、键和值流经过短因果卷积;查询和键在门控增量递归之前进行L2归一化。衰减门$\alpha_t$和写入门$\beta_t$控制递归更新,而sigmoid输出门调节以零为中心的RMS归一化输出。
内核效率与架构消融: 通过FlashQLA内核库优化GDN,在NVIDIA GPU上实现了比FLA Triton内核【引用5,FLA: A triton-based library...+2024+URL】$2-3\times$ 的前向加速和约 $2\times$ 的后向加速。消融实验表明,GDN混合架构在9个基准测试中的8个优于全注意力Transformer,在7个基准上超过了SWA混合架构。
压缩的轻量级索引器: 给定输入隐藏状态 $\mathbf{x}_i$,索引器采用具有 $H$ 个查询头和1个共享键头的MQA【引用7,Fast transformer decoding: One write-head is all you need+2019+arXiv】结构。首先应用独立的轻量级投影:
实现与评估: 主干和MTP模块中的所有全注意力层都被QSA替换。索引器采用4个查询头和1个共享键头,预算 $K=2048$,压缩比 $r=4$。评估表明,QSA在短上下文基准上保持了通用能力,并在长上下文(如RULER【引用10,Ruler: What's the real context size...+2024+arXiv】和MRCR【引用11,OpenAI MRCR+2025+Dataset】)上随着上下文增长表现更好。此外,在推测解码中复用QSA索引并未影响MTP性能【引用12,Glm-5...+2026+URL】。
动机: 基于嵌入的记忆为扩展模型容量提供了补充维度【引用25,Gemma 3n model overview+2025】。N-gram嵌入进一步将单字查找泛化为基于局部上下文的记忆检索【引用26,Conditional memory via scalable lookup...+2026+ACL】。短n-gram作为键检索嵌入表,增强相应的token表示,几乎不增加每token的FLOPs,且确定性寻址允许主机内存卸载和异步预取。
实现机制: 为了解决NS迭代在分布式训练中的负载不平衡问题,开发了Canzona框架【引用30,Canzona: A unified, asynchronous...+2026+arXiv】,将逻辑优化器分配与物理参数布局解耦,通过静态分区器均衡DP秩间的NS FLOPs,并通过异步微组流水线重构矩阵。此外,通过CUDA图捕获整个步骤以消除小内核的启动开销。
超参数缩放
动机: 新架构和优化器改变了最优超参数,因此重新拟合了Qwen3.5系列【引用31,Qwen3.5: Towards native multimodal agents+2026+URL】使用的缩放定律【引用32,Scaling laws for neural language models+2020+arXiv】。新定律预测出更大的批量大小和学习率。
动机与设计: 大规模训练中会出现小规模实验中不存在的稳定性挑战【引用33,Small-scale proxies for large-scale transformer training instabilities+2023+arXiv】。压力测试通过将学习率保持在最优值的倍数(2倍和4倍)来模拟生产运行中长时间的峰值学习率阶段。
【引用1】Vaswani et al., Attention is all you need, 2017, NeurIPS. 引用说明:在指出全自注意力机制的token混合成本随序列长度呈二次增长且KV缓存呈线性增长时引用。
【引用2】Yang et al., Gated delta networks: Improving mamba2 with delta rule, 2024, arXiv. 引用说明:在介绍引入Gated DeltaNet (GDN) 作为混合架构核心组件以压缩前缀时引用。
【引用3】Schlag et al., Linear transformers are secretly fast weight programmers, 2021, ICML. 引用说明:在解释线性注意力可以被视为将键值关联存储在矩阵状态中的快速权重记忆时引用。
【引用4】Su et al., Roformer: Enhanced transformer with rotary position embedding, 2024, Neurocomputing. 引用说明:在说明全注意力层保留了旋转位置嵌入(RoPE)时引用。
【引用5】Yang & Zhang, FLA: A triton-based library for hardware-efficient implementations of linear attention mechanism, 2024, URL. 引用说明:在对比FlashQLA内核效率时,作为基线FLA Triton内核引用。
【引用6】Liu et al., Deepseek-v3.2: Pushing the frontier of open large language models, 2025, arXiv. 引用说明:在提及DSA使用轻量级索引器生成token级稀疏掩码但仍有二次开销时引用。
【引用7】Shazeer, Fast transformer decoding: One write-head is all you need, 2019, arXiv. 引用说明:在说明QSA索引器采用MQA(多查询注意力)结构时引用。
【引用8】Gao et al., Seerattention: Learning intrinsic sparse attention in your llms, 2024, arXiv. 引用说明:在QSA密集蒸馏阶段,说明采用最大池化对齐教师分布与块级索引器分数时引用。
【引用9】Wang et al., Proxyattn: Guided sparse attention via representative heads, 2026, ICLR. 引用说明:同上,支持最大池化对齐策略。
【引用10】Hsieh et al., Ruler: What's the real context size of your long-context language models?, 2024, arXiv. 引用说明:在评估QSA长上下文能力及架构消融时引用RULER基准。
【引用11】OpenAI, OpenAI MRCR: Long context multiple needle in a haystack benchmark, 2025, Dataset. 引用说明:在评估QSA长上下文检索能力时引用MRCR基准。
【引用12】GLM-5-Team, Glm-5: from vibe coding to agentic engineering, 2026, URL. 引用说明:在说明推测解码步骤中复用QSA索引策略时引用。
【引用13】He et al., Deep residual learning for image recognition, 2016, CVPR. 引用说明:在陈述残差连接为每个块提供直接路径的动机时引用。
【引用14】Xiong et al., On layer normalization in the transformer architecture, 2020, ICML. 引用说明:在说明预归一化能在规模化时保持训练稳定时引用。
【引用15】Huang et al., Densely connected convolutional networks, 2017, CVPR. 引用说明:在列举解决信号衰减的方法(密集层间连接)时引用。
【引用16】Zhou et al., Value residual learning, 2024, arXiv. 引用说明:在列举增加注意力值额外残差路径的方法时引用。
【引用17】Sun et al., You only cache once: Decoder-decoder architectures for language models, 2024, arXiv. 引用说明:在列举跨层复用缓存状态的方法时引用。
【引用18】Srivastava et al., Highway networks, 2015, arXiv. 引用说明:在提及增加残差读写表达能力的方法时引用。
【引用19】Baykal et al., Alternating updates for efficient transformers, 2023, arXiv. 引用说明:在介绍拓宽残差流的AltUp方法及其简化变体时引用。
【引用20】Zhu et al., Hyper-connections, 2024, arXiv. 引用说明:在介绍泛化残差流拓宽的超连接(HC)方法时引用。
【引用21】Xie et al., mhc: Manifoldconstrained hyper-connections, 2025, arXiv. 引用说明:在对比mHC使用sigmoid及双随机矩阵约束,以及消融实验有界正向门控时引用。
【引用23】Team et al., Attention residuals, 2026, URL. 引用说明:在将GR与注意力残差(AttnRes)进行性能和成本对比时引用。
【引用24】Zhang et al., xhc: Expanded hyper-connections, 2026, URL. 引用说明:在提及探索使用更大分支数进行稀疏分支更新的xHC工作时引用。
【引用25】Google DeepMind, Gemma 3n model overview, 2025. 引用说明:在说明基于嵌入的记忆(及主机内存卸载)为扩展模型容量提供补充维度时引用。
【引用26】Cheng et al., Conditional memory via scalable lookup: A new axis of sparsity for large language models, 2026, ACL. 引用说明:在解释N-gram嵌入将单字查找泛化为基于局部上下文的记忆检索时引用。
【引用27】Jordan et al., Muon: An optimizer for hidden layers in neural networks, 2024, Blog. 引用说明:在介绍采用Muon优化器及Nesterov加速动量时引用。
【引用28】Amsel et al., The polar express: Optimal matrix sign methods and their application to the muon algorithm, 2025, arXiv. 引用说明:在说明NS迭代采用Polar Express方法的每步系数调度时引用。
【引用29】Shoeybi et al., Megatron-lm: Training multi-billion parameter language models using model parallelism, 2019, arXiv. 引用说明:在说明融合参数(如qkv、fc1)在Megatron中的存储方式及拆分动机时引用。
【引用30】Wang et al., Canzona: A unified, asynchronous, and load-balanced framework for distributed matrix-based optimizers, 2026, URL. 引用说明:在介绍为解决NS迭代负载不平衡而开发的Canzona框架时引用。
【引用31】Qwen Team, Qwen3.5: Towards native multimodal agents, 2026, URL. 引用说明:在提及重新拟合Qwen3.5系列使用的超参数配方时引用。
【引用32】Kaplan et al., Scaling laws for neural language models, 2020, arXiv. 引用说明:在说明应用缩放定律预测最优学习率和批量大小时引用。
【引用33】Wortsman et al., Small-scale proxies for large-scale transformer training instabilities, 2023, arXiv. 引用说明:在说明通过提高学习率在小模型中复现大规模不稳定性以设计压力测试时引用。
【引用34】Kimi Team, Kimi K2: Open agentic intelligence, 2025, arXiv. 引用说明:在说明GR允许在没有qk-clip等显式激活控制下稳定训练时引用。
【引用35】Agarwal et al., gpt-oss-120b & gpt-oss-20b model card, 2025, arXiv. 引用说明:在说明GR允许在没有SwiGLU-clip控制下稳定训练时引用。