Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression
Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression
发表时间: 2026-09 · arXiv:2609.36322 (ByteDance Seed / Princeton / Stanford / UC Berkeley)
原文: https://arxiv.org/abs/2609.36322
Xingyu Zhu, Pu (Luke) Yi, Ziheng Cheng, Ang Lv, Jing Liu, Lexing Ying, Yiyuan Ma, Xin Dong
ByteDance Seed, Princeton University, Stanford University, University of California, Berkeley
速读
一句话结论 本文揭示了采用分块 KV 缓存压缩的大语言模型存在严重的相位敏感性缺陷,目标信息在压缩窗口中的相对位置会导致长上下文检索准确率出现高达40个百分点的周期性剧烈波动。
要解决什么问题 现有的长上下文推理通常受限于 KV 缓存的显存和计算开销,因此工业界常采用分块 KV 缓存压缩技术,将连续的 token 按照固定的步长划分窗口,并压缩成更少的缓存条目。这种机制引入了一个新的位置坐标即相位,也就是 token 绝对位置对压缩步长取模的余数。原有评估做法的卡点在于,只看平均准确率会掩盖模型底层的系统性缺陷。由于压缩是在未来查询内容未知前进行的,模型必须无差别地保留信息。稍微改变输入前缀的长度,就会改变目标信息在压缩窗口中的相位。这导致同一个键值对在某些相位下极易被检索,而在另一些相位下则几乎无法被提取。这种周期性的外推失效机制意味着,高平均分的模型在实际应用中可能仅仅因为一段无关紧要的注释长度发生了几个字符的变化,就会在正确与完全错误的预测之间来回翻转,严重影响了模型在长文本场景下的可靠性。
怎么做的 为了探究这种相位敏感性的根源,作者没有停留在黑盒测试,而是从头预训练了一系列基于 Qwen3-0.6B 架构的 Transformer 模型,将分块 KV 压缩作为唯一的架构变量,并结合因果干预和理论推导进行机制分析。核心思路是验证相位特化现象,即不同的注意力头是否在不对称地负责检索不同相位的信息。关键设计由三个分析部件构成。首先是控制变量预训练,通过改变窗口大小、步长、是否重叠以及门控机制,证明只要存在压缩步长,周期性波动就会必然出现。其次是 KV 头敲除干预,通过将特定层的 KV 头输出替换为不包含当前输入特定信息的校准集均值,观察检索准确率的下降位置,精准定位出哪些头负责读取哪些相位。最后是压缩门控的动力学分析。在压缩核中,每个窗口 $j$ 内偏移量为 $i$ 的隐藏状态 $\pmb{h}_{j,i}$ 通过门控得分 $\alpha_{j,i}^K$ 被加权压缩为键条目:
$$ \alpha_{j,i}^K = \frac{\exp(s_{j,i}^K)}{\sum_{u=0}^{W-1} \exp(s_{j,u}^K)}, \qquad \widehat{K}_j = \sum_{i=0}^{W-1} \alpha_{j,i}^K \odot \big(C_i^K \pmb{h}_{j,i}\big) $$作者发现,在预训练过程中,部分注意力头的门控参数会自发演化出静态的偏移量偏好,例如某个头永远赋予窗口内特定位置最高的权重。理论推导进一步证明,在理想的检索任务中,为了最大化目标对齐程度,梯度流动力学必然会驱使压缩门控走向这种极端的相位特化。这种分工机制解释了为什么模型能绕开平均性能的崩塌,却在微观上留下了周期性的盲区。
效果如何 实验评估分为黑盒探测和白盒验证两部分。在黑盒探测中,作者在 128K 上下文长度、包含 16K 个键值对的设置下,对 DeepSeek-V4 家族进行了单 token 的大海捞针测试,该家族代表了当前顶尖的稀疏压缩路线。结果显示,通过改变前缀填充词长度来平移目标相位,DeepSeek-V4-Flash-Base 的检索准确率在不同相位间最大相差 40.2 个百分点,即使是经过后训练的 DeepSeek-V4.1-Flash 也存在 6.1 个百分点的系统性落差。在官方推理代码补全任务中,仅改变装饰性注释的长度,模型对下一个 token 的预测就会在正确的 8 和错误的 32 之间周期性翻转。在白盒验证中,作者对比了使用 100B tokens 训练的带有各种压缩核的 0.6B 预训练模型与代表无压缩路线的 Full attention 基线。结果表明,Full attention 基线在不同相位下的准确率是一条平直线,最大波动不超过 6.1 个百分点,而所有压缩变体均出现了与压缩步长完美吻合的周期性大幅波动,最大落差高达 78 个百分点。作者也承认了当前研究的局限性,虽然门控偏好解释了窗口内部的相位差异,但对于跨窗口边界的键值对截断效应,目前仍缺乏统一的理论解释,且尚未提出在不损失压缩效率的前提下彻底消除相位敏感性的完美方案。
主要贡献
Transformer模型中的长上下文推理常常受限于KV缓存,因为其内存和注意力计算成本会随着上下文长度的增加而增长。为了解决这一瓶颈,诸如DeepSeek-V4等模型采用了分块KV缓存压缩(Chunked KV-cache compression)技术。该技术将连续的标记(Token)分组为固定大小的窗口,并以固定的步长将每个窗口压缩为较少的缓存条目。然而,这种压缩机制引入了一个新的位置坐标:标记的“相位(Phase)”,即标记相对于压缩窗口边界的位置。
本文的核心发现是,在使用此类压缩的模型中存在一种系统性的不对称性:相同的信息在一个相位上可能很容易被检索到,而在另一个相位上却很难被检索。作者将这种检索性能的周期性变化称为“相位敏感性(Phase sensitivity)”。在采用分块KV缓存压缩的大型开源模型中,不同相位之间的长上下文检索准确率差异最高可达40个百分点。这种周期性的“薄弱点(Weak spots)”往往被平均基准测试分数所掩盖。
为了深入研究这一行为,作者的主要贡献包括:
- 系统性揭示与测量:首次在DeepSeek-V4和DeepSeek-V4.1等模型中揭示并量化了相位敏感性,证明了仅改变无关填充词的长度即可导致模型预测结果的周期性翻转。
- 受控预训练验证:从头开始预训练了一系列以Qwen3-0.6B为骨干的Transformer模型,将KV压缩作为唯一的架构修改,成功在多个变体中复现了相位敏感性,证实了分块压缩是该现象的根源。
- 机制分析与相位特化:通过对KV头和层进行因果干预(敲除实验),揭示了“相位特化(Phase specialization)”现象,即不同的注意力组件对检索不同源相位的信息有着不对称的贡献。
- 理论证明:分析了理想化的检索模型,证明了梯度流动力学(Gradient flow dynamics)如何促使压缩门产生锐利的相位特化,表明即使在未来查询未知的情况下,训练也会偏向于选择性保留特定相位的信息。
背景知识与关键观察
长上下文推理的瓶颈与压缩方案:Transformer中的长上下文推理可能受限于KV缓存,其内存和注意力成本随上下文长度增长。一个在DeepSeek-V4【11, DeepSeek-V4: Towards highly efficient million-token context intelligence + 2026 + arXiv + https://arxiv.org/abs/2606.19348】等模型中使用的实用补救措施是分块KV缓存压缩:模型将连续的标记分组为固定大小的窗口,将每个窗口压缩为更少的缓存条目,并使用这些摘要进行长上下文检索(引用 【28, Compressive transformers for long-range sequence modelling + 2020 + ICLR + https://openreview.net/forum?id=SylKikSYDH】和 【36, LoMA: Lossless compressed memory attention + 2024 + arXiv + https://arxiv.org/abs/2401.09486】)。压缩发生在处理上下文时,在稍后的查询指定需要回忆什么信息之前。因此,每个摘要都与查询无关,并且必须保留以后可能需要的信息 。
相位坐标的引入:这种设计在上下文上强加了周期性结构。每隔$S$个标记开始一个新的压缩窗口,其中$S$是压缩步长。因此,除了绝对位置之外,每个标记都有一个相对于这些边界的新坐标。将其坐标称为其相位,定义为其位置对$S$取模。将输入移动几个标记可以改变哪些标记被一起压缩,而不改变它们的内容或相对位置。因此,相同的信息可能会根据其相位被不同地压缩,从而以不同的保真度被保留。
DeepSeek-V4中的周期性翻转代码补全示例:在具有分块KV缓存压缩的LLM中,检索性能随源信息的相位急剧且周期性地变化,这种故障模式被称为相位敏感性。一个启发性的例子来自于要求DeepSeek-V4-Flash-Base补全DeepSeek-V4的官方推理代码。提示词在FP8量化函数中的类型转换FP内部结束,原始源代码继续为8。周围的代码倾向于这个延续。该函数量化为FP8,而外部转换已经转换为compute_dtype,即FP32。补全为32将重复外部转换并跳过舍入步骤。
装饰性填充词对预测的影响:为了测试这种预测是否依赖于位置,在前面添加了一个装饰性的文档字符串,并仅通过改变其第二行重复的=字符的数量来改变其长度。代码保持不变,每个额外的填充标记将代码和补全位置移动一个位置。在从24到39个标记的16个填充长度$L$中,Top-1预测周期性地翻转。特别是,当$L \bmod 4 \in \{2, 3\}$时,模型预测8,而在其余八个长度处预测32,并且$P(8) - P(32)$的范围从$-0.79$到$0.95$。因此,仅改变文档字符串的长度就逆转了首选的延续。这种逆转每四个标记重复一次,与DeepSeek-V4的压缩稀疏注意力(CSA)的步长$S = 4$相匹配。
其他模型与填充词的普遍性:这种匹配表明预测取决于代码相对于压缩窗口的位置。这种逆转不仅限于一种填充词。在测试的所有四个填充词系列中,大多数预测都遵循相同的四标记模式,并且经过后训练的DeepSeek-V4-Flash-0731和DeepSeek-V4.1-Flash【12, DeepSeek-V4.1-Flash: Pushing the limits of KV cache compression + 2026 + arXiv + https://arxiv.org/abs/2609.19969】在几次填充词扫描下也显示出周期性逆转,与它们的压缩步长(分别 为$S = 4$和$S = 2$)相匹配。相比之下,没有分块KV压缩的DeepSeek-V3.1-Base在相同的64个输入中仅在4个输入处将32排在8之上,且差距非常小。
检索中相位敏感性的系统测量:为了更系统地测量这种影响,转向一个受控的基于键值对的检索任务,在该任务中可以测量模型检索相同信息片段的能力,但这些信息相对于压缩边界处于不同的相对位置。对于压缩步长$S$,将从位置$t$开始的键值对的$t \bmod S$称为其相位,当特定的检索指标(如准确率或分配给正确答案的概率)随源的相位发生系统性变化时,称该检索具有相位敏感性。
评估设置与残差组划分:在单标记的“大海捞针”(NIAH)检索上评估了DeepSeek-V4-Flash和DeepSeek-V4-Pro的基础版本和后训练版本,以及后训练的DeepSeek-V4.1-Flash。每个128K标记的提示词包含16k个键值对,并要求提供靠近其中部的一个源键的值。将提示词按源键位置对8取模的残差分为八个残差组,这涵盖了DeepSeek-V4的两个步长周期和DeepSeek-V4.1的四个步长周期。所有组共享相同的提示词长度、查询位置和键值绑定,并选择它们的填充长度,使得源键绝对位置的均值和方差在每个组中都相同。
基础与后训练模型的相位敏感性结果:在图2中可以看到,基础检查点具有强烈的相位敏感性,最大差距高达40.2个百分点。后训练提高了准确率并缩小了这些差距,但后训练的DeepSeek-V4模型的差距仍然很大。DeepSeek-V4.1-Flash的差距最小,但其所有四个偶数残差组的准确率仍高于所有四个奇数残差组。仅凭平均准确率会掩盖不同相位之间的这些差异。
方法细节
受控预训练研究的动机:DeepSeek-V4除了分块KV压缩之外,在许多方面与标准Transformer不同,并且无法在没有压缩的情况下重新训练它以查看周期性是否消失。为了测试分块压缩是否是相位敏感性的来源,从头开始预训练了一个基于Qwen3【27, Qwen3 technical report + 2025 + arXiv + https://arxiv.org/abs/2505.09388】派生的模型系列,其中分块压缩是唯一实质性的架构变化,同时以相同方式训练了全注意力基线。还改变了执行压缩的方式,以查看相位敏感性的哪些方面(如其周期)依赖于该设计。这些模型也支持第4节中的机制分析 。
KV压缩内核系列的结构:每个内核将一个窗口压缩为每个KV头一个键和一个值。有效载荷映射(payload map)设置每个标记贡献的内容,压缩门(compression gate)设置其进入摘要的强度。
门控逻辑与公式计算:对于一个头,设$\pmb{h}_{j,i} \in \mathbb{R}^d$为大小为$W$的窗口$j$中偏移量$0 \leq i < W$处的隐藏状态。对于分支$B \in \{K, V\}$,有效载荷映射、门映射和位置偏置的形状分别为$C_i^B \in \mathbb{R}^{d_h \times d}$、$Z_i^B \in \mathbb{R}^{d_g \times d}$和$b_i^B \in \mathbb{R}^{d_g}$。这里$d$是隐藏宽度,$d_h$是头维度,$d_g$是门维度。对于键分支,计算门逻辑值:
在窗口上进行Softmax操作将这些逻辑值转化为门分数,用于加权有效载荷:
内核系列的变量设计:改变这个系列以测试相位敏感性的候选解释。参考模型每层有一个KV头,并使用带有标量门的非重叠八标记窗口。窗口大小$W$设置一个条目总结多少个标记,步长$S$设置产生条目的频率,因此参考模型是W8/S8。分别改变它们可以显示周期是遵循窗口还是步长,以及重叠窗口($S < W$)(其中标记出现在几个偏移量处,而其相位保持固定)是否消除了该影响。
特定配置与DeepSeek-V4的比较:用均匀平均(将每个门分数固定为$1/W$)替换学习到的门,测试相位敏感性是否需要学习到的门。该系列还包括DeepSeek-V4的CSA内核【11, DeepSeek-V4: Towards highly efficient million-token context intelligence + 2026 + arXiv + https://arxiv.org/abs/2606.19348】,它测试了第2节中研究的内核在Qwen骨干上使用时是否产生相位敏感性 。
评估任务的调整与填充协议:为了在这些模型中测量相位敏感性,将NIAH任务调整为64个随机键值对,具有相邻的单标记键和值,并报告全词汇表下一个标记的准确率。前缀填充(Prefix Padding)将所有记录与外部填充词一起移动。因为记录背靠背排列,这种移动改变了每个干扰项的相位以及目标的相位。因此,添加了序列内填充(In-sequence Padding),它改变了记录之间的间隙,使得干扰项相位不再与目标同步移动。在每个协议中,固定查询位置,并匹配目标位置采样分布在源键位置对24(测试步长的公倍数)取模的残差组之间的均值和方差。
分块压缩与全注意力基线的对比:如果相位敏感性是由分块压缩引起的,压缩模型应该表现出这种特性,而全注意力基线则不应该。在图3中看到了这种对比。每个压缩模型都随源键相位发生周期性变化,包括DeepSeek风格的内核(图3i),而全注意力基线保持平坦(图3a)。表8中的每次压缩运行都同样如此,前缀填充差距高达78个百分点,而基线最多为6.1个百分点。
摘要指标对相位差异的掩盖:请注意,摘要指标掩盖了这种差异的大部分。在有八个KV头的情况下,W8/S8压缩模型在平均准确率和验证损失上几乎与其全注意力基线匹配,但其最差残差仅为$9.9\%$,而基线为$58.4\%$。在一个和四个KV头的情况下,压缩模型在可比的验证损失下达到了比基线更高的平均准确率。
窗口大小、步长与周期性的关系:分别改变窗口和步长表明,在测试的几何结构中,无论窗口是否重叠,周期都遵循步长。在$W = 8$时,步长$S \in \{4, 6, 8\}$给出了大约四、六和八个标记的周期(图3b-d)。W4/S4尽管窗口较小,但与W8/S4共享四标记周期,并且W12/S12产生大约十二标记的周期(图3e)。在这些实验中,相位敏感性既不需要旋转位置嵌入(RoPE),也不需要学习到的门:在没有RoPE的情况下(图3h)以及当均匀平均替换门时,它仍然存在。
边界效应不足以解释全部变异:一个自然的初步解释是窗口边界,因为相邻的键和值可能落在不同的窗口中。在W8/S8参考模型中,只有相位7的键其值在下一个窗口中。然而,准确率在共享一个窗口的相位0到6之间变化超过50个百分点(图3d)。边界并没有捕捉到完整的准确率趋势。这种剩余的变异表明答案在于模型如何写入压缩内存以及如何从中读取。
相位特化的定义:检索在每个相位都通过写入和读取压缩条目的注意力头进行,而一个头可能比其他头更可靠地服务于某些相位。这被称为相位特化(phase specialization):某些头对检索的贡献系统地依赖于相位,因此不同的头对不同相位的信息贡献不对称。该定义不预设任何原因。
KV头敲除实验的机制:为了找出哪些头对哪个相位的检索很重要,一次敲除一个KV头【24, In-context learning and induction heads + 2022 + Transformer Circuits Thread + https://transformer-circuits.pub/2022/in-context-learning-and-induction-heads/index.html】、 【38, Retrieval head mechanistically explains long-context factuality + 2025 + ICLR + https://arxiv.org/abs/2404.15574】,并观察准确率在哪里下降。具体来说,使用均值替换 【35, Interpretability in the wild: a circuit for indirect object identification in GPT-2 small + 2023 + ICLR + https://arxiv.org/abs/2211.00593】,它用其在许多其他提示词上的平均值替换其在干预位置的输出,这样输出就不再携带任何特定于当前提示词的内容。某个相位准确率的下降证明了该头的特定输出对该相位的检索有因果贡献 。
预训练模型与DeepSeek-V4的敲除策略:在预训练模型中,在相同的评估集上运行这些敲除,将最终位置读取KV头的查询头的输出替换为它们在不相交的校准提示词集上的平均值。其他标记位置的计算保持不变。对DeepSeek-V4-Flash-Base采用类似的敲除策略,并在一段查询后缀处替换整个层的注意力输出,每个残差组有256个评估提示词。
敲除映射的可视化与分析:在图4中可视化了敲除每个头对检索各个相位信息性能的影响。全注意力和压缩之间的敲除映射不同。在全注意力基线中,具有大损失的层在每个位置都会减少相似数量的准确率(图4a)。在W8/S8压缩模型中,一些头的损失集中在少数几个相位上,并且不同的头具有不同的依赖于相位的效果(图4b)。在DeepSeek-V4-Flash-Base中,最大的损失不均匀地影响每个相位,少数较早的层仅影响某些相位,每四个位置重复一次,这是其压缩步长(图4c)。
模式的普遍性:这种模式并不是特定于一个模型的。在大多数压缩模型中,一些头的损失集中在每步长重复的少数几个相位上,而在其他模型中,损失分布在所有相位上,并带有周期性变化。在有几个KV头的情况下,一些单独的头仍然显示出集中在一个或两个相位上的损失,因此不对称性不仅仅是层的属性。
压缩门偏好的假设:敲除显示了哪些头在哪些相位重要,但没有说明原因。原因来源的一个自然候选者是压缩门,它设置了每个偏移量在压缩条目中的权重。一个其门持续偏好某些偏移量的头,在相应的相位应该最重要。在W8/S8参考模型中测试了这一点,该模型的标量键和值门具有每个偏移量的独立参数,并且其窗口不重叠($W = S$),因此偏移量$i$即为相位$i$。
静态与输入依赖浓度的测量:由于门分数依赖于输入,门可以通过两种方式将其分数集中在偏移量之间。静态浓度(Static concentration)在每个窗口中偏好相同的偏移量,而输入依赖浓度(input-dependent concentration)偏好随内容变化的偏移量。只有静态浓度将头绑定到固定相位。用有效偏移量数量来测量两者,定义为$\exp(H(\cdot))$,其中$H$是香农熵。设$\pmb{\alpha} \in \mathbb{R}^W$为一个窗口的门分数,并对保留的自然语言文本取期望,通过$\exp(H(\mathbb{E}[\pmb{\alpha}]))$测量静态浓度,通过$\mathbb{E}[\exp(H(\pmb{\alpha}))]$测量平均每窗口浓度。对每个窗口应用相同分数的门将在图5a的对角线附近,因为当$\pmb{\alpha}$近似恒定时,期望会交换。
预训练期间门偏好的演变:如图5所示,在初始化时,所有门似乎都接近均匀,没有显示出任何一种浓度。在预训练期间,一些门(如第9、10和14层的门)沿对角线向左下角移动,形成静态浓度。其他键门在右边缘附近结束,具有不同程度的输入依赖浓度,但没有一致的偏置。在图5b中可视化了这些头的平均门分数。每个键门在几个相邻的偏移量处达到峰值,第14层在窗口早期,第10层在中间,第9层在后期,并且每个值门在一个偏移量后达到峰值,因此每个头偏好一个标记及其后继标记,就像在一个二元语法键值对中一样。
偏好与敲除损失的匹配:这些峰值与每个头在第4.1节中观察到的特化相位匹配:其敲除损失集中在其键门偏好被查询标记且其值门偏好后继标记的位置(图5c)。除了第0层之外,最大的敲除损失来自静态集中的头。随着每层头数的增加,静态浓度变得更加锐利:在具有四个KV头的W8/S8模型中,许多头在单个偏移量处达到峰值,并在单个相位处失去准确率。
理论分析背景:在第4.2节中,一些门对跨窗口的相同偏移量发展出持久的偏好,并且这些头在相应的相位最重要。在一个理想化的归纳模型中,探讨了为什么在未来查询未知时压缩会集中,为什么浓度会变得静态,以及头是否在自身之间划分相位。
理想化归纳任务的设定:考虑一个上下文$\pmb{X} = (\pmb{x}_{\ell,r})_{\ell \le L, r \le S}$,包含$LS$个不同的标记嵌入,从大小为$N$的词汇表$\mathcal{V} \subset \mathbb{R}^d$中均匀无放回地采样,并排列在$L \geq 4$个步长为$S \geq 3$的非重叠块中。块内的位置$r$是偏移量$r - 1$,因此是一个单一相位。压缩后,查询$\pmb{q}$重复从$L(S - 1)$个非最终块位置中均匀采样的标记,并请求同一块中的其后继标记$\pmb{y}$【4, Birth of a transformer: A memory viewpoint + 2023 + NeurIPS + https://arxiv.org/abs/2306.00802】、 【24, In-context learning and induction heads + 2022 + Transformer Circuits Thread + https://transformer-circuits.pub/2022/in-context-learning-and-induction-heads/index.html】 。
压缩系数的计算:具体而言,$1 \leq H < S$个头中的每一个将块$\ell$压缩为:
其中压缩系数$\pmb{p}_{h,\ell}^K, \pmb{p}_{h,\ell}^V$是$\mathbb{R}^S$中的概率向量,并且在查询揭示之前选择。为了更清晰的分析,在训练期间固定嵌入,并将查询、键和值映射设置为恒等。
注意力与损失函数:每个头通过块分数$\gamma \langle \pmb{q}, \pmb{k}_{h,\ell} \rangle$上的Softmax对其压缩值进行加权,其中$\gamma \in (0, 1]$,并且尺度为$\beta > 0$的绑定反嵌入(tied unembedding)将求和的头输出映射到下一个标记的逻辑值。将预测$\pmb{y}$的所得总体交叉熵损失记为$\mathcal{L}$。
理想化嵌入几何:假设理想化的嵌入几何具有公共分量$\kappa > 0$和误差$\varepsilon \geq 0$:
公共分量反映了标记表示的各向异性【14, Representation degeneration problem in training natural language generation models + 2019 + ICLR + https://openreview.net/forum?id=SkEYojRqtm】、 【26, Attention sinks and compression valleys in LLMs are two sides of the same coin + 2026 + ICLR + https://proceedings.iclr.cc/paper_files/paper/2026/hash/1734b19d9afe7d2c7f1154954eaf0d5a-Abstract-Conference.html】、 【29, The shape of learning: Anisotropy and intrinsic dimensions in transformer-based models + 2024 + EACL + https://aclanthology.org/2024.findings-eacl.58/】,精确的几何意味 着$\varepsilon = 0$。
精确几何下的头部选择:在精确几何下,一个头特定于目标的逻辑值正比于其对正确块的注意力乘以其对答案的值权重。当一个头将其所有键权重放在$r$上并将其所有值权重放在$r + 1$上(最集中的压缩)时,称该头选择位置$r$。选择增强了查询在$r$处的这两个因子,但放弃了对其他地方查询的直接证据。
定理1(非正式):最佳压缩是集中的:为了了解损失本身倾向于什么,在一个预言机类$\mathcal{G}_{\mathrm{oracle}}$上最小化$\mathcal{L}$,其压缩系数可以任意依赖于上下文但不依赖于查询,且不强加门参数化。记$\pmb{e}_r$为位置$r$处的独热向量,得到以下结果:对于足够大的$N$和足够小的$\varepsilon$,$\mathcal{G}_{\mathrm{oracle}}$上的每个全局最小化器在每个上下文、块$\ell$和头$h$中都设置$\pmb{p}_{h,\ell}^K = \pmb{e}_r$和$\pmb{p}_{h,\ell}^V = \pmb{e}_{r+1}$,其中$r \in \{1, \ldots, S - 1\}$可能依赖于这三者。当$\varepsilon = 0$时,所选位置在每个上下文和块内的头之间是不同的。
定理1的含义:尽管查询未知,但最佳压缩是最大程度集中的,每个块中每个K/V分支的每个头有一个有效偏移量。然而,所选位置可能因上下文和块而异,因此最优性需要每个块中的浓度,但不需要静态浓度。
线性压缩器的设定:为了研究浓度何时变为静态,限制预言机类。每个头有一个键和一个值门向量$\pmb{c}_{h,r}^B \in \mathbb{R}^d$,这是跨上下文和块共享的、唯一的训练参数:
静态浓度的表达能力:在精确几何下,$\pmb{c}_{h,r}^B$沿嵌入均值的分量充当位置$r$的独立于输入的偏置,因此这些门可以表达静态浓度,尽管单独的参数化并不强制它。从一个小的随机初始化分析$\mathcal{L}$上的梯度流。
定理2(非正式):梯度流产生静态浓度:假设$\varepsilon = 0$并且在有效门参数空间中,在以零为中心、半径足够小$\rho$的欧几里得球中均匀初始化。对于固定的模型尺度和相对于$\log(e/\rho)$足够大的$N$,在初始化上的高概率下,$\mathcal{L}$上的梯度流为每个头$h$产生一个位置$r_h \in \{1, \ldots, S - 1\}$,使得当训练时间趋于无穷大时,$\pmb{p}_{h,\ell}^K(r_h), \pmb{p}_{h,\ell}^V(r_h + 1) \to 1$,这在上下文和块上是一致的。不同的头可能选择相同的$r_h$。
定理2的含义:对于每个头,键门分数收敛到$r_h$处的独热向量,值门分数收敛到$r_h + 1$处的独热向量,因此静态和每窗口有效偏移量数量都趋向于一。定理1允许所选位置随输入变化,而梯度流为每个头固定了它。这给出了第9、10和14层相邻键和值偏好的理想化解释,这些层的门分数保持比独热极限更柔和。
实验环境
-
数据集:
- 合成的动物-名称检索任务(包含64个动物和64个人名的精选池)。
- 单标记的“大海捞针”(NIAH)检索数据集,上下文长度为128K。
- 代码补全示例使用DeepSeek-V4官方推理代码、Omarchy Linux Shell测试代码以及改编自
gretelai/synthetic_text_to_sql的SQL任务。 - 用于前缀填充和序列内填充的自然语言文本来自
agentlans/high-quality-english-sentences数据集。
-
模型架构配置:
- 评估了DeepSeek-V4系列模型(DeepSeek-V4-Flash-Base、DeepSeek-V4-Flash-0731、DeepSeek-V4-Pro-Base、DeepSeek-V4-Pro-0813、DeepSeek-V4.1-Flash)以及无分块压缩的DeepSeek-V3.1-Base。
- 预训练的骨干模型为Qwen3-0.6B,具有28层、隐藏宽度1024、16个查询头、头维度128。KV压缩变体包括W8/S8(参考)、W8/S4、W8/S6、W12/S12,并测试了标量门/向量门、重叠/非重叠窗口、不同KV头数等配置。
-
硬件与软件配置:
- DeepSeek-V4的推理使用了官方的TileLang推理实现,模型并行度为4,并使用FP8专家权重。
- Qwen3变体的预训练设置:训练了100B个标记,使用AdamW优化器($\beta_1 = 0.9, \beta_2 = 0.95, \epsilon = 10^{-8}$),权重衰减为0.1,梯度裁剪范数为1。使用BF16精度,全局批次大小为1024个序列,序列长度为2048。学习率预热至$2 \times 10^{-3}$,随后通过余弦调度衰减至$2 \times 10^{-5}$。
实验结果
- 代码补全的周期性翻转:在变长填充词的测试中,DeepSeek-V4系列模型展现出与压缩步长(V4为$S=4$,V4.1为$S=2$)严格匹配的周期性预测翻转(正确或错误延续的概率交替占优)。而无分块压缩的DeepSeek-V3.1-Base则没有表现出这种依赖于位置的周期性翻转(图1及附录B)。
- 大海捞针(NIAH)检索的相位敏感性:在128K上下文的检索中,基础模型的准确率根据源键的取模残差(相位)呈现出高达40.2个百分点的巨大差异。经过后训练的模型虽然整体准确率有所提高,且差距有所缩小,但依然保留了显著的相位敏感性差距(DeepSeek-V4.1-Flash的偶数残差组始终高于奇数残差组)(图2)。
- 预训练Qwen3模型的验证:全注意力基线模型在任何相位上均保持平坦的准确率,而所有引入分块KV压缩的模型均表现出与步长匹配的周期性准确率波动(图3)。例如,W8/S8模型的最好与最差相位差距高达75.3个百分点;即使将学习门替换为均匀平均,差距降至19.2个百分点,但相位敏感性依然存在(图11)。
- 相位特化与敲除影响:KV头敲除实验证实了特定的注意力头在特定的相位上起主导作用。在W8/S8模型中,第9、10、14层等展现出对特定偏移量的强烈静态偏好,且敲除这些头会导致其偏好相位的检索准确率大幅下降(图4、图5)。
- 门循环的因果验证:通过将训练好的压缩门参数循环移动$\delta$个偏移量,实验观察到检索准确率的模式也大致移动了$\delta$个相位。这在多个模型(如W12/S12、W8/S8)中得到了验证,证明了门偏好对窗口内检索准确率波动的因果贡献(图19、图20)。
结论
结论与讨论:本文将相位敏感性确定为具有分块压缩KV缓存的模型中的一种系统性故障模式:检索准确率取决于源信息相对于压缩窗口的相位。该现象出现在DeepSeek-V4、V4.1以及预训练的所有压缩模型中,其周期遵循压缩步长。预训练模型中的KV头敲除和注意力读出干预揭示了对检索的依赖于相位的贡献,为测试模型中的相位特化提供了因果证据。最后,优化动力学分析显示了在简化的二元语法检索模型中,训练如何在规定的假设下产生压缩门的静态浓度,说明了相位特化的一种机制。
未来工作展望:机制结论在受控环境中最为强烈,并未在大型异构模型中确立相位敏感性的普遍原因。特别是,门循环干预不能恢复边界相位(附录H),这使得边界和窗口内不对称性的统一解释悬而未决。显式的跨头和层协调是否能在不牺牲平均性能或压缩效率的情况下使检索质量在不同相位上更加均匀,仍然是一个悬而未决的问题。除了受控检索,代码补全示例记录了DeepSeek-V4和DeepSeek-V4.1中的周期性错误。这些观察结果激发了研究相位敏感性是否也影响与鲁棒性相关的行为。例如,请求在上下文中保持含义不变的移动是否会改变拒绝或遵从,以及任何此类变化是否跟踪压缩相位?将对其在实际应用场景中潜在鲁棒性影响的系统研究留给未来的工作。
补充细节
学习到的压缩记忆:Compressive Transformer总结过去的激活【28, Compressive transformers for long-range sequence modelling + 2020 + ICLR + https://openreview.net/forum?id=SylKikSYDH】,LoMA训练模型使用压缩的KV表示 【36, LoMA: Lossless compressed memory attention + 2024 + arXiv + https://arxiv.org/abs/2401.09486】 ,Activation Beacon用规则间隔的学习标记的KV条目替换原始激活【44, Long context compression with activation beacon + 2025 + ICLR + https://arxiv.org/abs/2401.03462】,CAT让后来的块关注早期块的压缩向量 【25, Controllably efficient language models + 2025 + arXiv + https://arxiv.org/abs/2511.05313】。稀疏注意力和缓存驱逐在内存上施加了相关的块或标记结构 。Sparse Transformer已经定义了一个跨步头,其可见性取决于位置对步长取模【8, Generating long sequences with sparse transformers + 2019 + arXiv + https://arxiv.org/abs/1904.10509】,这是研究的周期性结构的先例。在保留遥远标记的精确分支的混合模型中(如NSA),该分支可能会掩盖仅压缩分支的故障。DeepSeek-V4仅在其局部窗口中保留精确标记 【11, DeepSeek-V4: Towards highly efficient million-token context intelligence + 2026 + arXiv + https://arxiv.org/abs/2606.19348】,在完整模型中发现了相位敏感性(第2节) 。
跨块故障模式:Lost in the Middle效应表明检索质量取决于相关信息在长上下文中的出现位置【19, Lost in the middle: How language models use long contexts + 2024 + TACL + https://aclanthology.org/2024.tacl-1.9/】。RULER表明简单的“大海捞针”测试可能会夸大可用的上下文长度 【16, RULER: What’s the real context size of your long-context language models? + 2024 + First Conference on Language Modeling + https://arxiv.org/abs/2404.06654】,Chen等人表明总分可以隐藏KV缓存压缩的特定于方法的故障 【5, The pitfalls of KV cache compression + 2026 + ACL + https://aclanthology.org/2026.acl-long.1926/】。在基于主旨的压缩中,Deng等人确定了生成段边界附近的退化 【13, A silver bullet or a compromise for full attention? A comprehensive study of gist token-based context compression + 2025 + ACL + https://aclanthology.org/2025.acl-long.241/】。相反,本文关注源标记的相位,它在每个压缩步长中重复,并且不同于整体上下文深度或查询在段内的位置 。
机制研究:确定了检索头,其消融会损害长上下文检索【38, Retrieval head mechanistically explains long-context factuality + 2025 + ICLR + https://arxiv.org/abs/2404.15574】,并且诸如RazorAttention和DuoAttention之类的缓存策略仅为这些头保留完整的缓存 【31, RazorAttention: Efficient KV cache compression through retrieval heads + 2025 + ICLR + https://arxiv.org/abs/2407.15891】、 【39, DuoAttention: Efficient long-context LLM inference with retrieval and streaming heads + 2025 + ICLR + https://arxiv.org/abs/2410.10819】。这些工作确立了头在检索角色上的差异。表明在压缩模型中,头的检索贡献也取决于相位,并且在检查的头中,与其压缩门偏好的偏移量一致(第4节) 。
理论方面:梯度下降可以将Softmax注意力转化为硬标记选择器【32, Transformers as support vector machines + 2023 + arXiv + https://arxiv.org/abs/2308.16898】、 【33, Max-margin token selection in attention mechanism + 2023 + NeurIPS + https://arxiv.org/abs/2306.13596】,多头训练动力学可以在头之间分配任务 【6, Training dynamics of multi-head softmax attention for in-context learning: Emergence, convergence, and optimality + 2024 + Conference on Learning Theory + https://proceedings.mlr.press/v247/siyu24a.html】、 【42, Incremental learning of sparse attention patterns in transformers + 2026 + ICML + https://arxiv.org/abs/2602.19143】。不声称这是关于注意力硬化或头部特化的第一个理论。分析反而涉及在已知查询之前选择的压缩,并询问集中的压缩何时是最优的,以及训练何时使其变为静态(第5节) 。
附录
定理1和定理2的延迟证明:在附录A中,陈述并证明了定理1和定理2的正式版本。定理8表明,预言机类上的每个最小化器都使用硬相邻选择,每个头将其所有键权重放在一个相位上,并将其所有值权重放在下一个相位上。将这样一对键和值相位称为一条路线。所选路线可能因上下文和块而异。定理12表明,从小的随机初始化对线性压缩器进行梯度流,以高概率达到硬相邻选择,每个头对所有输入都有一条路线,尽管不同的头可能共享一条路线。所陈述的正式条件比第5节中更一般。那里假设的$L \geq 4$和$\gamma \leq 1$意味着$\gamma < \log 3 \leq \log(L - 1)$,因此正式条件在正文设置中成立。
平均与选择的权衡:这两个结果都取决于平均和选择之间的权衡。平均块中位置的头保留了关于每个位置的一些证据,而选择一个位置的头则以全强度保留该位置的证据,并放弃关于其他位置的直接证据。当选定位置的增益超过其他地方的损失时,选择是有利的。第二个问题是几个头是否在它们之间划分位置,称之为互补覆盖,因为只有当它们的选择不同时,锐利的头才能服务尽可能多的位置。
一般模型中的权衡复杂性:在一般模型中,这种权衡很难直接看到。每个头在每个块的$S$个位置上具有键和值系数,并通过其自己的Softmax关注块,所有头都通过词汇表上的Softmax耦合,并且在梯度流下,系数来自依赖于输入嵌入的门。因此,希望在一个足够小的设置中看到这种权衡,以便在证明一般结果之前手工解决。
两相位玩具示例:在附录A.1中,研究了一个具有两个头和两个相位的玩具示例,其中每个头的压缩由单个数字设置,损失是两个变量的函数。在那里可以以封闭形式计算为什么头会锐化其压缩,以及为什么两个头倾向于在它们之间划分相位。该玩具示例不是一般定理的特例,因为它有$S = 2$,只保留键,并理想化了值读出。使用它来获取直觉,并在其末尾解释了其论证的哪些部分延续到一般模型,哪些部分没有(附录A.1.2)。
玩具示例中的互补两相位选择:在玩具示例中,每个块包含两个固定的键条目$k_{\ell,1}, k_{\ell,2}$。每个头$h \in \{1, 2\}$使用可训练的逻辑值$\theta_h$形成一个压缩键:
这里$\sigma(t) = (1 + e^{-t})^{-1}$,$p_h = 1$选择相位1,$p_h = 0$选择相位2,$p_h = 1/2$平均混合它们。随后的查询以相等的概率请求任一相位。在正交寻址下(具有$\kappa = 0$的精确几何的类似物),查询与其在唯一目标块中请求的键的内积为一,与所有其他键的内积为零。因此,在注意力尺度为一的情况下,头$h$的目标块逻辑值对于相位1是$p_h$,对于相位2是$1 - p_h$,而所有$L - 1$个干扰逻辑值均为零。两个头对相位1和2的总正确块注意力质量为:
玩具示例的优化分析:训练更新逻辑值$\theta_h$而不是$p_h$,因此根据它们重写目标。设$\pmb{\theta} = (\theta_1, \theta_2)$,并将头$h$的符号相位偏好写为:
对于$s = +1$(相位1)或$s = -1$(相位2),头$h$的目标块逻辑值为$(1 + s\chi(\theta_h)) / 2$,因此其正确块注意力质量为:
定理3(互补两相位选择):假设$D > 1$。在$[0, 1]^2$上,$\mathcal{L}(p_1, p_2)$的唯一全局最小化器是$(1, 0)$和$(0, 1)$,在紧化的$\pmb{\theta}$空间中对应于$(+\infty, -\infty)$和$(-\infty, +\infty)$。如果还满足$2\beta \sigma \left( \frac{2\beta}{1+D} \right) > D - \frac{1}{D}$,那么在原点的足够小邻域内支持的任何绝对连续初始化几乎必然在梯度流下收敛到这些最小化器之一。如果其密度有界,那么对于$\delta, \eta \in (0, 1/2)$,在概率最多为$\delta$的事件之外,直到$(p_1(t), p_2(t))$位于$(1, 0)$或$(0, 1)$的$\ell_\infty$距离$\eta$内的时间为$T_{\eta, \delta} = \mathcal{O} \left( \log \frac{1}{\delta} + \frac{1}{\eta} \right)$。这通过引理4(全局最小化器)、引理5(互补路由的稳定性)、引理6(吸引的互补管)和引理7(退出进入互补管)来证明。
从玩具示例到一般模型:玩具示例隔离了两种压力,一种倾向于锐利的头,另一种倾向于平衡的相位覆盖。锐化来自与$L - 1$个干扰块的竞争。因为$D > 1$,均匀的头给正确块的注意力不到一半,并且在这个机制中,当目标逻辑值增加时,正确块注意力质量的上升超过了当逻辑值减少相同数量时的下降。因此,向一个相位移动的头在该相位上获得的注意力质量多于在另一相位上失去的注意力质量,这提高了两个相位的平均注意力质量。平衡来自损失。两个头为每个相位的相同边距添加证据,并且逻辑损失随着边距的增长而变平,因此添加到具有较大边距的相位的证据比添加到具有较小边距的相位的证据降低损失更少。对于固定的均值,因此当两个相位接收相同的注意力质量时,损失最小。只有在互补端点处才能同时满足这两种压力,这就是为什么它们是唯一的全局最小化器。
一般模型中的压力变化:这两种压力在一般模型中再次出现,但它们以不同的方式发生变化。锐化仍然存在,但它现在来自将键与值配对,而不是来自$D > 1$提供的不对称性。在精确几何下,一个头对于位置$r$处查询的目标逻辑值的贡献是其正确块注意力(随其在$r$处的键权重增长)乘以其在$r + 1$处的值权重。因为值权重总和为一,所以这个贡献在查询位置上求和最多是一个独热键所接收的注意力,并且只有当键系数在某个$r$处是独热的,并且值系数在$r + 1$处是独热的时,它才达到该值。相比之下,当词汇表很大时,平衡变得微弱。在这种机制下,交叉熵损失在目标逻辑值中几乎是线性的,因为其归一化器主要由未出现在上下文中的许多词汇项主导。在精确几何下,选择相同位置的两个头保持相同的预期目标逻辑值,并且仅通过归一化器支付成本,数量级最多为$1/N$。当$\varepsilon = 0$时,这种惩罚仍然使互补覆盖成为最佳选择。然而,动力学证明将所有归一化器项视为小扰动,并且剩余的目标项不耦合不同的头,因此证明没有分离它们的力。因此,与玩具示例不同,定理12保证了持久的选择,但不保证互补覆盖。
模型和压缩器类:在附录A.2中,用完整的符号陈述了第5节的一般模型。对于正整数$m$,记$[m] := \{1, \dots, m\}$。设$S \geq 3$,使用$1 \leq H \leq S - 1$个头,并使用$L \geq 2$个块。块是不重叠的,每个包含$S$个位置。设$\mathcal{V} \subset \mathbb{R}^d$为包含$N$个不同嵌入向量的词汇表,其中$N \geq LS$。上下文$\pmb{X}$由$L$个有序块组成:$\pmb{X} = \big( (\pmb{x}_{\ell,1}, \dots, \pmb{x}_{\ell,S}) \big)_{\ell=1}^L$,其中$LS$个嵌入从$\mathcal{V}$中均匀无放回地采样。独立地,$\ell_* \sim \mathrm{Unif}[L]$和$r_* \sim \mathrm{Unif}[S - 1]$。查询向量为$\pmb{q} = \pmb{x}_{\ell_*,r_*}$,目标嵌入为$\pmb{y} = \pmb{x}_{\ell_*,r_*+1}$。让$\mathcal{X}$为具有不同嵌入的所有此类有序上下文的有限集。
预言机类与线性压缩器类:考虑两个压缩器类。在预言机类(Oracle class)中,在观察到$\pmb{X}$之后且在采样$(\ell_*, r_*)$之前,压缩器规则可以为每个$\ell \in [L]$和$h \in [H]$计算任意概率向量$\pmb{p}_{h,\ell}^K(\pmb{X}), \pmb{p}_{h,\ell}^V(\pmb{X}) \in \Delta_S$。这些键和值压缩系数可以任意依赖于$\pmb{X}$。压缩的KV条目为$\pmb{k}_{h,\ell} = \sum_{r=1}^S \pmb{p}_{h,\ell}^K(r) \pmb{x}_{\ell,r}$,$\pmb{v}_{h,\ell} = \sum_{r=1}^S \pmb{p}_{h,\ell}^V(r) \pmb{x}_{\ell,r}$。对于训练动力学结果,将预言机类限制为线性压缩器(Linear compressors),其门逻辑值在嵌入中是线性的。它们使用跨上下文和块共享的向量$\pmb{c}_{h,r}^K, \pmb{c}_{h,r}^V \in \mathbb{R}^d$,没有标量偏置。
定理8(定理1的正式版本):在公式(37)的几何假设下,存在常数$c_{\gamma,\beta}, C_{\gamma,\beta} > 0$使得以下成立。假设$N \geq C_{\gamma,\beta} L S \exp \left( \frac{C_{\gamma,\beta} H}{L} \right)$且$\varepsilon \leq \frac{c_{\gamma,\beta}}{L^2 H S}$。那么$\mathcal{G}_{\mathrm{oracle}}$上的每个最小化器都使用硬相邻选择:对于每个$\pmb{X} \in \mathcal{X}$,$\ell \in [L]$和$h \in [H]$,存在$r_{\pmb{X},\ell,h} \in [S - 1]$使得$\pmb{p}_{h,\ell}^K(\pmb{X}) = \pmb{e}_{r_{\pmb{X},\ell,h}}$,$\pmb{p}_{h,\ell}^V(\pmb{X}) = \pmb{e}_{r_{\pmb{X},\ell,h} + 1}$。如果$\varepsilon = 0$,最小化器恰好是那些分配,对于这些分配,对于每个$\pmb{X}$和$\ell$,映射$h \mapsto r_{\pmb{X},\ell,h}$是单射的。这通过引理9(投影到相邻顶点)排除混合系数和引理10(精确几何下的不同路线)比较剩余的独热路线分配来证明。
定理12(定理2的正式版本):在假设11(均匀检索分布、固定模型参数、精确几何和正均值、仅门总体训练、小随机初始化)下,对于每个$0 < \delta < 1$,存在$0 < c_\delta \le 1$和$C_\delta < \infty$使得以下成立。如果$0 < \rho \leq c_\delta$且$N \geq C_\delta \log \frac{e}{\rho}$,那么以至少$1 - \delta$的概率,存在$r_1, \dots, r_H \in [S - 1]$使得当$t \to \infty$时,$\max_{h \in [H]} \sup_{\pmb{X} \in \mathcal{X}, \ell \in [L]} \max \{ 1 - p_{h,\ell}^K(r_h; t, \pmb{X}), 1 - p_{h,\ell}^V(r_h + 1; t, \pmb{X}) \} \to 0$。路线$r_h$不一定不同。
定理12的证明逻辑:证明跟踪了从对称的零起始路径到对齐的赢家,然后到持久的独热路由的动力学。当每个头的键门偏好某个相位$r_h \in [S - 1]$且其值门偏好下一个相位$r_h + 1$时,赢家是对齐的。引理13(词汇表抑制)表明归一化器导数是$\mathcal{O}(N^{-1})$的。引理14(对称基线和路线对比增长)表明从零开始的轨迹保持在均值对齐子空间中,所有头同意,并且路线对比是不稳定的。引理15(来自随机初始化的对齐路线差距)表明从小的随机开始,每个头以高概率获得这样一条路线。引理16(均值放大)和引理17(对齐赢家的持久性)表明该路线随后被放大并在每个输入中持续存在。
代码补全示例的额外细节:在附录B中,给出了第2.1节中代码补全示例的细节:精确的标记计数、后训练模型和没有分块压缩的DeepSeek-V3.1-Base上的相同示例,以及另外两个代码补全示例。对于DeepSeek-V4-Flash-Base的FP8示例,给出了重现它所需的精确输入,以及另外三个填充词系列,以测试逆转是否取决于填充词的格式或措辞。在所有四个填充词系列中,都观察到了预测的周期性翻转。在聊天格式输入的后训练模型(DeepSeek-V4-Flash-0731和DeepSeek-V4.1-Flash)上,这种敏感性依然存在,尽管其周期和对填充词内容的依赖因模型而异。相反,没有分块压缩的DeepSeek-V3.1-Base没有表现出周期性逆转。此外,还展示了Omarchy合盖测试(Shell脚本)和SQL站点距离查询任务中的周期性错误,证明这种反转并非FP8示例独有。
大海捞针评估的额外细节:在附录C中,描述了第2.2节和第3节中“大海捞针”评估的细节。对于DeepSeek-V4系列,构建了2048个提示词(V4.1为20480个),每个提示词包含128000个标记和16000个键值对。通过改变自然语言填充词的长度,将提示词按源键位置对8取模的残差分为八个残差组,同时固定了提示词长度、查询位置以及目标位置的均值和方差。对于基于Qwen3的模型,构建了精确的动物-名称检索任务,并使用了两种填充协议:前缀填充(Prefix Padding)将自然语言填充词放在映射主体之前和之后,移动所有记录;序列内填充(In-sequence Padding)则在主体内部使用固定数量的间隔符,通过改变目标前后的间隔符分布来改变相位,而无需移动整个主体。
基于Qwen3模型的架构和预训练额外细节:在附录D中,描述了第3节中预训练模型的架构、注意力内存、位置编码和训练设置。Qwen3-0.6B骨干具有28层、隐藏宽度1024、16个查询头和头维度128。参考压缩内核使用非重叠窗口($W=S=8$),每层一个KV头,具有标量门和独立的K/V分支。详细说明了窗口索引、注意力内存和可见性策略(固定宽度局部窗口与开放尾部局部窗口)、位置编码(部分RoPE与无RoPE)以及K/V绑定。参考的100B标记训练运行使用AdamW,批量大小为1024个序列,序列长度为2048。
KV头敲除的额外细节:在附录E中,定义了第4.1节中的KV头敲除。敲除测量了当注意力组件的特定于提示词的输出被固定的参考向量替换时,检索如何变化。使用该组件在独立的校准提示词上的平均输出作为参考,这消除了输出携带的关于特定提示词的信息(如查询的键对应哪个值),同时保留了其平均值。详细描述了替换的注意力输出、校准和均值替换的计算、评估提示词和指标,以及对预训练模型和DeepSeek-V4-Flash-Base的敲除扫描。强调干预改变了内部表示而保持评估提示词和模型参数固定,从而测量了干预对测试检索行为的因果影响,但它不是对记忆的字面删除,也不能证明存在唯一的检索回路。
基于Qwen3模型的完整结果:在附录F中,提供了表8中列出的23个压缩运行和3个全注意力基线的完整扫描结果。通过六组图表比较了前缀填充和序列内填充,并报告了在KV头敲除下的逐层按相位的相对准确率变化。结果表明,没有任何测试的架构变化(包括随机种子、KV头数、压缩几何、压缩内核、位置和归一化、本地内存策略)能够消除周期性的薄弱点,尽管某些配置(如均匀平均)显著缩小了差距。
跨模型的门偏好和敲除效果:在附录G中,展示了门偏好与敲除效果之间的联系在更多模型中的体现,包括四个W8/S8种子复制的每个头,以及另外五个配置的每个头。通过静态浓度和每窗口浓度测量门偏好(图14)。锐利的门偏好以及在偏好相位处的敲除损伤在不同种子(图16)和配置(如无RoPE、较大窗口、四个KV头,图15和图17)中反复出现,但并非每个头都如此。对于重叠窗口(如DeepSeek风格内核),按相位折叠的门曲线显示出较少的偏好(图18),因为每个相位汇总了多个偏移量,且向量门分数在通道上取平均值。
重定向门偏好:在附录H中,测试了在训练后编辑具有锐利偏移量偏好的门是否会随之移动薄弱相位。通过将每个门的参数(门映射和偏置)循环移动固定的偏移量$\delta$,在五个具有非重叠窗口的模型中验证了准确率模式是否移动了$\delta$个相位。在远离边界相位的区域,观察到的准确率模式在很大程度上遵循了所有模型和循环的预测(图19、图20),$R^2$通常在0.88到1.00之间。这支持了在这些模型中门偏好对窗口内检索的因果贡献。然而,门循环并没有恢复边界相位的准确率,并且会降低整体准确率。
扩展的相关工作:在附录I中,提供了关于相关工作的更广泛讨论,涉及学习到的摘要记忆(如Compressive Transformer、Activation Beacon、CAT等)、跨块故障模式(如Lost in the Middle、基于主旨的压缩中的锯齿现象)、稀疏和混合路由(如Sparse Transformer、NSA、DeepSeek-V4)、缓存分配和专用的检索组件(如H2O、SnapKV、RazorAttention)、检索诊断和位置偏置,以及优化和特化理论。指出本文的经验主张更加具体,即在压缩模型中,KV头的检索贡献取决于相位,并且与它们的压缩门偏好一致。
💬 评论讨论
欢迎在这里分享您的想法和见解!