SpecCache: Speculative KV Cache Reuse for Efficient RAG Serving

发表时间: 2026-07 · ACL 2026

原文: https://aclanthology.org/2026.acl-long.859

Zijian Wen, Tao Zhang, Shuangwu Chen, Shenghao Ye, Yu Guo, Qirui Chen, Jingxian Shuai, Yunpeng Hou, Huasen He, Jian Yang
University of Science and Technology of China, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center

速读

一句话结论 提出了一种名为 SpecCache 的免训练选择性 KV Cache 复用框架,通过轻量级投机模型的深层特征指导目标大模型挑选关键 Token 进行重计算,在几乎不损失生成质量的前提下大幅降低了首字延迟并提升了吞吐量。

要解决什么问题 在检索增强生成(RAG)中,拼接大量检索文本会导致大模型在预填充阶段的注意力计算复杂度呈平方级增长,引发极高的首字延迟。现有的 KV Cache 复用方案在处理多文本块时卡在了“如何准确挑选需重计算的 Token”上。直接拼接所有预计算的 KV Cache 会丢失跨文本块的注意力信息,导致实际 KV 值产生严重偏移,生成质量大幅下降;Prefix Caching 则只能匹配首个文本块,复用率极低。近期方法转向选择性重计算,但 EPIC 依赖静态规则(强制重计算每个文本块前几个 Token),容易漏掉重要语义词;CacheBlend 利用目标模型第一层的 KV 偏移量来挑选 Token,但浅层网络主要捕获表面特征,缺乏深层语义信息,无法精准定位真正引发严重 KV 偏移的关键 Token。

怎么做的 核心思路是利用轻量级投机模型的深层隐藏状态作为代理,指导目标大模型挑选需重计算 KV Cache 的关键 Token。作者发现,KV 值偏移在深层网络中最显著,且轻量级投机模型与目标大模型在深层语义特征上高度一致。用小模型跑一遍输入,既绕开了大模型提取深层特征的巨大开销,又比浅层特征更精准。方法由三个部件构成。首先是重要性分数估计,将长上下文输入投机模型,提取其深层(最后三分之一层)隐藏状态,计算每个 Token 在这些层的 $L_2$ 范数平均值作为重要性分数:

$$I_i = \frac{1}{S - D + 1} \sum_{\ell=D}^S \bigl\| h_i^{(\ell)} \bigr\|_2$$


范数越大的 Token 对注意力输出的扰动风险越高,据此选取分数最高的 Top-K 个 Token。其次是语义跨度补全,用于解决独立挑选 Token 导致的语义词组碎片化问题。该部件对分数归一化后,计算相邻 Token 分数的相对变化率 $\delta_i$:

$$\delta_i = \frac{\left| \tilde{I}_{i+1} - \tilde{I}_i \right|}{\tilde{I}_i}$$
当变化率小于阈值时合并为一个跨度。若某跨度内被选中的 Token 比例超过设定阈值,则将该跨度剩余 Token 全部拉入重计算集合,保证实体语义完整。最后是跨分词器对齐,由于投机模型和目标模型分词器不同,该部件通过共享的原始输入建立映射,确保投机模型选出的 Token 能准确覆盖目标模型对应的所有子 Token,从而在目标模型预填充时精准执行重计算。

效果如何 实验基于 vLLM 搭建,投机模型为 1B 参数的 LLaMA3-1B-Instruct,目标模型涵盖 Mistral-7B-Instruct-v0.2、LLaMA3-8B-Instruct 和 YiCoder-9B-Chat。评测数据含 LongBench 的多跳问答和摘要任务,文本块设为 512 Tokens,硬件为双卡 40GB A100。对比基线包括:代表标准预填充的 Full recompute、代表直接复用的 Full reuse、代表基于浅层特征动态复用路线的 CacheBlend,以及代表基于静态固定位置复用路线的 EPIC。在 15% 重计算比例下,SpecCache 任务得分比 CacheBlend 高出 2.1% 至 23.2%,比 EPIC 高出 3.4% 至 30.08%。在维持极高生成质量的同时,相比全量重计算将首字延迟降低了 2.17 至 3.95 倍,吞吐量提升了 2.7 至 5.2 倍。代价方面,引入投机模型打分和对齐会产生约占预填充时间 5% 的额外延迟。局限在于,由于低排名 Token 估计存在噪声及跨度补全引入的碎片化,任务质量不随重计算比例严格单调上升;且当前仅使用现成通用投机模型,未针对目标模型微调,也尚未在 70B 级别超大模型上验证扩展性。

主要贡献

检索增强生成(RAG)通过补充外部知识库检索到的文本块,显著增强了大型语言模型(LLMs)的能力。然而,处理这种长上下文会显著增加推理延迟,因为注意力机制的计算复杂度随输入长度呈二次方增长,导致首个Token生成时间(TTFT)大幅增加。为了加速RAG服务,跨不同LLM输入复用相同检索文本的KV缓存成为一种有前景的解决方案。

当前依赖浅层特征或静态启发式规则的KV缓存复用方法往往无法准确识别需要重新计算的关键Token,从而导致生成质量下降。本文的核心研究目标是打破高延迟的全KV重新计算与低质量的全KV复用之间的权衡。作者观察到KV偏差在模型的深层网络中更为明显,但直接从目标模型中提取深层特征的计算成本过高。关键的创新点在于,作者发现轻量级投机模型(Speculative Model)的深层特征在选择需要重新计算的关键Token时,与目标模型表现出强烈的一致性。

基于上述发现,本文提出了SpecCache框架。该框架利用投机模型的深层隐藏状态范数(Hidden-state Norms)作为代理,指导目标大模型进行关键Token的选择。实验表明,SpecCache超越了现有的最先进(SOTA)基线方法。与全KV重新计算相比,它将TTFT减少了 $2.17 - 3.95 \times$,推理吞吐量提高了 $2.7 - 5.2 \times$,且生成质量的下降微乎其微。

背景知识与关键观察

现有KV缓存复用策略的局限性。现有的KV缓存复用方法存在明显的缺陷。直接拼接所有检索块预计算KV缓存的完全KV缓存复用(Full KV Cache Reuse)方法避免了冗余计算,但无法捕获跨块注意力(Cross-chunk attention),导致预计算的KV缓存与完全重新计算获得的实际值存在巨大偏差,严重降低了生成质量。目前系统广泛采用的前缀缓存(Prefix Caching)通过匹配最长公共前缀来复用LLM输入,但在包含多个文本块的RAG场景中,只有第一个块可以作为前缀,其他块的KV缓存无法使用,导致复用率低且加速效果有限。近期的研究转向选择性KV缓存复用,例如EPIC采用静态选择策略,将每个块的前几个Token指定为关键Token;而CacheBlend采用动态选择策略,仅重新计算在第一层表现出大KV偏差的Token。然而,浅层网络主要捕获句法或表面特征,其包含的语义内容少于深层网络,这引发了浅层网络能否准确识别真正关键Token的疑问。
图1:KV缓存复用策略比较。(a) 完全KV复用:直接复用所有检索到的KV缓存。(b) 前缀缓存:复用匹配的前缀并重新计算后缀。(c) EPIC:重新计算每个块固定位置的Token并复用其余部分。(d) CacheBlend:重新计算从第一层选择的Token并复用其他。(e) SpecCache(本文方法):利用投机模型精确选择关键Token进行重新计算。

深层特征对KV偏差的敏感性。为了研究浅层网络识别关键Token的有效性,作者通过测量每一层预计算KV缓存与完全重新计算KV缓存之间的余弦距离来分析逐层KV偏差。分析结果表明,跨不同模型的KV偏差在浅层通常很微弱,但在深层变得非常显著。基于此,作者使用深层特征进行可靠的KV偏差检测,深层引导的方法(SpecCache)显著优于依赖浅层特征或静态启发式规则的方法(如CacheBlend和EPIC)。
图2:逐层KV偏差。左图:浅层无法捕获KV偏差的漂移,而深层显示出高敏感性。右图:在MuSiQue数据集上评估Llama-3-8B时,SpecCache(深层引导)显著优于依赖浅层特征的方法(CacheBlend)或静态启发式方法(EPIC)。

投机模型深层特征的一致性。直接从目标大模型中提取深层特征进行Token选择会导致巨大的延迟,从而抵消KV缓存复用的优势。受投机解码(Speculative Decoding)的启发,作者观察到轻量级投机模型的深层语义特征与目标大模型之间存在强烈的一致性。通过评估重要性分数估计选出的前 $20\%$ Token的重叠率(Jaccard相似度),发现浅层-深层基线(Shallow-Deep baseline)的重叠率较低,表明浅层Token选择无法代表深层偏好;相反,投机模型实现了更高的重叠率。值得注意的是,跨家族(Cross-family)的投机模型仍然优于浅层-深层基线,这证实了投机模型可以作为目标模型的代理来识别重要Token。
图3:Token选择重叠率。在2WikiMQA上选出的前20%重要Token的Jaccard相似度(投机模型:Llama3-1B, Qwen2.5-1.5B;目标模型:Llama3-8B)。Spec Target测量跨模型重叠(同家族/不同家族),Target $L_0 L_{10/20/30}$ 报告了浅层-深层的模型内基线,测量目标模型第0层与更深层之间的Token选择重叠率($L_k$ 表示第 $k$ 层)。

方法细节

2.1 SpecCache概述

SpecCache工作流概述。作者开发了SpecCache以改进RAG服务中的选择性KV缓存复用。SpecCache的工作流程包含三个阶段:首先,检索相关的文本块并加载其预计算的KV缓存;接着,使用一个轻量级的投机模型来评估Token的重要性并选择需要重新计算的Token;最后,基于所选的Token在目标模型中执行选择性KV复用。
图4:SpecCache框架概述。投机性Token选择的流水线包括:(1) 重要性分数估计以识别关键Token;(2) 语义Span补全以保留连贯的多Token Span;(3) 跨分词器对齐以将选择准确映射到目标模型。

RAG上下文与预计算KV缓存。SpecCache首先检索与用户查询相关的文本块,这些文本块的KV缓存已经离线预计算并存储在KV缓存池(KV Cache Pool)中。随后,SpecCache获取这些对应的缓存,同时将组装好的完整输入(结合检索到的文本块和用户查询)送入投机模型中,以进行投机性Token选择。

投机性Token选择。给定组装好的输入,投机模型通过一个三步流水线来识别需要重新计算的Token集合:首先,基于深层隐藏状态范数进行重要性分数估计(Importance Score Estimation);接着,通过语义Span补全(Semantic Span Completion)来减少多Token语义单元的碎片化;最后,执行跨分词器对齐(Cross-Tokenizer Alignment),将投机模型选出的Token映射到目标模型的分词器空间,最终生成最终的重新计算Token集合。

选择性KV复用。给定需要重新计算的Token和预计算的KV缓存,目标模型在Prefill阶段执行选择性KV缓存复用。SpecCache首先执行位置恢复(Positional recovery),确保预计算的KV缓存正确对应于它们在组装输入中的绝对位置。然后,目标模型重新计算所选Token的KV缓存,并将其与预计算的缓存进行融合,从而完成选择性KV缓存复用过程。

2.2 重要性分数估计

基于深层隐藏状态的Token重要性评估。为了在选择性KV缓存复用中识别关键Token,需要测量每个Token的重要性分数。该分数源自投机模型的隐藏状态。设 $X^s = [x_1^s, \dots, x_N^s]$ 表示由检索块与用户查询拼接而成的输入序列,其中 $N$ 是投机模型分词器下的Token数量。将 $X^s$ 输入到一个 $S$ 层的投机模型中,会在深层范围 $\ell \in \{D, \dots, S\}$ 内产生一系列隐藏状态 $\{h_i^{(\ell)} \in \mathbb{R}^d\}$,其中 $D$ 表示深层的起始索引。在本文中,深层被定义为模型的最后三分之一层。然后计算重要性分数 $\mathcal{I} = \{I_1, \dots, I_N\}$,其中每个对应于Token $x_i^s$ 的 $I_i$ 计算为其在各深层隐藏状态的平均 $\ell_2$ 范数:

$$ I_i = \frac{1}{S - D + 1} \sum_{\ell=D}^S \bigl\| h_i^{(\ell)} \bigr\|_2, \quad i = 1, \dots, N. $$

基于幅值的Token影响力量化依据。上述公式的建立基于Token影响力的幅值视角。由于Value向量是隐藏状态的线性投影,更大的隐藏状态范数本质上会诱导出更大级别的Value向量。考虑到注意力输出是由Value向量的加权混合形成的,这些向量的幅值直接决定了它们对最终输出的贡献比例【15,Attention is not only a weight: Analyzing transformers with vector norms + 2020 + EMNLP】。近期在KV缓存缩减方面的证据进一步表明,Value向量范数捕获了关键的重要性信号【10,Attention score is not all you need for token importance indicator in kv cache reduction: Value also matters + 2024 + EMNLP】。因此,作者将具有大范数的Token视为携带更高的复用引起的扰动风险,因为这些Token中的KV偏差在最终的注意力输出中会被放大。作者特意将这种聚合限制在深层,因为观察表明深层对KV偏差具有独特的敏感性。此外,轻量级投机模型与目标模型之间的强烈一致性使其能够作为选择重要Token的可靠代理。给定全局重新计算比率 $\rho \in (0, 1)$,作者选择具有最高 $I_i$ 值的初始TopK($K = \lceil \rho N \rceil$)个Token进行重新计算,而其余Token则检索其预计算的KV缓存。该选择过程公式化如下:

$$ T_{\mathrm{init}}^s = \left\{ x_i^s \in X^s \mid i \in \mathrm{TopK}(\mathcal{I}, K) \right\}. $$


随后,初始Token集合 $T_{\mathrm{init}}^s$ 将通过语义Span补全过程进行细化。

2.3 语义Span补全

独立选择导致的语义碎片化问题。初始Token集合 $T_{\mathrm{init}}^s$ 是通过独立对Token进行排序获得的,这可能会破坏多Token的语义单元。例如,TopK策略可能会选择“New”和“City”,但遗漏了“York”,导致在KV复用下实体被部分刷新并发生语义退化。因此,作者应用了一个轻量级的后处理步骤,该步骤首先基于重要性分数将Token分割为局部平滑的Span,接着当一个Span已经被 $T_{\mathrm{init}}^s$ 充分覆盖时,通过填补其剩余未选择的Token来补全该Span。

基于相对变化的Span分割。Token级别的重要性分数可能存在噪声,并且其绝对尺度可能因提示词和数据集而异。为了稳健地识别多Token语义单元的边界,作者对归一化后的信号进行操作。具体而言,将Token重要性分数进行归一化,使其在不同输入之间具有可比性:

$$ \tilde{I}_i = \frac{I_i - \min I_k}{\max I_k - \min I_k}. $$


然后,基于相邻Token之间的相对变化来识别Span边界以划分序列,公式化如下:

$$ \delta_i = \frac{\left| \tilde{I}_{i+1} - \tilde{I}_i \right|}{\tilde{I}_i}, \quad i = 1, \dots, N - 1. $$
基于这种相对变化,只要 $\delta_i < \tau_{\mathrm{smooth}}$,就将连续的Token合并为一个Span,生成Span集合 $\mathcal{P} = \{p_1, \dots, p_J\}$。每个Span $p_j = [u_j, v_j]$ 是一个索引区间,其中 $u_j$ 和 $v_j$ 分别表示起始和结束Token的索引。为了防止合并过长,将最大Span长度限制为16个Token。

基于覆盖率的Span补全机制。在分割之后,并非每个Span都需要补全。补全所有Span会过度膨胀重新计算比率,从而破坏KV缓存复用带来的效率收益。因此,作者采用重要Token覆盖率作为一个简单的标准来指导选择性Span补全。对于每个Span $p_j$,按如下方式计算重要Token覆盖率:

$$ r_j = \frac{\left| T_{\mathrm{init}}^s \cap [u_j, v_j] \right|}{v_j - u_j + 1}. $$


如果覆盖率超过阈值(即 $r_j \geq \tau_{\mathrm{cover}}$),则将整个Span添加到重新计算集合中。细化后的选择可以公式化为:

$$ T^s = T_{\mathrm{init}}^s \cup \bigcup_{r_j \geq \tau_{\mathrm{cover}}} p_j. $$
实验中设置 $\tau_{\mathrm{smooth}} = 0.4$ 和 $\tau_{\mathrm{cover}} = 0.7$。为了避免过度扩展,在Span补全后会应用全局预算控制。如果扩展后的集合超过了最大尺寸限制,则仅保留在相同 $I_i$ 排名下重要性最高的Token,并丢弃其余部分。这防止了重新计算量的过度增长,同时保留了最显著的更新。总体而言,这种细化确保了重要的实体和短语被完整重新计算,而不是作为碎片化的Token子集,从而减少了KV复用下的KV偏差。

2.4 跨分词器对齐

跨分词器对齐机制。在实际部署中,投机模型和目标模型通常使用不同的分词器(Tokenizer)【25,Accelerating llm inference with lossless speculative decoding algorithms for heterogeneous vocabularies + 2025 + ICML】。因此,投机模型选择的一个Token可能对应于目标分词器下的多个子Token。为了应用投机模型选出的Token,作者通过共享的原始输入对齐两个模型的Token序列,从而在投机模型和目标模型之间建立位置映射。设 $X^t = [x_1^t, \dots, x_M^t]$ 表示目标模型的Token序列。定义一个对齐映射 $\Psi$,其中 $\Psi(x_i^s) \subseteq \{x_1^t, \dots, x_M^t\}$ 表示与所选Token $x_i^s$ 相对应的目标Token索引集合。例如,如果 $x_i^s$ 被拆分为两个目标子Token $x_j^t$ 和 $x_{j+1}^t$,那么 $\Psi(x_i^s) = \{x_j^t, x_{j+1}^t\}$。给定选择集合 $T^s$,通过将每个选定的Token扩展为其所有对齐的目标子Token,将其转换为目标索引。生成的重新计算集合可以公式化为:

$$ T \triangleq \bigcup_{x_i^s \in T^s} \Psi(x_i^s). $$

对齐机制的作用。这种对齐机制防止了部分更新,它确保一旦某个Token被选中,代表相同文本片段的所有对应目标子Token都将被重新计算,从而保持与目标分词器的严格一致性。在目标模型Prefill期间,然后准确地为 $T$ 中的索引重新计算KV缓存,确保即使两个词表不同也能进行正确的重新计算。

实验环境

实验结果

延迟与质量的权衡比较。作者评估了SpecCache、完全重新计算(Full recompute)以及代表性的KV缓存复用基线(完全复用、CacheBlend、EPIC)。完全重新计算获得了最高的质量但TTFT最大;完全复用最小化了TTFT但质量大幅下降。相比之下,SpecCache始终处于高精度区域并改善了延迟-质量边界。在 $15\%$ 的重新计算比率下,SpecCache恢复了大部分完全重新计算的质量,同时将TTFT减少了 $2.17 - 3.95 \times$;在 $20\%$ 时,它匹配了完全重新计算的分数,同时保留了显著的延迟优势。
图5:延迟与质量对比。EPIC的后缀表示每个块重新计算的Token数量,而对于SpecCache和CacheBlend,它表示重新计算比率。

选择性KV复用方法的比较。由于重要性评分的开销,SpecCache引入了适度的TTFT增加,但在评估的任务中通常产生比EPIC和CacheBlend更高的生成质量。具体而言,在 $15\%$ 的比率下,SpecCache得分显著高于CacheBlend和EPIC。在 $20\%$ 时,SpecCache继续在生成质量上优于CacheBlend。
分数并非严格单调的原因:随着重新计算比率的增加,重新计算集合从最重要Token扩展到排名较低的Token,其重要性估计更嘈杂且边际贡献有限。额外的重新计算可能会引入更多复用和重新计算Token之间的边界,导致碎片化并放大对齐误差(在MuSiQue等多跳推理任务中尤为明显)。

运行时开销评估。作者使用Mistral-7B对SpecCache的运行时开销进行了分解(分为评分Score、对齐Align和目标模型预填充Prefill)。Prefill仍然是主要成本,而Score和Align仅占Prefill的约 $5\%$。由于Score和Align与预计算KV缓存的加载并行执行,其成本基本被隐藏。SpecCache的TTFT接近CacheBlend,且比完全重新计算快 $2.3 - 3.7 \times$。
图6:不同方法之间的TTFT比较。

Goodput(有效吞吐量)评估。为了评估变动负载下的性能,作者定义了Goodput指标(仅当响应质量超过阈值时才计为成功请求)。在MuSiQue数据集上的结果显示,尽管CacheBlend和EPIC获得了更高的原始吞吐量,但由于严重的质量下降,其收益被抵消。SpecCache在保持高生成质量的同时,在规模化时维持了较高的Goodput,实现了卓越的平衡。
图7:各方法的吞吐量和Goodput对比。

语义Span补全的消融实验。对比包含和不包含语义Span补全模块的SpecCache(如表1所示),在几乎所有设置下,包含Span补全的版本均优于不包含的版本。这表明该模块在固定的重新计算预算下通过更好地保留语义连贯性,有效提升了任务性能。

选择层数的影响。评估重要性评分对层选择的敏感性(所有层、最后2/3、最后1/3、仅最后一层)。结果表明,优先考虑更深层始终能提升F1分数,其中最后1/3层实现了最佳的整体性能。
图8:选择不同层对各模型的影响。

重新计算比率的影响。将重新计算比率从 $10\%$ 增加到 $25\%$ 会带来分数的平滑提升。即使在低比率下,SpecCache也能恢复大部分质量,而在 $20-25\%$ 时达到与完全重新计算相当的性能,同时TTFT减少 $2.17 \times$。
图9:不同重新计算比率对Yi-coder-9B的影响。

模型家族和规模的影响。固定目标模型为Qwen2.5-14B,改变投机模型。扩展同家族的Qwen2.5投机模型(0.5B-3B)一致提升了任务分数。相反,切换到不同家族但参数规模相当的模型(LLaMA3-3B)导致分数明显低于Qwen2.5-3B。这表明与目标模型属于同一家族的投机模型能够提供更可靠的选择。
图10:投机模型家族和规模的影响。

结论

本文提出了SpecCache,这是一种新颖的选择性KV缓存复用框架,旨在不牺牲生成质量的前提下加速RAG服务。基于深层特征对KV偏差异常敏感的洞察,SpecCache利用轻量级投机模型来准确识别关键Token。实验证明,SpecCache显著降低了TTFT并提高了相较于完全重新计算的吞吐量,同时在准确性上始终优于SOTA基线方法。未来的工作需要验证SpecCache在更大架构(如70B参数)上的可扩展性,并评估其在更复杂的特定领域数据集上的鲁棒性。

附录

Span细化的超参数敏感性。作者研究了Span细化对两个阈值的敏感性:用于Span分割的 $\tau_{\mathrm{smooth}}$(当 $\delta_i < \tau_{\mathrm{smooth}}$ 时合并相邻Token)和用于基于覆盖率补全的 $\tau_{\mathrm{cover}}$(当Span $p_j = [u_j, v_j]$ 的重要Token覆盖率 $r_j \geq \tau_{\mathrm{cover}}$ 时进行扩展)。在保持 $T_{\mathrm{init}}^s$ 和所有其他组件固定,且全局重新计算预算固定为 $20\%$ 的情况下,对 $(\tau_{\mathrm{smooth}}, \tau_{\mathrm{cover}})$ 进行了二维网格扫描。结果显示了分割和补全如何共同影响Span边界和语义连贯性。
图11:在2WikiMQA上使用Llama3-8B进行 $(\tau_{\mathrm{smooth}}, \tau_{\mathrm{cover}})$ 网格扫描的分数热力图。

补充细节

相关工作
* 检索增强生成(RAG):RAG通过将外部语料库中检索到的相关上下文合并到输入提示词中来增强LLM的生成。虽然这通过将答案建立在证据基础上来改善事实性,但显著扩展的输入序列长度增加了Prefill阶段的计算成本,从而延迟了TTFT。
* KV缓存复用:预计算和复用KV缓存已被广泛研究,以分摊Prefill成本并减少TTFT。大多数早期工作集中在前缀缓存上,这在RAG高度动态的上下文中效用有限。近期的选择性复用方法(如CacheBlend和EPIC)转向位置无关的块复用,但其依赖浅层信号或静态启发式规则,往往无法识别最需要重新计算的Token。
* 投机推理:投机推理通常使用轻量级模型通过草稿验证来加速解码或通过Token修剪来压缩提示词。SpecCache独特地重新利用了投机模型来指导选择性KV复用,在无需重新训练或微调的情况下恢复RAG中关键的跨块注意力。

伦理声明。本研究中使用的所有数据集均公开可用。SpecCache是一个用于加速长上下文推理的框架,它没有引入针对不安全生成的新保障措施。在多租户环境中部署时,应确保用户和请求之间的严格隔离,特别是要防止缓存激活的跨请求泄漏。


方法细节参考文献汇总
* 【15, Attention is not only a weight: Analyzing transformers with vector norms + 2020 + EMNLP】: 在“基于幅值的Token影响力量化依据”段落中被引用,用于论证注意力输出是由Value向量的加权混合形成的,这些向量的幅值直接决定了它们对最终输出的贡献比例。
* 【10, Attention score is not all you need for token importance indicator in kv cache reduction: Value also matters + 2024 + EMNLP】: 在“基于幅值的Token影响力量化依据”段落中被引用,用于进一步支撑Value向量范数能够捕获关键重要性信号的观点。
* 【25, Accelerating llm inference with lossless speculative decoding algorithms for heterogeneous vocabularies + 2025 + ICML】: 在“跨分词器对齐机制”段落中被引用,用于说明在实际部署中,投机模型和目标模型通常使用不同的分词器(Tokenizer)这一事实。