KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference
KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference
发表时间: 2026-06 · arXiv:2605.18071 (SIGMOD 2026)
原文: https://arxiv.org/abs/2605.18071
作者/机构:Jian Lin, Jiazhi Mi, Zicong Hong, Haodong Wang, Qianli Liu, Haoyue Zhang (Hong Kong University of Science and Technology, China); Peng Li (Xi’an Jiaotong University, China); Song Guo (Hong Kong University of Science and Technology, China)
速读
一句话结论 本文提出了一种跨 GPU、DRAM 和 SSD 的多层 KV Cache 管理系统 KVDrive,通过协同优化缓存放置、流水线调度和跨层数据移动,在保证模型精度的前提下,将长上下文大语言模型推理的吞吐量提升了最高 1.74 倍。
要解决什么问题 大语言模型在处理长上下文时,KV Cache 的显存占用会随上下文长度和批处理大小呈线性增长,极易撑爆 GPU 显存。现有的主流缓解方案是将 KV Cache 卸载到主机内存(DRAM)中,在每次注意力计算前按需将关键数据取回 GPU。然而,这种做法卡在两个致命瓶颈上。首先是严重的流水线停顿,现有系统通常按顺序执行“选择关键数据、从内存拉取数据、GPU 计算”这三个阶段,导致 GPU 在等待数据传输时闲置,CPU 在 GPU 计算时停滞,选择和拉取阶段的延迟占到了总推理时间的近一半。其次是存储层级的扩展性断崖,当上下文和批处理规模进一步增大,连主机内存也会被耗尽,如果简单地将数据溢出到固态硬盘(SSD),GPU 与 SSD 之间极低的带宽会导致严重的 I/O 阻塞。现有系统无法真正利用异构硬件的算力,导致吞吐量在触及内存上限后断崖式下跌,无法支撑真实场景下的大批次长文本推理。
怎么做的 KVDrive 的核心思路是放弃单纯在算法层面死磕稀疏度,转而从系统架构出发,将缓存管理、流水线调度和多层存储解耦并重新协同设计,从而在极度受限的显存预算下掩盖 I/O 延迟。该方法由三个关键部件构成。第一是基于注意力的缓存管理,它打破了传统的最近最少使用策略,在 GPU 内维护一个包含近期多个 Token 关键 KV 数据的滑动窗口。系统采用前瞻性驱逐策略,每步丢弃当前注意力得分最低的数据,并针对不同 Transformer 层和注意力头的异构局部性,将窗口大小分配建模为多维背包问题进行离线求解:
$$ \operatorname* { m a x } _ { \{ w _ { l , h } \} } \sum _ { l , h } \mathrm { B e n e f i t } _ { l , h } ( w _ { l , h } ) \quad \mathrm { s . t . } \quad \sum _ { l , h } \mathrm { C o s t } _ { l , h } ( w _ { l , h } ) \leq M $$这一设计最大化了 GPU 内的数据复用,将冗余的数据搬运降至最低。第二是弹性流水线调度,系统将选择、拉取和计算三个阶段彻底解耦,将批处理请求切分为微批次。在解码时,GPU 为当前微批次执行选择操作,同时 CPU 评估上一个微批次的缓存命中情况并从内存拉取更早微批次的数据,最后再对整个批次统一执行计算,从而完美重叠了 I/O 与计算时间,消除了流水线气泡。第三是协同多层存储,系统将 SSD 引入存储层级,在预填充阶段利用注意力分布对前缀 Token 进行重要性评分,将高分数据预热至 GPU 和 DRAM,其余落盘至 SSD;同时采用感知 SSD 的数据布局,将语义连续和同层同头的数据打包存储,把零碎的随机读取转化为高效的顺序 I/O,并利用固定内存和内存映射实现并行的稀疏同步,彻底打通了 GPU、DRAM 和 SSD 的数据通路。
效果如何 实验在 L20 服务器、H20 服务器以及 RTX 4090 工作站上进行,评测了 Llama-3-8B-1048K、Qwen-3-8B、Qwen-3-14B 和 Phi-4-mini-instruct 等模型。对比基线包括不卸载的 Original、全量卸载的 FlexGen,以及代表空间分块路线的 Quest 和 ShadowKV,代表相似度分组路线的 PQCache、MagicPIG 和 RetroInfer。在 RULER 和 LongBench 长文本基准测试中,KVDrive 在保持精度的前提下,吞吐量比最强的基线方法 ShadowKV 提升了最高 1.74 倍。在显存仅有 24GB 的 RTX 4090 上,借助多层存储架构,其吞吐量甚至达到了 96GB 显存 H20 服务器原生基线的 3 倍。不过该系统也存在一定的代价与局限性:系统强依赖于离线性能分析来确定最优的二维窗口缩放比例和流水线微批次大小;此外,随着缓存窗口尺寸的增加,虽然 I/O 传输量显著下降,但索引查找的延迟会随之上升,分块大小也存在一个 U 型的性能折中点,需要针对具体硬件仔细调参才能达到最佳平衡。
主要贡献
随着大型语言模型(LLMs)在能力和应用上的不断扩展,支持长上下文推理已成为文档理解、复杂代理工作流和大型知识库推理等应用的关键。长上下文推理的核心障碍在于键值(KV)缓存的内存占用。在自回归解码期间,LLM必须保留所有先前标记的键和值以进行注意力计算。与固定的模型权重不同,KV缓存随序列长度和批处理大小线性增长,极易超过模型本身的大小。例如,Llama-3.1-8B-Instruct支持高达$128\mathrm{k}$个标记的序列,需要超过16 GB的KV缓存。现有的商用GPU仅提供几十吉字节的内存,无法将整个KV缓存存储在GPU内存中。
为了弥补这一内存鸿沟,现有研究提出将KV缓存卸载到主机内存中,并在每次注意力计算前将所需条目重新加载到GPU内存中。然而,现有方法未能有效协调CPU和GPU的计算、数据传输和存储,导致资源利用率低下(如GPU等待数据、CPU在GPU执行期间停顿、I/O带宽闲置)。
为解决这些挑战,本文提出了KVDrive,这是一个跨越GPU内存、主机DRAM和SSD的整体多层KV缓存管理系统。与依赖算法稀疏性改进的先前工作不同,KVDrive从系统角度出发,联合优化缓存放置、流水线调度和跨层协调,以在严格的GPU预算下维持高吞吐量推理。系统的主要贡献和创新点如下:
- 基于注意力的缓存管理:KVDrive通过使其具有注意力感知能力并针对Transformer架构进行定制,重新思考了传统的缓存管理。系统在GPU内存中维护一个关键条目的滑动窗口,仅增量更新窗口外的差异,并依赖于二维层-头缓存分配和前瞻驱逐策略,在保持内存开销有界的同时最大化重用。
- 弹性流水线调度:KVDrive通过新的SFC解耦设计,将选择、获取和计算解耦为独立调度的阶段。系统将解码划分为微批次,并以最小干扰并行执行这些阶段,消除了异构资源之间的停顿。
- 协调的多层KV存储:KVDrive将SSD作为第三层引入,并协调HBM、DRAM和SSD之间的数据移动。它应用重要性引导的预热来优先处理高价值KV条目,采用感知SSD的布局以最大化顺序I/O局部性,并执行并行稀疏同步以最小化跨层传输开销。
- 系统实现与评估:实现了一个功能完备的KVDrive原型,并在长上下文基准测试中对其进行了评估。结果表明,在保持准确性的同时,该系统实现了比现有最先进工作高出高达$1.74\times$的吞吐量。
背景知识与关键观察
KV缓存与稀疏注意力机制。现代LLMs通常基于仅解码器的Transformers构建,推理分为预填充和解码两个阶段。在解码阶段,系统自回归地生成标记,每一步都会将新的键和值向量附加到缓存中。然而,并非所有标记对注意力的贡献都相同,具有较高注意力分数的标记通常发挥更关键的作用。这些对应的键值对被称为关键KV条目,丢弃非关键条目通常只会导致极小的精度损失。由于标记的关键性取决于当前的查询,系统必须动态识别哪些KV条目是相关的。作为代表性系统,Quest【29,QUEST: Query-Aware Sparsity for Efficient Long-Context LLM Inference + 2024 + ICML】将键条目划分为块,并通过将查询向量与键的通道级最小值和最大值相乘来估计它们的重要性,从而大幅减少注意力计算。
现有KV缓存卸载的局限性。KV缓存大小随上下文长度和批处理大小线性增长,迅速超出GPU内存容量。最近的研究提出将KV缓存从GPU内存卸载到较慢但较大的层(如主机内存或SSD)。现有的卸载系统在解码期间通常需要三个步骤:(1)通过存储在GPU内存中的索引选择关键KV条目;(2)将这些条目从主机内存获取到GPU内存;(3)使用稀疏注意力和前馈网络等层操作计算新标记。为了提高效率,探索了列选择(如InfiniGen【18,InfiniGen: Efficient generative inference of large language models with dynamic KV cache management + 2024 + OSDI】)、空间分块(如Quest【29】和ShadowKV【28,ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference + 2025 + ICML】)以及相似性分组(如MagicPig【7,MagicPIG: LSH Sampling for Efficient LLM Generation + 2025 + ICLR】和PQCache【40,PQCache: Product Quantization-based KVCache for Long Context LLM Inference + 2025 + Proc. ACM Manag. Data】)等策略。
表1. 几种代表性KV缓存卸载系统与我们的KVDrive之间的比较。
| Naive | Quest [29] | ShadowKV [28] | InfiniGen [18] | MagicPIG [7] | PQCache [40] | KVDRIVE (Ours) | |
|---|---|---|---|---|---|---|---|
| Caching | × | × | LRU | × | × | LFU/LRU | Attention-Based |
| Scheduling | Sequential | Sequential | Sequential | Partial Pipeline | Sequential | Sequential | Elastic Pipeline |
| Tiering | DRAM | DRAM | DRAM | DRAM | DRAM | DRAM | Coordinated Multi-Tier |
长上下文与多批次设置下的核心挑战。大多数现有系统在每个解码步骤都会从主机内存加载一组新的关键KV条目,并丢弃之前获取到GPU中的条目。尽管最近的研究观察到了短程时间局部性,但这在长程中尚未得到系统分析。
关键发现1:关键KV条目表现出强烈的时间相关性。关键KV条目不仅在相邻标记之间,而且在更广泛的局部范围内都表现出强烈的时间相关性。因此,维护最近关键KV条目的滑动窗口可以实现有效的重用。我们将每个解码步骤的关键KV窗口定义为对应于多个最近标记的关键KV条目集合。分析表明,与传统的每步清除缓存或仅保留最近一步条目的方法相比,维护覆盖多个最近步骤的滑动窗口能产生显著更高的收益。例如,在$6.25\%$的稀疏度预算下,扩大窗口大小可将主机到GPU的传输量从每步超过$500\mathrm{MB}$降低到$12.5\mathrm{MB}$以下,且仅需少量额外的GPU内存。
关键发现2:KV选择和获取阶段引发严重的GPU停顿。KV选择和获取合计占解码延迟的很大一部分。它们的顺序执行会产生明显的GPU流水线停顿,并且其影响随着批处理大小和上下文的增加而增大。选择阶段的高计算成本和获取阶段的数据移动是主要瓶颈。由于大多数现有系统按顺序执行这些阶段(选择、获取、计算),这两个阶段都会阻塞GPU执行。因此,尽管卸载缓解了GPU内存压力,但这些停顿在规模化时主导了整体运行时间。
关键发现3:GPU与磁盘间的带宽限制导致吞吐量骤降。由于GPU和磁盘之间的带宽相比GPU-DRAM传输有限,现有的卸载系统难以有效地将KV缓存迁移到磁盘,导致严重的吞吐量下降。当主机内存充足时,增加批处理大小可显著提高吞吐量。但在实际部署限制下,一旦考虑长上下文和大批次,KV缓存会迅速耗尽可用主机内存容量。如果没有有效的多层管理,强制将缓存溢出到SSD会导致解码延迟再次被数据移动所主导。
方法细节
系统架构与执行流程。KVDrive旨在在严格的GPU内存限制下支持高吞吐量的长上下文LLM推理。当KV缓存超过GPU容量时,它会被卸载到主机DRAM或SSD,系统在预填充阶段在GPU内存中构建索引。在解码期间,每个新标记遵循三个阶段的工作流:通过索引识别关键KV条目;从DRAM或SSD将所选条目获取到GPU HBM中;对新获取的和驻留的KV条目的并集执行注意力和前馈计算。KVDrive采用分层设计来组织轻量级索引,将KV缓存划分为块,并使用每个页面的平均键作为其代表,形成用于相似性分组的更高级别质心。这种分层结构保留了连续标记之间的局部语义连续性,在匹配检索精度的同时,将索引占用空间减少了$50\%$,并将查找速度提高了高达$2\times$。
基于注意力的缓存管理设计。KVDrive摒弃了传统的基于使用情况(如LRU、LFU)的策略,通过利用模型的注意力机制来推断缓存条目的语义重要性。系统在GPU内存中维护一个覆盖几个最近标记的关键KV条目的滑动窗口。在初始化时,离线分析建立给定模型的窗口大小和内存占用之间的映射。然后,系统在考虑了模型参数、激活和中间缓冲区占用的内存后,选择适合可用GPU缓存预算的最大可行窗口大小。这确保了缓存充分利用剩余的GPU容量,而不会干扰模型计算。
带有前瞻驱逐的滑动窗口策略。在解码期间,窗口一次前进一个标记:从主机内存获取新的关键KV条目,同时驱逐现有条目的一个子集。观察表明,在一个步骤中获得高注意力的条目在下一步中更有可能保持关键状态。随着$M$的增加,与后续步骤的Top-$K$集合的重叠迅速增加然后饱和,这表明排名靠前的条目被持续重用。基于此,KVDrive采用前瞻驱逐策略:在每一步中,丢弃当前步骤注意力分数最低的条目,因为它们在后续步骤中最不可能被重用。通过维护紧凑且增量更新的工作集,KVDrive在解码步骤之间摊销了主机-GPU传输,提高了带宽效率。
二维窗口缩放的异构性优化。分析表明,不同的层和注意力头在扩大窗口大小时,在内存开销和传输减少之间表现出异构的权衡。一些层头对主要捕获局部依赖性,应分配较少的空间;而其他专门用于建模长程结构的层头应分配更多空间。为了系统地利用这种异构性,KVDrive将二维窗口缩放制定为离线优化问题。对于每层$l$和头$h$,分析得出:$\mathrm{Benefit}_{l,h}(w)$为窗口大小$w$实现的传输减少,$\mathrm{Cost}_{l,h}(w)$为该窗口大小消耗的额外GPU内存。给定总GPU缓存预算$M$,目标是最大化收益:
$\max_{\{w_{l,h}\}} \sum_{l,h} \mathrm{Benefit}_{l,h}(w_{l,h}) \quad \mathrm{s.t.} \quad \sum_{l,h} \mathrm{Cost}_{l,h}(w_{l,h}) \leq M$
这是一个多重选择背包问题(MCKP)的变体。KVDrive在离线状态下解决它:从最小的窗口开始,迭代扩大具有最高收益成本比的窗口,直到满足GPU缓存预算。这种方法在几分钟内产生接近最优的分配,并且不产生运行时开销。
弹性流水线调度与SFC解耦。为了消除选择和获取阶段导致的GPU停顿,KVDrive提出了弹性流水线调度策略。三个紧密耦合的阶段(选择、获取和计算)表现出不同的性能瓶颈:选择阶段主要受I/O限制,获取阶段由主机-设备数据传输主导,而计算主要在GPU上受计算限制。KVDrive通过SFC解耦解决这些低效问题,将这三个阶段解耦以进行独立调度。每个批次被划分为多个微批次,以实现选择和获取之间的细粒度并行,而计算则作为整个批次的单个单元执行。在解码期间,GPU为当前微批次执行选择,同时CPU评估前一个微批次的缓存命中/未命中状态,并从主机内存获取更早微批次的KV条目。所有微批次完成获取后,进行计算。同时,缓存元数据更新与计算重叠。
流水线参数的联合优化。KVDrive流水线的性能关键取决于三个参数:索引中的质心数量、GPU缓存大小和微批次大小。(1)索引:较多的质心提高选择粒度但增加选择成本。KVDrive使用空间分块方法一半的质心实现了相当的准确性。(2)缓存大小:较大的GPU内缓存缩短了获取时间,但增加了CPU侧评估时间。KVDrive执行预热阶段,增量增加缓存大小,直到CPU评估时间和GPU获取时间达到平衡。(3)微批次大小:KVDrive执行简短的预运行校准,以在推理开始前凭经验确定最佳配置。
基于Roofline模型的性能分析。现有工作主张在KV缓存卸载系统中在CPU上执行注意力,认为CPU-GPU传输开销主导了GPU执行。然而,KVDrive的Roofline模型分析表明,自适应缓存管理确保在每个解码步骤中,只有未在GPU内缓存中的关键KV条目必须从主机内存获取。大约$80\%$的关键条目直接从GPU内缓存提供服务,这保持了运算强度高于阈值,使得GPU保持比CPU更高的有效吞吐量。
协调的多层KV存储设计。为了在长上下文或大批次下扩展容量,KVDrive设计了一个协调的多层KV存储系统,实现HBM、DRAM和SSD之间的高效协作。
重要性引导的预热机制。在预填充阶段结束时,模型已经计算了提示最终标记与整个前缀之间的注意力。KVDrive利用这些信息在解码开始前估计前缀KV条目的长期重要性。系统根据提示最终观察窗口中查询产生的注意力分布,为前缀标记分配重要性分数。根据此重要性配置文件,所有KV条目首先持久化到SSD作为完整后备存储,而排名较高的条目被提升到更快的层:最高分数的条目放置在GPU HBM中,后续最高分数的条目被卸载到DRAM中。
感知SSD的布局规划。为了使存储组织与解码期间观察到的时间及结构访问模式对齐,KVDrive采用两级打包策略。(1)语义连续性打包:将解码期间经常一起被关注的KV条目按顺序放置在同一个区段(extent)中,将细粒度、不规则的访问转化为粗粒度的顺序传输。(2)层-头分区:区段按层和注意力头进行分区,每个{层,头}对分配到一个专用的SSD段,以保留结构局部性。
并行稀疏同步策略。为了维持多层卸载下的解码吞吐量,KVDrive采用了逐步改进的同步策略。(a)与FlexGen【27,Flexgen: High-throughput generative inference of large language models with a single gpu + 2023 + ICML】的朴素逐层传输不同,(b)KVDrive采用块级稀疏获取,仅传输当前注意力查询实际需要的KV条目块,并将多个块请求合并为区段大小的顺序读取。(c)系统采用分层传输,从SSD获取的KV条目首先读入DRAM支持的memmap区域,然后暂存到预分配的页面锁定缓冲区中,以实现异步预取。(d)最后,系统通过离线分析指导页面锁定缓冲区和memmap缓存之间的平衡协调,优先考虑表现出频繁停顿的层-头KV条目。
补充细节
系统实现。KVDrive的原型包含约9000行Python代码、1000行C++代码和3000行CUDA代码。系统基于PyTorch 2.3.0构建。为了支持大型KV缓存存储,KVDrive使用numpy.memmap进行内存映射数组,支持直接在磁盘上对KV张量进行持久化和页面级访问。稀疏更新和检索通过torch.Tensor.index_copy_()执行。聚类采用RetroInfer【6,RetroInfer: A Vector-Storage Approach for Scalable Long-Context LLM Inference + 2025 + arXiv】的Triton内核,数据移动原语源自ShadowKV【28】。系统利用FlashInfer进行优化的GPU内核计算,并完全支持通过连续批处理(continuous batching)的并行会话。所有长上下文模型均采用Huggingface的transformers框架提供的官方RoPE实现。
实验环境
- 评估模型:Llama-3-8B-1048K(8B参数,1M上下文)、Qwen3-8B和Qwen3-14B(128K上下文)、Microsoft Phi-4-mini-instruct(3.8B参数,128K上下文)。
- 基准测试:LongBench(双语长上下文理解基准)和RULER(涵盖检索、多跳推理、聚合和QA任务)。
- 基线系统:Original(无卸载)、FlexGen(全缓存卸载)、Quest、ShadowKV、PQCache、MagicPIG、RetroInfer(包含开启和关闭原生注意力估计的两个变体)。
- 硬件配置:
- 高性价比服务器:NVIDIA L20 (48 GB) GPU,Intel Xeon Platinum 8457C CPU,100 GB DDR5主机内存。
- 高端服务器:NVIDIA H20 (96 GB) GPU,AMD EPYC 9K84 CPU,200 GB DDR5主机内存。
- 工作站:NVIDIA RTX 4090 (24 GB) GPU,Intel Xeon Gold 6430 CPU,120 GB DDR5主机内存。
- 所有系统均配备NVMe U.2 SSD。
实验结果
总体吞吐量提升。在L20服务器上,KVDrive在所有评估配置中始终优于所有基线系统。与最具竞争力的基线ShadowKV相比,KVDrive实现了高达$70\%$的吞吐量提升。MagicPIG因构建庞大的预计算索引导致OOM故障;Original基线在重负载下也遭遇OOM。FlexGen虽然避免了OOM,但由于严重的I/O瓶颈,其吞吐量骤降至不到1 token/s。在H20和RTX 4090服务器上,KVDrive相比表现最好的基线实现了$1.23\times$到$1.53\times$的吞吐量提升,展现了其在多硬件和工作负载条件下的稳健性。
微基准测试:准确性与驱逐策略。在RULER和LongBench的所有任务中,KVDrive实现了与Quest和ShadowKV等最先进卸载系统相当甚至略好的准确性,证明了其索引和检索设计引入的精度损失可以忽略不计。关于驱逐策略,前瞻(LA)策略在大多数配置中优于传统的LRU基线,在Llama3-8B和Qwen-3-8B上,LA策略将命中率提高了$0.9\%$到$3.9\%$。
二维窗口缩放与窗口大小的影响。在受限的GPU内存预算下,二维缩放相比统一窗口分配有效减少了数据传输,证明了异构重用模式能有效避免GPU缓存浪费。对于窗口大小,当批处理大小为1时,较小的窗口大小(如2)由于查找时间激增而产生较低延迟;当批处理大小扩展到4时,非FFN组件成为主要瓶颈,较大的窗口大小(如4)通过减少I/O带宽需求变得更加有效。
块大小与质心数量的权衡。随着块大小的增加,整体延迟和I/O延迟呈现U型趋势,中等块大小(如4)在保留语义连续性和最小化冗余之间取得了最佳平衡。关于质心数量,最佳数量与上下文长度保持固定比例(如120k对应8192,60k对应4096),增加质心数量虽然提高了选择延迟,但通过更好的负载均衡和数据局部性大幅降低了I/O和查找时间。此外,将质心数量从8192减少到2048可以在不损失精度的前提下将索引大小减少$4\times$。
内存布局与多层存储性能。KVDrive展现出比ShadowKV和Quest显著更低的GPU内存使用率,这归功于其稀疏高效的索引机制。在存储层方面,KVDrive的逐块传输和分层异步获取策略大幅降低了获取开销。当使用SSD作为存储层次结构的一部分时,KVDrive维持了高吞吐量,相比仅DRAM配置仅下降了$40\%$,同时支持更大的批处理大小。
预填充延迟、成本效益与批处理扩展。KVDrive的预填充延迟与全注意力基线相当,表明其索引构建和卸载开销极小。在成本效益方面,KVDrive通过有效的稀疏卸载将内存占用减少了约$4\times$,使得消费级RTX 4090实现了比企业级H20基线高出高达$3\times$的吞吐量。此外,随着批处理大小的扩展,KVDrive通过跨微批次重叠I/O和计算,有效隐藏了数据移动开销,维持了吞吐量的强劲上升趋势。
结论
本文提出了KVDrive,这是一个用于长上下文LLM推理的整体多层KV缓存管理系统。KVDrive引入了三种系统级技术:具有滑动窗口重用和前瞻驱逐的基于注意力的GPU内缓存管理;通过最小化停顿来重叠选择、获取和计算的弹性流水线调度;以及协调的多层KV存储。评估表明,KVDrive在保持准确性的同时,将吞吐量比最先进的卸载系统提高了$1.74\times$。这些结果证明了系统级缓存和流水线协同设计在严格的GPU预算下实现高效长上下文推理的有效性。
未来的工作将集中在三个方向:(1)扩展到具有不同KV缓存访问模式的多模态模型;(2)研究存内计算(Processing-in-Memory)硬件以将选择和部分计算直接卸载到存储层;(3)探索KVDrive与量化及剪枝技术的协同作用,设计分层混合精度存储方案(例如为HBM中的热块保持FP16精度,对溢出到SSD的冷块应用INT4量化),以在保持生成质量的同时缓解海量上下文检索中的I/O瓶颈。
💬 评论讨论
欢迎在这里分享您的想法和见解!