DARTree: Speculative Diffusion Decoding With Autoregressive Draft Trees
DARTree: Speculative Diffusion Decoding With Autoregressive Draft Trees
发表时间: 2026-08 · arXiv:2608.13524 (MBZUAI)
原文: https://arxiv.org/abs/2608.13524
作者/机构:Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen / VILA Lab, MBZUAI
速读
一句话结论 本文提出了一种免训练的投机解码方法 DARTree,通过将因果校正与树构建过程解耦,实现了按深度并行的草稿树生成,在无损目标模型输出分布的前提下取得了最高 9.73 倍的推理加速。
要解决什么问题 现代自回归大语言模型推理时受限于显存 I/O 带宽,单次前向传播仅生成一个 Token,导致硬件并行算力利用率低下。投机解码通过引入轻量级草稿模型并行生成多个候选 Token 来缓解这一问题。基于扩散的块草稿模型(如 DFlash)能在一次前向传播中并行预测整个 Token 块,消除顺序生成延迟并支持更大容量的草稿模型。然而,这种并行预测牺牲了因果条件,即每个位置的预测仅依赖已验证的前缀,而无法依赖同一块中较早生成的草稿 Token。现有的因果校正头通过沿单一路径传播状态来弥补这种偏差,但当试图将单链扩展为树状结构以提高候选命中率时,遇到了严重的效率瓶颈。由于节点校正分数强依赖其特定路径的历史状态,传统最佳优先树构建必须严格遵循“弹出堆顶、执行校正推理、将子节点推回堆中”的交替循环。这种逐节点顺序执行机制使因果校正无法跨节点并行,导致树构建本身成为显著延迟来源,抵消了并行草稿的加速收益。
怎么做的 DARTree 的核心思路是放弃全局逐节点最佳优先搜索,转而采用按深度批处理策略构建较宽的候选超树,最后通过一次性剪枝提取紧凑树用于验证。该设计绕开了顺序执行瓶颈,使因果校正能在同深度的多个分支上并行张量化计算。方法由按深度并行的超树构建和延迟最佳优先剪枝两个关键部件构成。首先,块并行主干网络执行一次前向传播生成整个草稿块的共享表示。接着 DARTree 从根节点逐层向深处扩展。在每个深度,算法将所有活动分支打包成批次,并行调用预训练校正模块,结合各自路径前缀状态计算校正概率。随后根据校正后的累积得分对候选扩展排名,在固定层宽度下保留高分节点,并将校正状态传递到下一深度,由此产生一棵固定宽度的候选超树。超树构建完成后,每个实例化前缀都获得了完整校正分数。DARTree 引入延迟最佳优先剪枝策略,通过以下公式对深度为 $d$ 的前缀 $u_{1:d}$ 评分: $$s_\beta(u_{1:d}) = \sum_{i=1}^d \log \widetilde{q}_i(u_i) + \beta d$$ 其中 $\widetilde{q}_i(u_i)$ 是深度 $i$ 处的校正概率,$\beta$ 是深度奖励超参(负值惩罚更深前缀)。由于扩展前缀只增加非正的对数概率和深度奖励,子节点得分永远不会高于父节点。基于此不变量,DARTree 证明在超树上直接进行全局 Top-$B$($B$ 为验证预算)选择,与使用最大堆进行最佳优先搜索完全等价: $$\text{BestFirst}_B(\mathcal{S}) = \text{TopB}_{u \in \mathcal{S}} s_\beta(u)$$ 这使算法能用单次 Top-$B$ 排序替换繁琐的堆操作。最后,剪枝后的前缀树被送入目标模型,利用树注意力掩码在一次前向传播中完成验证。
效果如何 实验在单张 NVIDIA RTX 6000 Ada GPU 上评估了 Qwen3-4B 和 Qwen3-8B 模型在数学、代码和对话等 7 个基准测试的表现。对比基线包括:标准自回归解码;代表块扩散路线的 DFlash(并行预测 16 个 Token);代表无校正树路线的 DDTree(利用 DFlash 边缘预测构建最佳优先树);代表单链因果校正路线的 Domino(联合训练扩散主干与自回归校正头)。在贪婪解码(温度为 0)和随机采样(温度为 1)下,DARTree 均取得最高平均接受长度和加速比。在 GSM8K 数据集上(Qwen3-4B,温度为 0),DARTree 每轮验证最多接受 12.97 个 Token,相较标准自回归解码实现 9.73 倍无损加速;接受长度比 DFlash 高 98.6%,比 Domino 高 27.9%。消融实验表明,将 DARTree 迁移至采用马尔可夫校正头的 DSpark 模型上,依然带来最高 34.3% 的加速提升,证明了该方法的通用性。作者也坦承了局限性:DARTree 未减少总计算量,而是用额外算力换取低延迟。验证大型候选树有计算开销,因此最适合显存带宽受限的低并发服务场景(如本地部署或小批量处理);当并发量增加、系统转为算力瓶颈时,验证大树的开销变昂贵,加速收益会衰减。此外,该方法依赖已配备因果校正头的预训练扩散模型,无法直接免训练应用于朴素扩散草稿模型。
主要贡献
现代自回归(Autoregressive, AR)大型语言模型在文本和代码的理解、推理和生成方面取得了显著成功,但其固有的顺序生成特性限制了推理速度。在每个解码步骤中,模型每个序列仅生成一个Token,却需要访问几乎所有的模型参数,这使得推理过程主要受限于I/O带宽,浪费了现代硬件的并行计算能力。
为了加速推理并提高硬件利用率,投机解码(Speculative Decoding)利用轻量级的草稿模型(Drafter)提出多个未来Token,并通过目标模型并行验证它们,从而在无损目标模型输出分布的前提下实现加速。基于扩散的块草稿模型(Diffusion-based block drafters)通过在一次前向传播中并行预测整个Token块,消除了顺序生成的延迟,并支持更高容量的草稿模型以提高提案质量(如DFlash)。然而,这种并行性牺牲了因果条件(Causal conditioning):每个草稿位置的预测仅依赖于已验证的前缀,而不依赖于同一块中较早位置生成的Token。现有的轻量级因果校正头(Causal correction heads)通过沿着单一草稿链传播选定的Token来缓解这种不匹配,但在结合树状结构构建以扩大候选覆盖范围时,遇到了效率瓶颈。
由于节点的校正分数依赖于该节点特定路径的状态,树构建中的每一次堆弹出(Heap pop)操作后都必须紧跟校正头的推理和后续的堆推入(Heap push)操作。这种交替进行的方式迫使校正头推理只能逐节点进行,使得树构建成为显著的延迟来源(如图1所示)。
本文引入了DARTree,这是一种免训练(Training-free)的投机解码方法,它将预训练的自回归校正头从单链扩展到树状结构。其主要贡献如下:
1. 识别了将路径条件因果校正与逐节点最佳优先树构建(Node-wise best-first tree construction)耦合所导致的顺序执行瓶颈。
2. 引入了一种免训练、按深度批处理(Depth-wise batched)的树构建方法,该方法在多个分支上并行应用因果校正,实现了无损加速。
3. 提出了一种延迟且简化的最佳优先剪枝策略(Deferred best-first pruning),用于选择最终的验证树,从而将自回归头的推理与顺序堆操作解耦。
在7个数学、代码和对话基准测试中,DARTree在所有四种模型-温度配置下均实现了最高的平均接受长度和加速比。在每轮验证中最多接受12.97个Token,比DFlash高出$98.6\%$,比Domino高出$27.9\%$,相较于本地测量的自回归解码实现了高达$9.73\times$的无损加速。
背景知识与设计原则
投机采样(Speculative Sampling)
设$p$和$q$分别表示目标模型和草稿模型,$x_{1:t}$为投机解码轮次前已提交的Token。草稿模型提出$\gamma$个Token $y_{1:\gamma}$,其中$y_{<i} = (y_1, \dots, y_{i-1})$,草稿位置$i$的上下文为$c_i = (x_{1:t}, y_{<i})$。当温度$T = 0$时,验证过程会接受与目标模型贪婪预测相匹配的连续草稿Token;在遇到第一个不匹配时,输出目标预测并终止当前轮次。当$T > 0$时,设$p_T$和$q_T$为经过温度缩放的目标和草稿分布。对于$y_i \sim q_T(\cdot \mid c_i)$,标准投机采样以概率$a_i = \min\left(1, \frac{p_T(y_i \mid c_i)}{q_T(y_i \mid c_i)}\right)$接受$y_i$。如果被接受,则提交$y_i$并继续验证位置$i+1$。在第一次拒绝时,仅从剩余分布$r_T(v \mid c_i) = \frac{[p_T(v \mid c_i) - q_T(v \mid c_i)]_+}{\sum_{w \in \mathcal{V}} [p_T(w \mid c_i) - q_T(w \mid c_i)]_+}$中采样一个替换Token(其中$[z]_+ = \max(z, 0)$)。并非所有实现都使用这种拒绝采样程序,例如DFlash采用简单的精确目标样本匹配机制。</p>
并行草稿与因果校正(Parallel Drafting and Causal Correction)
块并行草稿模型在一次前向传播中预测所有$\gamma$个未来位置的分布。给定已验证前缀$x_{1:t}$,这些预测诱导出分解分布$q_{\text{par}}(y_{1:\gamma} \mid x_{1:t}) = \prod_{i=1}^\gamma q_i(y_i \mid x_{1:t})$。这种并行性消除了顺序展开,降低了延迟并支持更高容量的模型。然而,每个$q_i$仅以$x_{1:t}$为条件,而目标分布$p(y_i \mid x_{1:t}, y_{<i})$还依赖于已实现的早期草稿Token。为了缓解这种因果不匹配,因果校正引入了并行预测之间的依赖关系。马尔可夫校正(Markov correction)对从$y_{i-1}$到$y_i$的单步过渡进行建模,而RNN校正则传播一个循环状态$r_i$来总结已实现的前缀$y_{<i}$。</p>
树验证与DDTree(Tree Verification and DDTree)
草稿树是表示多个候选延续的前缀树。在验证时,节点被展平,树注意力掩码允许每个节点仅关注已验证的上下文及其从根到节点路径上的Token。DDTree通过在分解的块扩散分布$q_{\text{par}}$下最大化代理预期接受长度来构建一个最多包含$B$个节点的树,即优化$\max_{\mathcal{T}: |\mathcal{T}| \le B} \mathbb{E}_{Y_{1:\gamma} \sim q_{\text{par}}(\cdot | x_{1:t})} [\alpha_{\mathcal{T}}(Y_{1:\gamma})]$。由于祖先的概率质量不小于其后代,具有最高概率质量的前$B$个前缀构成了该代理下的最优树。DDTree使用最大堆(Max-heap)进行最佳优先搜索来枚举它们,复杂度为$O(B \log B)$。
方法细节
DARTree是一种免训练的投机解码方法,它将预训练的带有因果校正的块并行草稿模型从单链扩展到投机树,且不假设特定的校正架构。核心挑战在于,经过因果校正后,分支分数变得依赖于路径,这使得精确的最佳优先构建本质上变为顺序执行。为此,DARTree在每个深度并行扩展固定数量的节点,构建一个较宽的候选超树(Supertree),然后将其剪枝为紧凑的树以供目标模型验证。DARTree仅修改候选树的构建过程;目标模型的树验证程序原封不动地继承自先前的工作。
解耦因果校正与最佳优先搜索
因果校正使得树构建依赖于路径:只有在校正头处理完沿着该前缀的Token后,才能对前缀的子节点进行评分。一种自然的精确方法是将这些校正后的分数与DDTree风格的最佳优先构建结合起来,维护一个候选前缀的最大堆。在每一步中,堆弹出得分最高的前缀,校正头在相应的Token历史下对其子节点进行评分,然后在扩展下一个前缀之前将这些子节点推回堆中。这种交替操作在校正后的分数下保留了全局最佳优先顺序,但阻止了校正在节点之间进行批处理(Batching)。
DARTree放宽了逐节点的搜索顺序,同时保留了路径级的因果校正。它将同一深度的所有分支放在一起评估,使用它们校正后的分数来保留用于下一个深度的节点,并将选定的校正状态向前传递。因此,搜索和校正在深度之间保持耦合,但在同一深度内没有任何堆决策将两次校正分开。这里的近似仅仅在于用固定宽度、按深度的调度替换了全局的、逐节点的最佳优先扩展;每个被实例化的分支仍然由预训练的校正头使用其已实现的前缀进行评分。
按深度并行的超树构建
块并行主干网络执行一次,为整个草稿块生成共享表示$\{H_d\}_{d=1}^\gamma$。为了限制校正头的开销,每个位置仅考虑其前$K$个Token预测作为候选扩展。从根节点开始,DARTree将每个深度处于活动状态的分支进行批处理,并将预训练的校正模块应用于它们各自的前缀状态。接着,它根据校正后的累积得分对候选扩展进行排名,在固定的层宽度下保留得分最高的扩展,并将相关的校正状态传递到下一个深度。
重复这种按深度扩展的过程会产生一个固定宽度的候选超树。固定的层宽度为每个深度提供了规则的批处理工作负载:跨深度保持顺序依赖,而在每个深度内的校正、评分、选择和状态更新被张量化(Tensorized)。因为轻量级校正头是批量评估的,所以增加层宽度几乎不会增加额外的草稿延迟(如图1所示)。这使得在草稿阶段构建一个比最终验证树更宽的超树变得切实可行。本文引入了验证预算$B$来控制保留在最终传递给目标模型的树中的节点总数。因此,DARTree可以在草稿期间构建更宽的超树,并。
算法 1: DARTree 构建
输入: 一次块并行传递产生的共享表示 {H_d}_{d=1}^\gamma 和基础对数几率 (logits) {L_d^{base}}_{d=1}^\gamma;校正头 g;候选词表大小 K;层宽度 W;节点预算 B;深度奖励 \beta \le 0
1: 初始化根层 S_0 <- {\emptyset},根校正状态 r(\emptyset) = r_0,以及根分数 s_\beta(\emptyset) = 0
2: 初始化候选超树 S <- \emptyset
3: for d = 1 to \gamma do
4: 选择 C_d <- TopK(L_d^{base}, K)
5: 并行校正 C_d 上所有前缀 u_{<d} \in S_{d-1}:
6: \widetilde{q}_d(C_d \mid u_{<d}) = g(C_d, H_d, r(u_{<d}))
7: 对于每个子节点 u_{1:d} = (u_{<d}, u_d) (其中 u_d \in C_d),评分:
8: s_\beta(u_{1:d}) <- s_\beta(u_{<d}) + \log \widetilde{q}_d(u_d \mid u_{<d}) + \beta
9: 保留全局前 W 个子前缀作为 S_d
10: 并行地从 r(u_{<d}) 和 u_d 更新它们的状态 \bar{r}(u_{1:d}),并设置 S <- S \cup S_d
11: end for
12: 剪枝完整的超树: \mathcal{T} = TopB_{u \in S} (s_\beta(u))
13: 返回 \mathcal{T}
仅在所有候选分数可用后才将其剪枝到$B$。
延迟最佳优先剪枝
一旦超树构建完成,每个被实例化的前缀都有一个校正后的分数,因此DARTree可以恢复最佳优先的预算分配,而无需将堆操作与校正交替进行。设$u_{1:d}$表示深度为$d$的前缀,$\widetilde{q}_i(u_i)$为其在深度$i$处的Token在给定已验证上下文及其前面的分支Token条件下的校正概率。我们通过以下公式对每个前缀进行评分:
其中$\beta$是深度奖励(Depth bonus),负值会惩罚更深的前缀。
引理 1(堆与Top-B的等价性)。设$\mathcal{S}$为实例化的前缀树,$B$为验证预算。如果$\beta \le 0$且在平局时优先考虑祖先节点,则最佳优先堆选择与全局Top-$B$选择返回相同的树:
扩展一个前缀会增加一个不大于零的对数概率和一个非正的深度奖励,因此任何子节点的得分都不能高于其父节点。全局得分最高的$B$个节点因此是前缀闭合的(Prefix-closed),并且正是被最佳优先最大堆顺序选择的节点。因此,在对超树进行评分后,可以用单次Top-$B$操作来替换堆。如果深度奖励为正,则该等价性不一定成立,因为正奖励可能允许后代的排名超过其祖先。随后,生成的这棵前缀树通过目标模型使用树注意力掩码在一次前向传播中进行验证。算法1总结了完整的按深度构建和延迟剪枝过程。在算法中,每个深度为$d$的节点由其从根到节点的Token前缀$u_{1:d}$标识;$\mathcal{S}_d$仅包含在深度$d$保留的节点,而$\mathcal{S}$累积了跨所有深度保留的节点。
实验环境
- 数据集:数学领域(GSM8K, MATH-500, AIME25)、代码领域(HumanEval, MBPP)、对话领域(MT-Bench, Alpaca)。
- 模型架构:Qwen3-4B 和 Qwen3-8B。
- 硬件配置:一台配备单张 NVIDIA RTX 6000 Ada Generation GPU 的服务器。CPU为两颗 AMD EPYC 9374F。
- 软件配置:操作系统为 Ubuntu 22.04.1 LTS。代码基于 HuggingFace Transformers 和 SGLang 实现,并使用 Triton 加速关键操作(如候选选择和树掩码构建)。
- 基准设置:基线包括标准AR解码、DFlash(并行预测16个Token)、DDTree(使用DFlash边缘预测构建最佳优先树)、Domino(联合训练DFlash主干与AR校正头)。DARTree默认使用Domino校正头,分为DARTree (fixed)和DARTree (pruned)两个变体。默认使用$K=64$,$B=64$。DARTree (fixed)在16个深度均匀分配预算(每层4个节点),DARTree (pruned)使用超树宽度12和深度奖励$\beta = -0.2$。生成最多2048个Token,Batch size为1。
实验结果
主要结果
实验在四个模型-温度配置(Qwen3-4B/8B, $T=0/1$)下进行。DARTree (fixed) 在所有配置下的整体平均接受长度($\tau$)和加速比均优于DDTree和Domino。相较于DDTree,$\tau$提升高达$22.9\%$,加速比提升高达$17.0\%$;相较于Domino,$\tau$提升高达$37.9\%$,加速比提升高达$30.8\%$。这证明了将因果校正从单链扩展到多分支能带来实质性收益。DARTree (pruned) 进一步取得了最佳的整体表现,其$\tau$和加速比分别比DDTree高出最高$28.9\%$和$22.7\%$,比Domino高出最高$46.8\%$和$40.1\%$。唯一的例外是AIME25在Qwen3-8B($T=1$)下,DDTree略快($4.56\times$ vs $4.50\times$),但DARTree仍具有更高的接受长度。在GSM8K(Qwen3-4B,$T=0$)上,DARTree每轮验证接受12.97个Token,达到$9.73\times$加速,其接受长度比DFlash高$98.6\%$,比Domino高$27.9\%$。(数据来源:Table 1)
树构建策略消融实验
在Qwen3-4B($T=0$)上对比了两种替代方案:1) 带有堆的顺序校正(Sequential Correction w. Heap):交替进行校正和堆更新,其接受长度接近DARTree,但每轮耗时约70ms,是DARTree的两倍以上。2) Domino-chain + DDTree:先在单链上校正再用DDTree构建树。DARTree通过并行执行特定路径的校正,使$\tau$比该方案提高了高达$16.4\%$,同时避免了顺序校正的开销,从而在所有数据集上实现了最高加速比。(数据来源:Table 2)
校正头迁移消融实验
将DARTree应用于近期发布的带有马尔可夫校正头的DSpark模型。结果显示,在所有六个数据集-温度设置中,DARTree均提高了接受长度(增加$14.6\% - 40.6\%$)和加速比(提升高达$34.3\%$)。这证明DARTree是一种通用的树构建方法,不仅限于Domino。(数据来源:Table 3)
超参数影响
在Qwen3-4B($T=0$)上研究了层宽度$W$和验证预算$B$。固定$B=64$时,将宽度从4增加到12显著提高了接受率,而更宽的层收益甚微(图4a)。固定$W=12$时,较大的预算$B$单调提高接受率,但加速比在$B=64-128$附近达到峰值,并在$B=192$时下降(图4b)。因此主实验选择$B=64$作为平衡点。(数据来源:Figure 4)
接受模式分析
图5展示了GSM8K上的按位置接受率。DARTree维持了明显更高的到达较后位置的概率:在近一半的解码轮次中,DARTree几乎接受了整个草稿块。DDTree在早期位置接受率高,Domino在后期位置表现较好,而DARTree结合了两者优势,既保留了早期的高接受率,又大幅延长了接受的延续序列。(数据来源:Figure 5)
结论
本文提出了DARTree,这是一种免训练的投机解码方法,它将经过因果校正的块并行草稿从单链扩展到树。DARTree通过按深度批处理扩展在多个分支上携带特定路径的校正,并在候选超树完全评分后,通过单次全局Top-$B$选择执行延迟的最佳优先剪枝。该设计避免了校正头推理和顺序堆更新的逐节点耦合,同时保持标准目标模型树验证程序不变。在所有评估基准中,DARTree在每种模型-温度配置下均实现了最高的整体平均接受长度和加速比,在贪婪解码和随机采样下均表现出一致的优势。未来的工作包括训练支持更长草稿块的模型,以及研究自适应的验证预算和树形状。
附录
局限性
DARTree依赖于配备因果校正头的预训练扩散草稿模型,因此其免训练特性不能直接应用于需要额外训练来合并此类头的朴素扩散草稿模型。此外,作为一种投机解码方法,DARTree并没有减少总FLOPs,而是用额外的计算换取了更低的延迟。验证大型候选树带来了计算开销,这使得它可能不适用于所有部署环境。
何时应该使用DARTree?
与其他基于树的投机解码方法一样,DARTree主要设计用于低并发服务(Low-concurrency serving),此时解码受到内存带宽的严重限制,计算资源未得到充分利用。随着并发量增加,批处理解码提高了硬件利用率,工作负载日益受限于计算能力,验证大树的开销变得昂贵。表4的评估表明,DARTree在低并发时提供最大收益;随着并发增加,调整$B$和$W$可以保持强大的性能。推荐场景包括:本地/个人/小规模模型服务(关注单请求吞吐量)、小批量处理的延迟敏感型请求,以及其他计算资源未充分利用的部署环境。
引理1的证明
假设两个过程使用引理1中的平局打破约定。对于任何具有父节点$p(u)$的节点$u = u_{1:d}$,其分数差为:
因为$\widetilde{q}_d(u_d \mid p(u)) \le 1$且$\beta \le 0$。因此,沿着每条从根到叶的路径,分数是非递增的,并且在平局时优先考虑祖先,全局Top-$B$集合是前缀闭合的。此外,任何未暴露的节点在堆中都有一个处于前沿的祖先,其得分至少相同。因此,每次堆弹出都会返回全局排序中的下一个节点,前$B$个弹出的节点正是全局Top-$B$节点。
额外实验
在Qwen3-4B($T=0$)上进一步检查了深度奖励$\beta$和候选词表上限$K$。如图6所示,当负深度奖励在$-0.2$到$-0.1$之间时,实现了最高的平均接受长度。将$K$从32变化到512对接受率或加速比影响不大,但使用全词表进行树扩展会因AR头延迟增加而大幅降低加速比。这支持了将$\beta = -0.2$和$K = 64$作为高效的默认设置。
验证树形状分布与可视化
比较了DDTree和DARTree如何在不同深度分配验证预算。DARTree形成更窄的树,并将更多候选分配给更深的层级,而DDTree更经常将其预算集中在少数几个宽而浅的层级中。图8至图11可视化了验证树。在示例中,DDTree包含许多重复或语义不兼容的父子过渡,而DARTree形成了更连贯且结构良好的分支,并在两个示例中都产生了更长的接受路径。
参考文献引用汇总:
- 【1,Fast inference from transformers via speculative decoding,2023,ICML】:在“投机采样”中被引用,介绍了标准投机解码的拒绝采样逻辑。
- 【2,Accelerating large language model decoding with speculative sampling,2023,arXiv】:在“投机采样”中被引用,同上。
- 【3,DFlash: Block Diffusion for Flash Speculative Decoding,2026,arXiv】:在“并行草稿与因果校正”中被引用,证明了块并行草稿能提高提案质量;在“投机采样”中提及了其精确目标样本匹配机制。
- 【4,Domino: Decoupling causal modeling from autoregressive drafting in speculative decoding,2026,arXiv】:在“并行草稿与因果校正”中被引用,提及了RNN校正方法。
- 【5,DSpark: ConfidenceScheduled Speculative Decoding with Semi-Autoregressive Generation,2026,arXiv】:在“并行草稿与因果校正”中被引用,提及了马尔可夫校正和RNN校正方法。
- 【6,Accelerating speculative decoding with block diffusion draft trees,2026,arXiv】:在“树验证与DDTree”及“解耦因果校正与最佳优先搜索”中被引用,介绍了DDTree最大化代理接受长度及最佳优先堆构建的方法。
- 【7,TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding,2026,arXiv】:在“并行草稿与因果校正”中被引用,提及了并行近似的马尔可夫校正。
💬 评论讨论
欢迎在这里分享您的想法和见解!