P-EAGLE: Parallel-Drafting EAGLE with Scalable Training

发表时间: 2026-02 · arXiv:2602.01469

原文: https://arxiv.org/abs/2602.01469

Mude Hui * 1 2 Xin Huang * 3 Jaime Campos Salas 3 Yue Sun 3 Nathan Pemberton 3 Xiang Song 3 Ashish Khetan 3 George Karypis 3

速读

一句话结论 本文提出了一种名为 P-EAGLE 的并行投机解码架构及配套的长上下文训练框架,将 EAGLE 的草稿生成过程从串行自回归升级为单次前向并行的多 token 预测,在不牺牲生成质量的前提下,使 120B 级别大模型在 vLLM 中的端到端推理速度提升了 1.10 至 1.36 倍。

要解决什么问题 推理能力模型在生成长序列时面临效率瓶颈。现有的 EAGLE 投机解码方法虽能加速推理,但其草稿模型(Drafting)的生成过程仍是自回归的,即生成每个 token 必须等待上一步完成,串行开销限制了加速上限。为打破此限制,业界提出了 ParallelSpec 和 PARD 等并行草稿生成方法,但它们在训练阶段遇到了致命的显存溢出(OOM)问题。在并行预测训练中,序列总位置数等于原始序列长度 $n$ 乘以预测深度 $K$,导致注意力显存和计算复杂度呈 $O((nK)^2)$ 二次方爆炸。处理 8K 甚至 20K tokens 时,单卡无法容纳单条序列的前向传播;同时,现有方法为减少位置数引入的随机采样机制,要求为每个样本单独构建复杂的注意力掩码,构建成本高达 $O((nK)^2)$,导致长上下文训练在算力和显存上均不可行。

怎么做的 P-EAGLE 的核心思路是通过一次前向传播并行生成 $K$ 个草稿 tokens,并用一套可扩展框架绕开长序列显存与耗时卡点。在架构设计上,P-EAGLE 摒弃了串行依赖。对于首个预测位置,它接收目标模型的真实隐藏状态和当前 Token Embedding;对于后续并行位置,由于缺乏前序真实输出,P-EAGLE 引入两个可学习参数:替代未知 token 的 Mask Token Embedding,以及替代前序隐藏向量的共享隐藏状态(Shared Hidden State)。理论证明,由于 RoPE 旋转位置编码已能让模型唯一恢复绝对位置信息,因此无需为不同预测深度设计专属编码或注入复杂上下文,所有并行位置共享同一个隐藏状态即可。为解决训练复杂度卡点,框架包含两个关键设计。一是摊销掩码构建(Amortized Mask Construction)。利用因果注意力跨深度的位置不变性,初始化时一次性预计算最大长度掩码,训练时通过常数时间复杂度的张量切片操作获取子矩阵,消除每样本构建开销。二是序列分块(Sequence Partitioning)。为解决单条长序列超显存问题,算法将序列切分为 $S$ 个分块,使峰值注意力显存大幅降低:$$ Memory \propto O\left(\frac{L^2}{S^2}\right) $$ 为不破坏跨深度的因果依赖,算法采用迭代传播机制,关键不变量为:$$ Chunk(p, d) = Chunk(p-1, d-1) \quad \text{for } d \ge 2 $$ 即深度 $d$ 的位置 $p$ 强制分配到与其依赖项相同的分块中,并在边界进行因果补全,从而在单卡实现序列内梯度累积。

效果如何 实验在 8 张 H200 GPU 上进行,使用 UltraChat、GSM-8K 等数据集,目标模型为 GPT-OSS 120B/20B 和 Qwen3-Coder 30B。对比基线有两个阵营:一是代表串行路线的强基线自回归 EAGLE-3(单层结构,高度优化);二是代表并行路线的 ParallelSpec 和 PARD(因在 8K 以上长上下文训练中直接显存溢出,仅用于可扩展性对比)。在 8192 tokens 训练设置下,P-EAGLE 成功扩展至 20K tokens 长度。生成质量上,P-EAGLE 的平均每步接受长度在所有测试集均匹配或超越自回归 EAGLE-3,如在 GPT-OSS 120B 提升 4.5%。在 vLLM 端到端吞吐量实测中(并发度为 2),P-EAGLE 相比 EAGLE-3 显著加速:GPT-OSS 20B 提速 1.27 至 1.36 倍,120B 提速 1.04 至 1.10 倍,Qwen3-Coder 30B 提速 1.04 至 1.17 倍。该方法也有代价与局限。首先,为补偿并行预测的信息缺失,P-EAGLE 需要更深的网络容量(推荐 4 层),若为追求极低延迟缩减至 2 层,在 20B 模型上的接受率会大幅下降 12.4%。其次,在并发度较高(如并发度为 4)时,由于目标模型的验证阶段成为新算力瓶颈,120B 大模型的加速比会受限而略有下降。

A1 主要贡献

本文主要解决的问题是大型语言模型(LLM)推理中的效率瓶颈,特别是针对推理能力模型(Reasoning LLMs)产生长输出序列的场景。现有的EAGLE方法虽然通过投机解码加速了推理,但其Drafting过程仍是自回归的(串行生成)。现有的并行Drafting方法(如ParallelSpec和PARD)在处理长上下文训练时,由于注意力机制的二次方复杂度,面临显存溢出(OOM)或计算不可行的问题。

主要贡献如下:

  1. 长上下文的可扩展训练框架:提出了一套包含“摊销掩码构建(Amortized Mask Construction)”和“序列分块(Sequence Partitioning)”的框架。这解决了并行预测训练中注意力显存随序列长度和预测深度乘积呈二次方增长的问题,使得模型能够在长序列(如20K tokens)上进行有效训练。
  2. 基于EAGLE的并行Drafting架构(P-EAGLE):引入了一个可学习的共享隐藏状态(Shared Hidden State),将EAGLE从自回归生成转变为并行多token预测。理论分析证明,利用RoPE的位置编码已足够包含所需的位置信息,无需额外的位置特定隐藏状态。
  3. 优化的训练配方:通过系统性的消融实验,确立了P-EAGLE的最佳实践,包括架构深度(推荐4层)、解冻Embedding层以及训练与推理时的预测深度对齐策略。
  4. 生产级部署与验证:在vLLM中实现了P-EAGLE,并在GPT-OSS 120B/20B和Qwen3-Coder 30B上进行了评估。结果显示,相比于高度优化的自回归EAGLE-3,P-EAGLE实现了1.10×–1.36×的端到端加速。

Fig 1: UltraChat数据集上的序列长度分布
Fig 1展示了推理类模型在UltraChat数据集上的长序列特征(中位数接近4K,P90超过10K tokens),强调了长上下文训练的必要性。

Table 1: 接受长度与可扩展性对比
Table 1对比显示,ParallelSpec和PARD在长上下文(8K+)训练时面临OOM或不可行问题,而P-EAGLE可扩展至20K tokens。

A2 方法细节

2. P-EAGLE 架构

架构设计
P-EAGLE旨在消除自回归Drafting的开销。传统的EAGLE生成$K$个draft tokens需要$K$次串行前向传播,因为每一步都依赖上一步的token和隐藏状态。P-EAGLE通过并行化设计,在一次前向传播中生成所有$K$个tokens。

Fig 2: P-EAGLE 架构示意图
Fig 2展示了P-EAGLE架构。上方为目标模型提供特征,下方Draft模型中,Pos 1使用真实特征,Pos 2-4使用可学习的共享隐藏状态$h_{shared}$进行并行预测。

3. 面向长上下文的可扩展训练框架

挑战分析
训练并行预测模型需要将长度为$n$的序列扩展以适应$K$个并行预测深度。未优化的情况下,总位置数为$n \times K$,注意力复杂度为$O((nK)^2)$,导致长序列OOM。虽然PARD方法引入了条件Drop-token (COD) 采样(按几何衰减率$r$保留后续深度位置)来减少总位置数,但其随机采样导致每个样本需要构建不同的注意力掩码(Mask),构建成本高达$O((nK)^2)$,在长序列下极其缓慢。

3.1 摊销掩码构建 (Amortized Mask Construction)

Fig 3: 因果注意力的位置不变性与掩码切片
Fig 3展示了如何通过切片预计算的大掩码来获得短序列的掩码,利用了注意力模式的位置不变性。

Table 2: 训练开销对比
Table 2: 训练开销对比

3.2 序列分块 (Sequence Partitioning)

Fig 4: 序列分块与依赖保留
Fig 4展示了直接按索引分块会破坏依赖关系(红色箭头跨越虚线),而所提算法能确保依赖项在同一分块中。

A3 背景知识/关键Observation/设计原则

在方法细节之前,论文阐述了关于隐藏状态设计的关键理论观察。

A4 实验环境

A4 实验结果

1. 接受长度 (Acceptance Length) 对比

实验旨在验证并行Drafting是否会降低生成质量。结果显示P-EAGLE在质量上不输于甚至略优于自回归EAGLE。

Table 9: 接受长度对比
Table 9: 接受长度对比

2. 端到端吞吐量 (vLLM)

在vLLM框架中实测输出tokens每秒 (OTPS)。

Table 10: vLLM中的端到端吞吐量对比
Table 10: vLLM中的端到端吞吐量对比

3. 消融实验结论 (基于LLaMA 3.1 8B)

A5 结论

本文提出了P-EAGLE,成功将EAGLE投机解码框架从串行自回归转变为并行多token预测。针对并行训练中长上下文导致的显存瓶颈,提出了一套包含摊销掩码构建和序列分块的可扩展训练框架。通过在vLLM上的实现,P-EAGLE在多个大规模模型(最高120B)上展现了相对于强基线AR EAGLE-3的显著加速(1.10×–1.36×),且不牺牲生成质量。这证明了并行Drafting在生产级LLM加速中的可行性和优势。未来工作可结合更长上下文的优化技术。

A6 附录

附录 A: ParallelSpec 和 PARD 的训练配置

附录 B: 隐藏状态增强冗余性的理论证明

附录 C: 2层 vs 4层 P-EAGLE 对比

Table 11: 2层与4层P-EAGLE性能对比
Table 11: 2层与4层P-EAGLE性能对比

A7 补充细节

4.1 隐藏状态消融细节

Table 3: 隐藏状态策略消融实验
Table 3数据表明,任何形式的显式上下文注入或深度编码都会导致性能下降。

Fig 5: 上下文注入系数α的训练轨迹
Fig 5显示模型在训练中主动减小注入系数$\alpha$,证实了上下文注入的负面影响。