PipelineRL: Faster On-policy Reinforcement Learning for Long Sequence Generation

发表时间: 2025-09 · arXiv:2509.19128 (ServiceNow / Mila)

Alexandre Piché (ServiceNow AI Research), Ehsan Kamalloo (ServiceNow AI Research), Rafael Pardinas (ServiceNow AI Research), Xiaoyin Chen (Mila, Université de Montréal), Dzmitry Bahdanau (ServiceNow AI Research, Mila, McGill University)

速读

一句话结论 本文提出了 PipelineRL 强化学习框架,通过并发异步生成与在途权重更新机制,在长文本推理任务中实现了比传统强化学习基线快约 2 倍的学习速度,同时保持了高度的数据同策性。

要解决什么问题 大语言模型在强化学习训练中的核心卡点在于,硬件吞吐量与数据同策性之间存在难以调和的矛盾。学习速度由学习效果与学习吞吐量的乘积决定。为了最大化 GPU 等 AI 加速器的吞吐量,生成引擎必须在大批次下运行。在传统强化学习的串行逻辑中,生成序列和训练策略是交替进行的,为了凑齐大批次数据,当前策略必须连续生成多个优化器步的数据,这就导致当前训练策略与生成数据的行为策略之间产生严重的步数滞后。这种滞后会产生陈旧的偏策数据。当行为策略与当前策略差异过大时,重要性采样的归一化有效样本量会急剧下降,导致策略梯度估计的方差显著增加,进而使训练变得不稳定甚至完全发散。反之,如果为了保持完全同策而强行在每个优化器步只生成极少量数据,GPU 就会在小批次下低效运行,导致吞吐量极低,此时即使增加再多的加速器也会面临严重的收益递减。因此,原有的串行做法卡在了无法同时兼顾高硬件利用率和高数据新鲜度的问题上。

怎么做的 PipelineRL 的核心思路是将数据生成与模型训练解耦为并发异步的两个进程,并引入了在途权重更新机制。它彻底抛弃了传统强化学习中生成与训练交替等待的低效模式,使得生成引擎和训练器能够各自全速运转。这种设计之所以能绕开吞吐量与同策性的矛盾,是因为它允许生成引擎在恒定的大批次下维持高硬件利用率,同时通过极低延迟的权重同步保证数据的新鲜度。其关键设计由三个流水线阶段构成:负责生成的 Actor、负责计算参考模型对数概率的 Preprocessor,以及负责更新参数的 Trainer。这三者通过高带宽网络并以 Redis 作为流式代理进行通信。在具体执行中,Trainer 在完成一次优化器步后,会立即通过网络将最新权重发送给 Actor。Actor 在接收到更新请求时,仅需短暂暂停,将新权重加载到显存中,然后直接在当前正在生成的序列上继续生成后续的 token,而不需要打断或丢弃在途的序列。这意味着同一个序列的不同 token 实际上是由不同优化步的策略生成的,其行为策略可以定义为:$$ \mu(y|x) = \prod_{t=1}^{|y|} \pi_{k(t)}(y_t | x, y_{<t}) $$ 其中 $k(t)$ 表示生成第 $t$ 个 token 时的优化器步数。为了修正这种策略偏差,方法依然依赖重要性采样,其有效样本量定义为:$$ \text{ESS} = \frac{(\sum_{i=1}^B w_i)^2}{\sum_{i=1}^B w_i^2} $$ 其中 $w_i$ 为重要性权重。由于在途更新机制确保了序列后期的 token 始终紧跟最新策略,PipelineRL 产生的混合策略序列在整体上保持了极高的有效样本量。在系统配置上,整个框架的资源分配被简化为训练加速器数量的设定,通过平衡训练时间和生成延迟来控制最大滞后,从而在不牺牲学习效果的前提下最大化整体系统的样本吞吐量。

效果如何 实验在 128 个 H100 GPU 上搭建,使用包含 17K 个数学问题的 OpenReasoner Zero 数据集,对 Qwen 2.5 Base 7B 模型进行长文本推理训练。硬件分配为 48 个 GPU 用于生成,80 个 GPU 用于训练。对比的基线方法包括不同滞后步数的传统强化学习,以及代表开源基础模型强化学习路线的 OpenReasoner Zero 和 SimpleRL Zero。量化结果表明,在达到相同期望奖励的指标下,PipelineRL 的学习速度比滞后步数为 32 的传统强化学习基线快了约 2 倍,这主要归功于其实现了约 2 倍的样本吞吐量。在 MATH500 和 AIME2024 基准测试中,PipelineRL 训练的模型表现持平或超过了 OpenReasoner Zero 等强基线。在同策性方面,尽管 PipelineRL 的早期 token 存在较高的最大滞后,但其整体有效样本量始终维持在与滞后步数为 8 的传统强化学习相当的高水平,而传统方法在滞后步数达到 64 时训练会直接发散。作者也指出了该方法的局限性与代价:如果模型在相同提示下生成的 token 数量完全一致,吞吐量的提升空间会受限;此外,在计算资源极少(单卡利用率已经足够高)或极多(受限于生成延迟下限)的极端场景下,PipelineRL 的加速优势会明显减弱。

A1 主要贡献

A3 背景知识/关键Observation/设计原则

# 传统RL的 Actor-Trainer 逻辑
# Actor 进程
def Actor():
    Sprog = [] # 在途序列
    while True:
        Sfin, Sprog = pop_finished_sequences(Sprog)
        Qtrain.put(Sfin)
        if len(Sprog) < H:
            add_prompts_to_Sprog(H - len(Sprog))
        if Trainer_requests_weight_update:
            μ = receive_weight_update()
        Sprog = generate_next_tokens_with(μ)

# Trainer 进程
def Trainer(π, opt_state):
    batch = []
    while True:
        request_actor_weight_update(π)
        batch = get_B_sequences_from(Qtrain)
        π, opt_state = optimizer_step(π, opt_state, batch)

A2 方法细节

A4 实验环境

A4 实验结果

A5 结论

A6 附录

A7 补充细节


方法细节与背景引用文献汇总

  1. 【Ahmadian et al., 2024, Back to basics: Revisiting REINFORCE style optimization for learning from human feedback in LLMs, arXiv】

    • 描述及位置:第 2.1 节,用于说明 REINFORCE 变体在 LLM RL 训练中与复杂算法同样有效。
  2. 【Roux et al., 2025, Tapered off-policy REINFORCE: Stable and efficient reinforcement learning for LLMs, arXiv】

    • 描述及位置:第 2.1 节,用于说明 REINFORCE 及其变体对于 LLM 训练的有效性。
  3. 【Munos et al., 2016, Safe and efficient off-policy reinforcement learning, NeurIPS】

    • 描述及位置:第 2.1 节,说明通过截断重要性采样权重来减小估计方差的常规做法。
  4. 【Espeholt et al., 2018, IMPALA: Scalable distributed deep-RL with importance weighted actor-learner architectures, ICML】

    • 描述及位置:第 1 节和第 2.1 节,说明并发异步 RL 架构中截断重要性权重的应用。
  5. 【Kong, 1992, A note on importance sampling using standardized weights, University of Chicago】

    • 描述及位置:第 2.1 节,引入有效样本量(ESS)来量化重要性采样质量。
  6. 【Schlegel et al., 2019, Importance resampling for off-policy prediction, NeurIPS】

    • 描述及位置:第 2.1 节,作为使用 ESS 评估偏策 RL 性能的文献支撑。
  7. 【Fakoor et al., 2020, P3O: Policy-on policy-off policy optimization, UAI】

    • 描述及位置:第 2.1 节,作为在偏策优化中使用 ESS 的文献支撑。
  8. 【Kwon et al., 2023b, Efficient Memory Management for Large Language Model Serving with PagedAttention, SOSP】

    • 描述及位置:第 2.3 节,介绍基于 PagedAttention 的 KV 缓存管理机制以提高生成效率。
  9. 【Noukhovitch et al., 2024, Asynchronous RLHF: Faster and more efficient off-policy RL for language models, arXiv】

    • 描述及位置:第 1 节和第 3 节,指出过高的偏策度(大 $G$)会损害 RL 算法的学习效果。
  10. 【Hu et al., 2025, OpenReasoner-Zero: An open source approach to scaling up reinforcement learning on the base model, arXiv】

    • 描述及位置:第 5 节和 5.1 节,说明实验中使用的数据集来源,以及基准对比的基线模型。
  11. 【Zeng et al., 2025, SimpleRL-Zoo: Investigating and taming zero reinforcement learning for open base models in the wild, arXiv】

    • 描述及位置:第 5 节,作为基准对比的基线模型之一。