数据筛选:我们丢弃了样本得分方差低和难度低的数据。具体来说,我们使用SFT模型为每个提示生成多个候选答案,然后使用奖励模型对其进行评分。得分方差低的提示被移除,因为它们表现出有限的采样多样性和极小的改进潜力。在豆包 1.5 Pro RL训练过程中【索引8,Wei Shen, et al. Exploring data scaling trends and effects in reinforcement learning from human feedback, 2025】,奖励得分提升超过某个阈值的提示也被移除。这是因为这些数据可能过于简单或已在数据集中大量存在。离线实验表明,过度优化这类样本会导致模型探索空间的过早崩溃并降低性能。
为了增强奖励模型的有效性,我们采用了在【索引9,Wenyuan Xu, et al. A unified pairwise framework for rlhf: Bridging generative reward modeling and policy optimization, 2025】中提到的成对生成式奖励模型,该模型评估两个回答的优劣,并使用“YES”或“NO”的概率作为最终奖励分数。这种方法使模型在评分时能够直接比较回答之间的差异,从而避免过度关注不相关的细节。实验结果表明,这种奖励建模方法提高了RL训练的稳定性,特别是在涉及不可验证和可验证问题的混合训练场景中,通过最小化两种不同类型奖励建模范式之间的冲突。这种改进可能归因于成对生成式奖励模型在缓解异常分数生成方面相较于传统奖励模型具有的内在优势,从而避免了与验证器的分数分布产生显著差异。
在长思维链(long-CoT)RLHF的背景下,我们遇到了诸如价值模型偏差和奖励信号稀疏性等若干挑战。为了解决这些问题,我们借鉴了我们先前工作【索引5,Yu Yue, et al. Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025】、【索引6,Qiying Yu, et al. Dapo: An open-source llm reinforcement learning system at scale, 2025】、【索引10,Yufeng Yuan, et al. What’s behind ppo’s collapse in long-cot? value optimization holds the secret. arXiv preprint arXiv:2503.01491, 2025】中的关键技术:
正样本语言模型损失(Positive Example LM Loss):这个损失函数旨在提高RL训练过程中正样本的利用效率。我们为正样本增加了一个带有系数$\mu$的语言模型损失:
这个额外的损失项帮助模型更好地从正样本中学习,从而提高其整体性能。
当合并来自不同领域的数据并整合多样的评分机制时,我们面临不同数据领域之间相互干扰的挑战。这种干扰可能源于难度水平的差异、奖励攻击的风险以及其他潜在因素。这些问题使得在模型的所有能力上实现统一和同步的提升变得极其困难。为了应对这个问题,我们引入了在线数据分布自适应(Online Data Distribution Adaptation)。该方法将强化学习期间的静态提示分布转换为一个能更好地满足模型训练需求的自适应分布。通过这样做,我们最小化了数据干扰的负面影响,并确保了不同能力之间更均衡的提升。因此,模型可以在广泛的任务上更一致地增强其性能。
5 基础设施
5.1 框架
训练框架是使用HybridFlow【索引11,Guangming Sheng, et al. Hybridflow: A flexible and efficient rlhf framework, 2024】编程抽象构建的。整个训练工作负载运行在一个Ray【索引12,Philipp Moritz, et al. Ray: A distributed framework for emerging AI applications, 2017】集群之上。数据加载器和RL算法在一个单进程的Ray Actor(单一控制器)中实现。模型训练和响应生成(rollout)在一个Ray Worker Group中实现。Ray Worker Group暴露了一组API(例如,generate_response/train_batch等),这些API通过SPMD(单程序多数据)在Worker Group内部运行繁重的训练/生成工作负载。单一控制器调用Ray Worker Group暴露的各种API来构建训练流程。HybridFlow编程抽象使得RL算法思想的快速原型设计成为可能,而无需处理复杂的分布式系统问题。
Seed1.5-Thinking是通过混合引擎架构【索引13,Zhewei Yao, et al. Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales, 2023】进行训练的,其中所有模型都位于同一位置。这防止了在训练和生成之间切换时GPU的空闲时间。在长CoT生成过程中,我们观察到由不同提示的响应长度差异巨大引起的严重掉队(straggler)现象。这导致了生成过程中的大量GPU空闲时间。为了缓解长尾响应生成的掉队问题,我们提出了SRS(流式Rollout系统)——一个资源感知的调度框架,它战略性地部署独立的流式计算单元,将系统约束从内存密集型转变为计算密集型。
序列长度均衡:有效序列长度在DP rank之间可能不平衡,导致计算工作负载不均衡和训练效率低下。为了应对这一挑战,我们利用KARP【索引14,Narendra Karmarkar and Richard M Karp. The differencing method of set partitioning, 1982】算法,该算法重新排列一个小批量内的输入序列,使其在微批次之间保持平衡。
内存优化:我们采用层级重计算【索引15,Tianqi Chen, et al. Training deep nets with sublinear memory cost, 2016】、激活卸载和优化器卸载来支持训练更大的微批次,以重叠FSDP引起的通信开销。
自动并行:为了实现最优的系统性能,我们开发了一个自动调优系统,称为AutoTuner。具体来说,AutoTuner遵循一种基于性能剖析的解决方案【索引16,Lianmin Zheng, et al. Alpa: Automating inter-and {Intra-Operator} parallelism for distributed deep learning, 2022】来建模内存使用。然后,它估计各种配置的性能和内存使用情况,以获得最优配置。
检查点:我们采用ByteCheckpoint【索引17,Borui Wan, et al. Bytecheckpoint: A unified checkpointing system for large foundation model development, 2025】来支持从不同的分布式配置中恢复检查点,且开销极小。这使得用户可以弹性地训练任务,以提高集群效率。
拒绝采样:拒绝采样已被认为是提升模型性能的一项有价值的技术【索引2,DeepSeek-AI. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025】。我们进行了一项消融实验,以检验使用拒绝微调(RFT)模型初始化RL是否会影响结果。我们的结果显示,使用RFT初始化的预训练模型在训练中饱和得更快,但最终性能低于未使用RFT训练的模型,如表3所示。
算法排名在不同模型尺寸间的一致性:我们观察到,RL算法在不同尺寸和架构的模型上表现出一致的排名行为。如表4所示,Seed-150B-MoE是一个在架构(MoE vs. dense)和尺寸上都与Qwen-32B不同的模型,但它展现出了一致的排名。值得注意的是,这种一致性表明Qwen-32B可以有效地作为研究RL算法的代理模型。
[8] Exploring data scaling trends and effects in reinforcement learning from human feedback (Wei Shen, et al., 2025): 在2.1.2节引用,说明了在豆包1.5 Pro RL训练过程中,移除奖励得分提升过快的简单数据。
[9] A unified pairwise framework for rlhf: Bridging generative reward modeling and policy optimization (Wenyuan Xu, et al., 2025): 在3.2节引用,作为本文采用的成对生成式奖励模型的理论依据。
[10] What’s behind ppo’s collapse in long-cot? value optimization holds the secret (Yufeng Yuan, et al., 2025): 在4.2节引用,同[5]和[6],作为本文采用的关键RL技术的来源。
[11] Hybridflow: A flexible and efficient rlhf framework (Guangming Sheng, et al., 2024): 在5.1节引用,作为本文训练框架所基于的编程抽象。
[12] Ray: A distributed framework for emerging AI applications (Philipp Moritz, et al., 2017): 在5.1节引用,作为训练工作负载所运行的集群系统。
[13] Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales (Zhewei Yao, et al., 2023): 在5.1节引用,作为本文采用的混合引擎架构的参考。
[14] The differencing method of set partitioning (Narendra Karmarkar and Richard M Karp, 1982): 在5.3节引用,作为序列长度均衡所采用的KARP算法的来源。
[15] Training deep nets with sublinear memory cost (Tianqi Chen, et al., 2016): 在5.3节引用,作为内存优化中层级重计算技术的来源。
[16] Alpa: Automating inter-and {Intra-Operator} parallelism for distributed deep learning (Lianmin Zheng, et al., 2022): 在5.3节引用,作为AutoTuner中基于性能剖析建模内存使用的解决方案来源。
[17] Bytecheckpoint: A unified checkpointing system for large foundation model development (Borui Wan, et al., 2025): 在5.3节引用,作为支持弹性训练的检查点系统的来源。