Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning

发表时间: 2025-04 · arXiv:2504.13914

原文: https://arxiv.org/abs/2504.13914

作者/机构: ByteDance Seed (完整作者列表见贡献部分)

速读

一句话结论 字节跳动 Seed 团队通过强化学习训练出总参数量为 200B、激活参数为 20B 的混合专家模型 Seed1.5-Thinking,该模型通过在响应前进行思考,在复杂推理基准和通用非推理任务上均取得了当前最优级别的性能。

要解决什么问题 长思维链的强化学习训练面临价值模型偏差和奖励信号稀疏的机制卡点。同时,当混合可验证的推理数据与不可验证的主观偏好数据进行联合训练时,不同数据域之间会因难度差异和奖励攻击风险产生相互干扰,导致模型各项能力难以同步提升。在工程实现上,由于不同提示词触发的思考链长度差异巨大,传统的同步生成框架会产生严重的掉队现象,导致生成过程中出现大量的 GPU 空闲时间。此外,现有的数学基准测试(如每年仅发布 30 题的 AIME)题目数量过少,评估方差大,难以有效区分当前最先进推理模型的真实水平。

怎么做的 核心思路是通过定制化的奖励建模、改进的近端策略优化算法以及流式生成架构,实现稳定且高效的长思维链强化学习。关键设计由三个部件构成。首先是奖励建模层,针对有确定答案的可验证问题,训练了一个 Seed-Thinking-Verifier 验证器,它通过输出详细的推理路径来剖析生成答案与参考答案的本质异同,从而绕开非思考型模型利用格式漏洞进行奖励攻击的卡点;针对无确定答案的主观问题,则采用成对生成式奖励模型直接比较两个回答的优劣,以缓解分数分布异常。其次是强化学习算法层,引入价值预训练使价值模型与监督微调策略对齐以维持思维链的连贯性,并采用解耦的广义优势估计,其中策略端的衰减因子根据回答长度 $l$ 动态自适应调整为 $\lambda_{policy} = 1 - \frac{1}{\alpha l}$,这一设计使时序差分误差在长短序列上分布更均匀。同时,算法解耦了上下裁剪边界,通过增大上边界鼓励模型探索低概率的有效路径,并为正样本引入带有系数 $\mu$ 的语言模型损失以提升利用效率。针对多领域数据混合训练带来的干扰,采用在线数据分布自适应技术动态调整提示词采样。最后是基础设施层,针对长序列生成的掉队问题,开发了流式生成系统,将模型演进与运行时执行解耦,通过动态调整同策略生成的完成率,将未完成的部分分配给历史快照模型进行异步续传,从而将系统约束从显存密集型转化为计算密集型,大幅减少了 GPU 空闲时间。

效果如何 实验基于总参数 200B、激活参数 20B 的混合专家模型 Seed1.5-Thinking 展开,训练数据包含 10 万道 STEM 题目、编程题、逻辑题及主观偏好数据,底层硬件依托支持张量、专家与上下文并行的 Ray 集群。对比基线包括 OpenAI 的推理模型 o1 与 o3-mini-high、同为先进推理路线的 DeepSeek R1,以及通用大模型 Gemini 2.5 Pro。在量化结果上,模型在 AIME 2024 数学基准上取得 86.7 分,追平 o3-mini-high 并显著优于 o1 和 DeepSeek R1;在 GPQA 科学问答上达到 77.3% 的准确率;在 Codeforces 编程测试中,pass@8 指标超越 DeepSeek R1 并逼近 Gemini 2.5 Pro。在真实用户场景的人工评估中,相较于 DeepSeek R1,其正面反馈率总体提升了 8.0%。但该方法也存在代价与局限:首先,提供详细推理路径的验证器会消耗大量的 GPU 计算资源;其次,在更新的 AIME 2025、自建的包含 100 道极难数学题的基准 BeyondAIME 以及编程任务上,模型性能仍落后于 o3 级别;此外,在偏向知识记忆的 SimpleQA 任务上表现平庸,且消融实验表明,若使用拒绝微调模型来初始化强化学习,会导致训练过早饱和,最终性能反而低于直接从基础模型启动。

A1 主要贡献

本文介绍了一款名为Seed1.5-Thinking的新型推理模型,该模型通过在响应前进行思考来提升在广泛基准测试中的性能。研究的核心目标是开发一个在推理和非推理任务上都表现出色的模型。

主要贡献和创新点如下:

  1. 卓越的推理能力:Seed1.e5-Thinking在多个高难度推理基准上取得了SOTA级别的性能。
    • 数学推理:在AIME 2024上获得86.7分,与o3-mini-high持平,显著优于o1和DeepSeek R1。为解决AIME 2024区分度不足的问题,团队构建了更具挑战性的BeyondAIME测试集。
    • 编程竞赛:在Codeforces基准测试中,pass@1和pass@8指标均优于DeepSeek R1。
    • 科学:在GPQA上获得77.3分,接近o3级别,这一提升主要归功于数学训练带来的泛化能力。
  2. 广泛的通用能力:模型在非推理任务上也表现出色。通过与DeepSeek R1的人工评估对比,Seed1.5-Thinking在多样化的真实用户场景中,用户正面反馈率总体提升了8.0%。
  3. 模型架构:Seed1.5-Thinking是一个混合专家(MoE)模型,激活参数为20B,总参数为200B,尺寸相对较小。
  4. 开发高质量推理模型的三个关键要素:本文详细阐述了在开发过程中的三个核心投入领域,分别是训练数据、强化学习(RL)算法和RL基础设施。
    • 数据:强调了思维链(CoT)数据对SFT的重要性,并构建了包含STEM、代码、逻辑推理和非推理任务的RL训练数据。
    • RL算法:为解决RL训练不稳定的问题,开创了VAPO和DAPO框架,分别针对actor-critic和policy-gradient范式,实现了稳定可靠的训练。
    • RL基础设施:开发了支持异构工作负载的解耦流式rollout架构,将迭代周期缩短至同步框架的1/3,并支持混合精度训练和自动故障恢复。
  5. 发布新基准:为评估通用推理能力,开发了两个内部基准BeyondAIME和Codeforces,并将公开发布以支持未来研究。

A3 数据与奖励建模

2 数据

2.1 强化学习训练数据

我们的RL训练数据包含两个主要部分:有确定答案的可验证问题和没有确定答案的不可验证问题。模型的推理能力主要来自第一部分,并能泛化到第二部分。

2.1.1 可验证问题

可验证问题主要包括配有答案的STEM问题、配备单元测试的编程问题以及易于自动验证的逻辑推理题。

STEM数据

代码数据

逻辑谜题数据

2.1.2 不可验证问题

不可验证问题主要涵盖需要基于人类偏好进行质量评估的非推理任务,涉及创意写作、翻译、知识问答、角色扮演等任务。这些提示源自用于豆包-1.5 Pro【索引7,ByteDance. Doubao-1.5-pro, 2025】的RL训练数据。该数据集在不同领域具有充分的覆盖。

2.2 高级数学基准

目前的推理模型通常使用AIME作为评估数学推理能力的首选基准。然而,由于每年只发布30个问题,其有限的规模可能导致高方差的评估结果,使其难以有效地区分最先进的推理模型。为了更好地评估模型的数学推理能力,我们构建了一个新的基准数据集:BeyondAIME。具体来说,我们与数学专家合作,根据已有的竞赛格式开发原创问题。我们通过结构修改和情景重构系统地调整现有的竞赛问题,确保不发生直接重复。此外,我们确保答案绝不是琐碎的值——例如问题陈述中明确提到的数字——以减少模型在没有适当推理的情况下猜对答案的机会。

通过这个严格的筛选和策划过程,我们最终汇编了一套包含100个问题的集合,每个问题的难度等于或大于AIME中最难问题的难度。与AIME类似,所有答案都保证是整数(不限于特定的数值范围),这简化并稳定了评估过程。

3. 奖励建模

作为RL中的一个关键组成部分,奖励建模定义了策略试图实现的目标。因此,一个精心设计的奖励机制对于在训练阶段为模型响应提供精确可靠的奖励信号至关重要。对于可验证和不可验证的问题,我们采用不同的奖励建模方法。


表1 两种验证器类型的准确率。具体来说,训练集上的准确率来自训练统计数据。此外,我们手动标注了456个样本构成测试集,这些样本专门从Seed-Verifier无法稳定处理的案例中选取。

3.1 可验证问题的奖励建模

通过恰当的原则和思维轨迹,我们利用LLM来判断各种场景下的大量可验证问题。这种方法产生了一个更通用的解决方案,超越了基于规则的奖励系统的局限性。

我们设计了两种渐进式的奖励建模解决方案,Seed-Verifier和Seed-Thinking-Verifier:

Seed-Thinking-Verifier显著缓解了与Seed-Verifier相关的三个主要问题:

表1展示了上述两种验证器的性能。结果表明,Seed-Verifier在处理某些特定案例时效果不佳,而Seed-Thinking-Verifier则展现出提供准确判断的卓越能力。尽管后者的思考过程确实消耗了大量的GPU资源,但我们认为它生成的精确而稳健的奖励结果对于赋予策略强大的推理能力至关重要。

3.2 不可验证问题的奖励建模

对于不可验证问题,我们为RL训练训练了一个奖励模型。奖励模型的训练数据与豆包1.5 Pro【索引7,ByteDance. Doubao-1.5-pro, 2025】中使用的人类偏好数据一致,主要涵盖创意写作和摘要等类别。

为了增强奖励模型的有效性,我们采用了在【索引9,Wenyuan Xu, et al. A unified pairwise framework for rlhf: Bridging generative reward modeling and policy optimization, 2025】中提到的成对生成式奖励模型,该模型评估两个回答的优劣,并使用“YES”或“NO”的概率作为最终奖励分数。这种方法使模型在评分时能够直接比较回答之间的差异,从而避免过度关注不相关的细节。实验结果表明,这种奖励建模方法提高了RL训练的稳定性,特别是在涉及不可验证和可验证问题的混合训练场景中,通过最小化两种不同类型奖励建模范式之间的冲突。这种改进可能归因于成对生成式奖励模型在缓解异常分数生成方面相较于传统奖励模型具有的内在优势,从而避免了与验证器的分数分布产生显著差异。

A2 方法细节

4. 方法

4.1 监督微调

我们的训练过程从监督微调(SFT)开始。SFT阶段为后续的强化学习阶段奠定了坚实的基础。与从基础模型开始RL相比,SFT模型产生的输出更具可读性,幻觉实例更少,并且表现出更低的有害性。我们策划了一个包含40万个训练实例的SFT数据集,其中包括30万个可验证问题和10万个不可验证问题。可验证的提示是从RL训练集中随机抽样的。不可验证的数据来源于用于豆包-Pro 1.5【索引7,ByteDance. Doubao-1.5-pro, 2025】的SFT数据,涵盖了创意写作、知识问答、安全和函数调用等领域。

为了生成具有长思维链(CoT)的高质量回答,我们采用了一个集成了模型合成、人工标注和拒绝采样的迭代工作流。最初,人类专家应用提示工程技术或与内部模型进行交互式对话,以产生具有各种推理模式的回答。在积累了数十个高质量的冷启动样本后,我们可以训练一个具有长CoT的推理模型,作为一个更有能力的助手。然后,我们使用Seed-Verifier对这个推理模型进行拒绝采样。虽然这个工作流主要应用于数学数据,但我们观察到它可以很好地泛化到其他领域,如编程、逻辑谜题甚至创意写作。因此,对于其他领域,我们也进行了一个冷启动过程,然后进行拒绝采样,以产生详细的推理轨迹。

在训练期间,每个实例被截断为32,000个token。我们使用上述数据对基础模型进行了两个epoch的微调。我们使用余弦衰减学习率调度,峰值学习率为$2 \times 10^{-5}$,并逐渐衰减到$2 \times 10^{-6}$。

4.2 强化学习

我们开发了一个统一的强化学习框架,该框架无缝地融合了来自广泛领域的数据。这种集成包含了三类数据:

在长思维链(long-CoT)RLHF的背景下,我们遇到了诸如价值模型偏差和奖励信号稀疏性等若干挑战。为了解决这些问题,我们借鉴了我们先前工作【索引5,Yu Yue, et al. Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025】、【索引6,Qiying Yu, et al. Dapo: An open-source llm reinforcement learning system at scale, 2025】、【索引10,Yufeng Yuan, et al. What’s behind ppo’s collapse in long-cot? value optimization holds the secret. arXiv preprint arXiv:2503.01491, 2025】中的关键技术:


通过增加$\epsilon_{high}$的值,我们为低概率token的增加创造了更多空间。这鼓励模型探索更广泛的可能回答,增强其发现新颖有效解决方案的能力。


这个额外的损失项帮助模型更好地从正样本中学习,从而提高其整体性能。

当合并来自不同领域的数据并整合多样的评分机制时,我们面临不同数据领域之间相互干扰的挑战。这种干扰可能源于难度水平的差异、奖励攻击的风险以及其他潜在因素。这些问题使得在模型的所有能力上实现统一和同步的提升变得极其困难。为了应对这个问题,我们引入了在线数据分布自适应(Online Data Distribution Adaptation)。该方法将强化学习期间的静态提示分布转换为一个能更好地满足模型训练需求的自适应分布。通过这样做,我们最小化了数据干扰的负面影响,并确保了不同能力之间更均衡的提升。因此,模型可以在广泛的任务上更一致地增强其性能。

5 基础设施

5.1 框架

训练框架是使用HybridFlow【索引11,Guangming Sheng, et al. Hybridflow: A flexible and efficient rlhf framework, 2024】编程抽象构建的。整个训练工作负载运行在一个Ray【索引12,Philipp Moritz, et al. Ray: A distributed framework for emerging AI applications, 2017】集群之上。数据加载器和RL算法在一个单进程的Ray Actor(单一控制器)中实现。模型训练和响应生成(rollout)在一个Ray Worker Group中实现。Ray Worker Group暴露了一组API(例如,generate_response/train_batch等),这些API通过SPMD(单程序多数据)在Worker Group内部运行繁重的训练/生成工作负载。单一控制器调用Ray Worker Group暴露的各种API来构建训练流程。HybridFlow编程抽象使得RL算法思想的快速原型设计成为可能,而无需处理复杂的分布式系统问题。

Seed1.5-Thinking是通过混合引擎架构【索引13,Zhewei Yao, et al. Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales, 2023】进行训练的,其中所有模型都位于同一位置。这防止了在训练和生成之间切换时GPU的空闲时间。在长CoT生成过程中,我们观察到由不同提示的响应长度差异巨大引起的严重掉队(straggler)现象。这导致了生成过程中的大量GPU空闲时间。为了缓解长尾响应生成的掉队问题,我们提出了SRS(流式Rollout系统)——一个资源感知的调度框架,它战略性地部署独立的流式计算单元,将系统约束从内存密集型转变为计算密集型。

5.2 流式Rollout系统(Streaming Rollout System)

SRS架构引入了流式rollout,将模型演进与运行时执行解耦,通过参数$\alpha$实现对on-policy和off-policy样本比例的动态调整:

此外,我们还在环境交互阶段实现了动态精度调度,通过带有误差补偿范围缩放的训练后量化部署FP8策略网络。为了解决MoE系统中的token不平衡问题,我们实现了一个三层并行架构,结合了用于层级计算的TP(张量并行)、带有动态专家分配的EP(专家并行)和用于上下文分块的SP(序列并行)。我们的内核自动调优器根据实时负载监控动态选择最优的CUDA内核配置。

5.3 训练系统

为了高效地大规模训练Seed1.5-Thinking模型,我们设计了一个混合分布式训练框架,该框架集成了先进的并行策略、动态工作负载均衡和内存优化。下面我们详细介绍驱动该系统效率和可扩展性的核心技术创新。

A4 实验环境与结果

实验环境

实验结果

6.1 自动评估结果

表2展示了在数学、编程、科学和通用知识等多个领域的评估结果。数学基准任务的结果是在32个模型响应中取平均值,而GPQA任务结果是在8个响应中取平均值。对于Codeforces,我们报告了avg@8和pass@8,因为pass@8更符合人类的提交习惯。所有其他任务的结果是在1个响应中取平均值。

表2 SOTA推理模型的结果。*结果来自我们的内部沙箱,可能因测试环境不一致而与报告结果有所不同。

6.2 人工评估结果

为了评估模型在主观任务上的性能(自动化指标不足以捕捉细微的人类偏好),我们在一系列多样化的非推理场景中进行了人工评估。我们的评估旨在衡量质量的关键维度,如连贯性、相关性、创造性和对以人为中心的偏好的遵守情况,由领域专家评估小组根据预定义的评分标准对模型输出与Deepseek R1进行评级。我们使用一个5分制评分量表,从0(非常差)到4(优秀),并在包含多轮对话的会话提示上评估两个模型。每个完整会话都用二元的赢/输结果进行标注,以捕捉整体用户体验,并为每轮分配一个0-4的单一分数。


图2 评级分布

6.3 预训练模型的影响

表3 预训练模型消融实验

表4 一致的算法排名。Seed-150B-MoE的结果仅为消融实验,步数有限。

A5 结论

我们介绍了一款名为Seed1.5-Thinking的卓越推理模型,它在推理任务和非推理任务上都取得了出色的性能。该模型利用先进的RL技术,稳定可靠地提升了思考能力,在AIME24上达到86.7%,AIME25上达到74.0%,在Codeforces上达到55.0%。未来,我们计划研究更高效的RL方法,并探索更具挑战性的思考模式任务,以推动模型智能的边界。此外,开发与验证器准确性相当的通用奖励模型也将是一个引人注目的研究方向。

A6 附录

A 验证器案例研究

表5展示了Seed-Verifier和Seed-Thinking-Verifier的案例研究。可以清楚地看到,Seed-Verifier在处理答案复杂的样本时表现不佳。相比之下,Seed-Thinking-Verifier能够通过进行逐步分析提供准确的判断结果。得益于其详细的思考过程,Seed-Thinking-Verifier展现出卓越的灵活性,并且可以有效地推广到几乎任何领域。


表5 验证器案例研究。

B 创意写作案例研究

在表6、7、8中,我们展示了中英文的例子,以证明我们的模型在创意写作方面的熟练程度。每个例子都分为三个不同的部分:原始用户提示、模型的思考链和模型的最终回答。

表6 创意写作案例1。

方法细节中的引用汇总