Forge: Scalable Agent RL Framework and Algorithm

发表时间: 2026-02

MiniMax

速读

一句话结论 MiniMax提出了一个名为Forge的大规模智能体强化学习框架,通过解耦系统架构、引入混合调度与前缀树合并技术,成功解决了复杂智能体训练中吞吐量、稳定性与灵活性无法兼顾的问题,并支撑了M2.5模型在十万级真实世界智能体脚手架上的高效训练。

要解决什么问题 现有的强化学习范式在扩展到复杂智能体时面临三个核心卡点。首先是架构层面的灵活性受限,标准框架强制智能体与底层的Token逻辑耦合,难以支持动态上下文管理或多智能体协作等复杂认知架构,导致模型无法在任意黑盒智能体上泛化。其次是系统调度陷入死锁,智能体与环境交互的耗时方差极大,从秒级到数小时不等;如果采用严格的同步调度会因掉队者效应导致集群大量空闲,而采用贪婪的异步调度又会引发严重的数据分布偏移,造成非平稳训练环境和梯度震荡。最后是计算冗余与算法失效,在长达200k的上下文窗口中,复杂的上下文管理导致大量请求共享相同前缀,传统方法反复重算造成算力浪费;同时,超长视界下的延迟反馈带来了极高的梯度方差,且传统强化学习目标仅关注正确性而忽略了智能体执行工具和子调用的时间成本,无法激励模型提升执行效率。

怎么做的 Forge的核心思路是通过中间件设计将智能体的推理逻辑与底层训练设施彻底解耦,并辅以调度和算法层面的定制优化。整个系统分为三层:智能体端作为纯粹的轨迹生产者运行,无需感知底层机制;中间件层包含网关服务器和数据池,通过标准协议隔离模型复杂性并异步收集数据;训练与推理端则专职承载高吞吐的Token生成与策略更新。为了绕开调度死锁,Forge引入了Windowed FIFO混合调度策略,在生成队列上施加滑动窗口约束:在窗口内部允许调度器贪婪地无序提取已完成的轨迹以避免队头阻塞,但在窗口边界严格阻塞,强制等待复杂任务完成,从而在系统吞吐量与数据分布一致性之间取得平衡。针对前缀计算冗余,系统采用了前缀树合并技术,利用Magi Attention等注意力原语,将共享相同历史前缀的多个补全样本合并为单棵前缀树,前向传播后再解构计算损失,实现了数学等价的零冗余计算。在算法层面,Forge采用CISPO算法进行混合域联合训练,并设计了包含过程奖励和任务完成时间奖励的复合奖励框架,其核心更新目标为:$$ \mathcal{J}_{\text {CISPO }}(\theta)=\mathbb{E}_{(q, a) \sim \mathcal{D},\left\{o_i\right\}_{i=1}^G \sim \pi_{\theta_{\text {old }}}(\cdot \mid q)}\left[\frac{1}{\sum_{i=1}^G\left|o_i\right|} \sum_{i=1}^G \sum_{t=1}^{\left|o_i\right|} \operatorname{sg}\left(\hat{r}_{i, t}(\theta)\right) \hat{A}_{i, t} \log \pi_\theta\left(o_{i, t} \mid q, o_{i,<t}\right)\right] $$其中优势函数 $\widehat{A}_{i,t}$ 结合了性能奖励与速度奖励,并通过Reward-to-go公式归一化以降低方差:$$ \widehat{A}_{i,t} = \sum_{p=t}^{T} (r_p^{\text{speed}} + r_p^{\text{perf}}) - B_i $$此外,系统还通过基于多Token预测的投机解码、预填充与解码分离以及全局L3 KV缓存池等架构创新,进一步实现了极致的推理加速。

效果如何 实验基于MiniMax M2.5模型展开,系统支持长达200k的上下文长度,并接入了超过10万种不同的真实世界智能体脚手架,包括以代码为中心的OpenCode Agent以及采用截断策略的Truncate BC等黑盒与白盒智能体,整体保持了每日百万级样本的处理吞吐量。在对比基线上,论文主要针对代表严格同步路线的FIFO调度、代表贪婪异步路线的FFFO调度,以及将每个样本视为独立实体进行计算的传统前缀处理方法进行了对比。量化结果表明,在引入前缀树合并技术后,系统彻底消除了前缀冗余,实现了40倍的训练速度提升,并显著降低了内存开销以支持更长的序列或更大的批量大小。在训练稳定性方面,CISPO算法结合复合奖励框架有效降低了梯度方差,在黑盒智能体强化学习训练过程中展现出奖励的持续稳定收敛。通过解耦架构和混合域训练,模型在数百种脚手架和数千种工具格式上均展示了广泛的兼容性和性能提升,证明了该方法在完全不透明的黑盒系统上也能提供一致且鲁棒的优化效果。

1. 主要贡献

本文介绍了MiniMax为解决大规模强化学习(RL)在复杂真实世界Agent应用中面临的“不可能三角”(系统吞吐量、训练稳定性和Agent灵活性)而开发的内部RL框架——Forge。主要贡献如下:
1. 整体架构创新:提出了Forge框架,通过灵活的系统架构、标准化的交互协议(Middleware设计),解耦了Agent推理逻辑与底层训练设施,支持任意Agent脚手架(Scaffold)的训练。
2. 大规模工程实践:该系统支持了MiniMax M2.5模型的构建,处理了超过10万种不同的真实世界Agent脚手架和环境,支持长达200k的上下文长度,保持了每日百万级样本的处理吞吐量。
3. 算法与调度优化:引入了Windowed FIFO混合调度策略解决效率与分布一致性的冲突;提出了前缀树合并(Prefix Tree Merging)技术消除计算冗余;采用CISPO算法结合混合域训练和复合奖励框架(包含时间成本奖励),实现了高效且稳定的训练。

2. 问题定义与背景

在详细介绍架构之前,论文首先将Agent RL系统的优化目标形式化为最大化有效Agent训练产出($J$):

$$ \max J(\theta) = \text{Throughput}(A) \times \text{Sample Efficiency}(A) $$ $$ \text{s.t. } \forall A \in \Omega_{agent} (\text{Arbitrary Agent}) $$

$$ E[\text{Update Variance}] < \delta (\text{Stability}) $$
$$ E[||J(T) - J^*||] < \epsilon (\text{Convergence}) $$

其中系统吞吐量受限于Rollout、训练、数据处理和I/O四个组件;样本效率取决于数据分布、质量、算法效率和Off-policy程度。

1.1 Agent扩展性与框架灵活性挑战
当前RL范式存在“玻璃天花板”:
* 受限的Agent自主性:标准框架将Agent视为白盒函数并共享状态,难以模拟复杂的认知架构(如动态上下文管理、多智能体协作),阻碍了模型在任意黑盒Agent上的泛化。
* Token一致性障碍:现有的TITO(Token-In-Token-Out)架构强制Agent与底层Token逻辑耦合。在复杂的上下文管理(Context Management, CM)下,维持高层推理抽象与底层训练表示的一致性计算成本极高。

1.2 系统效率与计算冗余
Agent的Rollout完成时间方差极大(从秒级到数小时),导致调度死锁:
* 异步控制器困境:严格的FIFO/同步调度受“掉队者效应”(Straggler Effect)影响导致集群空闲;而贪婪/FFFO模式虽然最大化了吞吐量,但会导致严重的数据分布偏移(Data Distribution Shift),造成非平稳训练环境和梯度震荡。
* 前缀冗余:Tokenizer机制与上下文管理的相互作用导致大量请求共享相同的前缀,在训练期间造成显著的计算浪费。

1.3 算法挑战:信用分配与优化稳定性
* 稀疏奖励与高梯度方差:Agent任务涉及超长视界和延迟反馈,在200k上下文窗口内将信用分配给特定Token极其困难,导致低信噪比和高梯度方差。
* 忽略延迟的优化:传统RL目标仅关注正确性而忽略执行的时间成本。在现实场景中,不同轨迹的延迟差异巨大,标准范式未能激励并行化或高效工具的使用。

3. 方法细节

2. 系统架构与Agent RL范式

为了缓解“效率 vs. Off-Policyness”的权衡并减少冗余,系统采用了以下架构创新。

2.1 RL系统设计

为了实现真正的可扩展架构,系统超越了具体实现,采用了通用的“中间件”设计,将Agent的推理逻辑与底层训练基础设施解耦。RL系统由以下3个模块组成:

Forge系统架构图:展示了Agent端(黑盒/白盒)、中间件层(网关服务器、数据池)以及引擎端(Rollout引擎、训练引擎)的交互流程
Forge系统架构图:展示了Agent端(黑盒/白盒)、中间件层(网关服务器、数据池)以及引擎端(Rollout引擎、训练引擎)的交互流程

通过这种模块化设计,Forge实现了引擎与Agent的完全解耦,集成了数百种类型的脚手架和数千种不同的工具调用格式。

2.2 针对上下文管理(CM)的白盒Agent RL

对于白盒Agent,通过全面的脚手架设计和增强,直接观察并优化模型在特定架构上的性能。针对长视界任务中上下文管理(如DeepSearch)面临的问题,采取了以下措施:

2.3 黑盒Agent RL:异构脚手架的鲁棒性

针对用户操作的专有或复杂“黑盒”Agent架构,Forge确保了跨不同认知架构的一致优化。

黑盒Agent RL训练过程中的奖励曲线,显示随着训练时间增加奖励呈上升趋势
黑盒Agent RL训练过程中的奖励曲线,显示随着训练时间增加奖励呈上升趋势

3. 工程优化

3.1 混合调度策略:Windowed FIFO

为了解决系统吞吐量与分布一致性之间的冲突,引入了Windowed FIFO策略。该策略在训练调度器上施加滑动约束,作为严格同步排序与贪婪异步执行之间的“中间地带”。

Windowed FIFO示意图:展示了生成批次大小为8,窗口大小为4时的初始状态
Windowed FIFO示意图:展示了生成批次大小为8,窗口大小为4时的初始状态
Windowed FIFO执行状态图:展示了剩余窗口容量为1时,最大乱序容忍度和Off-Policy滞后的情况
Windowed FIFO执行状态图:展示了剩余窗口容量为1时,最大乱序容忍度和Off-Policy滞后的情况

3.2 基于前缀树合并(Prefix Tree Merging)的Agent轨迹训练加速

在Agent训练中,数据集通常由大量的多轮对话样本组成,这些样本在结构上表现出高度的重叠。

标准补全示意图:展示了三个序列分别重复计算长公共上下文的情况
标准补全示意图:展示了三个序列分别重复计算长公共上下文的情况
前缀树合并示意图:展示了多个序列共享同一个长公共上下文前缀树的结构
前缀树合并示意图:展示了多个序列共享同一个长公共上下文前缀树的结构

3.3 极致的推理加速

通过三项架构创新优化生成管道:

4. 可扩展Agent RL算法

4.1 RL算法

核心算法采用CISPO,并专门针对长视界Agent的特性进行了调整。
* 统一混合域训练:不同于导致负迁移或域间干扰的多阶段强化学习,采用统一训练策略。同时混合推理(Reasoning)、通用问答(General QA)和Agent领域的任务。这种联合训练方法减轻了顺序训练中常见的性能下降,并显著增强了模型在不同任务间的泛化能力。

$$\mathcal{J}_{\text {CISPO }}(\theta)=\mathbb{E}_{(q, a) \sim \mathcal{D},\left\{o_i\right\}_{i=1}^G \sim \pi_{\theta_{\text {old }}}(\cdot \mid q)}\left[\frac{1}{\sum_{i=1}^G\left|o_i\right|} \sum_{i=1}^G \sum_{t=1}^{\left|o_i\right|} \operatorname{sg}\left(\hat{r}_{i, t}(\theta)\right) \hat{A}_{i, t} \log \pi_\theta\left(o_{i, t} \mid q, o_{i,<t}\right)\right]$$ <h3 id="42-dense-and-efficiency-aware-reward">4.2 密集与效率感知奖励(Dense and Efficiency-Aware Reward)

提出了一个复合奖励框架,旨在解决超长上下文(高达200k)的信用分配挑战,同时确保训练稳定性:
* 过程奖励(Process Reward):为了提供密集反馈,针对中间行为(例如惩罚语言混合或特定工具调用错误),而不是仅依赖最终结果。
* 任务完成时间奖励(Task Completion Time Reward):在Agent场景中,将相对完成时间纳入奖励信号。这不仅取决于Token生成,还取决于特定工具执行和子Agent调用的延迟。这激励Agent利用并行性,从而加速任务执行。
* Reward-to-go用于方差减少:采用Reward-to-go公式对回报进行归一化,有效降低梯度方差并提高信用分配的精度,稳定优化过程。

$$\hat{r}_{i,t}(\theta) = \text{clip} \left( r_{i,t}(\theta), 0, 1 + \epsilon_{high}^{IS} \right)$$

$$\widehat{A}_{i,t} = \sum_{p=t}^{T} (r_p^{\text{speed}} + r_p^{\text{perf}}) - B_i$$

4. 实验环境与结果

实验配置与环境
* 模型:MiniMax M2.5。
* 数据规模与上下文:支持高达200k的上下文长度,处理了超过10万种不同的真实世界Agent脚手架。
* 硬件与吞吐量:系统保持了每日百万级样本的处理吞吐量。
* 验证对象:包括OpenCode Agent(代码中心)、Truncate BC策略等多种黑盒与白盒Agent。

实验结果
* 训练稳定性与收敛性:通过CISPO算法与复合奖励框架,系统实现了奖励的持续收敛(见图2)。Reward-to-go机制有效降低了梯度方差。
* 训练效率提升:Prefix Tree Merging技术消除了前缀冗余,实现了40倍的训练速度提升,并显著减少了内存开销。
* 泛化能力:通过解耦架构和混合域训练,M2.5在数百种脚手架和数千种工具格式上展示了广泛的兼容性和性能提升,证明了在黑盒Agent上的鲁棒性。

5. 结论

MiniMax通过Forge框架成功解决了扩展Agent RL面临的“不可能三角”。通过整合灵活的解耦架构、Windowed FIFO调度、Prefix Tree Merging以及稳定的CISPO算法,Forge实现了RL系统吞吐量的突破,同时确保了跨任意Agent脚手架的鲁棒泛化。这一整体方法支持了MiniMax M2.5的大规模训练,交付了高效的真实世界Agent能力,推进了“Intelligence with Everyone”的使命。