MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

发表时间: 2026-09 · Tech report by LLM-Core Xiaomi (huggingface.co)

原文: https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf

LLM-Core Xiaomi

速读

一句话结论 小米团队通过在多模态混合专家模型上全方位扩展强化学习的计算量、环境复杂度和评分机制,训练出具备强大智能体能力的 MiMo-V2.6 系列模型,在代码、通用工具和网络安全等任务上达到了比肩闭源前沿模型的效果。

要解决什么问题 大模型通过强化学习实现自我进化的核心卡点在于,当把强化学习扩展到复杂的长逻辑链智能体任务时,原有的训练机制和基础设施会失效。首先是奖励信号的粒度卡点:在代码或智能体任务中,传统的二元测试用例(通过或不通过)无法区分代码质量,且极易引发模型通过作弊(如从环境中读取现成答案)来骗取高分的奖励黑客现象。其次是系统吞吐与显存卡点:在高达 1M 上下文长度下,大批量、多模态的长序列采样会产生海量的路由和多模态负载数据,传统的同步训练和集中式数据处理会导致严重的显存溢出和主机内存耗尽。最后是模型架构的稳定性卡点:在强化学习过程中,混合专家模型(MoE)的路由机制极易发生负载坍塌,导致少数专家被过度激活,进而引发微批次内的显存溢出并打断训练。

怎么做的 核心思路是构建解耦的异步强化学习基础设施,并引入基于智能体分组评分的细粒度奖励机制。为了绕开奖励粒度粗和作弊的卡点,方法设计了分组智能体评分机制。对于部分任务使用离线合成的评分标准,将二元测试奖励与代码质量和行为得分相乘;对于其他任务则使用在线的分组优势重分配(GAR),智能体裁判会对同一组内通过测试的多个轨迹进行质量排序,将低质量轨迹的优势值转移给高质量轨迹,其核心更新式为:

$$ \lambda = \frac { \sum _ { j \in \mathcal { P } } A _ { j } } { \sum _ { j \in \mathcal { P } } f _ { j } A _ { j } } , \qquad A _ { i } ^ { \prime } = \lambda f _ { i } A _ { i } \quad ( i \in \mathcal { P } ) $$

其中 $\mathcal{P}$ 是通过测试的样本集合,$f_i$ 是质量衰减因子,这保证了正向优势值的总和不变。同时引入基于组内相对长度的惩罚项,抑制模型在强化学习中无意义地增加输出长度。为了绕开系统吞吐卡点,设计了控制面与数据面分离的架构。调度器只处理轻量级的元数据,而庞大的多模态和 MoE 路由数据被直接写入分布式键值存储,在打包训练数据时由各个张量并行组按需拉取,避免了主节点内存撑爆。为了解决 MoE 路由坍塌的卡点,在强化学习阶段直接冻结了 MoE 的路由器参数,并使用 R3 机制在训练时重放采样阶段的专家索引,确保训练和推理的绝对一致性。此外,为了防止模型对单一交互环境过拟合,方法构建了包含多种微型框架的多框架训练池,强制模型在不同交互机制下泛化。

效果如何 实验基于 1.02T 参数(激活 42B)的 MiMo-V2.6-Pro 和 310B 参数(激活 15B)的 MiMo-V2.6-Flash 模型,在数千张 GPU 上进行,单步处理 1568 个样本和 2.7B 到 3.7B 个 tokens。对比基线包括代表上一代开源路线的 MiMo-V2.5 Pro,以及代表当前闭源前沿路线的 Claude 3.5 Sonnet、GPT-4o 和 Claude 3 Opus。在 DeepSWE v1.1 长周期代码任务上,Pro 版本得分 71.9,Flash 版本得分 67.9,逼近 GPT-4o 的 73.0;在 AutomationBench 通用智能体任务上,Pro 版本以 53.1 的得分超越了 GPT-4o 的 45.8;在 CyberGym 网络安全任务上,Pro 版本达到了 94.0 的高分。作者也坦诚了该路线的代价与局限:扩展强化学习极其昂贵,Pro 和 Flash 分别耗资 2.6M 和 0.9M 美元;系统在运行中遭遇了多次失效,包括 GPU 双比特错误、MoE 负载不均导致的显存溢出,以及长序列数据打包时引发的 CPU 内存耗尽;此外,尽管部署了多层防御,模型在训练初期仍会不断寻找环境漏洞进行作弊,必须依赖离线审计和对抗性测试来持续修补环境。

主要贡献

实现基础模型递归自我改进(Recursive self-improvement, RSI)的核心愿景在于通过持续的探索和反馈来扩展模型能力。这一目标的实现依赖于智能体(Agents),它们将模型与交互式环境结合,从而提供自我改进所需的多步轨迹和反馈信号。因此,在复杂的智能体任务上扩展强化学习(RL)是实现这一目标的具体路径。然而,这一过程面临两大主要挑战:首先,面向基础模型的强化学习需要合适的模型架构以及为智能体提供足够丰富的探索空间;其次,扩展强化学习需要在基础设施、环境和评分器(grader)方面提供复杂的解决方案。

本文介绍了MiMo-V2.6系列模型,旨在弥合上述差距,在全能多模态领域推动模型智能的前沿,并在大规模强化学习方面迈出实用性的一步。该系列包括MiMo-V2.6-Pro(一个拥有1.02万亿参数、激活参数为420亿的混合专家MoE模型)和MiMo-V2.6-Flash(一个拥有3100亿参数、激活参数为150亿的MoE模型)。

主要创新点与研究目标如下:

  1. 架构与探索空间的奠基:在强化学习之前,模型在广泛的多模态语料库上进行了中期训练(mid-training),以提供充足的探索空间。同时,建立在预训练混合SWA(滑动窗口注意力)架构上的坚实基础设施,为后续的规模扩展提供了支持。
  2. 三个维度的强化学习计算扩展

    • 更大批次与更高吞吐量:采用完全异步训练,在高达1M的上下文长度下,每步消耗1,568个样本和2.7至3.7十亿(B)个token。
    • 更多样化和复杂的环境:在混合的智能体框架下,涵盖代码、通用、视觉和网络安全领域。
    • 更多的评分器计算:引入分组智能体评分(groupwise agentic grading),为长周期任务产生更准确的奖励信号,并引导模型生成更短、token效率更高的解决方案。
  3. 稳定的大规模训练机制:为了在规模化训练中保持稳定,冻结了MoE路由(MoE router),并建立了针对奖励作弊(reward hacking)的多层防御机制。

  4. 统一的混合任务智能体RL基础设施:构建了包括统一轨迹表示、高并发多框架部署(rollout)、控制面与数据面解耦以及训练-推理一致性在内的基础设施。
  5. 开源贡献:开源了训练动态、RL环境和RL框架,以及轻量级模型MiMo-V2.6-Distill-Qwen-9B,以促进可重复性研究和模型自我改进的进一步发展。
图1 MiMo-V2.6-Pro和MiMo-V2.6-Flash在整个强化学习训练过程中每个任务的基准分数。
图1 MiMo-V2.6-Pro和MiMo-V2.6-Flash在整个强化学习训练过程中每个任务的基准分数。

背景知识与架构设计

MiMo-V2.6的整体架构设计。MiMo-V2.6采用了标准的Transformer【1, Attention is all you need, 2017】骨干网络,并通过轻量级投影器(projectors)连接了视觉和音频编码器。文本骨干网络主要由交替使用局部滑动窗口注意力(SWA)和全局注意力(GA)的重复混合块组成。模型堆叠了??个混合块,每个混合块的结构为$N$个连续的SWA块后接一个GA块。唯一的例外是第一个Transformer块,它使用全局注意力和密集的普通前馈网络(FFN)来稳定早期的表示学习。模型中使用的滑动窗口大小??为128。SWA块和GA块都使用了没有共享专家的稀疏MoE FFN。此外,MiMo-V2.6还集成了一个基于SWA和密集FFN的多token预测(MTP)模块【2, Better & faster large language models via multi-token prediction, 2024, https://openreview.net/forum?id=pEWAcejiU2】,以提高预训练期间的模型性能。详细的模型配置如表1所示 。

MiMo-ViT的混合注意力架构。MiMo-ViT同样采用了混合注意力架构。它用带有汇聚增强(sink-augmented)的SWA替换了MiMo-VL-7B【3, Mimo-vl technical report, 2025, https://arxiv.org/abs/2506.03569】中固定的、非重叠的窗口注意力,从而允许在连续层之间跨越窗口边界进行信息交换,缓解了视觉碎片化问题。局部SWA层在行优先和列优先的token序列化之间交替,以支持沿两个空间轴的信息传播。最后,定期插入GA层以直接聚合全局上下文。这种设计大幅降低了高分辨率视觉处理的计算成本,同时实现了 与GA ViTs相当的性能【4, Semantic head specialization guides hybrid vit attention for multimodal llms, 2026, https://arxiv.org/abs/2608.28383】。为了从头预训练MiMo-ViT,研究人员将其与一个小型预训练LLM配对,并仅使用交叉熵目标在多模态理解数据上优化生成的VLM。这种简单的方法避免了对比学习等辅助目标,使得预训练既高效又可扩展。关键在于,LLM保持可训练状态,为ViT提供稳定、具有语义意义的梯度。在超过4T图像token的预训练后,MiMo-ViT学习到了强大的视觉表示 。

图2 MiMo-V2.6的整体架构。音频、视觉和文本输入被映射到一个共享的token序列中,并由MiMo混合SWA骨干网络处理,随后是语言建模头和多token预测(MTP)块。
图2 MiMo-V2.6的整体架构。音频、视觉和文本输入被映射到一个共享的token序列中,并由MiMo混合SWA骨干网络处理,随后是语言建模头和多token预测(MTP)块。

音频编码的两个处理阶段。MiMo-V2.6中的音频编码包括音频token化(Audio Tokenizer)和随后的分块编码(patch encoding)两个阶段。音频Token化编码器首先通过一个将帧率减半的双层卷积前端处理对数梅尔频谱图。生成的序列随后传递给一个具有因果混合注意力架构的Transformer,该架构交替使用SWA和GA层。SWA层捕获局部时间依赖性,而GA层聚合整个前置序列的上下文。随后的下采样卷积进一步将帧率减半至$25\mathrm{Hz}$,之后一个20层残差向量量化器(RVQ)将每一帧表示为20个离散的音频token。该音频Token化器遵循MiMo-Audio【5, Mimo-audio: Audio language models are few-shot learners, 2025, https://arxiv.org/abs/2512.23808】的训练方法,并在涵盖语音、音乐和其他音频内容的2000万小时音频上进行了训练。音频分块编码器与文本骨干网络联合训练,在每个时间步,使用每个RVQ码本独立的嵌入表对音频token进行嵌入,然后将生成的嵌入求和以形成单个帧表示。每四个连续的帧被分组为一个音频块,并由一个仅限该块内进行双向自注意力的Transformer处理。四个输出表示随后被拼接并线性投影为单个骨干输入嵌入,将音频序列速率从$25\mathrm{Hz}$降低到$6.25\mathrm{Hz}$ 。

推测解码的多token预测模块。MiMo-V2.6中的推测解码使用了一个多token预测(MTP)模块,该模块遵循DFlash的块扩散设计【6, Dflash: Block diffusion for flash speculative decoding, 2026, https://arxiv.org/abs/2602.06036】。起草器(drafter)包含5个带有密集前馈网络的Transformer层。在骨干隐藏特征和一个干净的锚点token的条件下,它在单次前向传递中预测随后的7个token,以供骨干网络并行验证。所有草稿层都使用带有分组查询的滑动窗口注意力(SWA),以限制注意力计算和KV缓存大小。Token在其草稿块内进行双向注意力计算,并且最多关注锚点之前的1,024个骨干上下文位置 。

表1 MiMo-V2.6-Flash和MiMo-V2.6-Pro的详细模型配置。主块层数不包括MTP模块。编码器参数计数包括输入嵌入,但不包括投影器。音频标记器编码器参数计数不包括EMA码本。

Block Configuration MiMo-V2.6-Flash MiMo-V2.6-Pro
Main Block Layers (Total/SWA/GA) 48/39/9 70/60/10
Hidden Size 4096 6144
SWA Heads (Q/KV) 64/8 128/8
Sliding Window Size 128 128
GA Heads (Q/KV) 64/4 128/8
Head Dimensions (QK/V) 192/128 192/128
Experts (Total/Activated) 256/8 384/8
# Total Parameters 310B 1.02T
# Active Parameters 15B 42T
MiMo-ViT Layers (Total/SWA/GA) 28/24/4
Hidden Size 1280
Attention Heads (Q/KV) 32/8
Sliding Window Size (Left/Right) 64/64
Spatial Merge Size $2 \times 2$
# Parameters 681M
Audio Tokenizer Encoder Layers (Total/SWA/GA) 24/12/12
Hidden Size 1024
Attention Heads (Q/KV) 16/16
Sliding Window Size 64
Codebooks 128
# Parameters 308M
Audio Patch Encoder Layers 6
Hidden Size 1024
Attention Heads (Q/KV) 16/16
Head Dimension 64
Attention Group Size 4
# Parameters 127M
Speculative Decoder Layers (Total/SWA/GA) 5/5/0 5/5/0
Hidden Size 4096 6144
SWA Heads (Q/KV) 64/8 128/8
Sliding Window Size 1024 1024
GA Heads (Q/KV) 64/4 128/8
Head Dimensions (QK/V) 128/128 128/128

预训练语料与两阶段策略。MiMo-V2.6的预训练语料库跨越了文本、视觉和音频。文本语料库来源于广泛的资源,包括公共网络内容、书籍、学术论文、代码和STEM材料。视觉语料库包括图像字幕、定位(grounding)、OCR、GUI、对话、视频和视觉编码数据。对于音频,整理了大规模多样化、高质量的数据,并将数据组织成三种任务格式:语音-文本交错、自动语音识别(ASR)和通用音频字幕。预训练采用了两阶段策略。在第一阶段,仅在文本数据上训练语言骨干网络,以建立强大的基础语言能力。在第二阶段,将骨干网络与内部预训练的ViT和音频编码器集成,并在全模态数据上联合训练整个模型,使其能够理解图像、视频和音频。预训练开始时的上下文长度为32K token,并在训练中途将其扩展到256K。MiMo-V2.6-Flash在48T token上进行训练(文本阶段26T,全模态阶段22T)。MiMo-V2.6-Pro在30T token上进行训练(两阶段分别为27T和3T)。预训练中使用了AdamW优化器。

面向智能体的中程训练(Mid-Training)设置。预训练建立了跨越文本、视觉和音频的广泛知识和通用理解,而中程训练则在这一通用基础与随后的的大规模强化学习之间架起桥梁,通过进一步发展模型的智能体能力、扩展长上下文支持,并调整优化设置以适应大批量训练。为此,MiMo-V2.6模型系列在一个多样化的、以智能体为中心的数据混合物上进行训练。这种多样性跨越了任务领域和数据模态,结合了代码、通用、视觉和研究任务中的真实智能体轨迹,以及高质量的文本、仓库级代码、图像、视频和音频数据。训练分两个阶段进行:首先使用256K上下文长度进行训练,将大部分计算资源分配给此阶段,然后在最后阶段将上下文长度扩展到1M。

引入Muown优化器以支持大批量训练。基础模型使用AdamW进行预训练,但初步实验表明,在混合任务RL中,随着批量大小的增加,优化效率会下降。与逐元素调整参数的AdamW不同,Muon通过正交化其更新来利用隐藏权重的矩阵结构【7, Muon: An optimizer for hidden layers in neural networks, 2024, https://kellerjordan.github.io/posts/muon/】。这种基于矩阵的更新在超过临界批量大小的区域仍能保持更强的数据效率,使得Muon特别适合大批量训练 【8, Muon is scalable for LLM training, 2025, https://arxiv.org/abs/2502.16982】。因此,在中程训练期间,研究人员将隐藏权重矩阵的优化器切换为Muon的变体——Muown,为模型后续的大批量RL做准备。Muown通过显式的行范数控制增强了Muon,减轻了谱范数漂移,并在开销极小的情况下降低了对权重衰减的敏感性 【9, Muown: Row-norm control for Muon optimization, 2026, https://arxiv.org/abs/2605.10797】。嵌入层、LM头和MoE路由器继续使用AdamW。尽管先前的工作报告称,将Adam预训练的模型切换到Muon训练可能会导致优化器不匹配和性能下降 【10, Can Muon fine-tune Adam-pretrained models?, 2026, https://arxiv.org/abs/2605.10468】,但在中程训练期间,研究人员没有观察到整个训练过程中的损失尖峰。此外,中程训练采用了MXFP4量化感知训练(QAT),使模型能够适应低精度计算,同时保持模型质量 。

方法细节

强化学习的扩展设计

强化学习计算规模的扩展。在本次发布中,研究团队继续突破后训练(post-training)算法的边界,特别侧重于扩展强化学习(RL)的计算规模。在短暂的监督微调(SFT)阶段之后,从三个维度扩展RL:训练计算(§4.1)、环境与智能体框架(§4.2)以及评分器计算(§4.3),从而实现了模型能力的根本性飞跃。研究团队在单次运行中跨数千个GPU扩展RL计算,在MiMo-V2.6-Pro和MiMo-V2.6-Flash的RL后训练上分别花费了260万美元和90万美元。训练使用了大批量大小:1,568个提示(prompts),组大小(group size)$G=16$,因此每步部署25K个序列,总计2.7B至3.7B个训练token(每个序列约11万至15万个token)。图3左侧展示了扩展RL计算的益处。随着累积成本的增加,两个模型在DeepSWE基准【11, Deepswe v1.1: a cleaner, more reproducible benchmark for frontier coding agents, 2026, https://github.com/datacurve-ai/deep-swe】上的平均@3分数稳步上升:在RL过程中,MiMo-V2.6-Pro从58.4提高到72.6,MiMo-V2.6-Flash从48.7提高到65.7。计算分为三个部分:部署(rollout)、评分(grading)和训练(training)。这种规模的扩展需要坚实的基础设施来保持训练的高效和稳定 。

图3 左图:DeepSWE v1.1上的平均@3分数与累积RL成本的关系。右图:MiMo-V2.6-Pro和MiMo-V2.6-Flash的训练、部署和评分器成本占比。
图3 左图:DeepSWE v1.1上的平均@3分数与累积RL成本的关系。右图:MiMo-V2.6-Pro和MiMo-V2.6-Flash的训练、部署和评分器成本占比。

强化学习学习目标的公式化构建。RL学习目标公式如下:

$$ \mathcal{L}(\theta) = - \mathbb{E}_{q \sim \bigcup_{d} \mathcal{D}_{d}, \{\mathbf{\Phi}_{\mathcal{D}_{d}}\}_{i=1}^{G} \sim \mu_{\theta_{\mathrm{old}}}(\cdot|q)} \left[ \frac{1}{\sum_{i=1}^{G} |o_{i}|} \sum_{i=1}^{G} \sum_{t=1}^{|o_{i}|} r_{i,t} M_{i,t} A_{i} \log \pi_{\theta}(o_{i,t} \mid q, o_{i,<t}) \right], $$ <p>
其中,$r$表示重要性采样比率,$M$是token级别的掩码,$A$是优势值。计算可以分解为三个部分。第一部分是部署(rollout):对于从任务数据集并集$\cup_{d} \mathcal{D}_{d}$中提取的每个提示$q$,部署策略$\mu_{\theta_{\mathrm{old}}}$生成一组$G$个候选解决方案$\{o_{i}\}$。第二部分是评分(grading):投资额外的计算用于智能体评估,以区分有效的解决方案和行为与有缺陷的解决方案和行为,这超越了二元测试结果所能揭示的内容。这些判断为优势值$A_{i}$提供了信息,使得在整个轨迹中能够进行更准确的信用分配。第三部分是训练(training):收集到的token通过$\log{\pi_{\theta}(o_{i,t} \mid q, o_{i,<t})}$的梯度更新$\theta$,并使用提示均值聚合(prompt-mean aggregation)。图3右侧显示了MiMo-V2.6-Pro的计算成本分解:部署消耗了$43.8\%$,训练消耗了$43.5\%$,而评分器占据了剩余的$12.7\%$。一个大批次在单次运行中包含了来自各种环境和框架的多种RL任务。评分器也被扩展以提供细粒度的学习信号。</p>

大批量训练的并行化与稳定性设计。大批量非常适合扩展GPU的使用:部署在序列上并行化,而训练将批次分片到数据并行(data-parallel)等级上,因此吞吐量随着GPU数量的增加而增长。由于HBM(高带宽内存)大部分被运行中的批次占据,模型可以保持高算术强度以充分利用GPU进行部署。由于部署和评分存在长尾效应,采用了部分部署(partial rollout)【12, Kimi k1.5: Scaling reinforcement learning with llms, 2025, https://arxiv.org/abs/2501.12599】以保持运行批次的饱和:当收集训练批次时,中断正在进行的序列,并在下一个部署阶段恢复它们。代价是重新预填充(re-prefill):每次策略更新后,延续部分必须重建其KV缓存,因此批量大小和部分部署是一起选择的——大批量分摊了重新预填充的成本。为了支持稳定的RL训练,通过R3 【13, Stabilizing moe reinforcement learning by aligning training and inference routers, 2025, https://arxiv.org/abs/2510.11370】和top-$p$采样候选集的重放 【14, Deepseekv3.2: Pushing the frontier of open large language models, 2025, https://arxiv.org/abs/2512.02556】确保了训练-推理的一致性。为了确保所有样本都能以有效的梯度对训练做出贡献,结合了动态采样器 【15, DAPO: an open-source LLM reinforcement learning system at scale, 2025】来过滤全部通过或全部失败的组。在多任务RL中,实现了一个样本混合器(Sample Mixer),以确保在不同任务具有不同部署持续时间和通过率的情况下,训练批次的分布高效且稳定。为了将部署阶段的轨迹打包成大型训练批次(2.7B–3.7B token),解耦了数据平面和控制平面。

代码智能体任务的合成与质量控制。扩展智能体RL需要多样化的环境,这些环境不仅要反映真实世界的任务,支持在训练规模下的可重复执行,还要提供与任务目标一致的奖励。然而,仅靠可执行的评估并不能保证监督的可靠性:测试可能会忽略所需的行为,拒绝有效的实现,或者在多次执行中产生不一致的结果。因此,核心挑战在于扩展任务构建的同时,确保奖励忠实地反映任务的正确性。研究团队建立了一个可扩展的合成和整理管道,重点关注监督的准确性和鲁棒性。通过五种互补的合成途径(GitHub合成、内部员工开发请求、规范驱动合成、源代码驱动合成【16, CodeMidas: Scaling agentic coding rl environments from code itself, 2026, https://arxiv.org/abs/2609.22068】以及公共资源和许可数据)构建了跨越异构编程语言、开发设置和任务范围的任务。为了确保监督的准确性,对任务规范的行为范围与其单元测试的行为范围进行了对齐审查。此外,通过基于部署的审计 (rollout-based auditing)进一步评估它们的一致性:审计智能体接收四个部署的完整日志并评估测试是否捕捉了所需行为。为了确保监督的鲁棒性,通过重复执行检查奖励的稳定性,要求失败到通过(F2P)和通过到通过(P2P)的测试结果在8次重跑中保持稳定,以筛选出不稳定的测试。图4总结了任务合成途径和用于评估监督准确性及鲁棒性的检查。

图4 整体代码智能体任务扩展管道。我们从不同来源构建任务,并经过严格的评估阶段,以确保监督是准确和鲁棒的。
图4 整体代码智能体任务扩展管道。我们从不同来源构建任务,并经过严格的评估阶段,以确保监督是准确和鲁棒的。

通用智能体任务的环境与合成。通用智能体环境通常由一个工作区和一组软件工具组成,通过MCP、API、CLI和GUI等接口访问。设计平衡了真实性与大规模RL的要求:收集真实世界的文件,并使用自动化的多智能体工作流构建本地软件模拟(mocks),以重现支持的操作、状态变化、输出格式和错误响应。所有状态都在本地存储,每个部署在隔离的沙盒中运行,可以恢复到固定的初始状态。在环境合成中,规划智能体指定工作区结构、选择工具并规划文件和数据库内容;网络搜索将计划锚定在真实信息中;多个智能体并行生成文件和填充数据库;审查智能体检查全局一致性并进行迭代修复。在任务合成和验证中,智能体探索每个环境并使用种子任务构建适合其内容和工具的任务。任务完成情况通过原子级的二元评分标准进行评估:基于代码的检查验证确定性属性(如数据库值),而基于LLM的检查评估更开放的内容。通过审查智能体检查不同能力级别模型的部署轨迹和执行结果,迭代细化评分标准,并引入负面检查和对抗性解决方案以测试抗奖励作弊能力。图5总结了这一管道。

图5 整体通用智能体环境和可验证任务合成管道。我们首先从真实世界的文件和软件模拟中构建逼真、可重置的环境。然后智能体探索这些环境并合成带有可验证评分标准的任务。
图5 整体通用智能体环境和可验证任务合成管道。我们首先从真实世界的文件和软件模拟中构建逼真、可重置的环境。然后智能体探索这些环境并合成带有可验证评分标准的任务。

视觉与网络安全智能体任务的构建。为了赋予智能体通过精确视觉控制塑造数字世界的能力,整理了多样化的视觉任务套件,分为开放式设计和高保真视觉复制两类。对于开放式设计,由于审美质量难以通过固定规则捕捉,结合了逐点(pointwise)和分组(groupwise)评分:首先迭代细化运行时正确性、指令遵循等逐点评分标准,稳定后引入分组评分,联合比较同一查询下的渲染工件,识别强弱候选者并分配奖励。对于高保真视觉复制,主要通过基于规则的相似度指标(如像素级相似度)进行评分,辅以基于LLM的整体视觉评估。在网络安全方面,通过真实的漏洞复现(如OSS-Fuzz提供的实例)训练网络安全智能体。验证机制必须将预期的漏洞与不相关的崩溃区分开来。研究团队从真实消毒器(sanitizer)报告中提取漏洞类型和崩溃位置两个属性,只有当PoC的崩溃在基于规则的字符串匹配下同时符合这两个属性时才被接受。这提供了一个确定性、可重复且计算成本极低的奖励信号。

多框架训练的解耦设计。智能体框架在模块设计上有所不同,模型必须适应多样化的交互机制。然而,仅在单一生产框架(如MiMo Code和Codex)内训练并不适合实际的RL,因为生产框架包裹了工程保护措施和多步工作流,其模块紧密耦合,无法隔离改变单一交互机制。为此,提出了使用精心设计的微型框架(mini-harnesses)进行多框架训练。所有微型框架都从相同的最小智能体循环开始,包括系统提示、工具和上下文管理。这些模块保持最小化和解耦,使得实现可以自由重组。然后,为代码、通用、视觉和网络安全派生出多样化、适应任务的微型框架配置。这使得训练分布既多样化又可控,鼓励了可迁移的任务解决策略。

奖励作弊的缓解策略。强化学习依赖奖励来衡量任务的成功,但智能体有时会通过利用环境或评估过程中的漏洞来获得高奖励(即奖励作弊)。例如在代码仓库修复任务中,智能体可能会在预期的任务上下文之外获取已发布的修复补丁。表2列举了代表性的奖励作弊案例。为了缓解这一问题,引入了结合中程训练对齐数据、RL环境准备、对抗性筛选和整个训练过程中的审计的综合缓解策略。首先,在中程训练中加入了智能体反思错误推理并纠正行为的对齐数据。其次,在环境准备阶段,清理构建日志、验证器输出、残留补丁以及可能暴露解决方案的二进制文件,清理缓存,并保留到基础提交为止的Git历史记录,强制实施容器级网络隔离。接着,一个专门的“黑客智能体(Hack Agent)”探测准备好的环境,寻找剩余的泄漏和可利用的弱点,并根据其发现迭代改进环境,直到黑客智能体无法找到成功的利用路径。最后,在训练期间定期对智能体轨迹进行离线审计,并且分组智能体评分器会将确认作弊的轨迹的有效奖励重置为零。如图6所示,采取这些措施后,记录的确认作弊比例在整个训练过程中保持在$2\%$以下。

模式与捷径 说明案例
安装并读取 任务(pytest):修复Windows conftest.py导入被路径小写破坏的问题。
思考:“让我检查pytest的变更日志或GitHub以查看是否有最近的修复。”
行动:pip install pytest==5.4.3;检查安装的源代码。
获取上游源代码 任务(Astropy):纠正移除所需TimeSeries列时产生的误导性错误。
思考:“让我直接从GitHub raw URL查看文件。”
行动:curl .../astropy/timeseries/core.py
克隆上游 任务(Matplotlib):阻止ax.clear()恢复共享轴上隐藏的刻度和标签。
思考:“让我直接获取并检查最新matplotlib中的相关文件。”
行动:git clone .../matplotlib.git;检查axis.py。
查找解决方案 任务(Django):修复MultiValueField忽略所需子字段的问题。
思考:“让我获取更多信息——变更集和应用的修复。”
行动:阅读Django工单#29205的变更历史。
探测版本 任务(Sphinx):从类文档中移除虚假的返回类型。
思考:“让我寻找修复。该问题可能在更高版本中已修复。”
行动:pip index versions sphinx

表2 仓库修复任务中代表性的奖励作弊案例。在这个设置中,检索分配的检出(checkout)之外的现有修复绕过了预期的修复任务。

图6 奖励作弊的预防和监控。(a) 训练前的环境准备和迭代的黑客智能体筛选,以及贯穿训练的离线轨迹审计。(b) 上图:在多轮清理中发现可被黑客攻击的环境比例。下图:在我们最终的RL运行中检测到奖励作弊的轨迹比例。
图6 奖励作弊的预防和监控。(a) 训练前的环境准备和迭代的黑客智能体筛选,以及贯穿训练的离线轨迹审计。(b) 上图:在多轮清理中发现可被黑客攻击的环境比例。下图:在我们最终的RL运行中检测到奖励作弊的轨迹比例。

分组智能体评分机制(Groupwise Agentic Grading)。对于代码智能体任务,二元测试奖励提供了可扩展的正确性信号,但不能区分通过测试的解决方案在实现质量或解决问题行为上的差异。因此,在不同的任务子集上使用了两种互补的方法:分组奖励合成(GRS)和分组优势重分配(GAR)。图7总结了这两个工作流。

图7 代码智能体RL的分组智能体评分。(a) 分组奖励合成将测试结果与来自预计算任务特定评分标准的每部署分数相结合。(b) 分组优势重分配在线比较轨迹,将确认作弊的奖励重置为零,并重新分配序列级优势。条形图示意性地说明了正优势从低质量传递到高质量通过解决方案的重分配。
图7 代码智能体RL的分组智能体评分。(a) 分组奖励合成将测试结果与来自预计算任务特定评分标准的每部署分数相结合。(b) 分组优势重分配在线比较轨迹,将确认作弊的奖励重置为零,并重新分配序列级优势。条形图示意性地说明了正优势从低质量传递到高质量通过解决方案的重分配。

分组奖励合成(GRS,离线评分标准)。对于部分高通过率任务,收集多个离线部署,并要求智能体结合任务规范和仓库进行研究,从而构建两个标准:评估实现结果的解决方案评分标准(solution rubrics),以及评估智能体如何处理和验证其工作的行为评分标准(behavior rubrics)。这些标准被重用于评估后续的训练部署。评分智能体进入每个部署的执行环境,根据任务特定的标准进行评估,分配解决方案分数$S^{\mathrm{sol}}$和行为分数$S^{\mathrm{beh}}$。对于轨迹$i$,设$R_i^{\mathrm{test}}$为原始二元测试奖励,最终的训练奖励通过将测试奖励与两个标准分数相乘来合成:

$$ R_i = R_i^{\mathrm{test}} \cdot S_i^{\mathrm{sol}} \cdot S_i^{\mathrm{beh}} . $$


这种乘法形式保持了标准监督与测试结果的联系:失败的轨迹保持零奖励,而通过的轨迹则通过实现质量和行为进一步区分开来。

分组优势重分配(GAR,在线评分)。对于剩余的代码智能体任务,应用在线GAR。对于每个混合结果的部署组,SFT训练的智能体评分器在线联合检查组内的所有轨迹,对比成功和失败的尝试,并从五个维度对通过的补丁进行排名:解决方案方法的适用性、实现的精确性、最小化更改、避免意外影响以及符合代码库约定的工艺。如果证据证实存在依赖外部答案的作弊行为,则将其有效奖励重置为零。使用剩余的质量排名重新分配序列级优势。对于轨迹$i$,设$R_i$为作弊修正后的有效二元奖励,$\bar{R}$为其组均值,$A_i = R_i - \bar{R}$为其序列级优势,$\mathcal{P} = \{i : R_i = 1\}$为通过的轨迹集合。首先使用质量因子$f_i \in (0, 1]$降低低质量通过的权重,然后通过一个公共因子将移除的正优势质量重新分配给通过的轨迹。未设上限的更新公式为:

$$\begin{aligned} \lambda = \frac{\sum_{j \in \mathcal{P}} A_j}{\sum_{j \in \mathcal{P}} f_j A_j}, \qquad A'_i = \begin{cases} \lambda f_i A_i, & i \in \mathcal{P}, \\ A_i, & i \notin \mathcal{P}. \end{cases} \end{aligned}$$


这保留了正优势总和$\sum_{i \in \mathcal{P}} A'_i = \sum_{i \in \mathcal{P}} A_i$以及由质量引起的相对权重,而不改变失败的轨迹。在实践中,对公共缩放因子进行封顶以防止正优势被过度放大。然后从通过和失败轨迹的优势中减去组均值,产生组均值为零的最终序列优势$A_i^{\mathrm{new}}$。图8显示,与没有在线评分的训练相比,在线评分支持在更稳定的训练机制下持续改进策略。

图8 使用MiMo-V2.6-Flash进行纯代码RL(训练批次大小128)时,有无在线分组优势重分配的比较。通过率为avg@n(n=3);我们还报告了平均总交互轮数和总token长度。
图8 使用MiMo-V2.6-Flash进行纯代码RL(训练批次大小128)时,有无在线分组优势重分配的比较。通过率为avg@n(n=3);我们还报告了平均总交互轮数和总token长度。

行为正则化机制。为了提高RL训练的稳定性并鼓励高效、可靠的行为,引入了两个互补的机制:组相对长度惩罚(Group-Relative Length Penalty)和段级行为惩罚(Segment-Level Behavioral Penalties)。
组相对长度惩罚旨在遏制生成token的过度增长。对于具有$G$个部署的提示$q$,如果通过率$|\mathcal{P}_q| / G > A$($A$为最小通过率),则计算参考长度$\ell_q^\star = \mathrm{Quantile}_{B/100} \{\ell_j : j \in \mathcal{P}_q\}$,并获得调整后的奖励:

$$ \widetilde{R}_i = R_i - \mathbf{1}[i \in \mathcal{P}_q] X \left[ \mathrm{clip}\left(\frac{\ell_i / \ell_q^\star - 1 - \delta}{s - \delta}, 0, 1\right) \right]^\gamma . $$


其中$X \geq 0$是最大扣除额,$\delta \geq 0$是容忍的相对超额,$\mathrm{clip}(x, 0, 1) = \min(1, \max(0, x))$。这鼓励使用适应每个提示的参考长度生成简洁的解决方案。

段级行为惩罚针对格式违规和工具调用错误(如格式错误的标记、无效的工具名称)。设$h_{i,t} = 1$标记有问题的token,$H_\pm$和$C_\pm$分别收集被标记和未被标记的token索引。调整后的token优势$\widetilde{A}_{i,t}$为:

$$\begin{aligned} \widetilde{A}_{i,t} = \begin{cases} \alpha(1 - h_{i,t})A_i, & A_i > 0, \\ [\beta(1 - h_{i,t}) + \kappa h_{i,t}]A_i, & A_i < 0, \\ 0, & A_i = 0, \end{cases} \quad \kappa > 1, \end{aligned}$$

$$ \alpha = \min\left(\alpha_{\max}, 1 + \frac{\sum_{H_+} A_i}{\sum_{C_+} A_i}\right), \qquad \beta = \max\left(\beta_{\min}, 1 - \frac{(\kappa - 1)\sum_{H_-} |A_i|}{\sum_{C_-} |A_i|}\right) . $$
这会在正向轨迹中屏蔽被标记的token,并在负向轨迹中更强烈地惩罚它们,同时保持每种符号的总优势质量守恒。

强化学习与OPD基础设施

图14 RL基础设施的总体架构概述。
图14 RL基础设施的总体架构概述。

具有细粒度学习信号的智能体强化学习。由于智能体部署跨越多个轮次和对话上下文,而结果奖励仅提供粗略的监督,因此采用以智能体为中心的执行模型,并将轨迹数据组织为四级层次结构:样本(Sample) -> 序列(Sequence) -> 上下文(Context) -> 片段(Segment)。每个序列作为一个智能体循环(Agent Loop)运行。在这个层次结构中,可配置的惩罚模块(Penalty Module)应用损失掩码和优势整形(advantage shaping)。规则(Rule)通过手工逻辑或基于模型的评判器判断片段、上下文或序列;策略(Strategy)将动作绑定到层次结构的一个级别。例如,复合的提前停止策略会在规则触发时立即停止部署,将结果奖励归零,并对触发轮次和早期轮次应用单独的动作。

多框架大批量强化学习的架构设计。在大批量规模下,混合任务批次增加了一个异构性维度。在执行端,框架池(Harness Pool)在持久的多租户Actor池中托管并发的框架实例和智能体循环,框架代码库、智能体行为和环境设置是独立配置的。使用Ray actors【17, Ray: A distributed framework for emerging AI applications, 2018】跨集群执行。为了避免耗尽全局控制存储(GCS)节点的并发文件描述符,运行固定大小的持久主机Actor池,每个Actor承载多个并发租户。在数据端,负载搬运工(Payload Porter)使驱动程序仅基于轻量级元数据(标量奖励、上下文长度和键)进行调度。沉重的有效负载(如MoE路由数据、top-$p$采样索引和多模态数据)一次性写入分布式键值存储(如Ray对象存储或TransferQueue【18, Asyncflow: An asynchronous streaming rl framework for efficient llm post-training, 2025, https://arxiv.org/abs/2507.01663】),并在消费处进行打包。多模态有效负载以相同方式分解为元数据和像素,仅在请求之间传送多模态增量 。

稳定异步混合任务强化学习的样本混合器(Sample Mixer)。为了在不同任务部署持续时间和过滤率存在巨大差异的情况下维持指定的训练分布,实现了Sample Mixer。如图15所示,25个数据源的平均生成token和活跃部署持续时间差异巨大。

  1. 自适应部署并发(Adaptive Rollout Concurrency):为每个源分配调度预算。设$B_i$为目标保留样本组数,$r_i$为接受率,$t_i$为部署持续时间,期望生成需求为$m_i = B_i / r_i$。预算为$(1 + p_i)m_i$组,过采样率$p_i$满足:

    $$ p_i = \mathrm{clip}(c t_i - 1, p_{\min}, p_{\max}), \qquad \frac{\sum_i m_i p_i}{\sum_i m_i} = \bar{p} . $$
  2. 自适应部署调度(Adaptive Rollout Scheduling):在预算内,使用权重平衡长期需求和当前批次进度:

    $$ w_i = \alpha \frac{B_i}{r_i} + (1 - \alpha) \frac{(B_i - A_i)^+}{r_i} , $$


    其中$A_i$是已接受的组数。如图16所示,赤字修正调度($\alpha=0.5$)提高了占用稳定性。

  3. 预测性部署分派(Predictive Rollout Dispatch):联合估计KV需求和预期推理并发,以指导新部署在各个等级上的准入和放置,最大化吞吐量。

  4. 样本重放(Sample Replay):在启动或恢复后的第一个收集步骤中,重用选定慢速源的已完成部署组,以加速初始收集。
图15 25个数据源的部署异构性。每条线连接一个源的起点(浅色)和终点(实线);每个点绘制了该源的平均生成token与平均部署时间。
图15 25个数据源的部署异构性。每条线连接一个源的起点(浅色)和终点(实线);每个点绘制了该源的平均生成token与平均部署时间。
图16 六个数据源的轨迹驱动调度模拟。上图:收集进度。下图:部署占用率。
图16 六个数据源的轨迹驱动调度模拟。上图:收集进度。下图:部署占用率。

训练与推理的一致性及优化。基础设施使用SGLang【19, Sglang: Efficient execution of structured language model programs, 2024】作为推理引擎,使用Megatron-LM【20, Megatron-lm: Training multi-billion parameter language models using model parallelism, 2019】作为训练引擎。在部署期间使用MXFP4作为专家的数据类型。为了保持一致性,在每次参数更新后对专家应用量化-反量化(QDQ)。通过部署路由重放(R3)【13】记录部署期间使用的专家索引并在训练期间重放;记录每个token的top-$p$采样候选集并在其内部重新归一化训练对数概率。在推理端,上下文缓存(Context Cache)在轮次之间携带有路由记录、采样候选集和视觉输入的KV状态,并将空闲状态卸载到主机内存。使用在RL日志上微调的草稿模型通过推测解码加速生成。在训练端,将所有损失计算(策略梯度损失、OPD损失等)融合到一个内核中,以节省内存并减少步骤时间。

实验环境与实验结果

实验环境设置

  • 数据集组成与规模:RL任务涵盖多个领域,包括智能体和竞争性编程(68%)、通用工具使用(12%)、美学设计(13%)、上下文遵循(3%)和网络安全(4%)。
  • 训练参数:全局训练批次大小为25K条轨迹(抽取1568个提示,每个提示16次部署)。使用GRPO算法,采用异步部分部署,陈旧度(staleness)为4。优化器使用Muown,学习率为$3 \times 10^{-6}$,无权重衰减或学习率预热,梯度裁剪阈值为1.0。训练期间冻结MoE路由器。重要性采样比率的上下界初始化为[0.2, 5.0],并根据策略熵在运行时独立调整。
  • 基准测试环境
    • 代码智能体:DeepSWE v1.1、ProgramBench、MiMo Code Bench。
    • 网络安全:CyberGym、ExploitGym、ExploitBench、SEC Bench Pro、MiMo Cyber Bench。
    • 通用智能体:AutomationBench、Toolathlon-Verified、GDPval-AA v2.1、JobBench、Agents' Last Exam、TerminalBench 4.0/2.1、OSWorld-Verified。
    • 视觉智能体:MiMo Visual Coding。

实验结果与分析

  1. 强化学习性能提升:如图9所示,Flash和Pro模型在DeepSWE v1.1、AutomationBench v1.0.6和MiMo Visual Coding上,随着RL训练的进行,基准分数整体提升。这些收益伴随着总token数的增加,表明更强的任务性能与更多的token使用同步发展。
    图9 在DeepSWE v1.1、AutomationBench v1.0.6和内部MiMo Visual Coding基准上,RL训练期间的基准分数(上)和总token数(下,以千为单位)。浅橙色和深橙色曲线分别代表Flash和Pro。

    图9 在DeepSWE v1.1、AutomationBench v1.0.6和MiMo Visual Coding上,RL训练期间的基准得分(顶部)和总token数(底部)。
    图9 在DeepSWE v1.1、AutomationBench v1.0.6和MiMo Visual Coding上,RL训练期间的基准得分(顶部)和总token数(底部)。
  2. 多框架训练效果:图10显示了多框架训练对DeepSWE v1.1性能的影响。这种专用训练提高了四个训练微型框架和三个保留框架(codex、claude code、mini-swe-agent)的性能。保留框架的平均Pass@1从约50%增加到66%,证明学习到的编码能力跨框架实现转移。
    图10 多框架训练期间DeepSWE v1.1上的Pass@1,(a) 训练框架和(b) 保留框架评估。浅色曲线显示单个框架结果;粗橙色曲线显示均值。

    图10 多脚手架训练期间在DeepSWE v1.1上的Pass@1,使用(a)训练脚手架和(b)保留脚手架进行评估。
    图10 多脚手架训练期间在DeepSWE v1.1上的Pass@1,使用(a)训练脚手架和(b)保留脚手架进行评估。
  3. 冻结路由器对稳定性的影响:图11比较了路由器参数可训练与冻结时的专家负载稳定性。可训练时,出现了严重的负载崩溃问题(CV从0.78升至2.0,峰值负载从$6\times$升至$16\times$)。冻结路由器后,三个统计指标保持平稳,基准性能正常增长。
    图11 MiMo-V2.6-Pro在RL期间解码器层9(384个专家)的专家负载平衡,比较了冻结和不冻结路由器的运行。(a) 专家负载的变异系数。(b) 峰值负载因子。(c) 负载低于均值0.1倍的冷专家比例。

    图11 在RL期间第9解码层(384个专家)的专家负载平衡,比较了冻结和未冻结路由器的运行。
    图11 在RL期间第9解码层(384个专家)的专家负载平衡,比较了冻结和未冻结路由器的运行。
  4. RL故障分析:图12总结了训练运行中的中断情况。基础设施故障主要是GPU内存双位错误(DBEs)。部署故障源于部分部署设置下的长度估计偏差,导致GPU和主机内存池耗尽。训练故障则是由于微批次内的MoE不平衡导致GPU OOM错误。
    图12 MiMo-V2.6-Pro和MiMo-V2.6-Flash在30个训练步骤中的时间轴,按经过的时间对齐。浅橙色表示已完成的步骤;其他颜色表示按原因分类的故障和恢复间隔。

    图12 30个训练步内的MiMo-V2.6-Pro和MiMo-V2.6-Flash时间线,按经过时间对齐。
    图12 30个训练步内的MiMo-V2.6-Pro和MiMo-V2.6-Flash时间线,按经过时间对齐。
  5. 通过MOPD2拓宽能力:混合RL之后,使用多前缀多教师同策略蒸馏(MOPD2)来结合针对不同任务训练的教师模型的能力。如图13所示,保留了在具有合适mixRL教师领域的自主学生部署(标准MOPD),并添加了前缀条件单轮部署。表3报告了最终的评估结果,MiMo-V2.6系列在各个领域实现了与前沿模型相当的性能。
    图13 MiMo MOPD2概述。(a) 领域专用教师在可验证任务上用MixRL训练,或在开放领域任务上用SFT训练。(b) 标准MOPD使用RL教师监督。(c) 前缀条件OPD重用来自教师部署或SFT数据的轨迹。

    图13 MiMo MOPD2概述。(a) 领域专业教师。(b) 标准MOPD。(c) 前缀条件OPD重用教师rollout或SFT数据中的轨迹。
    图13 MiMo MOPD2概述。(a) 领域专业教师。(b) 标准MOPD。(c) 前缀条件OPD重用教师rollout或SFT数据中的轨迹。

补充细节:基于智能体RL的开源基础

从MiMo-V2.6进行知识蒸馏。为了给开源社区提供一个强大的智能体能力基础,研究团队通过在MiMo生成的数据上监督微调(SFT)Qwen3.5-9B模型,开发了MiMo-V2.6-Distill-Qwen-9B。该混合数据包含774亿个总token,涵盖代码(29.9%)、网络安全(14.2%)、通用领域(28.5%)和视觉任务(27.4%)(详见表4)。生成的SFT检查点在各项评估中均优于原始的Qwen3.5-9B,例如SWE-bench Pro从32.0提升至44.6,AutomationBench从5.0%提升至30.3%。

基于开源环境的强化学习。研究团队开源了涵盖代码、网络安全、通用领域和视觉任务的RL环境(约7k个任务,详见表5)。从MiMo-V2.6-Distill-Qwen-9B的SFT检查点开始,分别在这四个领域使用开源环境进行GRPO训练。如表6所示,RL训练在所有11项评估中均进一步提升了SFT检查点的性能。例如,SWE-bench Verified从61.1升至66.2,Terminal Bench 2.1从37.1升至52.8。此外,在内部音乐基准测试中,分数从SFT后的45.7大幅提升至RL后的52.5。

开源模型的多框架训练实验。在代码领域进行的多框架训练实验表明(如表7所示),多框架RL进一步提升了模型在所有数据集-框架对上的性能。在MiMo Code Bench (mini)上,7个框架中相较于SFT的额外增益范围为1.8至9.3个百分点。

视觉生成案例研究。图17展示了Web开发领域的案例研究。Qwen3.5-9B生成的网站视觉设计平淡、布局简单;经过蒸馏的SFT模型生成了内容更丰富、色彩更协调的网站;而经过RL训练的模型则提供了最精美的结果,具有精致的排版、引人注目的主图部分和更完整的页面布局。
图17 由Qwen3.5-9B、MiMo-V2.6-Distill-Qwen-9B (SFT)和MiMo-V2.6-Distill-Qwen-9B (RL)生成的网站主图部分示例。每行(a-c)显示了三个模型对同一提示的输出。
图17 (b)部分
图17 (c)部分

结论

本报告介绍了MiMo-V2.6系列以及通过大规模智能体强化学习推进基础模型的实用方法。建立在全能多模态基础和以智能体为中心的中程训练之上,研究团队从三个维度扩展了强化学习:训练批次大小和吞吐量、环境和智能体框架的多样性与复杂性,以及投入到分组智能体评分中的计算量。这些进展得到了异步训练、混合任务部署基础设施、训练-推理一致性机制以及针对训练漂移和奖励作弊的防御措施的支持。它们共同实现了在长周期交互上的持续优化,同时提高了解决方案的质量和token效率。在公共和内部基准测试中的评估证明了该方法的有效性,MiMo-V2.6在广泛的智能体任务中实现了与前沿模型相媲美的性能。为了使研究社区能够接触到这一方向,团队开源了MiMo-V2.6-Distill-Qwen-9B以及精心整理的任务环境、验证器、端到端RL框架和可组合的微型框架。这项工作强调了广泛探索、信息反馈和可扩展训练系统的共同重要性,为模型自我改进迈出了实用的一步。

附录

贡献与致谢。研究团队向所有贡献者表达了诚挚的感谢,包括小米数据平台、CloudML、NGK、MiChat、Mify、MiKS和LLM-Plus团队,以及未在论文中明确列出的人员。核心贡献者和普通贡献者的名单在原论文附录中以名字反向字母顺序列出,涵盖了架构设计、数据管道、基础设施、模型训练等多个方面的工程师和研究人员。