发表时间: 2025-05 · arXiv:2505.09388
原文: https://arxiv.org/abs/2505.09388
文章标题:Qwen3技术报告
作者/机构:Qwen团队
一句话结论 Qwen团队推出了Qwen3系列大语言模型,通过统一“思考”与“非思考”模式并引入强到弱蒸馏技术,在235B参数规模下实现了与OpenAI-o1等顶尖闭源模型相媲美的推理与通用能力。
要解决什么问题 现有开源大模型面临几个核心卡点。首先是复杂推理与快速响应的割裂:用户通常需要在专门优化对话的通用模型(如GPT-4o)和专门用于复杂多步推理的模型(如QwQ-32B)之间来回切换。其机制在于,传统模型前向传播缺乏动态算力分配路径,无法在单一模型内按任务难度切换计算深度。其次是推理计算资源缺乏可控性,开发者难以在延迟和性能之间进行细粒度的“思考预算”分配。再次,在端侧小模型的构建上,传统的强化学习后训练方法不仅消耗极大的计算资源,而且难以充分激发小模型的探索潜力,导致高性能轻量级模型的开发成本居高不下。此外,以往预训练数据混合停留在领域级别的粗粒度优化,难以在实例级别精准控制质量;且现有模型在低资源语言上的表现仍有局限。
怎么做的 核心思路是通过架构优化、多阶段预训练与四阶段后训练,在单一模型中统一“思考”与“非思考”模式。在架构上,模型包含密集型和混合专家(MoE)两种结构,移除了QKV偏置并引入QK-Norm以稳定训练;MoE模型采用细粒度专家分割与全局批量负载均衡损失来促进专家特化。预训练使用36万亿tokens,利用细粒度标签在实例级别优化数据混合。预训练分为通用知识积累、高质量推理数据强化以及长上下文扩展三个阶段,其中长上下文阶段通过调整旋转位置嵌入基础频率并结合YARN与双块注意力(DCA)技术扩展至32K上下文。后训练是实现模式统一的关键,分为四个阶段:第一阶段是长思维链冷启动,利用严格过滤的复杂问题和高质量推理过程建立基础推理模式;第二阶段是推理强化学习,采用GRPO算法在极具挑战性的查询上更新参数,通过控制熵来平衡探索与利用;第三阶段是思考模式融合,通过在监督微调数据的聊天模板中引入`/think`和`/no think`标志,让模型学会根据指令切换模式。这种融合自然衍生出了“思考预算”机制——当生成的思考tokens达到预设阈值时,系统强制插入停止思考的指令,模型即可基于已有的中间推理直接输出答案;第四阶段是通用强化学习,结合基于规则、带参考答案和无参考答案的基于模型奖励,全面提升指令遵循和Agent调用能力。对于轻量级模型,则采用强到弱蒸馏替代复杂的强化学习:先进行离策略的响应蒸馏,再让学生模型生成序列,通过最小化学生与教师模型输出logits之间的 $KL$ 散度进行在策略微调,从而高效转移模式切换与推理能力。
效果如何 实验覆盖0.6B到235B参数规模的模型矩阵。对比基线既包括代表顶尖闭源路线的OpenAI-o1、GPT-4o,也包括代表开源SOTA路线的DeepSeek-R1、DeepSeek-V3、Llama-4系列以及Gemma-3。在后训练评估中,旗舰模型Qwen3-235B-A22B(总参数235B,激活参数22B)在“思考模式”下,于23个基准测试中的17个超越了强推理基线DeepSeek-R1,在数学和代码任务上与OpenAI-o1高度可比;在“非思考模式”下,则在18个基准上超越了GPT-4o。中等规模的Qwen3-32B在思考模式下全面超越了前代推理模型QwQ-32B。对于轻量级模型,强到弱蒸馏展现了极高的效率,仅消耗传统强化学习十分之一的GPU算力,不仅提升了基础性能,还通过扩大探索空间提高了 $Pass@64$ 分数。不过,这种大一统的设计也伴随着代价:作者承认,为了在后训练的融合与通用强化学习阶段换取更强的通用指令遵循和Agent能力,模型在AIME等极端复杂的纯推理任务上的性能出现了轻微退化;此外,在RULER基准的极长上下文纯检索任务中,开启思考模式反而会因为生成冗余内容而干扰检索精度。
本文介绍了Qwen模型家族的最新版本——Qwen3。Qwen3系列大型语言模型(LLMs)旨在提升性能、效率和多语言能力,其核心研究目标是通过一系列创新设计,打造在各类任务和领域中达到顶尖水平的开源大模型。
核心问题与研究目标:
创新点与主要贡献:
所有Qwen3模型均在Apache 2.0许可下公开发布,以促进社区的研究和发展。
Qwen3系列模型构成。Qwen3系列包含6个密集模型(Qwen3-0.6B、Qwen3-1.7B、Qwen3-4B、Qwen3-8B、Qwen3-14B和Qwen3-32B)以及2个混合专家(MoE)模型(Qwen3-30B-A3B和Qwen3-235B-A22B)。旗舰模型Qwen3-235B-A22B总参数量为2350亿,每个token激活的参数量为220亿。
密集模型架构。Qwen3密集模型的架构与Qwen2.5【Yang et al., 2024b, Qwen2.5 technical report, arXiv preprint arXiv:2412.15115】相似,采用了分组查询注意力(GQA)【Ainslie et al., 2023, GQA: Training generalized multi-query Transformer models from multi-head checkpoints, EMNLP】、SwiGLU【Dauphin et al., 2017, Language modeling with gated convolutional networks, ICML】、旋转位置嵌入(RoPE)【Su et al., 2024, Roformer: Enhanced Transformer with rotary position embedding, Neurocomputing】以及带有预归一化(pre-normalization)的RMSNorm【Jiang et al., 2023, Pre-RMSNorm and Pre-CRMSNorm Transformers: Equivalent and efficient pre-LN Transformers, CoRR】。此外,移除了在Qwen2【Yang et al., 2024a, Qwen2 technical report, CoRR】中使用的QKV偏置(QKV-bias),并引入了QK-Norm【Dehghani et al., 2023, Scaling vision transformers to 22 billion parameters, ICML】到注意力机制中,以确保Qwen3训练的稳定性。模型的关键架构信息在表1中提供。
表1:Qwen3密集模型的模型架构。
MoE模型架构。Qwen3 MoE模型的基础架构与Qwen3密集模型相同。关键架构信息见表2。该系列模型沿用了Qwen2.5-MoE【Yang et al., 2024b, Qwen2.5 technical report, arXiv preprint arXiv:2412.15115】的设计,并实现了细粒度专家分割【Dai et al., 2024, DeepSeekMoE: Towards ultimate expert specialization in mixture-of-experts language models, CoRR】。Qwen3 MoE模型共有128个专家,每个token激活8个。与Qwen2.5-MoE不同的是,Qwen3-MoE的设计排除了共享专家。此外,模型采用了全局批量负载均衡损失(global-batch load balancing loss)【Qiu et al., 2025, Demons in the detail: On implementing load balancing loss for training specialized mixture-of-expert models, CoRR】来鼓励专家的特化。这些架构和训练上的创新显著提升了模型在下游任务中的性能。
表2:Qwen3 MoE模型的模型架构。
分词器。Qwen3模型使用Qwen的分词器【Bai et al., 2023, Qwen technical report, CoRR】,该分词器实现了字节级字节对编码(BBPE)【Brown et al., 2020, Language models are few-shot learners, NeurIPS; Wang et al., 2020, Neural machine translation with byte-level subwords, AAAI; Sennrich et al., 2016, Neural machine translation of rare words with subword units, ACL】,词汇表大小为151,669。
本节描述了预训练数据的构建、预训练方法的细节,并展示了在标准基准上评估基础模型的实验结果。
数据规模与多样性的扩展。与Qwen2.5【Yang et al., 2024b, Qwen2.5 technical report, arXiv preprint arXiv:2412.15115】相比,Qwen3的训练数据在规模和多样性上都得到了显著扩展,具体体现在预训练token数量增加了一倍,覆盖的语言数量增加了三倍。所有Qwen3模型都在一个包含119种语言和方言、总计36万亿token的大规模多样化数据集上进行训练。该数据集涵盖了编码、STEM(科学、技术、工程和数学)、推理任务、书籍、多语言文本和合成数据等多个领域的高质量内容。
数据扩充方法。为了进一步扩充预训练数据语料库,首先使用Qwen2.5-VL模型【Bai et al., 2025, Qwen2.5-VL technical report, arXiv preprint arXiv:2502.13923】对大量类PDF文档进行文本识别。然后,使用Qwen2.5模型【Yang et al., 2024b, Qwen2.5 technical report, arXiv preprint arXiv:2412.15115】对识别出的文本进行精炼以提升质量,通过这一两步过程,获得了数万亿个高质量的额外文本token。此外,还利用Qwen2.5【Yang et al., 2024b, Qwen2.5 technical report, arXiv preprint arXiv:2412.15115】、Qwen2.5-Math【Yang et al., 2024c, Qwen2.5-Math technical report: Toward mathematical expert model via self-improvement, CoRR】和Qwen2.5-Coder【Hui et al., 2024, Qwen2.5-Coder technical report, CoRR】模型合成了数万亿个不同格式的文本token,包括教科书、问答、指令和代码片段,覆盖了数十个领域。最后,通过整合额外的多语言数据并引入更多语言来进一步扩展预训练语料库,支持的语言数量从Qwen2.5的29种大幅增加到119种,增强了模型的语言覆盖范围和跨语言能力。
数据标注与混合优化。开发了一套多语言数据标注系统,用于提升训练数据的质量和多样性。该系统已应用于大规模预训练数据集,在教育价值、领域、主题和安全性等多个维度上对超过30万亿的token进行了标注。这些详细的标注支持了更有效的数据过滤和组合。与以往在数据源或领域级别优化数据混合的研究【Xie et al., 2023, Doremi: Optimizing data mixtures speeds up language model pretraining, NeurIPS; Fan et al., 2023, DoGE: Domain reweighting with generalization estimation, arXiv preprint arXiv:2310.15393; Liu et al., 2024b, RegMix: Data mixture as regression for language model pre-training, arXiv preprint arXiv:2407.01492】不同,本研究通过在小型代理模型上进行广泛的消融实验,并利用这些细粒度的数据标签,在实例级别上优化了数据混合。
三阶段预训练流程。Qwen3模型通过一个三阶段的过程进行预训练:
超参数优化。与Qwen2.5【Yang et al., 2024b, Qwen2.5 technical report, arXiv preprint arXiv:2412.15115】类似,基于上述三个预训练阶段,为最优超参数(如学习率调度器和批量大小)的预测建立了缩放定律(scaling laws)。通过广泛的实验,系统地研究了模型架构、训练数据、训练阶段和最优训练超参数之间的关系。最终,为每个密集或MoE模型设定了预测的最优学习率和批量大小策略。
图1:Qwen3系列模型的后训练流程。
后训练的双重核心目标。Qwen3的后训练流程经过精心设计,旨在实现两个核心目标:
四阶段训练流程。如图1所示,Qwen3系列中的旗舰模型遵循一个复杂的四阶段训练过程。前两个阶段专注于发展模型的“思考”能力。接下来的两个阶段旨在将强大的“非思考”功能集成到模型中。
轻量化模型的蒸馏方法。初步实验表明,直接将教师模型的输出logits蒸馏到轻量级学生模型中,可以有效提升其性能,同时保持对其推理过程的精细控制。这种方法避免了为每个小规模模型单独执行详尽的四阶段训练过程的必要性。它不仅带来了更好的即时性能(如更高的Pass@1分数),还提升了模型的探索能力(如改进的Pass@64结果)。此外,与四阶段训练方法相比,该方法实现了更高的训练效率,仅需1/10的GPU小时。
后续章节内容。在以下部分,将介绍四阶段训练过程,并详细解释强到弱蒸馏方法。
数据集构建。首先构建了一个全面的数据集,涵盖了数学、代码、逻辑推理和通用STEM问题等广泛类别。数据集中的每个问题都配有经过验证的参考答案或基于代码的测试用例。该数据集是长思维链(long-CoT)训练“冷启动”阶段的基础。
两阶段过滤流程。数据集的构建涉及一个严格的两阶段过滤过程:查询过滤和响应过滤。在查询过滤阶段,使用Qwen2.5-72B-Instruct来识别并移除不易验证的查询,例如包含多个子问题或要求进行通用文本生成的查询。此外,还排除了Qwen2.5-72B-Instruct无需使用CoT推理就能正确回答的查询,这有助于防止模型依赖表面猜测,确保只包含需要更深层次推理的复杂问题。同时,使用Qwen2.5-72B-Instruct为每个查询标注其领域,以保持数据集中领域分布的平衡。
响应筛选与训练目标。在保留一个验证查询集后,使用QwQ-32B【Qwen Team, 2025, QwQ-32B: Embracing the power of reinforcement learning, Qwen Blog】为每个剩余查询生成N个候选响应。当QwQ-32B持续无法生成正确解决方案时,由人类标注员手动评估响应的准确性。对于Pass@N为正的查询,会应用更严格的过滤标准,以移除那些(1) 最终答案错误,(2) 包含大量重复,(3) 明显是猜测而缺乏足够推理,(4) 思考与总结内容不一致,(5) 涉及不当的语言混合或风格转换,或(6) 疑似与潜在的验证集项目过于相似的响应。随后,使用一个精心挑选的精炼数据集子集进行推理模式的初始冷启动训练。此阶段的目标是向模型灌输基础的推理模式,而不是过分强调即时的推理性能。这种方法确保了模型的潜力不受限制,为后续的强化学习(RL)阶段留下了更大的灵活性和提升空间。为有效实现此目标,在此准备阶段最好尽量减少训练样本数量和训练步数。
查询-验证器对筛选标准。在推理RL阶段使用的查询-验证器对必须满足以下四个标准:(1) 在冷启动阶段未使用过。(2) 对于冷启动模型是可学习的。(3) 尽可能具有挑战性。(4) 覆盖广泛的子领域。最终收集了总共3,995个查询-验证器对,并采用GRPO【Shao et al., 2024, DeepSeekMath: Pushing the limits of mathematical reasoning in open language models, CoRR】来更新模型参数。研究发现,使用大的批量大小和每个查询高的 rollout 数量,并结合离策略(off-policy)训练来提高样本效率,对训练过程有益。同时,通过控制模型的熵以使其稳定增加或保持稳定,来平衡探索与利用,这对维持稳定的训练至关重要。因此,在单次RL运行过程中,无需任何手动干预超参数,就实现了训练奖励和验证性能的持续提升。例如,Qwen3-235B-A22B模型在总共170个RL训练步骤中,AIME'24分数从70.1提高到85.1。
表9:在思考模式融合阶段,用于思考和非思考模式的SFT数据示例。对于思考模式,/think 标志可以省略,因为它代表默认行为。此功能已在Hugging Face的tokenizer支持的聊天模板1中实现,其中可以使用额外参数enable_thinking=False来禁用思考模式。
目标与方法。思考模式融合阶段的目标是将“非思考”能力集成到先前已开发的“思考”模型中。这种方法允许开发者管理和控制推理行为,同时也降低了为思考和非思考任务部署独立模型的成本和复杂性。为实现这一点,在推理RL模型上进行了持续的监督微调(SFT),并设计了一个聊天模板来融合这两种模式。此外,研究发现能够熟练处理两种模式的模型在不同的思考预算下表现始终良好。
SFT数据构建。SFT数据集结合了“思考”和“非思考”数据。为了确保第二阶段模型的性能不受额外SFT的影响,“思考”数据是通过在第一阶段的查询上使用第二阶段模型本身进行拒绝采样生成的。而“非思考”数据则经过精心策划,以覆盖包括编码、数学、指令遵循、多语言任务、创意写作、问答和角色扮演在内的多样化任务。此外,还采用自动生成的清单来评估“非思考”数据的响应质量。为了增强在低资源语言任务上的性能,特别增加了翻译任务的比例。
聊天模板设计。为了更好地集成两种模式并让用户能够动态切换模型的思考过程,为Qwen3设计了聊天模板,如表9所示。具体来说,对于思考模式和非思考模式的样本,分别在用户查询或系统消息中引入了/think和/no think标志。这使得模型能够根据用户的输入选择相应的思考模式。对于非思考模式的样本,在助手的响应中保留了一个空的思考块。这种设计确保了模型内部格式的一致性,并允许开发者通过在聊天模板中拼接一个空的思考块来阻止模型进行思考行为。默认情况下,模型在思考模式下运行;因此,添加了一些用户查询不包含/think标志的思考模式训练样本。对于更复杂的多轮对话,在用户的查询中随机插入多个/think和/no think标志,模型响应遵循遇到的最后一个标志。
思考预算。思考模式融合的另一个优势是,一旦模型学会了以非思考和思考两种模式响应,它自然就发展出了处理中间情况的能力——即基于不完整的思考生成响应。这种能力为实现对模型思考过程的预算控制奠定了基础。具体来说,当模型的思考长度达到用户定义的阈值时,会手动停止思考过程并插入停止思考的指令:“考虑到用户限定的时间,我现在必须直接基于思考给出解决方案。\n</think>.\n\n”。插入此指令后,模型会根据其截至该点的累积推理继续生成最终响应。值得注意的是,这种能力并非通过显式训练获得,而是作为应用思考模式融合的自然产物而出现的。
目标与核心能力。通用RL阶段旨在广泛增强模型在多样化场景下的能力和稳定性。为此,建立了一个覆盖超过20个不同任务的复杂奖励系统,每个任务都有定制的评分标准。这些任务专门针对提升以下核心能力:
/think和/no think标志以切换思考模式,并始终使用指定的token(如<think>和</think>)来分隔思考和响应部分。奖励类型。为了为上述任务提供反馈,利用了三种不同类型的奖励:
蒸馏流程设计。强到弱蒸馏流程专为优化轻量级模型而设计,包括5个密集模型(Qwen3-0.6B、1.7B、4B、8B和14B)和一个MoE模型(Qwen3-30B-A3B)。该方法在提升模型性能的同时,有效地赋予了其强大的模式切换能力。蒸馏过程分为两个主要阶段:
/think和/no think两种模式下生成的输出结合起来进行响应蒸馏。这有助于轻量级学生模型发展基本的推理技能和在不同思考模式间切换的能力,为下一阶段的在策略训练奠定坚实的基础。/think或/no think模式产生响应。接着,通过将其logits与教师模型(Qwen3-32B或Qwen3-235B-A22B)的logits对齐来微调学生模型,以最小化KL散度。模型架构:
数据集:
硬件与软件配置:
预训练模型在通用知识、推理、数学、科学知识、编码和多语言能力等15个基准上进行了全面评估。
Qwen3-235B-A22B-Base (旗舰MoE模型):
Qwen3-32B-Base (旗舰密集模型):
Qwen3-14B-Base & Qwen3-30B-A3B-Base:
Qwen3-8B/4B/1.7B/0.6B-Base (端侧模型):
后训练模型在思考(Thinking)和非思考(Non-thinking)两种模式下进行了评估。
Qwen3-235B-A22B (旗舰模型):
Qwen3-32B (旗舰密集模型):
轻量级模型 (Qwen3-30B-A3B, 14B, 8B, 4B, 1.7B, 0.6B):
思考预算的有效性。为了验证Qwen3是否可以通过增加思考预算来提升其智能水平,在数学、编码和STEM领域的四个基准上调整了分配的思考预算。结果如图2所示,Qwen3的性能随着分配的思考预算增加而呈现出可扩展且平滑的提升。此外,研究观察到,如果将输出长度进一步扩展到32K以上,模型的性能有望在未来得到进一步提升,但这部分探索将作为未来工作。
图2:Qwen3-235B-A22B的性能随思考预算的变化情况。
在策略蒸馏的有效性和效率。通过比较从同一个离策略蒸馏的8B检查点开始,分别进行蒸馏与直接强化学习后的性能和计算成本(以GPU小时衡量),来评估在策略蒸馏的有效性和效率。为简化比较,此部分仅关注数学和代码相关的查询。如表21所示,蒸馏方法在性能上显著优于强化学习,同时所需GPU小时仅为后者的约1/10。此外,来自教师logits的蒸馏使学生模型能够扩展其探索空间并增强其推理潜力,这体现在AIME'24和AIME'25基准测试中,经过蒸馏后的pass@64分数相较于初始检查点有所提高。相比之下,强化学习并未带来pass@64分数的任何提升。这些观察结果凸显了利用更强教师模型指导学生模型学习的优势。
表21:Qwen3-8B上强化学习与在策略蒸馏的比较。括号中的数字表示pass@64分数。
思考模式融合与通用RL的效果。为了评估后训练过程中思考模式融合和通用强化学习(RL)的有效性,对Qwen-32B模型不同阶段进行了评估。除之前提到的数据集外,还引入了几个内部基准来监控其他能力,包括:
/think和/no think标志的多轮对话,测试模型是否能根据用户查询正确切换思考模式。
表22:Qwen3-32B在推理RL(阶段2)、思考模式融合(阶段3)和通用RL(阶段4)后的性能。带*的基准为内部数据集。
实验结论。结果如表22所示,可以得出以下结论:
本技术报告介绍了Qwen系列的最新版本Qwen3。Qwen3具备思考模式和非思考模式,允许用户动态管理用于复杂思考任务的token数量。该模型在一个包含36万亿token的广泛数据集上进行了预训练,使其能够理解和生成119种语言和方言的文本。通过一系列全面的评估,Qwen3在其预训练和后训练版本中,均在代码生成、数学、推理和Agent等一系列标准基准测试中表现出强大的性能。
在不久的将来,研究将集中在几个关键领域。将继续通过使用质量更高、内容更多样化的数据来扩大预训练规模。同时,将致力于改进模型架构和训练方法,以实现有效压缩、扩展到极长上下文等目标。此外,计划增加用于强化学习的计算资源,特别关注基于Agent的RL系统,这些系统能从环境反馈中学习,从而构建能够处理需要推理时扩展(inference time scaling)的复杂任务的Agent。
RULER基准评估。为了评估长上下文处理能力,在RULER基准【Hsieh et al., 2024, RULER: What’s the real context size of your long-context language models?, CoRR】上报告了结果,如表23所示。为实现长度外推,使用了YARN【Peng et al., 2023, YaRN: Efficient context window extension of large language models, CoRR】,缩放因子为4。在思考模式下,将思考预算设置为8192个token,以减轻在极长输入上过于冗长的推理。
表23:Qwen3模型在RULER基准上的性能。
结果分析。结果显示:
多语言基准测试。表24-35展示了在西班牙语、法语、葡萄牙语、意大利语、阿拉伯语、日语、韩语、印度尼西亚语、俄语、越南语、德语和泰语等多种语言上的详细基准分数。这些表格的结果表明,Qwen3系列模型在所有评估的基准中都取得了有竞争力的性能,展示了其强大的多语言能力。
Belebele基准评估。为了评估Qwen3在更广泛语言范围内的性能,使用了Belebele【Bandarkar et al., 2023, The Belebele benchmark: A parallel reading comprehension dataset in 122 language variants, CoRR】这一自然语言理解基准。在基准支持的80种语言上进行了评估,排除了42种未优化的语言,如表36所示(按语系组织)。Qwen3与其他基线模型在Belebele基准上的性能比较见表37。结果显示,Qwen3取得了与同等规模Gemma模型相当的性能,同时显著优于Qwen2.5。
(由于篇幅限制,表24至表37的具体内容在此省略,但它们共同证明了Qwen3强大的多语言能力。)
表36:Qwen3在Belebele基准测试中支持的语系和语言代码。
表37:Qwen3与其他基线模型在Belebele基准测试中的性能比较。分数最高者以粗体显示,次高者带下划线。
以下是论文方法章节(第2、3、4节)中引用的参考文献及其在文中的作用说明:
【Yang et al., 2024b, Qwen2.5 technical report, arXiv preprint arXiv:2412.15115】
【Ainslie et al., 2023, GQA: Training generalized multi-query Transformer models from multi-head checkpoints, EMNLP】
【Dauphin et al., 2017, Language modeling with gated convolutional networks, ICML】
【Su et al., 2024, Roformer: Enhanced Transformer with rotary position embedding, Neurocomputing】
【Jiang et al., 2023, Pre-RMSNorm and Pre-CRMSNorm Transformers: Equivalent and efficient pre-LN Transformers, CoRR】
【Yang et al., 2024a, Qwen2 technical report, CoRR】
【Dehghani et al., 2023, Scaling vision transformers to 22 billion parameters, ICML】
【Dai et al., 2024, DeepSeekMoE: Towards ultimate expert specialization in mixture-of-experts language models, CoRR】
【Qiu et al., 2025, Demons in the detail: On implementing load balancing loss for training specialized mixture-of-expert models, CoRR】
【Bai et al., 2023, Qwen technical report, CoRR】
【Brown et al., 2020, Language models are few-shot learners, NeurIPS; Wang et al., 2020, Neural machine translation with byte-level subwords, AAAI; Sennrich et al., 2016, Neural machine translation of rare words with subword units, ACL】
【Bai et al., 2025, Qwen2.5-VL technical report, arXiv preprint arXiv:2502.13923】
【Yang et al., 2024c, Qwen2.5-Math technical report: Toward mathematical expert model via self-improvement, CoRR】
【Hui et al., 2024, Qwen2.5-Coder technical report, CoRR】
【Xie et al., 2023, Doremi: Optimizing data mixtures speeds up language model pretraining, NeurIPS; Fan et al., 2023, DoGE: Domain reweighting with generalization estimation, arXiv preprint arXiv:2310.15393; Liu et al., 2024b, RegMix: Data mixture as regression for language model pre-training, arXiv preprint arXiv:2407.01492】
【Xiong et al., 2023, Effective long-context scaling of foundation models, CoRR】
【Peng et al., 2023, YaRN: Efficient context window extension of large language models, CoRR】
【An et al., 2024, Training-free long-context scaling of large language models, CoRR】
【Qwen Team, 2025, QwQ-32B: Embracing the power of reinforcement learning, Qwen Blog】
【Shao et al., 2024, DeepSeekMath: Pushing the limits of mathematical reasoning in open language models, CoRR】
【Lambert et al., 2024, Tulu 3: Pushing frontiers in open language model post-training, CoRR】