20251018_103502_Parallel-R1:基于强化学习实现大语言模型并行思考
Parallel-R1:基于强化学习实现大语言模型并行思考
1 论文核心信息与重要结论
1.1 标题、机构与作者团队
- • 论文标题:Parallel-R1: Towards Parallel Thinking via Reinforcement Learning(Parallel-R1:通过强化学习实现并行思考)
- • 核心机构: 腾讯AI Lab Seattle 等
- • 论文地址:https://arxiv.org/pdf/2509.07980
1.2 核心Highlight(重要结论)
- 首个通用数学任务的并行思考RL框架:Parallel-R1是首个通过强化学习(RL)让大语言模型(LLMs)在真实复杂数学推理任务中自主学习并行思考的框架,突破了现有方法仅依赖监督微调(SFT)或局限于玩具任务的瓶颈。
- 渐进式课程学习解决冷启动:通过“简单任务SFT→简单任务RL→复杂任务RL”的三阶段课程,解决了RL训练并行思考的冷启动问题(模型初始无法生成并行轨迹),仅用简单任务(如GSM8K)的低成本数据即可教会模型并行格式。
- 模型行为的动态演化:训练过程中,模型的并行思考策略从早期“计算探索”(用多路径试错找解法)逐步转变为后期“多视角验证”(先用高置信度单路径解题,再用并行验证答案),首次揭示了LLM并行思考的内在机制。
- 并行思考作为中期探索支架:将并行思考作为RL训练的“临时探索阶段”,可解锁更高性能天花板——在极具挑战性的AIME25基准上,峰值准确率达25.6%,较直接训练的串行模型提升42.9%。
- 交替奖励策略平衡性能与并行率:提出“准确率-并行率交替奖励”,80%步骤优化准确率、20%步骤分层奖励并行行为,既避免模型“为并行而并行”(牺牲性能),又防止模型“只追求正确而放弃并行”(失去泛化能力),在AIME25上实现19.0%的Mean@16(并行率63.0%)。
- 跨基准的稳定性能提升:在MATH、AMC23、AIME24、AIME25四大数学基准上,Parallel-R1(因果变体)较直接RL训练的串行模型平均提升8.4% 准确率,其中MATH基准平均准确率达86.7%,AMC23的Mean@16达70.5%。
1.3 研究背景与问题提出
1.3.1 并行思考的价值:从人类认知到LLM推理
- • 认知科学依据:人类解决复杂问题时,会同时考虑多个可能性(如“这道题用因式分解还是代数变换?”),避免过早“锁定”单一错误路径,最终整合多视角结论——这种“并行思考”是结构化推理的核心。
- • LLM领域的验证:Google Gemini正是凭借并行思考能力,在国际数学奥林匹克竞赛中取得金牌,证明并行思考可显著提升LLM的复杂推理能力。
1.3.2 现有方法的三大核心问题
现有激活LLM并行思考的方法分为“测试时策略”和“训练时策略”,但均存在关键局限:
| 方法类型 | 代表方案 | 核心问题 |
|---|---|---|
| 测试时策略 | Tree of Thoughts、MCTS、多轨迹采样 | 推理开销极高(需生成大量冗余轨迹),无法将并行能力“永久植入”模型,仅为临时技巧。 |
| 训练时策略(SFT) | 基于合成数据的行为克隆 | 1. 依赖复杂昂贵的合成数据管道(生成高质量并行轨迹成本高); 2. 仅模仿已知模式,无法泛化到未见过的复杂问题(如AIME); 3. 无法学习“探索性并行”,仅能复制固定并行结构。 |
| 训练时策略(RL) | 仅在玩具任务(如CountDown)验证 | 1. 冷启动问题:模型预训练/SFT阶段未接触并行行为,RL初始无法生成有效并行轨迹; 2. 奖励设计难:仅用“最终准确率”奖励,模型会放弃并行(走捷径);强制并行奖励,模型会“为格式牺牲正确性”; 3. 机制黑箱:不清楚模型何时/为何使用并行思考,无法优化训练策略。 |
1.3.3 Parallel-R1的目标
针对上述问题,Parallel-R1的核心目标是:设计一个RL框架,让LLM从无到有学习“自适应并行思考”,既能在复杂数学任务上泛化,又能平衡并行行为与推理性能,同时揭示其内在学习机制。
2 相关工作:现有方案的局限与创新定位
2.1 并行思考(Parallel Thinking)研究现状
现有并行思考方法可分为“非自适应”和“自适应”两类,均未解决通用任务的RL训练问题:
- 非自适应并行(主流):
- • 方案:从推理开始就生成多个独立轨迹,仅在最终合并结果;或按固定间隔交换轨迹信息。
- • 局限:并行的“分支/合并点”由人工预设,不依赖推理进度(如不管题难不难,都生成3条轨迹),灵活性差。
- 自适应并行(少数尝试):
- • 方案1:Tree of Thoughts、MCTS:基于外部验证器的启发式控制并行路径。
- • 方案2:SFT-based:将长串行推理链拆分为并行结构,通过SFT教模型模仿。
- • 方案3:RL-based:仅在CountDown(数字游戏)等玩具任务上验证,无法迁移到数学推理。
- • 局限:依赖外部工具(方案1)、泛化差(方案2)、任务范围窄(方案3)。
Parallel-R1的突破:首个不依赖外部工具、通过RL在通用数学任务上实现自适应并行思考的框架,且能自主学习并行的“触发时机”(何时用并行)和“使用方式”(探索还是验证)。
2.2 RLVR(带可验证奖励的强化学习)研究现状
RLVR(Reinforcement Learning with Verifiable Rewards)是一类通过“可自动验证的结果”(如数学题的最终答案、代码的运行结果)设计奖励的RL方法,无需人工标注或训练奖励模型,已在多个领域应用:
- • 数学推理、代码生成、多模态推理。
- • 优化方向:通过自博弈、测试时RL提升效率,通过DAPO、VAPO提升稳定性。
现有RLVR的局限:所有方案均基于“串行推理”,未考虑LLM的并行思考能力——模型只能按单路径生成推理链,无法通过并行探索突破性能瓶颈。
Parallel-R1的补充:将RLVR扩展到“并行推理”场景,设计适配并行行为的奖励与训练流程,填补了RLVR在并行思考领域的空白。
2.3 本文与现有工作的核心区别
| 维度 | 现有SFT方法 | 现有RL方法(玩具任务) | Parallel-R1(本文) |
|---|---|---|---|
| 数据依赖 | 复杂合成数据(成本高) | 玩具任务数据(泛化差) | 简单任务SFT+复杂任务RL(低成本) |
| 并行行为自适应度 | 固定并行结构(无自适应) | 有限自适应(仅玩具任务) | 全自适应(自主触发/调整) |
| 奖励设计 | 无(仅模仿数据) | 单一奖励(准确率或并行率) | 阶段化+交替奖励(平衡性能与并行) |
| 任务范围 | 简单任务(如GSM8K) | 玩具任务(如CountDown) | 通用数学任务(MATH/AIME/AMC) |
| 机制可解释性 | 黑箱(仅模仿,不知为何并行) | 无分析 | 行为演化分析(探索→验证) |
3 Parallel-R1框架核心技术方案
3.1 框架设计概述:从SFT到RL的范式突破
Parallel-R1的核心思路是:将“并行思考能力”拆解为“格式学习→行为稳定→泛化优化”三个阶段,用SFT解决“会不会”(格式),用RL解决“用得好”(行为与泛化),整体框架如图1所示:

(https://论文原图示意,此处文字描述:上半部分为推理流程,下半部分为训练阶段)
- • 推理流程(上半部分):模型先串行生成推理链,遇到关键步骤时输出
<Parallel>标签, spawn多个<Path>(并行路径),生成后用<Summary>汇总结论,再继续串行推理,循环至得到答案。 - • 训练阶段(下半部分):
- 阶段1(冷启动SFT):用简单数学题(GSM8K)的并行轨迹教模型
<Parallel>/<Path>/<Summary>的格式。 - 阶段2(简单数学RL):用RL稳定模型的并行行为(确保想用时能生成格式)。
- 阶段3(复杂数学RL):用RL让模型在难任务(DAPO→AIME/MATH)上泛化并行能力,优化解题性能。
框架同时支持两种模型变体:
- • Parallel-R1-Seen(因果模型):无架构修改,依赖训练让模型自主区分并行路径。
- • Parallel-R1-Unseen(结构化模型):修改注意力机制(路径窗口掩码+多宇宙位置编码),强制并行路径隔离,防止信息泄露。
3.2 并行思考行为的形式化定义与推理流程
3.2.1 并行思考的两阶段形式化
借鉴人类解决问题的逻辑,Parallel-R1将LLM的并行思考定义为“探索-总结”循环,可重复触发:
- 探索阶段(Exploration):
- • 触发条件:模型在串行推理中检测到“关键步骤”(如“这道题有两种解法,不确定哪种对”)。
- • 行为:暂停主推理链,生成N个独立的
<Path>块(N≥2),每个<Path>是一条完整的子推理路径(如“用因式定理”“用代数变换”),路径间无信息交互。
- 总结阶段(Summary):
- • 行为:模型整合所有
<Path>的结果,判断“哪些路径有效”“结论是否一致”,生成<Summary>块(如“因式定理路径得到有效解,代数变换路径无结果”)。 - • 输出:将
<Summary>的结论合并回主推理链,恢复串行生成,直至遇到下一个关键步骤或得到最终答案。
3.2.2 推理时的具体工作流
为实现上述行为,论文引入三个控制标签(模型需学习何时/如何使用),推理流程如下(以“求196的正除数个数”为例):
- 步骤1:串行推理初始化
模型按常规 autoregressive 生成推理前缀:
“To find the number of positive whole number divisors of 196, we first need to determine its prime factorization. …” - 步骤2:触发并行探索
模型检测到“求除数有两种方法(列举法/公式法)”,输出<Parallel>标签,进入并行模式:
“…
One way is to list all the divisors of 196 and count them: 1, 2, 4, 7, 14, 28, 49, 98, 196. Total 9 divisors.
Use the formula derived from the prime factorization: 196 = 2²×7². The number of divisors is (2+1)×(2+1)=9.
” - 步骤3:生成总结并恢复串行
模型输出<Summary>整合结果,再继续主推理链:
“Both approaches confirm the answer is 9.Thus, the number of positive whole-number divisors of 196 is 9. Final Answer: 9”
关键特性:并行触发是“自适应”的——简单题(如“1+1=?”)可能不触发并行,复杂题(如AIME数论题)可能触发多次并行(如“先并行验证解法,再并行验证计算步骤”)。
3.3 简单可扩展的数据 pipeline:解决冷启动的关键
3.3.1 核心发现:简单任务是冷启动数据的“金矿”
论文通过实验发现一个关键现象(Key Finding 1):
强模型(如DeepSeek-R1-0528-Qwen-3-8B)用简单提示即可为简单数学任务(GSM8K) 生成高质量并行轨迹,但对复杂任务(DAPO) 完全失效,具体数据如表1所示:
表1 不同任务的并行轨迹生成质量对比(相同提示+采样设置)
| 数据集 | 样本数量 | 符合并行格式的轨迹比例(%) |
|---|---|---|
| GSM8K | 7472 | 83.7 |
| DAPO | 17916 | 0.0 |
- • 原因:GSM8K是小学水平数学题(如“小明有5个苹果,妈妈再给3个,共几个?”),解法单一且步骤短,模型易生成“多视角验证”的并行轨迹;DAPO是高中竞赛题(如三角函数与不等式结合),解法复杂,模型无法自主拆解并行路径。
启示:用简单任务(GSM8K)的并行轨迹作为“冷启动数据”,可低成本教会模型并行格式,避免依赖复杂合成数据。
3.3.2 Parallel-GSM8K数据集构建
基于上述发现,论文构建了冷启动数据集Parallel-GSM8K,步骤如下:
- 数据来源:选取GSM8K训练集(约7k样本,均为简单数学题)。
- 并行轨迹生成:用DeepSeek-R1-0528-Qwen-3-8B模型,通过“零样本提示”生成并行推理轨迹,提示模板核心逻辑:
“Solve the problem step by step. When you encounter a step with multiple perspectives, insert a block with at least two s, then summarize with.” - 格式检查(关键步骤):用Algorithm 1(并行格式检查算法) 过滤无效轨迹,确保标签配对正确(如
<Path>必须在<Parallel>内,所有标签必须闭合)。 - 数据用途:仅用于“教模型并行格式”,不教“解题方法”——即模型需学习的是“怎么写并行块”,而非“这道题怎么解”。
3.3.3 Algorithm 1:并行格式检查算法(确保数据质量)
该算法用“栈(Stack)”验证标签的嵌套与闭合,是过滤无效数据的核心,具体步骤如下:
输入:tokens(模型生成的并行轨迹token列表)
输出:format_valid(布尔值,True表示格式有效)
预定义:tag_pairs = {(, ), (
1: 初始化栈 S 为空集(S = ∅)2: 初始化 format_valid = True(默认有效)3: 遍历 tokens 中的每个 token t:4: if t 是“开启标签”(如<Parallel>、<Path>):5: 将 t 压入栈 S(push t to S)6: elif t 是“关闭标签”(如</Parallel>、</Path>):7: if 栈 S 为空(无匹配的开启标签):8: format_valid = False(标签不配对,无效)9: 跳出循环(break)10: else:11: 取出栈顶标签 top_tag(Top(S))12: if (top_tag, t) 在 tag_pairs 中(开启-关闭标签匹配):13: 弹出栈顶标签(pop S)14: else:15: format_valid = False(标签不匹配,如<Parallel>对应</Path>)16: 跳出循环(break)17: end if18: end if19: end for(遍历结束)20: if format_valid 为 True 且 栈 S 不为空(有未闭合的开启标签):21: format_valid = False(如只有<Parallel>,没有</Parallel>)22: end if23: 返回 format_valid
示例:若轨迹为“<Parallel><Path>1+1=2</Path></Parallel>”,栈操作如下:
- • 遇到
<Parallel>:压栈(S=[<Parallel>]) - • 遇到
<Path>:压栈(S=[<Parallel>, <Path>]) - • 遇到
</Path>:栈顶是<Path>,匹配,弹出(S=[<Parallel>]) - • 遇到
</Parallel>:栈顶是<Parallel>,匹配,弹出(S=∅) - • 遍历结束,S为空,format_valid=True(有效)。
若轨迹为“<Parallel><Path>1+1=2</Parallel></Path>”:
- • 遇到
</Parallel>时,栈顶是<Path>,不匹配,format_valid=False(无效)。
3.4 因果模型(Parallel-R1-Seen)的RL实现
Parallel-R1-Seen是无架构修改的基础版本,核心是通过RL让模型自主学习“何时生成并行块”,重点在RL算法选择和三阶段训练流程。
3.4.1 RL算法:Group Relative Policy Optimization(GRPO)
论文选择GRPO作为RL算法,而非PPO(常用RL算法),原因是:
GRPO通过“组内相对优势”标准化奖励,减少单一样本噪声对更新的影响,更适合LLM的长序列生成(推理链通常数百token)。
GRPO的核心公式与符号定义
首先明确 GRPO 的输入与关键变量:
- • :输入问题(如 “AIME25 的数论题”)。
- • :当前待优化的策略(模型参数为 )。
- • :旧策略(用于计算重要性权重,避免策略更新过快)。
- • :从旧策略采样的 个候选响应(推理轨迹), 为组大小(论文中 )。
- • :候选响应 的奖励(如 “是否正确 + 是否有并行块”)。
- • :数值稳定常数(论文中取 )。
- • :clip 参数(论文中取 0.2,限制重要性权重范围)。
- • :KL 散度正则系数(论文中取 0.1,防止新策略与参考策略 偏差过大)。

- 重要性权重(Importance Weight)
衡量当前策略与旧策略对候选响应 的概率比,用于将旧策略的采样数据适配到当前策略: - 优势函数 表示“选择 比组内平均选择好多少”,标准化是为了减少组内样本差异导致的更新波动:
- • :组内平均奖励。
- • 分母:组内奖励的标准差 + 稳定常数,避免分母为 0。
- GRPO 损失函数
结合“clip 截断”(防止 过大导致更新不稳定)和“KL 正则”(防止策略漂移),目标是最大化期望优势:
- • :将 限制在 (),避免极端值。
- • :当前策略与参考策略(通常是上一轮的 )的 KL 散度,确保策略更新平滑。
3.4.2 三阶段训练流程(Parallel-R1-Seen)
每个阶段的目标、数据、奖励设计均不同,循序渐进提升模型的并行能力:
阶段1:冷启动SFT(格式学习)
- • 目标:教会模型生成正确的并行标签(
<Parallel>/<Path>/<Summary>),解决“不会写”的问题。 - • 数据:Parallel-GSM8K(约7k样本,过滤后的有效并行轨迹)。
- • 训练细节:
- • 模型初始化:Qwen-3-4B-Base(开源轻量模型,平衡性能与效率)。
- • 优化器:AdamW,batch size=128,学习率=1e-5,权重衰减=0.01,学习率调度=余弦退火(warm-up比例0.1)。
- • 训练步数:58个梯度更新步骤(仅需少量训练即可学会格式)。
- • 关键特点:仅优化“格式正确性”,不关注“解题正确性”——即使推理错误,只要格式对,也算有效训练样本。
阶段2:简单数学RL(行为稳定)
- • 目标:让模型在简单任务上“稳定触发并行行为”(需要时能生成并行块,不需要时不生成),解决“会写但不敢用”的问题。
- • 数据:与阶段1相同(Parallel-GSM8K),但仅用“问题”作为输入,模型需自主生成并行轨迹。
- • 奖励设计(二进制乘积奖励):
- • (准确率奖励):若最终答案正确,;否则。
- • (并行奖励):若生成至少一个完整的并行单元(
<Parallel>+至少两个<Path>+<Summary>),;否则。 - • 逻辑:只有“格式对且答案对”才给+1,否则-1——强制模型同时关注格式与正确性。
- • 训练细节:
- • RL算法:GRPO,组大小(每个问题采样5个候选响应)。
- • batch size=1024,学习率=1e-6(低学习率避免忘记格式),训练轮次=5个epoch(35个梯度更新步骤)。
阶段3:通用数学RL(泛化优化)
- • 目标:让模型在复杂数学任务上“泛化并行能力”,用并行思考提升解题性能,解决“会用但用不好”的问题。
- • 数据:DAPO数据集(开源数学竞赛数据集,含高中难度题目,适合泛化训练)。
- • 奖励设计(仅准确率奖励):
- • 逻辑:此时模型已能稳定生成并行格式,重点转向“用并行提升解题正确率”——若并行能帮助找到正确答案,模型会自主保留该行为;若并行无用,模型会减少使用。
- • 训练细节:
- • RL算法:GRPO,组大小( G=8 )(复杂任务需更多候选响应采样)。
- • batch size=512,学习率=1e-6,训练步数=300个梯度更新步骤。
- • 输出模型:此阶段结束后得到的模型即为“Parallel-R1-Seen”。
3.5 结构化模型(Parallel-R1-Unseen)的RL实现
Parallel-R1-Seen的局限是:并行路径的token会相互注意力(如<Path>1的token能看到<Path>2的token),导致“路径信息泄露”(模型偷懒,不认真生成独立路径)。为此,论文设计了Parallel-R1-Unseen,通过修改注意力机制强制路径隔离。
3.5.1 结构化注意力机制:路径隔离的核心
结构化模型的核心创新是路径窗口掩码(Path-window masking) 和多宇宙位置编码(Multiverse position encodings),两者结合确保并行路径的独立性:
1. 路径窗口掩码(防止信息泄露)
- • 设计逻辑:每个
<Path>块内的token,只能“注意力到”两类token:
- 同一
<Path>块内的所有token(路径内自注意力)。 <Parallel>标签之前的“共享上下文”(主推理链的前缀,如问题描述、之前的推理步骤)。
- • 禁止注意力:不能注意力到“其他
<Path>块的token”和“<Summary>块的token”(生成<Path>时<Summary>还未生成)。 - • 示意图(简化):```plaintext
[共享上下文] [Path1: token1, token2, …] [Path2: tokenA, tokenB, …] [Summary: …]Path1的token能注意:共享上下文 + Path1内tokenPath2的token能注意:共享上下文 + Path2内tokenPath1与Path2的token不能互相关注 - • 作用:强制模型为每个路径生成独立推理,避免“抄作业”(如Path2直接复用Path1的结论)。
2. 多元全局位置编码(避免位置混淆)
- • 问题:传统位置编码中,Path1的token1和Path2的tokenA位置索引连续(如Path1结束于位置100,Path2开始于101),模型会认为两者是“串行关系”,而非“并行关系”。
- • 解决方案:为每个
<Path>分配“独立的位置索引空间”(多宇宙):
- • 共享上下文的位置索引:0, 1, 2, …, L(L为共享上下文长度)。
- • Path1的位置索引:L+1, L+2, …, L+M(M为Path1长度)。
- • Path2的位置索引:L+1, L+2, …, L+N(N为Path2长度,与Path1的位置索引重叠)。
- •
<Summary>的位置索引:L+M+N+1, …(恢复连续索引)。
- • 作用:让模型认为“所有Path在同一位置空间生成”,明确其并行关系,避免将Path2视为Path1的延续。

3.5.2 结构化模型的训练流程调整
论文发现:直接将Seen的三阶段流程用于Unseen会失败——阶段2的简单数学RL会让结构化注意力“过拟合”(在简单任务上学的掩码无法泛化到复杂任务)。因此,重新设计训练流程:
- 移除阶段2(简单数学RL):直接从“冷启动SFT”进入“通用数学RL”,避免注意力掩码过拟合。
- 冷启动SFT调整:
- • 模型初始化:Qwen-3-4B-Base,但修改注意力层以支持路径窗口掩码和多宇宙位置编码。
- • 训练步数:230个梯度更新步骤(结构化模型需更多训练理解掩码规则)。
- 通用数学 RL 的两种奖励方案
- • S1(仅准确率奖励):与 Seen 的阶段 3 相同,——目标是最大化解题性能,不强制并行。
- • S2(交替奖励):在固定窗口(每 10 个训练步骤)内交替使用两种奖励:
- • 80 % 步骤:仅准确率奖励()——优先优化性能。
- • 20 % 步骤:分层奖励(平衡并行与性能):
- • 逻辑:鼓励并行,但不强制(有并行且正确比无并行正确多 0.2 奖励),避免为并行牺牲性能。
有并行单元且答案正确无并行单元但答案正确其他情况(错误或格式不对)
4 实验验证:关键结果与核心发现
4.1 实验设置:确保公平与可复现
4.1.1 模型与基准
- • ** backbone模型**:Qwen-3-4B-Base(所有方法均基于此模型,排除模型差异影响)。
- • 评估基准:四大数学推理基准,覆盖不同难度:
- MATH(Hendrycks et al., 2021):高中数学竞赛题,共12k样本,评估Mean@1(每个问题生成1个响应)。
- AMC23:美国数学竞赛(AMC 12/10 2023年真题),中等难度,评估Mean@16和Pass@16(每个问题生成16个响应,取平均准确率和最高准确率)。
- AIME24/AIME25:美国数学邀请赛(AIME 2024/2025年真题),高难度(仅前5% AMC选手可参加),评估Mean@16和Pass@16。
4.1.2 基线方法
设置两类基线,确保对比公平:
- 无并行的串行方法:
- • Qwen3-4B-Base(原始模型):无任何训练,基线中的基线。
- • GRPO(DAPO):直接用GRPO在DAPO上训练串行推理(无并行),代表当前RLVR的最佳串行性能。
- • GRPO(DAPO)+ RL on GSM8K:先在GSM8K上RL,再在DAPO上RL(验证简单任务RL的作用)。
- 有并行的SFT方法:
- • Parallel-SFT-Seen:用Parallel-GSM8K做SFT(无RL),因果模型。
- • Parallel-SFT-Unseen:用Parallel-GSM8K做SFT(无RL),结构化模型。
4.1.3 训练与评估细节
- • 训练框架:基于VERL(Sheng et al., 2024)修改,所有超参数统一(除奖励设计外)。
- • 评估采样:
- • MATH:温度T=1.0,生成1个响应(Mean@1)。
- • AMC23/AIME24/AIME25:温度T=1.0,生成16个响应(Mean@16:16个响应的平均准确率;Pass@16:16个响应中至少1个正确的概率)。
- • 答案验证:数学题答案客观,用“精确匹配”验证(如“70”必须与标准答案完全一致,不含额外字符)。
4.2 主要结果:Parallel-R1的性能优势
4.2.1 并行思考显著提升性能
- • 因果模型(Parallel-R1-Seen):在所有基准上均为最佳或次佳:
- • AIME25 Mean@16=19.2,较GRPO(DAPO)的14.8提升29.7%;
- • AMC23 Mean@16=70.5,较GRPO(DAPO)的63.6提升10.9%;
- • MATH Mean@1=86.7,较GRPO(DAPO)的83.5提升3.8%;
- • 平均准确率48.9,为所有方法最高。
- • 结构化模型(Parallel-R1-Unseen S2):在AIME25 Pass@16(42.2)和AMC23 Pass@16(91.5)上表现最佳,证明结构化注意力能提升“最高性能上限”。
4.2.2 SFT vs RL:RL是并行能力泛化的关键
- • SFT方法(Parallel-SFT-Seen/Unseen)的并行率高达95.6%(几乎每个问题都生成并行块),但性能远低于RL方法:
- • AIME25 Mean@16仅8.0/5.2,较Parallel-R1-Seen的19.2低58.3%/72.9%;
- • MATH Mean@1仅76.6/71.5,较Parallel-R1-Seen的86.7低11.6%/17.5%。
- • 原因:SFT仅教会模型“机械生成并行格式”,无法学习“何时需要并行”——简单题也强行并行,浪费计算资源;复杂题并行路径无效,反而引入错误。
4.2.3 简单任务RL的价值(仅对因果模型有效)
- • 对Parallel-R1-Seen:去掉阶段2(简单数学RL)后,平均性能下降2.3%——证明简单任务RL能稳定并行行为。
- • 对Parallel-R1-Unseen:加上阶段2(简单数学RL)后,平均性能下降8.6%——证明结构化注意力在简单任务上学的掩码无法泛化到复杂任务,反而过拟合。
4.3 消融实验:验证核心组件的必要性
4.3.1 训练阶段的影响
- • 结论1:简单数学RL对因果模型必要,对结构化模型有害。
- • 结论2:并行提示提升性能——去掉训练时的并行提示(仅用普通解题提示),平均性能下降1.8%,证明提示能帮助模型理解并行逻辑,而非单纯记忆格式。
4.3.2 奖励设计的影响
结构化模型(Unseen)的奖励设计消融实验
| 奖励方案 | 并行率(%) | AIME25 | AIME24 | AMC23 | MATH | 平均 |
|---|---|---|---|---|---|---|
| 仅准确率(S1) | 13.6 | 17.7 | 18.3 | 69.7 | 82.6 | 47.1 |
| 仅并行(强制并行) | 80.3 | 17.7 | 15.2 | 59.4 | 81.7 | 43.5 |
| 交替奖励(S2) | 63.0 | 19.0 | 16.3 | 67.5 | 84.5 | 46.9 |
- • 仅准确率奖励:并行率仅13.6%(模型几乎不用并行),虽在AMC23(69.7)和MATH(82.6)上表现不错,但失去并行思考的泛化能力,AIME25性能平平。
- • 仅并行奖励:并行率高达80.3%,但性能最差(平均43.5)——模型为“凑并行格式”生成无效路径(如简单题也强行分两条路径),反而降低准确率。
- • 交替奖励(S2):平衡最佳——并行率63.0%,AIME25性能达19.0(所有奖励方案中最高),平均性能46.9,接近仅准确率奖励的47.1,证明交替奖励能在不牺牲性能的前提下保持并行能力。
4.4 模型行为演化:从探索到验证的策略转变
论文通过分析<Parallel>块在推理链中的“相对位置”(<Parallel>起始token索引 / 推理链总长度),揭示了模型并行思考策略的动态变化(Key Finding 2)。
4.4.1 实验设计
- • 跟踪Parallel-R1-Seen在阶段3(通用数学RL)的训练过程,每50个梯度步骤采样100个推理链,计算
<Parallel>块的平均相对位置。 - • 相对位置=0:在推理开始时触发并行;相对位置=1:在推理结束时触发并行。
4.4.2 核心发现:策略从“探索”转向“验证”
- • 早期训练(0-100步):平均相对位置≈0.3,
<Parallel>块在推理早期触发——模型用并行进行“计算探索”(如“先试两种解法,看哪种能走通”),因此时模型解题能力弱,需多路径试错。 - • 后期训练(200-300步):平均相对位置≈0.7,
<Parallel>块在推理后期触发——模型用并行进行“多视角验证”(如“先按一种方法算出答案,再用另一种方法验证是否正确”),因此时模型解题能力强,先保证主路径正确,再用并行降低错误率。
4.4.3 案例佐证
- • 早期模型(探索型):解“找b>9使17_b整除97_b”时,在推理开始就触发并行,两条路径分别用“因式定理”和“基算术”探索解法(Figure5)。
- • 后期模型(验证型):解同一题时,先通过“多项式除法”算出b=21和49,再在推理后期触发并行,两条路径分别验证“基有效性”和“方程解法”,确认答案正确(Figure6)。
原因:奖励设计驱动——模型最终奖励由“答案正确性”决定,早期能力弱时,探索是找到正确答案的唯一方式;后期能力强时,验证是确保答案正确的更安全方式(避免探索引入错误)。
4.5 并行思考作为中期探索支架:突破性能天花板
论文提出“并行思考作为RL训练的中期探索支架”的概念(Key Finding 3):将并行思考作为“临时探索阶段”,帮助模型找到更优的策略空间,之后即使回归串行推理,性能也能超越直接训练的串行模型。
4.5.1 两阶段训练设计
- • 阶段1(探索阶段,0-200步):用Parallel-R1-Unseen(S2)的交替奖励,强制模型使用并行思考,探索多路径策略。
- • 阶段2(利用阶段,200-400步):切换为“仅准确率奖励”,模型可自主选择是否使用并行,重点优化已探索到的有效策略。
4.5.2 核心结果
- • 基线(GRPO直接训练):AIME25准确率稳定在14.8左右,无提升空间。
- • 探索阶段(0-200步):并行率维持在60%以上,准确率从14.8提升至19.0——并行探索帮助模型找到更多解题策略。
- • 利用阶段(200-400步):并行率逐渐下降至30%,但准确率继续提升至25.6%——模型放弃无效并行策略,保留有效策略(即使不用并行,也能复用并行探索学到的解题逻辑)。
性能提升:25.6%较基线(14.8%)提升42.9%,证明并行思考的“探索支架”作用——临时的并行探索能解锁更高的性能天花板,即使后续不用并行,性能也远超直接训练的串行模型。
5 结论与展望
5.1 研究总结
Parallel-R1的核心贡献的是:首次用RL在通用数学任务上实现LLM的自适应并行思考,通过“渐进式课程学习”解决冷启动问题,通过“交替奖励”平衡性能与并行率,通过“行为分析”揭示并行思考的演化机制,并验证了并行思考作为“中期探索支架”的价值。具体总结如下:
- 技术突破:提出“简单SFT→简单RL→复杂RL”的三阶段课程,用低成本数据解决RL训练并行思考的冷启动问题,无需复杂合成数据或外部工具。
- 方法创新:设计因果与结构化两种模型变体,提出交替奖励策略,平衡并行行为与解题性能,适配不同场景需求。
- 机制洞察:首次发现LLM并行思考的策略演化规律(探索→验证),并验证并行思考可作为RL训练的“探索支架”,突破性能天花板。
- 性能验证:在MATH、AMC23、AIME24、AIME25四大基准上稳定提升,平均准确率较直接RL的串行模型高8.4%,AIME25峰值准确率达25.6%(提升42.9%)。
5.2 未来研究方向
- 任务扩展:将Parallel-R1推广到非数学任务(如逻辑推理、代码调试、科学问答),验证并行思考的通用性。
- 架构优化:改进结构化注意力机制,让路径掩码能泛化到不同任务(解决当前Unseen模型简单任务RL过拟合的问题)。
- 奖励精细化:设计“步骤级并行奖励”(如对有效并行路径单独奖励),而非仅用“最终奖励”,进一步提升并行路径的质量。
- 效率提升:降低并行思考的推理开销(如动态调整并行路径数量,简单题少分路径,复杂题多分路径),适配实际应用场景。
如何学习大模型 AI ?
我国在AI大模型领域面临人才短缺,数量与质量均落后于发达国家。2023年,人才缺口已超百万,凸显培养不足。随着Al技术飞速发展,预计到2025年,这一缺口将急剧扩大至400万,严重制约我国Al产业的创新步伐。加强人才培养,优化教育体系,国际合作并进,是破解困局、推动AI发展的关键。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

2025最新大模型学习路线
明确的学习路线至关重要。它能指引新人起点、规划学习顺序、明确核心知识点。大模型领域涉及的知识点非常广泛,没有明确的学习路线可能会导致新人感到迷茫,不知道应该专注于哪些内容。
对于从来没有接触过AI大模型的同学,我帮大家准备了从零基础到精通学习成长路线图以及学习规划。可以说是最科学最系统的学习路线。

针对以上大模型的学习路线我们也整理了对应的学习视频教程,和配套的学习资料。
大模型经典PDF书籍
新手必备的大模型学习PDF书单来了!全是硬核知识,帮你少走弯路!

配套大模型项目实战
所有视频教程所涉及的实战项目和项目源码等

博主介绍+AI项目案例集锦
MoPaaS专注于Al技术能力建设与应用场景开发,与智学优课联合孵化,培养适合未来发展需求的技术性人才和应用型领袖。


这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

为什么要学习大模型?
2025人工智能大模型的技术岗位与能力培养随着人工智能技术的迅速发展和应用 , 大模型作为其中的重要组成部分 , 正逐渐成为推动人工智能发展的重要引擎 。大模型以其强大的数据处理和模式识别能力, 广泛应用于自然语言处理 、计算机视觉 、 智能推荐等领域 ,为各行各业带来了革命性的改变和机遇 。

适合人群
- 在校学生:包括专科、本科、硕士和博士研究生。学生应具备扎实的编程基础和一定的数学基础,有志于深入AGI大模型行业,希望开展相关的研究和开发工作。
- IT行业从业人员:包括在职或失业者,涵盖开发、测试、运维、产品经理等职务。拥有一定的IT从业经验,至少1年以上的编程工作经验,对大模型技术感兴趣或有业务需求,希望通过课程提升自身在IT领域的竞争力。
- IT管理及技术研究领域人员:包括技术经理、技术负责人、CTO、架构师、研究员等角色。这些人员需要跟随技术发展趋势,主导技术创新,推动大模型技术在企业业务中的应用与改造。
- 传统AI从业人员:包括算法工程师、机器视觉工程师、深度学习工程师等。这些AI技术人才原先从事机器视觉、自然语言处理、推荐系统等领域工作,现需要快速补充大模型技术能力,获得大模型训练微调的实操技能,以适应新的技术发展趋势。

课程精彩瞬间
大模型核心原理与Prompt:掌握大语言模型的核心知识,了解行业应用与趋势;熟练Python编程,提升提示工程技能,为Al应用开发打下坚实基础。
RAG应用开发工程:掌握RAG应用开发全流程,理解前沿技术,提升商业化分析与优化能力,通过实战项目加深理解与应用。
Agent应用架构进阶实践:掌握大模型Agent技术的核心原理与实践应用,能够独立完成Agent系统的设计与开发,提升多智能体协同与复杂任务处理的能力,为AI产品的创新与优化提供有力支持。
模型微调与私有化大模型:掌握大模型微调与私有化部署技能,提升模型优化与部署能力,为大模型项目落地打下坚实基础。
顶尖师资,深耕AI大模型前沿技术
实战专家亲授,让你少走弯路

一对一学习规划,职业生涯指导
- 真实商业项目实训
- 大厂绿色直通车
人才库优秀学员参与真实商业项目实训
以商业交付标准作为学习标准,具备真实大模型项目实践操作经验可写入简历,支持项目背调
大厂绿色直通车,冲击行业高薪岗位
文中涉及到的完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐








所有评论(0)