论文

OPE:通过大纲引导的路径探索克服并行思维中的信息饱和

OPE: Overcoming Information Saturation in Parallel Thinking via Outline-Guided Path Exploration

模型训练强化学习RLVR

摘要

并行思维已成为大型推理模型(LRM)解决复杂问题的新范式。近期方法利用强化学习(RL)来增强并行思维,旨在解决监督微调在计算资源和有效性方面遇到的局限。然而,大多数现有研究主要关注聚合阶段的优化,对路径探索阶段的关注有限。在本文中,我们在可验证奖励强化学习(RLVR)设定下对并行思维的优化进行理论分析,发现探索路径之间的互信息瓶颈从根本上限制了整体性能。为解决这一问题,我们提出大纲引导路径探索(OPE),在并行路径推理之前通过生成多样的推理大纲显式划分解空间,从而减少信息冗余并提升各探索路径所捕获信息的多样性。我们以迭代 RL 策略实现 OPE,独立优化大纲规划与大纲引导的推理。在多个具有挑战性的数学基准上的大量实验表明,OPE 在不同聚合策略下均有效提升推理性能,使 LRM 能够更可靠地发现正确解。

OPE:通过大纲引导的路径探索克服并行思维中的信息饱和
图1:OPE框架概览。(左)朴素的并行思考独立采样推理路径。由于模式坍缩,这些路径往往呈现高冗余,并倾向于收敛到同一个错误答案。(中)OPE通过显式生成多样化的提纲(outline)将解空间划分为不同的方向(四种不同策略),从而缓解上述问题。这种结构化探索最大化了潜在解的覆盖范围,使模型能够成功找到正确的推理轨迹。(右)OPE训练流程包括使用合成数据的Cold Start(冷启动)阶段,以及其后新颖的Iterative RL(迭代强化学习)策略。