论文
OPE:通过大纲引导的路径探索克服并行思维中的信息饱和
OPE: Overcoming Information Saturation in Parallel Thinking via Outline-Guided Path Exploration
摘要
并行思维已成为大型推理模型(LRM)解决复杂问题的新范式。近期方法利用强化学习(RL)来增强并行思维,旨在解决监督微调在计算资源和有效性方面遇到的局限。然而,大多数现有研究主要关注聚合阶段的优化,对路径探索阶段的关注有限。在本文中,我们在可验证奖励强化学习(RLVR)设定下对并行思维的优化进行理论分析,发现探索路径之间的互信息瓶颈从根本上限制了整体性能。为解决这一问题,我们提出大纲引导路径探索(OPE),在并行路径推理之前通过生成多样的推理大纲显式划分解空间,从而减少信息冗余并提升各探索路径所捕获信息的多样性。我们以迭代 RL 策略实现 OPE,独立优化大纲规划与大纲引导的推理。在多个具有挑战性的数学基准上的大量实验表明,OPE 在不同聚合策略下均有效提升推理性能,使 LRM 能够更可靠地发现正确解。
