论文
先知道要解决什么,然后再如何解决:预先计划授权 LLM 数学推理
Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning
摘要
当前基于计划的推理方法通过在执行之前插入计划阶段来改进 大语言模型 (LLM),从而产生问题 $\rightarrow$ plan $\rightarrow$ cot 范式。虽然有效,但更仔细的检查揭示了固有的范式层面的差距:规划和执行阶段都决定如何解决问题,而先前的问题是解决什么;认识问题类型、适用的工具和可预见的陷阱;仍然完全隐式。为了弥补这一差距,我们提出了 PPC(Preplan-Plan-CoT),这是一个引入了明确的问题理解阶段(preplan)的框架,产生了一个新的问题 $\rightarrow$ preplan $\rightarrow$ plan $\rightarrow$ cot 范式。实现这一范式需要保护两端预计划的概念完整性。具体来说,我们设计了一个三阶段综合管道,带有扰流分数检测器,可以过滤掉泄漏和扰流故障,以建立干净的预计划监督,并且复合 GRPO 奖励强制生成的计划真正遵循预计划。跨四个骨干网和五个数学推理基准的实验表明,PPC 在 40 个指标中的 39 个指标上取得了最佳结果,与最强基线相比,将 maj@16 和 pass@16 分别提高了 +2.23 和 +3.06,而没有引入额外的推理词元开销。