论文

经Lean的定理证明过程验证强化学习

Process-Verified Reinforcement Learning for Theorem Proving via Lean

模型训练强化学习奖励建模与过程监督RLVR

摘要

虽然可验证奖励强化学习(RLVR)通常依赖单一二元验证信号——形式推理中的符号证明助手提供丰富的细粒度结构化反馈。结构化过程与非结构化奖励之间的缺口凸显既稠密又可靠的反馈的重要性。本工作中——我们证明Lean证明助手本身可充当符号过程神谕——在训练期间供给结果级与细粒度战术级经验证反馈。证明尝试被解析为战术序列——Lean的细化标记局部可靠步骤与最早的失败步骤——产生以类型论为依据的稠密、验证器锚定的信用信号。我们将这些结构化奖励纳入带首错传播与首token信用方法的GRPO式强化学习目标——平衡结果级与过程级优势。STP-Lean与DeepSeek-Prover-V1.5的实验表明战术级监督在多数设定中超越仅结果基线——在MiniF2F与ProofNet等基准上带来改进。超越实证增益——我们的研究凸显更广的视角:符号证明助手不仅是评估时的验证器——还可以在训练期间充当过程级奖励神谕。这开启了结合语言模型可扩展性与符号验证可靠性的形式推理强化学习框架的路径。

经Lean的定理证明过程验证强化学习:论文配图
图 1:通过Lean结合结果和策略级别奖励的总体框架:证明 YY 被解析为策略 T1,…,T5T_{1},\dots,T_{5},Lean提供结果反馈 g⁡(Y)g(Y) 和步骤级别错误(例如,T3T_{3} 处的失败会使后续策略无效)。然后将奖励分配给每个策略的第一个标记。