论文
通过结构化形式化中间产物学习生成可形式化验证的逐步逻辑推理
Learning to Generate Formally Verifiable Step-by-Step Logic Reasoning via Structured Formal Intermediaries
摘要
大语言模型(LLM)近来在复杂的多步推理任务上展现出令人瞩目的表现,尤其是在采用结果奖励强化学习进行后训练时(Guo et al. 2025)。然而,已有观察表明,结果奖励常常忽视有缺陷的中间步骤,导致即便最终答案正确,推理步骤也不可靠。为解决这一不可靠推理问题,我们提出 PRoSFI(Process Reward over Structured Formal Intermediates),一种在不牺牲准确性的前提下增强推理可靠性的新型奖励方法。直接生成形式化证明对中等规模(7B)模型而言几乎难以完成,因此模型并不这样做,而是输出与其自然语言推理对齐的结构化中间步骤。随后,每一步都由形式化证明器(formal prover)验证。只有完全通过验证的推理链才能获得高奖励。形式化验证的引入引导模型生成逐步可机器检查的证明,从而产生更可信的最终答案。PRoSFI 为训练可信赖的推理模型提供了一种简单而有效的方法。
