论文
合理推理的正确答案:语言模型的可验证过程监督
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
摘要
训练语言模型以产生正确的答案和合理的推理仍然是一个开放的挑战。具有可验证奖励的强化学习通常仅优化最终结果,这可以提高任务准确性,但会牺牲推理质量,产生不准确、不完整或不一致的痕迹。我们提出了可验证的过程监督(VPS),这是一个 后训练 框架,通过监督结构化中间声明来共同优化预测准确性和推理质量。我们首先应用有监督的 微调 来引入结构化推理格式,从而实现过程级奖励的中间声明的确定性提取和验证。为了解决推理子任务的异构难度,我们引入了自适应权重,可以优先考虑剩余错误最大的组件,从而创建隐式课程。我们将国际象棋上的 VPS 作为受控测试台进行评估,其中推理步骤可以根据引擎信号进行确定性验证。虽然只注重结果的 RL 可以提高走棋准确度,但它会急剧降低推理质量,使获胜率误差增加高达 112%,并使内部一致性降低高达 69%。相比之下,VPS 在保持准确性的同时显着提高推理质量,将获胜率误差降低高达 30%,并将一致性恢复到接近饱和。推理空间分析进一步表明,如果没有结构化的先验,仅结果的强化学习会收敛到依赖于预算的捷径,而不是合理的多步骤推理。除了国际象棋之外,我们在数学推理中也观察到同样的现象,即仅注重结果的 RL 提高了准确性,同时降低了步级算术和一致性,而 VPS 则保持了两者。这些结果表明,VPS 使语言模型能够在可验证的领域中准确可靠地进行推理。