论文

神经符号 PRM:通过结构化痕迹和符号验证增强科学推理

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification

模型训练奖励建模与过程监督

摘要

虽然工具增强的 大语言模型 显着改进了定量 STEM 任务中的多步骤推理,但仍然存在一个关键的残余故障模式:语法上格式良好、数学上可执行、单元一致但上下文不上下文证据一致性的中间推理步骤。当前的方法要么依赖于无法评估语义意图的形式验证器,要么让过程奖励模型(PRM)承担检查算术和逻辑的双重任务。在本文中,我们提出了一个神经符号框架,它将推理干净地解耦为两个形式维度:符号有效性($V$)和语义基础性($G$)。我们通过使用确定性符号验证器充当硬过滤器来构建来保证$V$。为了评估 $G$,我们在验证者接受的流形上有条件地训练 PRM。为了有效地训练这个 PRM,我们引入了反事实符号扰动(CSP),这是一种新颖的数据合成策略,可以通过算法生成保留约束的硬负例(完美通过验证者但在逻辑上有缺陷的步骤)。在推理时,我们部署验证者优先的约束搜索,保证验证者覆盖的操作的执行一致性,同时仅依靠 PRM 对语义基础进行排名。通过针对使用 LLM 的强大工具的精确残差类别,我们的方法显着提高了推理可靠性,而无需使用先前框架的庞大启发式方法。