论文

Reason Popper-ly:用归纳逻辑编程修补上下文内推理

Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming

模型推理推理验证与自校正

摘要

思维链(CoT)提示使大语言模型(LLM)能够处理多步推理任务,但生成的中间步骤并不保证逻辑上成立。我们提出Reason Popper-ly,一个神经符号框架,它用归纳逻辑编程(ILP)从推理轨迹中学习关系组合规则,并将其部署为用于步骤级修正的在线验证器。给定LLM生成的轨迹,该方法依据学到的规则表检查每个推断步骤,诊断违规类型,用符号推导的修补重写错误步骤,并重新生成剩余后缀,使模型能够在已验证轨迹的条件下产出最终答案。我们在CLUTRR(一个多跳亲属关系推理基准)上,用五个语言模型在2到10跳的推理链上进行评估。在所有模型上,Reason Popper-ly相比标准CoT一致提升最终准确率,在最长的链上小模型最高提升48个百分点、前沿模型提升15个百分点。与完全外置的符号流水线相比,我们的方法在更难的实例上表现更好,因为它保留了模型成功的锚定(grounding),只修正可验证的推理失败。此外,步骤级ILP验证产生了细粒度的错误分类学,提供了超出最终答案准确率的诊断洞见。

Reason Popper-ly:用归纳逻辑编程修补上下文内推理:论文配图
图 1:Reason Popper-ly 概述。左:LLM 生成的推理轨迹可能包含局部合理但组合无效的步骤。右:我们的方法检测违规步骤,诊断错误类型,修补违规步骤,并根据纠正的前缀重新生成剩余后缀。