论文

通过Group Relative Policy Optimization将多跳推理锚定于结构因果模型

Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

模型训练强化学习RLVR

摘要

多跳事实验证 (MHFV) 需要对不同证据进行复杂推理,这给经常遭受幻觉和断裂逻辑链困扰的大语言模型 (LLM) 带来了重大挑战。现有方法虽然通过思想链 (CoT) 提高透明度,但缺乏对证据和主张之间因果关系的明确建模。在这项工作中,我们引入了一种新颖的框架,该框架将推理建立在结构因果模型(SCM)中,将验证视为建设性的因果推理过程。我们凭经验确定了推理链长度和准确性之间的“倒 U 形”相关性,揭示了过度的结构复杂性会降低性能。为了解决这个问题,我们提出了一种使用组相对策略优化(GRPO)的基于规则的强化学习策略。这种方法动态地优化了结构深度和简洁性之间的权衡。在 HoVer 和 EX-FEVER 上进行的大量实验表明,我们的 SCM-GRPO 框架显着优于最先进的基线,为复杂的事实验证提供了可靠且可解释的解决方案。

通过Group Relative Policy Optimization将多跳推理锚定于结构因果模型
图 2:所提出框架的整体架构。训练流程由两个不同的阶段组成:(1) SFT,其中使用结构化数据集 𝒟 s ​ t ​ r ​ u ​ c ​ t \mathcal{D}_{struct} 使基础模型与基于 SCM 的推理范式保持一致; (2) GRPO 强化学习优化,其中通过分组采样和复合奖励函数(R c , R s , R l R_{c},R_{s},R_{l} )对策略模型进行细化,以增强推理鲁棒性并减轻幻觉。