论文

知识图谱是隐式奖励模型:路径导出信号使组合推理成为可能

Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning

模型训练奖励建模与过程监督

摘要

大语言模型在数学和编程等结构化推理领域已经实现了接近专家的性能,但它们在专业科学领域执行组合多跳推理的能力仍然有限。我们提出了一种自下而上的学习范式,其中模型基于公理领域事实,并组合它们来解决复杂的、看不见的任务。为此,我们提出了一种基于监督微调和强化学习(RL)相结合的训练后流程,其中知识图充当隐式奖励模型。通过从知识图路径中导出新颖的奖励信号,我们提供了可验证的、可扩展的、有根据的监督,鼓励模型在强化学习期间构建中间公理,而不是仅优化最终答案。我们在医学领域验证了这种方法,在短跳推理路径(1-3 跳)上训练 14B 模型,并评估其对复杂多跳查询(4-5 跳)的零样本泛化。我们的实验表明,路径衍生奖励充当了“组合桥梁”,使我们的模型在最困难的推理任务上能够显着优于更大的模型和前沿系统(例如 GPT-5.2 和 Gemini 3 Pro)。此外,我们还证明了我们针对选项洗牌压力测试的对抗性扰动方法的稳健性。这项工作表明,将推理过程建立在结构化知识的基础上是实现智能推理的可扩展且有效的途径。

知识图谱是隐式奖励模型:路径导出信号使组合推理成为可能
图2:SFT+RL 流程概览:从 SFT 到以 KG 为基础的 RL 的流程示意图。SFT 实现领域特定的接地,而 RL 期间由路径导出的奖励信号则为组合式推理提供必要的过程监督。