论文
强化前修复:用于多跳问答的上下文增强知识图推理
Repair Before Reinforce: Context-Augmented Knowledge Graph Reasoning for Multi-Hop Question Answering
摘要
问答通常需要对多个相互关联的事实进行推理,而不是检索单个孤立的关系。知识图 (KG) 提供了一种结构化的方式来表示此类事实,但仅在孤立的 KG 头-关系-尾三元组上训练大型语言模型 (LLM) 可能会限制它们学习多跳推理所需的周围上下文的能力。在这项工作中,我们提出了一个用于多跳问答的上下文增强训练框架。虽然普遍适用,但我们在特定疾病 KG 的背景下验证了该框架,使用可靠的 KG 提取框架(称为 GraphMERT)提取胃轻瘫和糖尿病。对于每个主要 KG 三元组,我们附加从同一源文本块中提取的支持三元组以形成上下文图(CG)。这创建了两种监督设置:基于 KG 的监督(仅使用目标 KG 三元组或路径)和基于 CG 的监督(使用目标 KG 三元组或路径以及支持上下文三元组)。我们在两种设置下使用监督微调(SFT)来训练 Qwen3-14B 模型,产生 KGModel 和 CGModel 变体。为了加强模型的低跳事实基础,我们引入了 LLM 判断的、历史感知的自适应修复管道,该管道可识别未解决的单跳故障,不断微调目标修复示例,并删除或隔离有问题的噪声三元组。此修复阶段使模型能够在清理后的保留一跳验证集上达到 100% 的准确性。最后,我们采用使用较低跳问答项目的强化学习 (RL),并评估较难的 3 跳、4 跳和 5 跳任务的泛化能力。在这两种疾病中,上下文增强监督比仅 KG 监督持续提高了多跳性能。从修复的 SFT 检查点初始化的 RL 会产生更大、更稳定的增益。