论文

面向时序知识问答的强化学习增强多跳推理

Reinforcement Learning Enhanced Multi-hop Reasoning for Temporal Knowledge Question Answering

模型训练强化学习RLVR

摘要

时序知识图谱问答(TKGQA)需要对知识图谱中受时序约束的实体关系进行多跳推理,以回答给定问题。然而,在每一跳,大语言模型(LLM)会检索到包含大量时序相似且语义复杂关系的子图,从而增加次优决策与错误传播的风险。为应对这些挑战,我们提出多跳推理增强(MRE)框架,同时增强前向与后向推理,以改进对全局最优推理轨迹的识别。具体而言,MRE首先通过提示工程引导LLM为给定问题生成多样的推理轨迹;随后筛选有效推理轨迹进行监督微调,作为冷启动策略;最后,我们引入树形分组相对策略优化(T-GRPO),一种递归的、树结构的探索式学习方法。在每一跳,探索在前一跳的基础上建立强因果依赖,而评估则由来自后续跳的多路径探索反馈提供信息。在两个TKGQA基准上的实验结果表明,所提出的基于MRE的模型在处理复杂多跳查询时持续超越最先进(SOTA)方法。进一步分析凸显了其可解释性的提升以及对含噪时序标注的鲁棒性。

面向时序知识问答的强化学习增强多跳推理 配图
图 1:复杂时间事实下的检索错误(b)以及 MRE 框架的解决方式(c)。