论文
TKG-Thinker:通过 Agentic 强化学习实现时序知识图谱上的动态推理
TKG-Thinker: Towards Dynamic Reasoning over Temporal Knowledge Graphs via Agentic Reinforcement Learning
摘要
时序知识图谱问答(TKGQA)旨在利用时序知识库回答时间敏感的问题。尽管大语言模型(LLM)在 TKGQA 中展现出显著潜力,当前的提示策略主要通过两个方面限制其效力:其一,在复杂时间约束下容易出现推理幻觉;其二,静态提示限制了模型的自主性与泛化能力,因为它缺乏通过与时序知识图谱(TKG)环境动态交互而来的优化。为解决这些局限,我们提出 TKG-Thinker,一个为 TKG 推理配备自主规划与自适应检索能力的新型智能体。具体而言,TKG-Thinker 通过双重训练策略,借助与 TKG 的动态多轮交互开展深入的时序推理。我们首先用思维链数据进行监督微调(SFT)以灌输核心规划能力,随后进入强化学习(RL)阶段,利用多维奖励在复杂时间约束下打磨推理策略。在三个开源 LLM 上的基准数据集实验结果表明,TKG-Thinker 取得了最先进的性能,并在复杂 TKGQA 设定中展现出强泛化能力。
