论文

TKG-Thinker:通过 Agentic 强化学习实现时序知识图谱上的动态推理

TKG-Thinker: Towards Dynamic Reasoning over Temporal Knowledge Graphs via Agentic Reinforcement Learning

模型训练强化学习Agentic RL

摘要

时序知识图谱问答(TKGQA)旨在利用时序知识库回答时间敏感的问题。尽管大语言模型(LLM)在 TKGQA 中展现出显著潜力,当前的提示策略主要通过两个方面限制其效力:其一,在复杂时间约束下容易出现推理幻觉;其二,静态提示限制了模型的自主性与泛化能力,因为它缺乏通过与时序知识图谱(TKG)环境动态交互而来的优化。为解决这些局限,我们提出 TKG-Thinker,一个为 TKG 推理配备自主规划与自适应检索能力的新型智能体。具体而言,TKG-Thinker 通过双重训练策略,借助与 TKG 的动态多轮交互开展深入的时序推理。我们首先用思维链数据进行监督微调(SFT)以灌输核心规划能力,随后进入强化学习(RL)阶段,利用多维奖励在复杂时间约束下打磨推理策略。在三个开源 LLM 上的基准数据集实验结果表明,TKG-Thinker 取得了最先进的性能,并在复杂 TKGQA 设定中展现出强泛化能力。

TKG-Thinker:通过 Agentic 强化学习实现时序知识图谱上的动态推理
图2:我们提出的TKG-Thinker概览。我们首先在高质量轨迹上进行监督微调以缓解冷启动问题,然后通过带时间工具调用的在线强化学习进一步优化模型。底部面板展示了三次rollout:一次完全成功、一次部分成功和一次失败。