论文

Search-on-Graph-R1:训练 大语言模型 通过强化学习搜索知识图

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

模型训练强化学习

摘要

知识图问答(KGQA)需要从主题实体导航到几个关系之外的答案。最近的方法促使前沿 LLM 通过检索工具探索图,但它们对前沿规模推理的依赖使得部署成本高昂。我们提出了 Search-on-Graph-R1 (\sogrone{}),它通过监督 微调 (SFT) 和强化学习 (RL) 将这种导航内部化为紧凑的 8B 模型。我们的中心思想是为前沿教师提供每个问题的标准 SPARQL 查询的支架,以便教师使用实时 \texttt{Search} 工具遍历已知的包含答案的路径,而不必发现路径本身。由于每个调用都是针对实时 Freebase 服务器执行的,因此生成的轨迹通过构造以知识图为基础。在 WebQSP、CWQ 和 GrailQA 上,8B 的 \sogrone{} 超越了我们比较中的所有冻结前沿 LLM 系统,并在我们比较的任何系统中在 CWQ 上发布了最强的结果。它在推理时不使用辅助模块,并且在训练期间不使用 LLM 判断。隔离每个训练阶段表明,SFT 和 RL 贡献了互补的增益,我们的方法可以跨模型系列迁移,并且 RL 学习用比 SFT 初始化更少的 \texttt{Search} 调用来获得答案。