论文

经自适应广度-深度检索的自主知识图谱探索

Autonomous Knowledge Graph Exploration with Adaptive Breadth-Depth Retrieval

上下文与知识知识图谱

摘要

从知识图谱为语言模型查询检索证据,需要在图上的广泛搜索与跟随关系链接的多跳遍历之间取得平衡。基于相似度的检索器提供覆盖面但较浅,而基于遍历的方法依赖选择种子节点以开始探索,当查询跨越多个实体与关系时可能失败。我们提出 ARK: Adaptive Retriever of Knowledge,一个使用工具的 KG 检索器,通过两操作工具集让语言模型掌控这一广度-深度权衡:对节点描述符的全局词汇搜索,以及可组合为多跳遍历的一跳邻域探索。ARK 在面向广度的发现与面向深度的扩展之间交替,而无需依赖脆弱的种子选择、预设跳数或检索训练。ARK 依据查询自适应使用工具:语言密集型查询用全局搜索,关系密集型查询用邻域探索。在 STaRK 上,ARK 达到 59.1% 的平均 Hit@1 与 67.4 的平均 MRR,相对基于检索与基于智能体的免训练方法,平均 Hit@1 提升最高 31.4%,平均 MRR 提升最高 28.0%。最后,我们通过免标签模仿把 ARK 的工具使用轨迹从大型教师蒸馏到 8B 模型,在 AMAZON、MAG 与 PRIME 数据集上分别比基础 8B 模型提升 Hit@1 绝对值 +7.0、+26.6 与 +13.5,同时保留教师 Hit@1 率最高 98.5%。

经自适应广度-深度检索的自主知识图谱探索
图1:Adaptive Retriever of Knowledge 概览。ARK 通过一个极简的两工具接口与 KG 交互:(a) 对于以文本为主的查询,ARK 强调广度,发出 Global Search 以检索宽泛的候选集合。(b) 对于以关系为焦点的查询,ARK 应用 Neighborhood Exploration,从先前检索到的节点(此处为一种药物)出发并扩展到相关实体,实现有针对性的关系检索。(c) 对于以关系为主的查询,ARK 通过交替使用 Global Search 与 Neighborhood Exploration 执行多跳检索:它先检索一个初始节点(如一篇文章),扩展到相关实体(如合著者),并持续扩展和过滤(如与每位作者相关且匹配查询关键词的论文),以恢复出一个有序的相关证据集合。