论文
维基数据搜索痕迹:训练知识图搜索智能体的数据集
Wikidata Search Traces: A Dataset for Training Knowledge Graph Search Agents
摘要
Wikidata 是最大的开放知识库之一,但回答有关它的复杂问题仍然需要 SPARQL 查询来命名正确的实体和属性并链接它们的关系。语言模型提供了一种自然语言替代方案,但主要来自记忆,这对于不太突出的实体来说最不可靠。我们研究了通过探索图来回答的智能体,并认为有两个障碍限制了它们:缺乏记录求解器如何探索的训练数据,以及将大型图结果直接添加到模型上下文的接口。我们测试了三个假设:图搜索的难度可以通过问题的结构来控制,而不仅仅是通过晦涩的实体或措辞;长期搜索的失败很大程度上来自于检索到的证据的管理方式,而不是模型本身;并且在合适的环境下,开放权重型号可以匹配商用封闭式型号。我们通过用嵌套条件替换命名实体来在冻结的维基数据快照上构建多跳问题,在每次扩展后检查目标是否保持唯一以及每个新条件都是必要的。我们发布了 10,235 个单实体和多跳问题的解决轨迹,以及生成它们的递归语言模型 (RLM) Harness,其中模型批量图形调用,将结果保留在持久的 Python 状态中,并通过子调用解释选定的证据。在 100 个问题上,与直接工具调用相同函数相比,Harness改进了我们在两个接口下运行的两个模型:gpt-6-luna 从 49 个正确答案上升到 61 个,其多跳精度提高了一倍,而 Qwen3.8-27B(在单个 GPU 上服务的开放权重模型)从 60 个上升到 74 个。
