论文

跟随实体:面向Agentic搜索的语料地图

Follow the Entities: A Corpus Map for Agentic Search

上下文与知识知识图谱

摘要

在大型文档集合上回答问题和完成任务通常需要连接分布在多个文档中的证据,例如一个项目的批准记录在一个文档中,其需求记录在另一个文档中,其最新状态记录在第三个文档中。最近的大语言模型Agent通过迭代搜索完整语料库而不是仅阅读一组固定的顶级文档来解决此问题。然而,当语料库仅作为文件的平面集合公开时,相关文档不会给出其与其他文档的关系的指示,因此Agent必须为每个查询重新发现这些关系,通常会丢失补充证据,同时消耗大量额外的词元。为了解决这个问题,我们引入了 CorpusMap,这是一个导航层,它围绕其重复实体组织语料库,这些实体可以从文档本身中识别出来,并且可以跨源将单个文档链接到许多其他文档。具体来说,CorpusMap 将每个重复实体表示为实体页面,该实体页面聚合有关该实体的信息并链接到引用该实体的每个文档,从而在实体和文档之间形成一个图表,Agent可以遍历该图表以收集其他断开连接的证据。此外,由于 CorpusMap 是通过解析文档中同一实体的提及来离线构建的,因此它的链接在查询之间共享,而不是在推理时重复重新发现。使用 7 个不同的模型和 3 个基准数据集,我们表明 CorpusMap 比原始语料库 Agentic 搜索提高了证据发现和答案质量,同时平均使用更少的标记,并且进一步优于 4 个替代导航层,这表明实体可以作为导航大型文档集合的有效锚点。