论文

SPIRE:保留结构的可解释的证据检索

SPIRE: Structure-Preserving Interpretable Retrieval of Evidence

上下文与知识检索增强

摘要

HTML 等半结构化源的检索增强生成受到文档结构与当今嵌入和生成模型的平面、基于序列的界面之间不匹配的限制。检索管道通常在索引之前将文档线性化为固定大小的块,这会模糊部分结构、列表和表格,并且很难在不丢失使其可解释的周围上下文的情况下返回小的、可引用的证据。我们提出了一种对树结构文档进行操作的结构感知检索管道。核心思想是将候选表示为子文档:精确的、可寻址的选择,保留结构身份,同时推迟周围上下文的选择。我们定义了一小组文档原语——路径和路径集、通过修剪提取子文档以及两种上下文化机制。全局上下文化添加了使选择易于理解所需的非本地脚手架(例如标题、标题、列表和表格结构)。局部情境化扩展了其结构邻域内的种子选择,以在目标预算下获得紧凑的、情境丰富的视图。在这些原语的基础上,我们描述了一个基于嵌入的候选生成器,该生成器对句子种子子文档进行索引,以及一个查询时、文档感知的聚合步骤,该步骤分摊共享的结构上下文。然后,我们引入上下文过滤阶段,使用本地上下文视图对检索到的候选者重新评分。通过 HTML 问答基准的实验,我们发现,与基于段落的基准相比,在保持结构的同时将选择置于上下文中可以在固定预算下产生更高质量、更多样化的引用,同时保持可扩展性。