论文

RIT-RAG:用检索诱导子树导航大型文档语料

RIT-RAG: Navigating Document Corpora with Retrieval-Induced Trees

上下文与知识智能体系统检索增强Agent 规划

摘要

检索增强生成(RAG)将语言模型建立在外部语料库中。 Agentic RAG 支持迭代搜索,但将模型暴露给没有文档结构的孤立块,从而很难将相关证据与仅类似于查询的块区分开来。 PageIndex 等结构感知方法可以导航文档结构,但无法扩展到大型语料库的结构,而大型语料库不适合LLM上下文。因此,他们首先使用文档检索器提交单个文档,并且无法从错误的选择中恢复。我们提出了 RIT-RAG(检索诱导树 RAG),它将内容检索与结构导航相结合。离线时,RIT-RAG 根据每个文档的目录或站点地图为每个文档构建一个树。在查询时,它检索大量块并使用它们的位置来产生可管理的子树,可能跨多个文档。 LLM 代理导航这些子树,有选择地读取有希望的节点,并在需要时重新制定查询。因此,检索建议去哪里看,而代理则决定看什么 读。在金融、科学和客户支持基准中,RIT-RAG 在普通基准、基于图形的基准和 Agentic 基准中实现了最高的答案准确性。在 EntQABench(我们包含 284 万个技术文档网页的新基准)上,它的准确性比三个LLM的最强基线提高了 6.8 至 11.4 个百分点。