论文

用于跨文档检索增强生成的分层抽象树

Hierarchical Abstract Tree for Cross-Document Retrieval-Augmented Generation

上下文与知识检索增强

摘要

检索增强生成(RAG)通过外部知识增强了大语言模型,基于树的RAG将文档组织成分层索引以支持多粒度的查询。然而,现有的为单文档检索设计的 Tree-RAG 方法在扩展到跨文档多跳问题时面临着严峻的挑战:(1)分布适应性差,其中 $k$-means 聚类由于严格的分布假设而引入了噪声; (2)结构隔离,因为树索引缺乏明确的跨文档连接; (3) 粗略的抽象,掩盖了细粒度的细节。为了解决这些限制,我们提出了 $Ψ$-RAG,一个具有两个关键组件的树形 RAG 框架。首先,通过迭代“合并和折叠”过程构建分层抽象树索引,无需先验假设即可适应数据分布。其次,多粒度检索代理可以通过重新组织的查询和代理驱动的混合 检索器 与知识库智能交互。 $Ψ$-RAG 支持从 词元级 问答到文档级摘要的各种任务。在跨文档多跳 QA 基准测试中,它的平均 F1 分数比 RAPTOR 高 25.9%,比 HippoRAG 2 高 7.4%。代码可在 https://github.com/Newiz430/Psi-RAG 获取。