论文

NavTree:无需 LLM 摘要的长文档树导航检索

Tree Navigation Without LLM Summaries: A Matched-Cost Study of Hierarchical Retrieval for Long-Document QA

上下文与知识检索增强

摘要

检索增强生成将语言模型置于外部上下文中,但对于长文档,平顶 $k$ 检索可能会聚集在单个区域并错过补充证据。 RAPTOR 风格的摘要树通过递归地对块进行聚类并使用语言模型在索引时总结每个簇,然后在查询时将摘要节点与原始块一起排名来解决此问题。我们展示了长文档 QA 中摘要树的主要好处可以来自导航而不是生成的摘要内容。我们介绍了 NavTree,一种仅叶子检索器,它在块上构建确定性平衡线段树(索引时零语言模型调用),并将树纯粹用作导航 脚手架:混合词汇和密集前沿行走,锚定在顶部检索的叶子上,从根下降,仅向读者发出叶子块。在针对平坦检索器的匹配成本评估和 RAPTOR 的提取重新实现中,NavTree 是我们评估的网格中最强的匹配成本分层检索器,并与最强的平坦基线联系在一起。在长文档多跳 QA 上,它是唯一在类与类的基础上显着优于 BM25 的分层方法,并由无读者检索 召回率 检查证实。已发布的抽象 RAPTOR 变体的匹配读者复制,在给出强大的集群摘要的情况下,在每个多块预算上仍然输给 NavTree,且索引成本为零。该排名包含更强大的 开放权重 阅读器、更强大的编码器以及将仅叶子发射隔离为结构杠杆的完整阶乘。

NavTree:无需 LLM 摘要的长文档树导航检索:论文原图
图 1:NavTree 的架构。 (A) 离线索引。 NavTree 将文档分割成句子感知块,将它们嵌入为叶节点 $\{v_{1},\ldots,v_{n}\}$,并构建确定性平衡线段树。内部节点 $\bar{c}_{i:j}$ 存储代表性后代句子的保守串联,但不会生成 LLM 生成的摘要。叶子和内部节点嵌入存储在单独的 FAISS 平面内积索引中,在索引时产生零 LLM 调用。 (B) 查询时导航。嵌入 $\mathbf{q}$ 的查询检索顶部 $K_{\ell}$ 叶锚点,其根到叶路径定义 Steiner 主动掩码 $\mathcal{A}$。混合密集-BM25 前沿步行穿过此活动子树。内部节点仅用于路由:它们被分割但从未发出。阅读器仅接收选定的原始叶子块,可选地在未选定的叶子上补充平顶 $k$ 尾部填充。虚线连接器表示重复使用相同的离线树和 FAISS 索引。