论文
NavTree:无需 LLM 摘要的长文档树导航检索
Tree Navigation Without LLM Summaries: A Matched-Cost Study of Hierarchical Retrieval for Long-Document QA
摘要
检索增强生成将语言模型置于外部上下文中,但对于长文档,平顶 $k$ 检索可能会聚集在单个区域并错过补充证据。 RAPTOR 风格的摘要树通过递归地对块进行聚类并使用语言模型在索引时总结每个簇,然后在查询时将摘要节点与原始块一起排名来解决此问题。我们展示了长文档 QA 中摘要树的主要好处可以来自导航而不是生成的摘要内容。我们介绍了 NavTree,一种仅叶子检索器,它在块上构建确定性平衡线段树(索引时零语言模型调用),并将树纯粹用作导航 脚手架:混合词汇和密集前沿行走,锚定在顶部检索的叶子上,从根下降,仅向读者发出叶子块。在针对平坦检索器的匹配成本评估和 RAPTOR 的提取重新实现中,NavTree 是我们评估的网格中最强的匹配成本分层检索器,并与最强的平坦基线联系在一起。在长文档多跳 QA 上,它是唯一在类与类的基础上显着优于 BM25 的分层方法,并由无读者检索 召回率 检查证实。已发布的抽象 RAPTOR 变体的匹配读者复制,在给出强大的集群摘要的情况下,在每个多块预算上仍然输给 NavTree,且索引成本为零。该排名包含更强大的 开放权重 阅读器、更强大的编码器以及将仅叶子发射隔离为结构杠杆的完整阶乘。
