论文

VecTree-RAG:一种结合向量和树检索的代理检索增强生成框架,以提高效率和准确性

VecTree-RAG: An Agentic Retrieval-Augmented Generation Framework Combining Vector and Tree Retrieval for Efficiency and Accuracy

上下文与知识检索增强

摘要

科学问答需要一个检索系统来解决两个不同的问题:识别哪些论文相关并在这些论文中找到支持证据。传统的检索增强生成通常通过对固定长度的段落进行相似性搜索、扁平化文档结构以及将科学主张与其方法论和论证背景分开来解决这两个问题。我们提出了 VecTree-RAG,这是一个代理框架,它将这些任务分配给互补的检索机制。向量搜索对整个语料库中的紧凑文档和章节表示进行排名,而推理引导的源验证章节树的遍历则在入围论文中定位证据。全文保留在页面存储中,并仅在结构本地化后逐步公开。我们在 300 个 QASPER 问题、54 个 LitQA2 问题的开放访问子集和 49 个多文档 MOSAIC 问题上评估 VecTree-RAG。与 Dense RAG、重新排名的 Dense RAG、RAPTOR 和 Search-o1 相比,VecTree-RAG 在所有三个基准上获得了最高的观察答案得分,在 QASPER 上达到 0.800 LLM 判断正确性,在 LitQA2 上达到 0.925 准确率,在 MOSAIC 上达到 0.547 综合得分。在 QASPER 上,其证据页精度为 0.274,而基线为 0.046--0.071。 LitQA2 消融进一步表明,完整的向量树架构比没有树导航或语料库级向量路由的变体需要更少的推理标记。这些结果表明向量检索缩小了语料库级别的搜索空间,而树导航则集中阅读结构相关的证据。尽管多轮推理仍然比单次调用检索更昂贵,但 VecTree-RAG 为科学文献问答提供了结构感知和可追踪的架构。