重新排序和后期交互提高检索质量:科学问答 RAG 策略的受控比较
Re-ranking and Late Interaction Drive Retrieval Quality: A Controlled Comparison of RAG Strategies for Scientific Question Answering
摘要
检索增强生成(RAG)现在是在外部知识中建立大语言模型(LLM)的标准方法,但检索管道的设计空间很大,并且变体之间的权衡尚不清楚,特别是在实际规模的特定领域语料库上。在这项工作中,我们对科学问答的六种检索策略进行了受控比较:(i) 经典的 top-k 密集检索,(ii) 基于 LLM 的查询重新措辞,(iii) 查询重新措辞,然后进行基于 LLM 的重新排名,(iv) 通过倒数排名融合 (RRF) 进行多查询融合,(v) Agentic 工具调用管道,其中生成器自行决定是否检索,(vi)使用 ColBERTv2 进行后期交互检索。所有六个管道共享相同的生成器(Meta-Llama/Llama-3.1-8B-Instruct)、提示和评估协议;五个单向量管道还共享 SPECTER2 嵌入和 Chroma 向量存储;所有六个检索均来自 2024-2025 年 463,971 篇 arXiv 论文的完整语料库。为了支持可重复的大规模评估,我们还发布了由 Llama-3.1-8B-Instruct 从跨学术领域的 10,000 篇论文的随机样本生成的 19,484 个问题陈述和方法论问题的综合问题数据集(其中 9,742 篇查询生成成功),并且每个策略都在同一查询集上进行评估。我们描述每个管道的架构和实现,发布代码和综合问题数据集,并使用大语言模型作为评审协议沿着多个质量维度评估每个策略,以及直接金论文检索指标。其结果是一个开放的测试平台,用于研究研究文献语料库上 RAG 设计选择的成本和质量权衡,也是未来忠实度、检索鲁棒性和 Agentic 检索工作的基础。