论文

SciRet:科学 RAG 检索和重新排序的计算感知实证研究

SciRet: A Compute-Aware Empirical Study of Retrieval and Reranking for Scientific RAG

模型评测模型能力评测

摘要

我们介绍 SciRet,这是一项基于 CORD-19 的科学问答检索增强生成的计算感知实证研究。我们没有提出新模型,而是评估了跨三个语料库规模的固定科学 RAG 管道:1,034 个块(1K 篇论文)、5,160 个块(5K 篇论文)和 15,480 个块(15K 篇论文)。该管道结合了句子窗口分块、BM25、BGE-M3 密集检索、倒数排名融合、可选的跨编码器重新排名和基于检索证据的答案生成。在这些设置中,混合检索比我们设置中的仅稀疏或仅密集检索更稳健,在 1K 和 15K 时达到 1.000 的 Recall@10。相比之下,MS MARCO 训练的交叉编码器重排序器降低了科学语料库的精度,这表明域不匹配可能会抵消更强的查询-段落交互的好处。在我们的设置中,使用 RAGAS 测量的 忠实性 一代随着语料库规模的增加而增加。检索评估使用源自混合系统的伪相关性标签,因此我们将结果视为受控比较证据而不是基准声明。我们发布代码、索引和评估输出以支持复制和后续研究。