论文
迷失在证据中?在 RAG 中再现文档位置和上下文大小效果
Lost in the Evidence? Reproducing Document Position and Context Size Effects in RAG
摘要
检索增强生成(RAG)系统依赖于将检索到的文档连接到模型的输入上下文中,这使得文档排序和上下文大小变得至关重要但有争议的设计选择。之前的工作报告了基于位置的影响,例如迷失在中间和相关的长上下文现象。然而,实证研究结果仍然不一致,并且很难在模型、数据集和评估协议中重现。在本文中,我们提出了一项系统的再现性研究,重新审视这些主张,并研究它们如何在受控评估框架下与当代 LLM 一起发展。我们首先表明主题采样是方差的主要来源:小主题集可以掩盖或夸大排序效果。基于跨多个主题预算的重复子集抽样,我们提供了一个实用的校准程序,可以识别主题计数,以可行的成本产生稳定的趋势。然后,使用这些固定主题集,我们重现并扩展了位置敏感性的结果,重新评估现代 LLM 中的中间丢失和位置偏差。然后,我们还研究了一个更现实的 RAG 场景,其中相关性由 检索器 而不是 Oracle 对 真值 文档的访问来调节。在此背景下,我们重新审查了最近的一项行业研究,并发现了评估选择的差异,例如有限的主题覆盖范围和对基于 LLM 的法官的依赖。最后,我们分析了检索顺序和上下文大小如何影响不完美检索下的下游 LLM 性能。我们的结果表明,这两个因素与检索质量和模型选择密切相关,并且从理想化设置得出的结论并不总是转移到现实世界的 RAG 管道中。我们发布了所有代码和配置,以支持鲁棒 RAG 评估的可重复性和未来工作。