论文

基于 LLM 的 检索器 值得吗?效率、鲁棒性和推理开销的实证研究

Are LLM-Based Retrievers Worth Their Cost? An Empirical Study of Efficiency, Robustness, and Reasoning Overhead

模型评测模型能力评测

摘要

大语言模型 检索器 提高了复杂查询的性能,但其实用价值除了准确性之外还取决于效率、稳健性和可靠的置信信号。我们跨 12 个任务和 14 个 检索器 重现推理密集型检索基准 (BRIGHT),并通过冷启动索引成本、查询延迟分布和吞吐量、语料库扩展、受控查询扰动的鲁棒性以及预测查询成功的置信度使用 (AUROC) 来扩展评估。我们还通过将标准查询与提供的五个推理增强变体进行比较来量化 \emph{推理开销},测量相对于增加的延迟的准确性增益。我们发现,一些专门用于推理的 检索器 实现了强大的有效性,同时在吞吐量方面保持竞争力,而几个基于 LLM 的大型双编码器会产生大量延迟,以获得适度的收益。推理增强对于低于 1B 的编码器会产生最小的延迟,但对于顶级 检索器 的回报会递减,并且可能会降低形式数学/代码域的性能。整个模型系列的置信度校准始终很弱,这表明在没有额外校准的情况下,原始检索分数对于下游路由来说是不可靠的。我们发布所有代码和工件以实现可重复性。