论文

LLM 对 IR 基准的影响:有效性、基线和污染的荟萃分析

The LLM Effect on IR Benchmarks: A Meta-Analysis of Effectiveness, Baselines, and Contamination

模型评测评测方法与指标

摘要

基准集合长期以来一直支持信息检索 (IR) 中的受控比较和累积进展。然而,之前的荟萃分析表明,报告的有效性增益往往无法累积,部分原因是使用了薄弱或过时的基线。虽然 大语言模型 越来越多地用于检索管道,但它们对既定 IR 基准的影响尚未得到系统分析。在本研究中,我们分析了 143 份出版物,报告了 TREC Robust04 合集和 TREC Deep Learning 2020 (DL20) 段落检索基准的结果,以检查检索有效性和基线强度的纵向趋势。我们观察到了所谓的 \emph{LLM 效应}:与 TREC 2020 的最佳结果相比,最近采用 LLM 组件的系统在 DL20 上实现了 8.8\% 的 nDCG@10 高出 8.8\%,自 2023 年以来在 Robust04 上高出约 20\%。然而,采用数据污染检测方法进行重新排名揭示了两个基准中可测量的污染。虽然排除受污染的主题会降低有效性,但置信区间仍然很宽,因此很难确定 LLM 效果是否反映了真正的方法论进步或预训练数据的记忆。