论文
解释查询扩展在信息检索中的效果差异
Towards Explaining Query Expansion Performance in Information Retrieval
摘要
查询扩展(QE)技术长期以来广泛应用于信息检索(IR)中来解决词汇不匹配问题。它们在现代检索系统中仍然具有相关性,包括基于大型语言模型 (LLM) 的检索系统。然而,没有任何一种 QE 方法在所有查询中始终优于其他方法。这项工作试图通过两个互补的视角来解释量化宽松绩效的变化。第一个是理想扩展查询 (IEQ) 的概念,这是一种利用下游 BM25 检索模型最大化检索效率的假设查询。第二个是可分离性视角,它使用 Cohen (d) 对给定扩展查询的相关和不相关文档进行评分的明显程度进行量化。我们开发了可分离性测量和实用公式来近似 IEQ 并研究这些因素与检索有效性的关系。对 TREC Robust 集合、TREC DL 2019-2022 段落集合和 TREC DL 2019-2020 文档集合的广泛实验揭示了一些有趣的模式。特别是,我们发现 更接近理想扩展查询的扩展查询往往会获得更高的检索效率。我们进一步表明,相关和不相关文件的可分离性为理解量化宽松绩效提供了补充视角。
