论文

基于 LLM 的查询重构的再现性研究

A Reproducibility Study of LLM-Based Query Reformulation

模型评测基准与评测资源

摘要

大语言模型 (LLM) 现在广泛用于信息检索中的查询重构和扩展,许多研究报告了显着的效率提升。然而,这些结果通常是在异质实验条件下获得的,因此很难评估哪些结果是可重复的以及哪些结果取决于具体的实施选择。在这项工作中,我们在统一且严格控制的实验框架下对十种代表性的基于 LLM 的查询重构方法进行了系统的再现性和比较研究。我们以两个参数尺度、三种检索范式(词汇、学习稀疏和密集)以及涵盖 TREC 深度学习和 BEIR 的九个基准数据集来评估两个架构 LLM 系列的方法。我们的结果表明,重构增益很大程度上取决于检索范式,词汇检索下观察到的改进并不总是转移到神经 检索器,并且较大的 LLM 并不总是产生更好的下游性能。这些发现澄清了先前工作中报告的成果的稳定性和局限性。为了实现透明复制和持续比较,我们通过 QueryGym 发布所有提示、配置、评估脚本并运行文件,QueryGym 是一个带有公共排行榜的开源重构工具包。\footnote{https://leaderboard.querygym.com}