论文

如果可以的话请路由我:查询重构选择的基准

Route Me If You Can: A Benchmark for Query Reformulation Selection

模型评测基准与评测资源

摘要

基于 LLM 的查询重构可以改进检索,但没有一种重构策略能够在查询、域、检索器或模型主干中始终保持最佳状态。这产生了一个推理时间决策问题:“给定一个原始查询和一组候选重新表述,应该向检索器发出哪一个?”。现有的研究很难进行比较,因为它们使用不同的重构池、检索器、相关信号、训练标签和评估指标。我们引入了 QueryRoute,这是一个基准,它冻结了可重复地研究此决策所需的昂贵工件:原始查询、生成的变体、多个检索器下的排名列表、检索分数和每个查询的预言机标签。该基准包含 3,757 个查询、11 个候选系统、5 个重构主干以及 TREC DL、BEIR 和 BRIGHT 中的 3 个检索器,产生 619,905 个检索结果。我们对监督分类、路由、QPP 和 LLM-as-judge 选择器进行基准测试。结果显示,与固定重组器相比,预言机有很大的空间,但当前的选择器仅恢复了其中的一部分;选择器排名在检索器之间会发生变化,并且相似的平均有效性可以隐藏不同的查询级别行为。发布的工件和评估工具允许对未来的选择器进行比较,而无需重新生成变体、重新运行检索或重建判断管道。代码和数据可在 https://github.com/haisonle001/QueryRoute 获取