论文
查询扩展不仅仅是生成:通过更好的集成改进密集检索
Query Expansion Is More Than Generation: Improving Dense Retrieval through Better Integration
摘要
大语言模型 (LLM) 可以在没有特定于任务的训练的情况下生成查询扩展,但相同的扩展通常会使冻结密集 检索器 变得更糟。我们发现了一个未被充分探索的因素:之前的工作通常关注生成什么文本,而如何将生成的文本合并到密集的 检索器 中却受到较少的系统关注。通过固定生成的扩展,我们表明性能下降通常可归因于集成方法本身。我们引入了 AnchorQE,这是一种 无需训练 方法,它在插值之前分别对原始查询及其扩展进行编码。插值因子是使用无监督的在线策略来估计的,该策略在未标记的测试流的一小部分上运行。直观上,只有当扩展具有检索强性并且与原始查询的检索证据一致时,我们的策略才会分配高扩展信任。我们发现,与 TREC-DL、LoTTE 和 BEIR 中广泛使用的仅扩展或文本级串联基线相比,AnchorQE 将检索效率提高了 12.89%。此外,我们还表明,我们估计插值因子的在线策略比在开发分区上调整的固定权重高出 3.81%。