论文
QPP 可以选择正确的查询变体吗?评估 RAG 管道的查询变体选择
Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines
摘要
大语言模型 (LLM) 使查询重构在现代检索和检索增强生成 (RAG) 管道中无处不在,从而能够生成多个语义等效的查询变体。然而,为每个重构执行完整的管道在计算上是昂贵的,这会激发选择性执行:我们能否在产生下游检索和生成成本之前识别出最佳的查询变体?我们研究查询性能预测(QPP)作为跨临时检索和端到端 RAG 的变体选择机制。与估计跨主题查询难度的传统 QPP 不同,我们研究主题内歧视 - 在同一信息需求的竞争变体中选择最佳重新表述。通过使用稀疏和密集 检索器 对 TREC-RAG 进行大规模实验,我们在基于相关性和决策的指标下评估检索前和检索后预测因子。我们的结果揭示了检索和生成目标之间的系统性分歧:最大化排名指标(例如 nDCG)的变体通常无法产生最佳生成答案,从而暴露了检索相关性和生成保真度之间的“效用差距”。尽管如此,QPP 可以可靠地识别比原始查询提高端到端质量的变体。值得注意的是,轻量级的预检索预测器经常匹配或优于更昂贵的后检索方法,为稳健的 RAG 提供了一种有效的延迟方法。