论文

更好地结合在一起:在强大的 RAG 基线下补充查询重写

Better Together: Complementary Query Rewriting Under a Strong RAG Baseline

上下文与知识检索增强

摘要

改进检索增强生成(RAG)的一种流行方法是将用户的问题重写为多个变体并使用所有变体进行搜索。一旦基础搜索已经很强大,我们就会测试这是否真的有帮助。在一个固定的竞争性管道(BGE 密集检索、跨编码器重新排名和 MMR 多样化)下,我们通过配对引导显着性测试,在三个数据集(HotpotQA、AmbigNQ 和 512K 文档 EnterpriseRAG-Bench)上,将四种查询重写策略 (S1-S4) 与两个强大的 LLM 基线(HyDE、Query2Doc)进行比较。我们的主要结果是,单独重写最多只能在强大的基线下具有竞争力,但结合方法会产生巨大的收益,因为不同的策略在不同的问题上会失败。四种方法 (S1+S3+S4+HyDE) 的事后联合将企业数据上的 HIT@10 提高了 +12.5 个点(51.70 vs 39.22),五种方法的联合达到 52.98 (+13.8)。预算匹配的对照仅获得了约 40% 的收益,这证实了互补性,而不是检索预算,是主要驱动力。在 HotpotQA 上,联合增加了 +1.6 到 +1.8 分 (p<0.001),使全方法预言机饱和;在 AmbigNQ 上,同样的融合会造成伤害(比最佳独奏低 -2.4,p<0.001),我们分析何时以及为何。由于重写成本高昂,因此我们在模拟中评估置信门控路由器,该路由器仅在基线自身的 top-1 分数较低时才运行重写。它捕获了大约一半的企业完全合并收益 (+4.3 HIT@10),同时为 <40% 的查询支付重写成本,并自动拒绝在 AmbigNQ 上重写。下游应答质量评估确认路由器将 F1 提高了 +1.92 (p<0.01),而扩展成本约为 40%。简而言之:将查询重写视为补充覆盖源,通过成本感知路由应用,而不是作为强大基线的独立替代品。