论文
一种尺寸并不适合所有人! RAG 的动态检索器和生成器选择
One Size Does Not Fit All! Dynamic Retriever and Generator Selection for RAG
摘要
尽管查询复杂性和信息需求存在巨大差异,检索增强生成(RAG)系统通常在查询中采用固定的检索器和生成器配置,从而导致计算资源的低效分配。虽然检索和生成自适应性已被独立研究,但它们对端到端 RAG 性能的联合影响仍未得到充分研究。我们系统地分析了检索器和生成器的复杂性如何在事实陈述和多跳问答(QA)中相互作用,包括桥接和组合推理任务。我们的分析表明,更强的检索通常会比增加的生成工作产生更大的收益,但两者都表现出递减和非单调的回报,这表明较高复杂性的配置在查询中并不是一律更好。受这些发现的启发,我们引入了 DRAG,一个用于选择检索器-生成器配置的查询自适应框架。我们首先提出 DRAG$_\text{QPP}$,这是一种免训练的路由方法,它使用查询性能预测(QPP)信号来指导检索器选择,并使用基于检索上下文的困惑度测量来指导生成器选择。我们进一步介绍 DRAG$_\text{SFT}$,这是一种监督路由方法,可以微调 LLM 以联合预测检索器-生成器配置。在三个 LLM 系列和四个 QA 基准中,\qpprag~ 实现了与强大的静态 RAG 基线相当的性能,同时大幅减少了推理延迟,而 DRAG$_\text{SFT}$ 始终提高了静态和免训练自适应基线的有效性。总体而言,DRAG 表明,联合调整检索和生成可以实现比静态 RAG 管道更有利的有效性-效率权衡。