论文

何时应搜索更多:基于强化学习的自适应复杂查询优化

When should I search more: Adaptive Complex Query Optimization with Reinforcement Learning

上下文与知识模型训练强化学习检索增强Agentic RL

摘要

查询优化是检索增强生成(RAG)系统效能的关键组成部分。虽然基于强化学习(RL)的Agentic和推理方法近来成为查询优化的有前景方向,但大多数现有方法聚焦于单个查询的扩展和抽象。然而,复杂用户查询在真实场景中普遍存在,常需要多个并行和顺序搜索策略来处理消歧和分解。将RL直接应用于这些复杂案例带来重大障碍。确定最优子查询数量以及有效重排和合并检索到的文档,极大地扩展了搜索空间并使奖励设计复杂化,常导致训练不稳定。为应对这些挑战,我们提出一个新的RL框架——自适应复杂查询优化(ACQO)。我们的框架旨在自适应决定何时以及如何扩展搜索过程。它包含两个核心组件:自适应查询重构(AQR)模块,动态决定何时将查询分解为多个子查询;排序-分数融合(RSF)模块,确保稳健的结果聚合并为学习智能体提供稳定奖励信号。为缓解训练不稳定,我们采用课程强化学习(CRL)方法,通过两阶段策略渐进引入更具挑战性的查询来稳定训练过程。综合实验表明,ACQO在三个复杂查询基准上取得最先进性能,显著优于既有基线。该框架还展现出更高的计算效率以及与不同检索架构的广泛兼容性,使其成为下一代RAG系统强大且可泛化的解决方案。

何时应搜索更多:基于强化学习的自适应复杂查询优化
图3:ACQO 概览。ACQO 采用两阶段课程强化学习来自适应地优化复杂查询,并通过 Rank-Score Fusion 整合多路检索结果。