少即是多:通过证据前置和压力自适应预算缓解 RAG 瓶颈
Less can be More: Relieving RAG Bottlenecks via Evidence Frontloading and Pressure-Adaptive Budgeting
摘要
现有的提高检索增强生成(RAG)效率的方法主要优化下游LLM生成,例如上下文压缩或服务优化。然而,RAG 是一个端到端系统,在不同的服务负载和重排序预算下,其瓶颈可能在上游重排序和下游生成之间转移。在本文中,我们首先凭经验描述了这种转移瓶颈行为,并表明上游重排序可能成为高查询率或大重排序预算下的主要瓶颈。减少重新排名预算可以缓解这一瓶颈,但也可能会丢失支持证据并降低召回率。为了解决这个问题,我们提出了 \textbf{\textsf{PACE}} (\textbf{P}优先考虑 \textbf{A}daptive \textbf{C}overage of \textbf{E}vidence),这是一个 无需训练 框架,它将 \textit{evidence frontloading} 与 \textit{压力自适应预算} 相结合。 \textsf{PACE} 首先根据边际证据覆盖范围对候选进行重新排序,优先考虑与查询相关、互补且有助于形成多跳证据链的文档。我们证明这个目标是单调子模的,为贪婪选择提供了 $(1-1/e)$ 近似保证。 \textsf{PACE} 然后根据重排序器和 LLM 的相对压力动态调整重排序预算。对三个多跳 QA 数据集和在线服务模拟的实验表明, \textsf{PACE} 提高了证据召回率,减少了排名繁重的工作负载下的 p95 延迟。更重要的是,这两个组成部分共同揭示了 \textit{少即是多}:证据密集的顶级候选者可以通过更少的重新排序文档实现更高的最终召回率。