论文

RAG 中的成本感知查询路由:检索深度权衡的实证分析

Cost-Aware Query Routing in RAG: Empirical Analysis of Retrieval Depth Tradeoffs

上下文与知识检索增强

摘要

检索增强生成(RAG)面临着基本的三向张力:更深入的检索改善了事实基础,但增加了词元成本和端到端延迟。静态检索配置无法解决异构查询工作负载之间的这种紧张关系 - 简单的定义查询将预算浪费在不必要的上下文上,而浅层检索则无法提供复杂的分析提示。本文介绍了 \emph{Cost-Aware RAG} (CA-RAG),这是一个每次查询的路由框架,它从 \emph{strategy bundles} 的离散目录中进行选择,每个策略包将检索深度(从无检索直接推理到 top-$k{=}10$ 密集检索)与固定的生成配置文件相结合,通过最大化标量效用,该标量效用将估计的质量先验与预测延迟和总计费词元的归一化惩罚线性结合起来。 CA-RAG 使用 FAISS 支持的密集检索和 OpenAI 聊天/嵌入 API 来实现,并在跨越四个捆绑包的 28 个查询基准上进行评估。路由器动态地执行所有捆绑包,实现比始终大量检索少 \textbf{26\% 的计费词元},比始终直接推理减少 \textbf{34\% 平均延迟},同时保持相同的答案质量。每个查询的增量分析表明,节省的费用是不均匀的,并且集中在更简单的查询中,从而激发了复杂性感知的护栏。敏感性分析证实,同一捆绑目录仅通过权重调整即可支持多个成本延迟质量操作点。所有结果均直接从记录的 CSV 工件生成,以实现完全可重复性。 CA-RAG 为注重成本的 LLM 部署提供透明、可审核的基础。