论文

SAGE:用于生产 RAG 系统的 SLO 感知自适应检索

SAGE: SLO-Aware Adaptive Retrieval for Production RAG Systems

上下文与知识检索增强

摘要

生产中的检索增强生成 (RAG) 系统在尾延迟和基础设施成本方面按照严格的服务级别目标 (SLO) 运行。然而,标准检索管道依赖于固定的检索预算,忽略了查询难度,对简单查询进行过度检索,而对困难查询提供服务不足,迫使操作员在答案质量与 SLO 合规性之间进行权衡。本文提出了 SAGE,一种学习的 SLO 感知自适应检索策略,可动态选择每个查询的段落数 k。 SAGE 使用源自初始检索的轻量级特征(例如,分数分布、排名差距、词汇信号),并通过来自近似最佳延迟质量权衡的预言机的模仿学习进行离线训练。推断时,它不会添加 LLM 调用并且开销最小。在 Natural Questions 上,在 5 秒 P95 延迟 SLO 下,SAGE 实现了 95% 的 SLO 合规性,而最佳静态基线 (k=20) 的 SLO 合规性为 30%,将 P95 延迟降低了 36%,检索成本降低了 51%,精确匹配 (EM) 损失仅 2 个百分点。在 Natural Questions 上训练的单一策略可推广到 HotpotQA、UnSeenTimeQA 和四个 LLM 系列(Llama、Qwen、Mistral、Gemma),持续产生 +45-52 点的 SLO 改进,而不会降低质量。