论文

超越静态 RAG:用于在商品 GPU 上进行高效长上下文推理的自适应三度量路由框架

Beyond Static RAG: An Adaptive, Tri-Metric Routing Framework for Efficient Long-Context Inference on Commodity GPUs

上下文与知识上下文工程

摘要

在 NVIDIA T4(16 GB VRAM)等商用 GPU 上部署检索增强生成(RAG)会暴露出一种我们称之为压缩悖论的实际故障模式:神经提示压缩会增加键值(KV)缓存争用和预处理延迟,从而超过生成时间节省,而跳过压缩可能会导致长上下文中的内存不足(OOM)故障。当 vLLM 服务的 LLM 和基于 PyTorch 的压缩器在内存预算紧张的情况下共同部署时,我们确定了两种不同的故障机制,并引入了 Tri-Metric Router,这是一种确定性、免训练的策略,可以在原始、神经 (LLMLingua-2) 和词法 (BM25) 管道之间进行选择。路由器使用三个 CPU 端信号:空间复杂度 ($L$)、句法密度 ($ρ_{key}$) 和类型标记比 (TTR)。与之前的仅语义适配不同,我们的调度信号是硬件物理的,基于 VRAM 余量和延迟交叉点。阈值根据 LongBench qasper 上的分析进行校准,在 T4 上产生接近 4,332 个字的操作交叉;我们的贡献是这种校准方法,而不是特定于硬件的常数。在分布外坚持时,该方法实现了 0% OOM 失败、88.5 $\pm$ 4.4% 预言机对齐和 49.3% 组合 F1,比始终在线的词法压缩提高了 5.2 个点,而无需额外的 VRAM 或训练成本。