论文

从检索上下文到运行时控制:边缘RAG的自适应压缩

From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG

上下文与知识上下文工程

摘要

检索增强生成(RAG)通过让生成过程基于外部段落来改进语言模型回答,但这带来开销:检索到的上下文加长提示,增加预填充工作量、KV缓存占用、内存流量、延迟与能耗。上下文压缩提供了一种自然的补救办法:在生成前修剪检索到的文本。然而,最先进的上下文压缩方法通常使用固定压缩预算,或在离线选定压缩率后在推理时套用。这种静态视角既忽略了工作负载变化,也忽略了边缘设备的实时状态。在边缘SoC上,压缩并非免费:压缩器本身运行在同一SoC上,其消耗的延迟与能耗可能抵消生成阶段的节省。本文提出遥测驱动的边缘RAG自适应压缩愿景,并以实验证据为支撑。我们在NVIDIA Jetson AGX Thor上,使用Llama和Qwen生成器、Natural Questions与HotpotQA数据集以及LLMLingua-2压缩,刻画了压缩的权衡。测量显示,对较大模型而言,生成主导RAG预算:对7B-8B生成器,生成约占每查询延迟的90%和GPU能耗的91%。探索压缩率的影响揭示出一个自适应运行区间:过温和的压缩会错失节能机会,而过度激进的压缩会损害推理质量。中等强度压缩可将GPU能耗最多降低53.2%,SoC能耗最多降低48.2%,且质量损失可忽略。我们主张由工作负载特征和边缘遥测引导的运行时策略来动态管理压缩。

从检索上下文到运行时控制:边缘RAG的自适应压缩:论文配图
图1. 面向边缘RAG的遥测信息驱动自适应压缩。检索到的段落会在生成前被压缩,但压缩比由一个控制器在运行时选择,该控制器观测边缘SoC的遥测数据,并针对延迟、能耗、温度、内存和精度约束进行优化。