论文

POLAR:边缘 LLM 服务中 LoRA 适配器缓存和路由的在线学习

POLAR: Online Learning for LoRA Adapter Caching and Routing in Edge LLM Serving

AI 基础设施推理服务

摘要

大语言模型 (LLM) 的边缘部署越来越依赖于轻量级 LoRA 适配器库,但 GPU/DRAM 一次只能保留一小部分常驻子集。通过非驻留适配器提供请求服务需要从存储中分页其权重,从而产生可测量的延迟。这会产生两个时间尺度的在线控制问题:在慢时间尺度上,系统选择哪些适配器保留在快速内存中,而在快时间尺度上,它将每个请求路由到其上下文相关效用先验未知的适配器。这两个决策紧密耦合:缓存决定探索成本,路由器决定哪些适配器接收信息反馈。我们将这种联合缓存和路由问题表述为两个时间尺度的上下文强盗,并提出 POLAR(适配器路由的寻呼和在线学习)。 POLAR 将缓存感知型 LinUCB 路由器与基于纪元的缓存控制器配对。我们研究两种变体。固定纪元版本提供了稳健的基线,并在任意情况下提供了最坏情况的遗憾保证。倍数版本 POLAR+ 增加了强制探索和改进的缓存优化,以在随机规律性和可缓存性条件下实现 $\widetilde{\mathcal{O}}(d\sqrt{NT}+\sqrt{KT})$ 次线性后悔,其中 $N$ 是适配器计数,$K$ 是缓存大小,$d$ 是上下文维度,$T$ 是地平线。路由项将标准上下文强盗率与对数因子相匹配,表明内存层次结构并没有从根本上减慢路由学习速度。使用 Qwen2.5-7B 的 15 个真实 LoRA 适配器以及测量的 GPU 分页延迟进行的实验表明,自适应缓存控制的性能明显优于非自适应基线,并表现出与理论一致的扩展趋势。