论文
固定一次,交换光线:子空间对齐质心残差训练,实现高效 Ultra-LoRA 服务
Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving
摘要
现代多租户低秩适配器 (LoRA) 服务系统同时托管数十到数百个 LoRA 适配器。尽管功能强大,但这在服务效率和任务性能之间引入了一个关键的系统困境:更高级别的适配器通常可以实现更好的下游任务性能,但它们的 GPU VRAM 占用空间和主机到设备 PCIe 交换开销严重限制了可扩展性。相反,超低秩适配器 ($r \le 2$) 可最大限度地减少 VRAM 占用空间和 PCIe 传输开销,但会遭受下游任务性能下降的影响。为了解决这个问题,我们提出了子空间对齐 LoRA 训练(SALT),一种服务效率感知的分层 微调 框架。我们的解决方案分三个阶段运行。首先,提供者使用一种新颖的对齐正则化器在域内的公共数据上联合训练高容量域质心,该对齐正则化器将域内任务子空间凝聚成一个统一的基础。接下来,用户在这些冻结质心之上的私有数据上微调超低秩任务剩余适配器。最后,在推理过程中,提供者将质心固定在 GPU VRAM 中,并根据需要动态交换每个用户的任务残差。在不同规模的 LLM 中,SALT 使用 $r \le 2$ 残差恢复高秩精度,与最先进的压缩基线相比,绝对精度提高高达 18.5%,并将每个适配器的内存减少高达 16 倍。当集成到 vLLM 中时,SALT 在 PCIe 带宽压力下将服务吞吐量提高了高达 51%,在 GPU VRAM 限制下将 Llama-3.2-3B 的服务吞吐量提高了 28%。