论文

标准LoRA适配器间共享前缀KV:质量与服务成本权衡

Shared-Prefix KV Reuse Across Standard LoRA Adapters: Quality and Serving Tradeoffs

模型推理KV Cache

摘要

一种常见小模型部署让同一骨干的多个LoRA专家处理相同上下文,朴素服务会为每个专家重复预填充。我们研究实际而有限的问题:对已训练的标准LoRA,而非专为缓存兼容重训的适配器,若只计算一次骨干预填充KV并跨专家复用,可保留多少任务质量、节省多少服务成本?在Qwen3-1.7B及两个适配器——HotpotQA抽取问答、GSM8K算术推理——上,我们扫描专家从复用基础缓存接管的边界,测量配对质量差和成本。完整前缀复用预填充成本最低,在留出GSM8K上质量差较小:160token预算下精确匹配差为−4.6,320token下−3.0,第二训练种子下−0.8;均有利于原生执行,但仅第一项区间排除零,幅度不一致。部分重算未显示优势,既未确立质量等价,也未形成通用边界选择规则。闭式岭回归KV转换器未优于直接复用,专家依赖性对照区间均包含零。实测服务收益是热缓存首token时间,随上下文增长,在8K约为16倍;双分支峰值内存只低12%,检查发现前缀从未物理共享,实现复用KV值却复制存储,因此未取得共享缓存内存节省。