论文
ReLoRA:知识重用适应,快速部署不断发展的 LLM 服务
ReLoRA: Knowledge-Reusing Adaptation for Fast Rollout of Evolving LLM Services
摘要
大语言模型 (LLM) 越来越多地部署为不断发展的服务,其中频繁的基础模型更新可能会使之前部署的特定于任务的低秩适应 (LoRA) 适配器失效。对于管理大量下游模型服务的服务提供商来说,为每个更新的基础模型从头开始重新训练每个 LoRA 适配器在计算上是令人望而却步的,并且会延迟服务部署。同时,更简单的替代方案,即简单地将原始 LoRA 适配器应用于更新的基础模型,通常会因适配器与主干网不兼容而导致服务质量下降。为了解决这个问题,我们提出了 ReLoRA,这是一种知识重用的重新适应框架,可以有效地恢复服务就绪的 LoRA 适配器,以发展 LLM 服务,同时保留或提高任务性能。具体来说,ReLoRA 包括两个关键优化步骤:1)自适应 LoRA 初始化利用贝叶斯优化,通过融合来自先前部署的任务适配器和基础模型演化的信息来构建兼容性感知起点; 2) 具有预定正则化的 微调 首先通过强正则化快速将适配器引导到高质量区域,然后通过宽松的正则化进行特定于任务的细化。这种设计能够快速恢复服务质量,并减少重新适应开销。大量实验表明,与基线相比,ReLoRA 将准备时间缩短了高达 8.9$\times$,并将准确性提高了高达 4.6\%。