论文
可推广低秩适应的策略超参数化
Strategic Over-Parameterization for Generalizable Low-Rank Adaptation
摘要
由于其计算和内存需求,通过完整的 微调 将 大语言模型 (LLM) 适应下游任务变得越来越不切实际。参数高效的 微调 (PEFT) 方法(例如低秩适应 (LoRA))通过将更新限制在一组紧凑的可训练参数来缓解这一问题,但这种激进的减少通常会牺牲泛化性,尤其是在跨异构任务和域的传输下。我们重新审视参数效率和适应能力之间的紧张关系,并询问两者是否真的存在矛盾。我们通过引入 LoRA-Over 来给出否定的答案,LoRA-Over 是一个基于简单原则的框架:在训练期间丰富优化环境,然后在推理时瓦解丰富的内容。 LoRA-Over 在训练期间将辅助参数注入低秩适配器中,以拓宽有效假设空间,并通过基于分解的重构将它们折叠回标准低秩结构,重构误差可忽略不计,保持推理成本与普通 LoRA 相同。由于并非所有权重矩阵都从增加的容量中平等受益,因此我们进一步提出了两种调度策略,一种是静态预定义的,另一种是在运行时动态确定的,可在最需要的地方引导额外的容量。我们使用 LLaMA 2-7B 和 LLaMA 3.1-8B 在语言理解(GLUE、T5-Base)、对话(MT-Bench)、算术推理(GSM8K)和代码生成(HumanEval)方面评估 LoRA-Over。在所有基准和规模上,LoRA-Over 始终优于普通 LoRA,这表明设计用于推理时消失的原则性超参数化是提高 PEFT 泛化性的有效杠杆。代码将在接受后发布。