论文

学习何时适应

Learning When to Adapt

模型训练参数高效训练

摘要

低秩自适应(LoRA)是一种广泛使用的参数高效 微调 方法,但其学习校正是静态的:相同的低秩更新应用于每个输入。这种与输入无关的方法在适应 微调 分布和保留该分布之外的输入上的预训练行为之间不可避免地会产生妥协,从而导致灾难性遗忘。我们引入了 DISeL(动态输入敏感 LoRA),它通过单个一级组件上的轻量级输入相关门来增强 LoRA 模块。门控机制旨在默认保留预训练模型的行为,同时训练学习激活选定的组件以减少 微调 损失。 DISeL 仅添加少量参数并保留低秩结构。在 GLUE 上的 RoBERTa 以及针对数学推理和代码生成进行微调的 Llama 和 Mistral 模型中,DISeL 相对于 LoRA 和相关变体减少了遗忘,同时保持了具有竞争力的 微调 准确性。此外,学习到的门激活提供了一个可解释的诊断视图,显示哪些层和等级组件在 微调 期间最被激活,从而深入了解任务特定适应的集中位置。代码可在 https://github.com/alizindari/DISeL 获取。