论文

LoRA-Diffusion:通过低秩轨迹分解实现参数高效的 微调

LoRA-Diffusion: Parameter-Efficient Fine-Tuning via Low-Rank Trajectory Decomposition

模型训练参数高效训练

摘要

LoRA 等参数高效的 微调 方法已经改变了大型自回归语言模型的适应方式,从而可以使用更少的可训练参数实现特定于任务的定制。然而,这些方法尚未成功扩展到基于扩散的语言模型,该模型通过迭代去噪而不是顺序标记预测来生成文本。我们提出了 LoRA-Diffusion,这是一种参数高效的 微调 方法,它将低秩分解应用于去噪轨迹而不是模型权重。与基于权重的 LoRA(修改各个变换矩阵)不同,我们的方法学习从噪声到输出的整个扩散路径的低秩扰动。我们引入了轨迹级低秩适配器,可以修改每个去噪步骤,跨扩散阶段的步骤自适应等级分配,以及组合多任务学习,允许在推理时合并特定于任务的模块而无需重新训练。在 SST-2、QNLI 和 MRPC 上,我们报告了五个随机种子的 词元级 去噪验证准确性。 LoRA-Diffusion 在 SST-2 上实现了最高的平均性能,在 QNLI 和 MRPC 上实现了强劲的性能。联合多任务训练进一步表明,LoRA-Diffusion 在评估的方法中实现了最高的 词元级 准确度。与完整的 微调 相比,该方法减少了每个任务的存储空间,并为扩散语言模型建立了参数高效的 微调 框架。