论文

TLoRA:大语言模型 的任务感知低秩适应

TLoRA: Task-aware Low Rank Adaptation of Large Language Models

模型训练参数高效训练

摘要

低秩适应(LoRA)已成为大语言模型广泛采用的参数高效的微调方法,其有效性很大程度上受到秩和缩放因子的分配以及初始化的影响。现有的 LoRA 变体通常仅解决这些因素之一,通常以增加训练复杂性或降低实际效率为代价。在这项工作中,我们提出了任务感知低秩适应(TLoRA),这是一个统一的框架,可以在训练开始时联合优化初始化和资源分配。 TLoRA 引入了一种数据驱动的初始化策略,通过对预训练权重和输入激活协方差的乘积执行奇异值分解,将 LoRA $A$ 矩阵与任务相关子空间对齐。此后,$A$ 矩阵被冻结,仅训练 $B$ 矩阵。此外,TLoRA 采用基于敏感性的重要性度量,在固定参数预算下自适应地跨层分配秩和缩放因子。我们进行了大量的实验,证明 TLoRA 在各种任务中始终表现出色,包括自然语言理解、常识推理、数学推理、代码生成和聊天生成,同时显着减少可训练参数的数量。