论文

FIM-LoRA:通过校准时间梯度方差估计为 LoRA 进行任务信息排名分配

FIM-LoRA: Task-Informative Rank Allocation for LoRA via Calibration-Time Gradient-Variance Estimation

模型训练参数高效训练

摘要

低秩适应(LoRA)为每个适应的权重矩阵分配一个统一的排名 - 这是一种实用的便利,但却忽略了一个基本现实:不同层对任务适应的贡献不同。我们通过轻量级工程解决方案解决了这个问题:在 微调 开始之前,运行八次校准向后传递,计算每个 LoRA-B 矩阵的梯度方差作为层信息性的代理,并按比例重新分配排名预算。由此产生的适配器是一个标准 LoRA,具有每层排名模式 - 没有新参数,没有训练开销,没有对服务基础设施进行更改。我们通过经验 Fisher 信息矩阵 (eFIM) 对角线的有效近似来实现这一点,仅限于 LoRA 适配器矩阵,与全模型 Fisher 估计相比,这将内存成本降低了约 256 倍。在使用 DeBERTa-v3-base 的 GLUE 上,FIM-LoRA 在相同的参数预算下与 LoRA 匹配(88.6 比 88.7),并且使用 LLaMA-3-8B 进行常识推理,达到 68.5 比 LoRA 68.7。每层排名图是可解释的:价值预测和早期到中间的层始终获得更高的排名,这与 Transformer 层角色的既定发现一致。