论文
Aletheia:跨架构高效 LoRA 微调 的梯度引导层选择
Aletheia: Gradient-Guided Layer Selection for Efficient LoRA Fine-Tuning Across Architectures
摘要
低秩适应 (LoRA) 已成为 大语言模型 的主要参数高效 微调 方法,但标准实践将 LoRA 适配器统一应用于所有 Transformer 层,无论其与下游任务的相关性如何。我们引入了 Aletheia,一种梯度引导层选择方法,它通过轻量级梯度探针识别与任务最相关的层,并将 LoRA 适配器仅应用于那些具有不对称秩分配的层。在涵盖 8 个架构系列的 14 个成功模型(0.5B-72B 参数,包括密集和专家混合架构)的 81 个实验行中,加上实验阶段2 中记录的另一次失败的 Pythia/GPT-NeoX 尝试,Aletheia 实现了 15-28% 的训练加速(平均 23.1%,p < 0.001),并且评估的额外遗忘有限,下游行为广泛匹配MMLU、GSM8K 和 HumanEval 基准测试包。在测试的系列和规模中,实验阶段1 显示了每个模型 100% 的速度获胜率,实验阶段2 显示了在有限退化框架内广泛保留的下游行为。这些结果共同支持了一个实用的模型经济学主张:智能层选择可以使 LoRA 微调 实质上更加高效,而不会给评估集带来重大的下游损害。