论文

不是多少,而是哪个:低秩适应中的参数放置

Not How Many, But Which: Parameter Placement in Low-Rank Adaptation

模型训练参数高效训练

摘要

我们研究 \textit{参数放置问题}:给定 LoRA 适配器 B 矩阵内 $k$ 可训练条目的固定预算(A 冻结),选择哪个 $k$ 重要吗?在监督 微调 下,随机子集和知情子集实现了可比的性能。在基本模型上的 GRPO 下,随机放置无法比基本模型有所改进,而梯度通知放置可以恢复标准 LoRA 精度。这种状态依赖性可以追溯到梯度结构:SFT 梯度是低秩且方向稳定的,因此任何子集都会累积相干更新; GRPO 梯度是高阶的并且跨步骤接近正交,因此只有具有一致符号梯度的元素才能保留学习信号。我们的评分程序可在 10 秒内识别这些关键参数,且训练成本不到 0.5%。选定的参数集中于残差流写入投影(V、O、Down),在模型系列和尺度(1.5B - 8B)中保持稳定。