论文

行为有效的 LoRA 写入稀疏且结构化

Behaviorally Effective LoRA Writes Are Sparse and Structured

模型评测模型行为与机制分析

摘要

低秩适应修复了更新的等级,但它无法识别经过训练的写入的哪些部分实际上携带行为。我们直接研究这个问题,并表明行为有效的 LoRA 写入是稀疏的、结构化的,并且比原始低秩参数化所暗示的更加集中。我们使用基于学习的 LoRA(基于学习的延续配方)来公开该结构。该配方预热无约束适配器,将其学习的写入列转换为模块级正交基础,冻结该基础,并在受约束参数化内继续训练。在从无约束形式到约束形式的 14 次精确转换中,转换步骤中保留的精度保持不变,并且重构的写入矩阵最多相差 0.25% 的相对 Frobenius 误差。然后,相同状态延续表明,相同的训练检查点在不同的写入子空间下以不同的方式发展,将写入几何建立为因果状态变量。无重新训练投影测试表明,有用的写入信号保留在学习的写入空间内,并且在很大程度上从随机或冻结激活 PCA 控制中消失。无论是在本地还是在全球范围内,集中模式都很明显。在 GSM8K、MathQA 和 AQuA 中,在我们测试的所有 12 个种子级案例中,每个模块的 top-k 延续在 {2, 4} 中的 k 处达到最佳值。更严格的全球排名测试表明,学习到的前 16 名和前 32 名子集优于匹配的随机子集,特别是在 GSM8K/Qwen 和 MathQA/Qwen 上。单向消融进一步揭示了一组稀疏的晚期 q_proj、o_proj 和 down_proj 组件,这些组件具有巨大的行为影响。