论文
LoRA 适配器的特征几何:微调语言模型中表征分歧的稀疏自动编码器分析
Feature Geometry of LoRA Adapters: A Sparse Autoencoder Analysis of Representational Divergence in Fine-Tuned Language Models
摘要
低秩适应(LoRA)已成为一种广泛采用的适应 大语言模型 的方法,但 LoRA 微调 引起的内部表征变化仍然没有得到充分理解。在这项工作中,我们使用稀疏自动编码器 (SAE) 研究 LoRA 引发的表示的几何形状。我们引入了一个增量激活框架,该框架隔离了适配器特定对残余流的贡献。使用具有 LoRA 等级 4、8、16 和 32 的 Gemma-2-9B,我们跨多个 Transformer 层训练特定于适配器的 SAE,并将其学习的特征空间与预训练的 SAE 字典进行比较。我们使用解码器方向之间的余弦相似性、特征子空间的主角分析以及激活表示之间的中心核对齐(CKA)来评估表示对齐。在各个层和级别中,我们一致观察到 LoRA 诱导的特征字典和预训练的 SAE 特征之间的几何对齐相对较弱。特定于适配器的 SAE 还比预训练的 SAE 更有效地重建增量激活,这表明 LoRA 更新占据了残余流中部分不同的表示结构。此外,特征密度随着等级和深度的增加而增加,而几何散度在不同等级之间保持相对稳定。这些发现提供了经验证据,表明 LoRA 微调 可以诱导预训练可解释性词典未完全捕获的特征结构,这对微调语言模型的机械可解释性、适应性分析和安全审核具有影响。