论文
子空间投影上的可解释性引导层选择:SAE 作为听诊器,而不是手术刀,用于原始任务向量模型编辑
Interpretability-Guided Layer Selection over Subspace Projection: SAEs as Stethoscopes, Not Scalpels, for Raw Task Vector Model Editing
摘要
LLM 越来越需要手术模型编辑来增强特定领域的功能,而不会产生与完整 微调 相关的计算成本或灾难性遗忘。稀疏自动编码器(SAE)已成为这种情况下一种很有前景的工具,原则上允许在特征级上识别干预位置。在这项工作中,我们严格评估了 Gemma-3-4B-IT 上用于数学推理的 SAE 引导编辑管道,并揭示了一种基本的失败模式:将任务向量投影到 SAE 特征子空间的直观吸引人的方法充当了信息瓶颈,丢弃了大约 97% 的修改能量,在七个数学科目中没有产生统计上显着的改进。我们表明,这种失败源于激活空间 SAE 方向和权重空间任务向量之间的几何失准。然后,我们提出视角的转变:SAE 作为听诊器,而不是手术刀,其中 SAE 用于分层诊断而不是干预级过滤。通过将未过滤的原始任务向量仅注入到由 SAE 衍生的特异性得分识别的层中,我们将 Minerva Math 基准上的数论准确度从 29.6% 提高到 39.4%(z=+3.41,p=0.0007); 7 门数学科目中有 5 门显着提高,没有一门显着下降。我们的方法是完全确定性的,不需要额外的推理成本,并为可解释性引导的模型编辑提供了原则框架。