论文
尾部捷径:通过 微调 更新的事后频谱压缩进行去偏
Shortcuts in the Tail: Debiasing via Post-Hoc Spectral Compression of Fine-Tuning Updates
摘要
微调 经常会在任务知识的同时引入虚假相关性,从而导致代表性不足的群体出现系统性失败。现有的缓解措施需要重新训练、分组标签或策划的反事实数据。我们展示了一种简单的事后干预减少了捷径依赖,而没有任何这些:截断 $ΔW = W_\mathrm{ft} - W_\mathrm{base}$ 的 SVD 尾部减少了虚假组差距,同时保持了任务准确性。在三个指令调整模型 ($0.5$B--$7$B) 和四个分类基准中,top-$k$ 截断减少了每个单元上 $<2$ pp 精度损失的差距,在 CivilComments 上最多减少了 $5\times$。我们建议这样做是有效的,因为快捷响应位于 $ΔW$ 奇异排序的尾部,这是关于截断行为的声明,而不是关于原始奇异值,原始奇异值分布广泛,并且在所有四个数据集中看起来相同。在受控边界情况下,微调 只有一个学习捷径,显示了预测的 FT 到基数崩溃,而底部/随机 $k$ 和匹配秩 LoRA 控制排除了通用低秩近似和秩约束训练作为解释。我们将此视为初步证据,表明 $ΔW$ 的奇异基是研究 微调 所学知识的有用坐标系。