论文
GRASP:识别并抑制微调中新学到的伪相关
Unsupervised Identification and Removal of Spurious Correlations During Fine-Tuning
摘要
微调 在筛选后的数据集上预训练的语言模型可能会在 微调 任务和数据筛选过程与任务纠缠在一起的意外潜在因素(例如角色不一致或政治倾向)之间产生虚假相关性。该模型可以锁定这些虚假相关性,从而导致偏差并减少分布外泛化。我们证明,在对任务复杂性和虚假相关性的合理假设下,可以在没有监督的情况下从朴素的 LoRA 微调的权重中识别出此类潜在因素。现有的消除偏差的方法(例如激活引导)可以在推理或训练期间从残差流激活中删除已识别的因素。然而,我们认为目标应该是消除虚假相关性,而不是潜在因素本身,因为预训练模型可能依赖它来获取真实的任务信号。为了实现这一点,我们提出了 GRASP(关联杂散模式的梯度投影),它可以防止模型获得对已识别的潜在因素的新依赖,同时保留任何预训练的内容。我们对三个 微调 任务进行验证。前两个涉及涌现失对齐,其中 微调 执行一项狭窄的任务(在我们的例子中,编写不安全的代码并提供糟糕的医疗建议)导致对不相关主题的失对齐回答。在这里,我们的方法完全消除了不安全代码情况下的失对齐,并在不良医疗建议情况下将失对齐减少了约 5 倍,在失对齐减少和任务保留之间的权衡中击败了所有基线。最后一个是一个新颖的政治偏见实验,其中 微调 右偏 Reddit 金融建议数据会导致不相关主题的政治倾向漂移。在这里,我们的方法将漂移减少了一半以上,同时提高了财务任务绩效,超越了所有基线。