论文
仅学习有效适配器可以表达的内容:针对 微调 中毒的子空间约束适应
Learning Only What Valid Adapters Can Express: Subspace-Constrained Adaptation Against Fine-Tuning Poisoning
摘要
参数高效的 微调 仍然留下了广阔的行为改变更新空间,因此可以表示和优化有毒的目标。我们研究了一种替代方案:将适应限制在从现有任务适配器的可信池估计的子空间内。在具有 196 个公共 LoRA 适配器的 flan-t5-large 上,我们表明:(1) 适配器的功能相关内容位于低维共享子空间中,在评估的任务分布下,其权重范数的 30% 到 38% 是冗余的; (2) 梯度适应限制在该子空间上的 128 个坐标,在干净的分类数据上与 LoRA 微调 完全匹配,而在目标标签反转下,LoRA 的精确匹配率下降到 3-26%,受限学习器在池覆盖的任务上保持 62-96%; (3)受限学习器无法拟合损坏的数据,其适应损失将干净数据与垃圾数据分开两个数量级(120x),这是一个没有额外检测器的分布外信号; (4) 针对在子空间内进行优化的自适应后门攻击者,在其目标行为与池中的任何内容不同的任务上,攻击会被阻止(成功率为 8%,而 LoRA 的成功率为 100%),而当目标与常见的池行为一致时,仅部分阻止(85%)。在这两项任务上,结果与目标与池方向的接近程度一致,这表明但没有建立池相对边界。该机制以峰值可塑性换取这些属性:在任务池覆盖较差的任务上,不受约束的 微调 获胜,并且保护假设池本身是可信的。代码和数据是公开的。