论文
用推理时共识缓解LLM微调引发的隐藏行为
Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning
摘要
近期研究表明,即使只用少量被投毒的数据微调语言模型,也能植入有针对性的不良行为,而表面上无害的数据也可能传递可广泛泛化的隐藏偏好。数据过滤、混入无害数据与正则化等标准防御手段只能减弱这些影响,却无法消除它们。我们转而通过冗余性追求鲁棒性:从不同来源收集多个数据集,只学习它们之间的共同内容。这样,如果只有一部分来源是恶意的,不良行为就会被阻断。为实施这一防御策略,我们在每个来源的数据集上分别微调一个参考模型,并在解码时聚合它们的下一词元分布。我们提出两种共识解码器:逐词元最小值解码,把每个词元的概率上限设为任一来源所给出的最低概率;以及相对基础模型变体,当各来源对某个词元的移动方向相反时,将其回退到基础模型概率。我们进一步放宽精确一致的要求,以容忍跨来源的部分支持以及同一意图的不同表面表达。在受控投毒任务、阈下学习与涌现失调等实验中,共识解码在抑制来源特有不良行为的同时保留了共享的有益行为,包括并集训练与权重平均仍保留不良行为的情形。
