论文
正确,不要删除:通过纠正性监督缓解紧急偏差
Correct, Don't Delete: Mitigating Emergent Misalignment with Corrective Supervision
摘要
针对一组有限的有害示范(例如糟糕的医疗建议)微调语言模型,可能会使其在不相关的问题上出现广泛的错位,这种现象称为紧急错位(EM)。通常的防御措施是找到有问题的行并将其删除,但是行定位器未通过我们的测试,并且删除行的帮助低于预期。我们提出一个不同的问题:给定一组固定的中毒行,纠正它们比删除它们更好吗?我们对 Qwen2.5-14B-Instruct 进行微调,混合不良的医疗建议和良性的聊天数据,提前选择四分之一的有毒行,然后删除它们或用同一提示的正确答案替换它们,保持其他所有内容相同。替换行可以将 EM 率降低约三分之一,并改善对未解决的医疗问题的答案,而删除相同的行则几乎没有可测量的效果。当一半的毒物行被纠正时,优势更大,并且它适用于第二个基础模型和第二个未对准的模型生物。替换的内容似乎很重要:在保留错误建议的同时解释行并没有显示出明显的好处,并且随数据集分发的正确答案似乎与我们的重写器的效果一样好。已知通过进一步微调重新调整已经中毒的模型是有效的,但尚未直接比较哪些数据起作用。我们发现,短期的纠正训练胜过对通用聊天数据进行相同数量的训练,对其他医疗提示的纠正效果大致与对中毒提示本身的纠正效果相同,并且指示纠正编写者建模一个仔细的、避免伤害的助手,与普通的纠正相比没有增加任何可衡量的好处。在我们测试的设置中,纠正有害的训练数据比删除它更能减少 EM。