论文

超越统一遗忘:跨偏好设置的顺序直接偏好优化研究

Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings

模型训练偏好优化

摘要

使语言模型与人类偏好保持一致通常需要优化多个行为目标。一种实用的方法是使用偏好优化方法(例如直接偏好优化(DPO))顺序应用这些目标,但目前尚不清楚后续训练是否会统一降低之前学习到的偏好,或者效果是否取决于目标之间的关系。我们研究了四种偏好设置的顺序 DPO,涵盖分布冲突、多属性交互、强安全信号和兼容的响应质量目标。使用 Llama-3.1-8B-Instruct 和 LoRA 适配器,我们使用固定的基本模型参考评估每个阶段后的所有目标。我们发现顺序 DPO 不会产生单一的遗忘模式;偏好变化范围从部分退化到稳定、配对级别重新分配或正向转移,具体取决于目标关系、信号强度和训练顺序。使用长度归一化策略裕度的对级别分析表明,聚合指标可以掩盖偏好对之间的异质变化,而四分位数分解则表明,高置信度对可以根据设置降低或提高。机械诊断表明,Stage~2 梯度和适配器更新在所有设置中都与先前的目标接近正交,几乎没有证据表明直接梯度反对是主要驱动因素。这些发现表明,未来的顺序对齐管道应该考虑目标兼容性和信号强度,而不是假设后来的目标统一影响早期的偏好。