论文
TPMM-DPO:用于迭代直接偏好优化的轨迹感知偏好引导模型合并
TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
摘要
直接偏好优化(DPO)由于其简单的训练过程和缺乏明确的奖励模型而被广泛应用于 大语言模型 对齐。然而,在迭代DPO中,当上一次迭代的策略模型被重复用作后续轮次的参考模型时,偏好数据中的噪声和参考模型中的误差会随着时间的推移而累积。这种积累可能会导致后期过度优化、性能波动和泛化能力下降。为了解决这些问题,我们提出了 TPMM-DPO,一种轨迹感知偏好引导模型合并方法。该方法将迭代 DPO 过程中生成的策略模型序列视为优化轨迹,并使用学习到的融合权重自适应地集成它们,从而构建更平滑、更鲁棒的参考模型。与仅依赖于单个先前模型的传统迭代 DPO 相比,TPMM-DPO 有效地减轻了噪声偏好引起的误差累积并提高了训练稳定性。实验结果表明,标准迭代DPO在训练中后期经常出现性能下降,而TPMM-DPO持续提高生成质量,并在域内和域外评估中获得更高的获胜率和奖励分数。进一步的消融研究和鲁棒性分析表明,与简单平均相比,可学习权重融合更有效地缓解了由噪声偏好引起的后期性能下降。