论文

LSC-DPO:控制学习信号的直接偏好优化

LSC-DPO: Learning-Signal-Controlled Direct Preference Optimization

模型训练偏好优化

摘要

直接偏好优化(DPO)已成为一种标准的无奖励模型方法,用于将语言模型与偏好数据保持一致。然而,随着训练期间缩放偏好边际的增长,逻辑 DPO 损失对进一步的变化变得越来越不敏感。我们从损失级几何角度研究 DPO,并将 sigmoid 因子识别为表征目标局部敏感性的学习信号。基于这一观点,我们提出了学习信号控制直接偏好优化(LSC-DPO),它动态调节目标状态附近的学习信号。对数空间分析为稳定跟踪目标学习信号机制建立了条件。 AlpacaEval 2、MT-Bench 和 Anthropic-HH 上的实验表明,LSC-DPO 始终优于 DPO 和强偏好优化基线。我们进一步发现,不同的系数初始化会导致不同的瞬态学习信号轨迹,即使它们后来的信号水平变得相似。基于这一观察,我们推导出信号预算补偿规则,该规则调整目标学习信号以补偿这些瞬态差异。由此产生的补偿大大减少了系数初始化过程中的性能变化。