论文

PLC-DPO:噪声和模糊偏好优化中的后标签校正

PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization

模型训练偏好优化

摘要

直接偏好优化 (DPO) 通过成对比较简化了对齐,但假设所有观察到的偏好都是可靠的。真实数据常常违反这一假设,导致标签颠倒、薄弱或模糊,从而导致有害的策略更新。为了解决这个问题,我们提出后验标签校正 DPO (PLC-DPO),通过将每对的训练信号路由为干净、翻转或平局的情况来稳健地优化偏好。关键思想是使用校准后的政策参考幅度作为在线证据来采取适当的纠正行动。这将噪声偏好学习重新定义为主动纠正监督方向和强度,而不仅仅是过滤可疑示例。在 57 个数据集模型基准单元中,PLC-DPO 获得了相对于 DPO 的最佳平均胜率(次佳方法为 60.5 对比 55.5)。注入噪声和连接压力测试、人为分歧分析和自我确认诊断进一步表明,路由保持稳定,并将翻转与弱方向对区分开来。