论文
从嘈杂的偏好中学习:一种直接偏好优化的半监督学习方法
Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization
摘要
人类的视觉偏好本质上是多维的,包括美学、细节保真度和语义对齐。然而,现有的数据集仅提供单一的整体注释,导致严重的标签噪声:在某些维度上表现出色但在其他维度上存在缺陷的图像被简单地标记为赢家或输家。我们从理论上证明,将多维偏好压缩为二进制标签会产生冲突的梯度信号,从而误导扩散直接偏好优化(DPO)。为了解决这个问题,我们提出了 Semi-DPO,这是一种半监督方法,它将一致的对视为干净的标记数据,将冲突的对视为有噪声的未标记数据。我们的方法首先对经过共识过滤的干净子集进行训练,然后使用该模型作为隐式分类器为噪声集生成伪标签以进行迭代细化。实验结果表明,Semi-DPO 实现了最先进的性能,并显着提高了与复杂人类偏好的一致性,并且在训练期间不需要额外的人工注释或显式奖励模型。我们将在以下位置发布我们的代码和模型:https://github.com/L-CodingSpace/semi-dpo