论文

噪声偏好标签下的无元数据元重新加权直接偏好优化

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels

模型训练偏好优化

摘要

直接偏好优化 (DPO) 已成为使 大语言模型 (LLM) 与人类偏好保持一致的重要方法,因为它消除了显式奖励建模和强化学习的需要。然而,其性能在很大程度上取决于偏好数据的质量,而现实环境中的噪声偏好数据会削弱对齐性能。为了解决这个问题,我们提出了一个双层优化框架,并证明在一些理想条件下,该框架可以在干净数据下恢复DPO最优。我们进一步推导了标签翻转噪声下可学习权重函数的先验形式。考虑到高质量的元数据可能难以获得,我们提出了一种即时增强一致性方法,即使在元数据完全不可用的情况下也可以进行元学习。为了降低 LLM 元学习中高阶梯度的高成本,我们将中心差近似与 LoRA 微调 相结合,并开发了一种可扩展的训练方案。 TL;DR摘要和人择有益无害对话的实验表明,该方法提高了不同噪声率下多个DPO基线的对齐性能。