论文
大语言模型 与噪声偏好的无偏对齐
Unbiased Alignment for Large Language Models with Noisy Preferences
摘要
大语言模型 与人类偏好的一致性通常是通过人类反馈的强化学习或直接偏好优化来实现的。然而,这些方法很容易受到现实世界偏好数据集中普遍存在的显着噪声的影响。为了解决这个关键问题,我们提出了一个无偏对齐的理论框架,引入了无偏奖励模型(URM)损失和无偏直接偏好优化(UDPO)损失。通过在数学上纠正偏好噪声引起的失真,我们的新颖目标可以直接从噪声数据集中实现无偏差的 模型训练,而不需要干净的 真值 监督。我们提供严格的理论分析,证明我们的方法具有噪声耐受性、参数向下兼容和分类校准的能力。跨不同数据集的综合实验表明,我们的方法优于最先进的基线。代码位于:https://github.com/cswjl/unbiased-alignment。