论文

根据噪声偏好进行 LLM 奖励建模的最优传输

Optimal Transport for LLM Reward Modeling from Noisy Preference

模型训练奖励建模与过程监督

摘要

奖励模型是人类反馈强化学习 (RLHF) 的基础,但现实世界的数据集不可避免地会受到噪声偏好的破坏。传统的训练目标往往会过度拟合这些误差,而现有的去噪方法通常依赖于同质噪声假设,而无法捕捉语言偏好的复杂性。为了应对这些挑战,我们提出了 SelectiveRM,一个基于最佳传输的框架。我们首先设计一种联合一致性差异,以使模型预测的分布与偏好数据保持一致。此外,为了解决严格质量守恒的限制,迫使模型适应异常值,我们通过部分传输结合了质量弛豫机制。这使得能够自主排除具有与语义一致性相矛盾的噪声偏好的样本。从理论上讲,我们证明 SelectiveRM 对未观察到的清洁风险优化了更严格的上限。大量的实验验证了我们的方法在不同的基准测试中显着优于最先进的基线。