论文
ImplicitRM:根据 LLM 对齐的隐式偏好数据进行无偏奖励建模
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
摘要
奖励建模是根据人类反馈(RLHF)进行强化学习以调整语言模型的长期挑战。当前的奖励模型在很大程度上取决于收集成本较高的实验反馈数据。在这项工作中,我们研究 \textit{隐式奖励建模}——从隐式人类反馈(例如点击和复制)中学习奖励模型——作为一种经济高效的替代方案。我们发现隐性奖励建模面临两个基本挑战:(1)隐性偏好数据缺乏明确的负样本,这使得标准的正负分类方法不适用; (2)隐性偏好数据存在用户偏好偏差,不同的响应有不同的引发用户反馈行为的倾向,这加剧了区分明确负样本的难度。为了应对这些挑战,我们提出了 ImplicitRM,旨在从隐式偏好数据中学习无偏奖励模型。 ImplicitRM 通过分层模型将训练样本分层为四个潜在组。在此基础上,它通过似然最大化得出学习目标,我们证明这在理论上是无偏见的,有效解决了这两个挑战。实验表明,ImplicitRM 可以跨隐式偏好数据集学习准确的奖励模型。代码可在我们的项目网站上找到。