论文

RewardExplainer:从反事实偏好反馈中学习奖励模型解释

RewardExplainer: Learning Reward Model Explanations from Counterfactual Preference Feedback

模型训练奖励建模与过程监督

摘要

奖励模型(RM)是大语言模型训练后的关键组成部分,为后续的强化学习提供奖励信号。然而,传统的判别性 RM 通常仅输出标量分数,因此很难识别与其评分决策相关的响应行为。现有的解释方法通常依赖于预定义的高级属性,并且需要对每个响应对进行重复的反事实干预来验证候选解释,缺乏使用 RM 的反馈来训练可重用解释器的闭环机制。为了解决这个问题,我们提出了 RewardExplainer,一个通过反事实重写从目标奖励模型获取反馈的框架,并使用该反馈来进一步优化解释器。 RewardExplainer 生成开放式、原子性和可干预的自然语言评分机制,使解释更加具体、可读和可操作。它进一步将反事实反馈转化为偏好监督,使解释器能够比单遍生成更忠实地捕捉目标 RM 的评分偏好和敏感行为。跨多个目标 RM 和解释器主干的广泛实验显示出一致的改进。除了解释之外,我们还使用生成的机制来识别潜在的偏差模式,并构建有针对性的去偏差数据,以微调奖励模型,提高奖励作弊基准的鲁棒性。