论文

通过因果推理时间干预消除奖励模型的偏差

Debiasing Reward Models via Causally Motivated Inference-Time Intervention

模型训练奖励建模与过程监督

摘要

奖励模型 (RM) 在使 大语言模型 (LLM) 与人类偏好保持一致方面发挥着核心作用。然而,RM 通常对响应长度等虚假特征敏感。用于减轻这些偏差的现有推理时间方法通常只关注响应长度,从而导致性能权衡。在本文中,我们提出了因果动机干预,以减轻 RM 在推理时的多种类型的偏差。我们的方法首先识别其激活与预定义偏差属性强相关的神经元,并应用神经元级干预来抑制这些信号。我们在 RM 基准上评估我们的方法,并观察到不同偏差类型对虚假特征的敏感性降低,而不会导致性能权衡。此外,当用于偏好注释时,使用我们的方法编辑 RM 中不到 2% 的所有神经元的小型 RM(2B 和 7B),使 LLM 能够改善对齐,在 AlpacaEval 和 MT-Bench 上实现与最先进的 70B RM 相当的性能。进一步的分析表明,偏差信号主要由早期层的神经元编码,这揭示了 RM 中偏差利用的内部机制。