论文
了解奖励模型中的帮助和无害的紧张
Understanding helpfulness and harmless tension in reward models
摘要
奖励模型是人类反馈强化学习 (RLHF) 的关键组成部分,使语言模型朝着有益和无害的行为方向发展。然而,这些目标背后的内部机制及其冲突仍然知之甚少。我们研究了在仅有益、仅无害和混合目标设置下训练的奖励模型中的对齐张力。我们发现混合目标模型通常表现不如单目标模型,这表明目标之间存在干扰。使用基于激活的方法,我们识别与每个目标相关的神经元,并通过有针对性的消融研究它们的功能作用。我们发现这些神经元因果地支持其相应的目标,同时经常对相反的目标产生负面影响。我们发现,很大一部分神经元在有益和无害之间是共享的,并且这些共享的神经元对模型行为产生不成比例的影响,从而导致排列紧张。此外,我们的结果提供了关于如何在奖励模型中表示对齐目标以及为什么多目标对齐仍然具有挑战性的见解和机制解释,激励了未来关于解开和可控对齐方法的工作。