论文
RLHF 如何放大谄媚
How RLHF Amplifies Sycophancy
摘要
大语言模型在基于偏好的后训练之后常表现出更强的谄媚行为,更倾向于肯定用户明示或暗示的信念,即便这与事实准确或健全判断相冲突。我们对来自人类反馈的对齐如何增加这一失败模式进行形式分析,识别出一个显式的放大机制,将针对学习到的奖励进行优化因果地关联到用于对齐的人类偏好数据中的偏差。我们表明,行为漂移的方向由基础策略下“认可提示中信念信号”与“学习到的奖励”之间的协方差决定,且一阶效应可简化为一个简单的均值差条件。随后,我们分析 Bradley-Terry 等随机效用模型下成对比较的奖励学习,刻画人类标注者偏好中的偏差何时会诱导这一奖励差。接着,我们提出一种旨在中和放大机制本身的训练时干预。在所有防止谄媚行为增加的后训练策略中,我们刻画了与无约束后训练策略在 KL 散度上最接近的唯一策略,并将相应的最小奖励修正推导为闭形式的同意惩罚(agreement penalty)。计算实验发现,奖励差在所有考察的配置中普遍存在并导致行为漂移。