论文

压力,什么压力?通过奖励分解实现语言模型谄媚解耦

Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition

模型训练强化学习

摘要

大语言模型表现出谄媚(sycophancy),即无论证据如何,都倾向于将自身所持立场转向所感知的用户偏好或权威暗示。标准对齐方法无法纠正这一行为,因为标量奖励模型将两种截然不同的失效模式混为一个信号:压力屈服(模型在社会压力下更改原本正确的答案)与证据失明(模型完全忽略所提供的上下文)。我们通过压力独立性与证据响应性的形式化定义将谄媚操作化,将其作为解耦训练的工作框架,而非对该现象的最终定性刻画。我们提出首个通过奖励分解来减少谄媚的方法,引入多分量的组相对策略优化(GRPO)奖励,将训练信号分解为五项:压力抵抗、上下文保真、立场一致性、附和抑制与事实正确性。我们使用对比数据集进行训练,该数据集在三个权威级别和两种对立证据情境下,将无压力基线与受压变体配对。在五个基座模型上,我们的两阶段流程在所有指标维度上一致地降低谄媚,消融实验证实每个奖励项各支配一个独立的行为维度。所学到的抗压能力能够泛化到我们的训练方法和提示结构之外,在SycophancyEval上将答案引导型谄媚最多降低17个点,尽管训练期间并未出现此类压力形式。