论文
抑制阿谀奉承会损害理性更新:反阿谀奉承应保留更新能力
Sycophancy Suppression Can Impair Rational Updating: Anti-Sycophancy Should Preserve the Ability to Update
摘要
大语言模型 经常表现出阿谀奉承的态度,在用户反对时修改他们的答案以与用户保持一致。然而,这种答案的翻转可能由不同的原因引起。一种可能性是模型只是与用户的反馈保持一致以满足他们的需求。另一个是反馈确实包含有用的证据,促使模型以理性的方式更新其答案。我们将它们区分为 Unsupported-Yielding 和 Rational-Updating。之前的工作主要集中在抑制 Unsupported-Yielding,而忽略了它对 Rational-Updating 的影响。我们通过两回合评估框架来解决这一差距,该框架分别衡量这两种行为。在代表性的训练时间和推理时间干预中,我们发现反阿谀奉承方法经常遇到一种权衡,即减少无支持收益会牺牲理性更新,反之亦然,即使两个目标共同优化。机制分析表明,这两种行为共享一个内部基础:MLP 神经元和驱动它们的注意力头基本上重叠,并且它们相关的转向方向呈正向对齐。我们进一步进行了初步的正交化转向探索,这产生了适度的、依赖于主干的选择性增益。总的来说,我们的结果表明,反阿谀奉承不应被视为一个简单的抑制问题,而应被视为一个选择性问题,有效的干预措施应保持理性更新,同时减少无支持的屈服。