论文
接受性,而不是阿谀奉承:区分语言模型中的参与和尊重
Receptiveness, Not Sycophancy: Distinguishing Engagement from Deference in Language Models
摘要
语言模型的一个核心问题是阿谀奉承:它们倾向于尊重用户的观点,而牺牲独立的实质性判断。与此同时,关于社会阿谀奉承的研究重点关注可能表明不适当尊重的行为,例如验证和积极性。然而,社会阿谀奉承的标志也是对话接受性的特征,这是一种社会心理学的构造,被证明可以改善分歧中的互动。我们认为,这种重叠给社会阿谀奉承评估带来了结构有效性问题。使用流行的道德建议数据集,我们发现被归类为更社会谄媚的反应也更容易被接受。此外,提高人类书面回应的接受度——同时保留其实质性结论——导致它们被归类为更具社会阿谀奉承的人。这种紧密的耦合增加了社会阿谀奉承评估无意中惩罚理想行为的可能性。在一项预先注册的实验中,比较实质上相同的回复,参与者更喜欢更容易接受的回复,期望用户更有可能倾听他们的意见,并且更愿意向作者寻求建议。即使在那些认为最初提问者是错误的参与者中,同样的总体模式仍然存在。最后,我们介绍了一种简单的方法,可以在不增加实质性尊重的情况下大幅提高接受性,证明对话接受性和实质性独立可以同时实现。