论文
SWAY:一种衡量和减轻阿谀奉承的反事实计算语言方法
SWAY: A Counterfactual Computational Linguistic Approach to Measuring and Mitigating Sycophancy
摘要
大语言模型 表现出阿谀奉承:倾向于将输出转向用户表达的立场,无论正确性或一致性如何。虽然之前的工作已经研究了这个问题及其影响,但需要严格的计算语言指标来识别模型何时被阿谀奉承。在这里,我们介绍 SWAY,一种无监督的阿谀奉承计算语言测量方法。我们开发了一种反事实提示机制,以识别模型的一致性在正向和负向语言压力下的变化程度,从而将框架效应与内容隔离开来。将此指标应用于基准 6 个模型,我们发现阿谀奉承随着认知承诺的增加而增加。利用我们的指标,我们引入了反事实缓解策略教学模型,以考虑如果提出相反的假设,答案会是什么。虽然指示明确反阿谀奉承的基准缓解措施会产生适度的减少,并且可能适得其反,但我们的反事实 CoT 缓解措施将模型、承诺级别和条款类型的阿谀奉承行为推向接近于零,同时不抑制对真实证据的响应。总体而言,我们提供了一个衡量阿谀奉承基准的指标以及由此得出的缓解措施。