论文
抑制压力,放大证据:自我引导注意力转向,以减轻阿谀奉承和固执
Suppressing Pressure, Amplifying Evidence: Self-Guided Attention Steering to Mitigate Sycophancy and Stubbornness
摘要
可靠的语言模型应该能够抵抗不受支持的用户压力,同时有效地使用客观的上下文信息。然而,模型可能会屈服于不受支持的用户压力,或者在相关上下文信息需要修改时未能更新其答案,从而表现出顽固的上下文态度。单独评估对这些故障的干预措施可能会掩盖减轻一种故障是否会加剧另一种故障。为了评估这种权衡,我们引入了 CoPE-Bench,每个问题有六个条件:中立基线、正确或不正确的用户压力、与中立答案一致或冲突的上下文信息,以及将不正确的主张与冲突的上下文信息相结合的联合条件。为了调节用户压力和上下文信息的影响,我们提出了 SPAE(抑制压力,放大证据),这是一个无需训练框架,它使用模型自己的判断来识别相关的token,通过token级别的注意力转向来抑制用户压力并放大上下文信息。与主要比较中最强的基线相比,在五个骨干模型中,SPAE 平均减少了 18.8 个百分点的压力,并将关节条件更新增加了 5.5 个百分点。在两回合对话中,它比最强提示基线平均提高了联合条件更新 13.2 个百分点。源数据和代码可以在https://github.com/03Grant/sycophancy-and-stubbornness.找到