论文

情感语境放大了 LLM 响应中的阿谀奉承

Affective Context Amplifies Sycophancy in LLM Responses

模型评测模型行为与机制分析

摘要

作为对话伴侣,大语言模型 (LLM) 经常能够了解用户的情绪状态。我们研究这种情感背景如何在主观、评价性交互中调节 LLM 的阿谀奉承,在这种交互中,用户分享邀请反馈的行为或意见。借鉴奉承理论,我们将阿谀奉承衡量为模型的独立评估与其面向用户的响应之间的差异,这是通过呈现与第三方帐户或用户自己的披露相同的内容而引起的。在七个 LLM 和两个 Reddit 数据集(r/AmItheAsshole 和 r/TrueUnpopularOpinion)中,我们发现这种分歧是系统性的,并且是强烈单向的。面向用户的反应始终会软化或抑制负面或反对性的判断。情感环境进一步放大了这种与消极状态的差异,特别是孤独和痛苦,产生了最大的影响。这些发现表明,情感情境作为一种脆弱性信号,在用户最需要的时候抑制关键反馈,通常是通过回避的阿谀奉承,其中模型退回到不置可否的反应而不是完全同意。