论文
并非典型谄媚者:大语言模型中谄媚的难以捉摸本质
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
摘要
我们提出了一种以直接和中立的方式评估大语言模型的阿谀奉承的新方法,减轻各种形式的不受控制的偏见、噪音或操纵性语言,这些都故意注入到先前作品的提示中。我们方法的一个关键新颖之处是使用大语言模型作为法官,将阿谀奉承的评估作为赌注设置中的零和游戏。在这个框架下,阿谀奉承为一个人(用户)服务,同时明确地给另一个人带来成本。比较四个领先模型 - Gemini 2.5 Pro、ChatGpt 4o、Mistral-Large-Instruct-2411 和 Claude Sonnet 3.7 - 我们发现,虽然所有模型在常见环境中都表现出阿谀奉承的倾向,其中阿谀奉承对用户来说是自私的,不会给他人带来任何成本,但 Claude 和 Mistral 却表现出“道德悔恨”,并对他们的行为过度补偿。奉承,以免明确伤害第三方。此外,我们观察到所有模型都偏向于最后提出的答案。至关重要的是,我们发现这两种现象并不是独立的。阿谀奉承和新近度偏差相互作用产生“建设性干扰”效应,当用户最后提出意见时,同意用户的倾向会加剧。
