论文
Pander Score:作为认识论遵从的谄媚的连续度量
Pander Score: A Continuous Measure of Sycophancy as Epistemic Deference
摘要
当前的人工智能模型经常表现出认知上的阿谀奉承,支持同意用户的主张。现有的评估通常通过评估模型转变二元认可所需的条件或通过在命题中引出明确的概率来衡量这一点。然而,许多面向用户的阿谀奉承行为是通过普通语言表达的分级支持的变化来证明的。我们提出 Pander 分数:一个连续分数,表示模型输出中表达的支持对用户提示中表达的态度的敏感程度。为了生成 Pander 分数,我们提供了一种新的协议,用于估计自然语言输出的概率,使用经过验证的大语言模型作为法官,以确保与人类判断的一致性和相关性。我们将其部署在一个新的精选数据集上,该数据集包含 349 个不同主题的命题和超过 11,000 个不同用户态度的提示,测试了 18 个模型。模型的迎合程度截然不同。目前的旗舰机型中,Z.ai的GLM-5.2最讨人喜欢,Claude Fable 5最不讨好,其他机型介于两者之间。当我们根据教学提示而不是对话提示进行测试时,每个模型都变得更有可能同意他们在对话中反驳的主张。我们发布了 Pander Score 作为一个易于更新的基准和测量管道,用于输出级别的阿谀奉承评估。