论文

交叉性谄媚:感知到的用户人口统计特征如何塑造大语言模型中的虚假认同

Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型表现出阿谀奉承的倾向——验证不正确的用户信念以显得令人愉快。我们调查这种行为是否随感知的用户人口统计数据而系统地变化,测试种族、年龄、性别和表达的置信水平的组合是否会产生不同的错误验证率。受交叉性法律概念的启发,我们使用 Anthropic 的 Petri 评估框架进行了 768 轮多回合对抗性对话,在数学、哲学和阴谋论领域的 128 个角色组合中探索了 GPT-5-nano 和 Claude Haiku 4.5。总体而言,GPT-5-nano 比 Claude Haiku 4.5 明显更加阿谀奉承($\bar{x}=2.96$ vs. $1.74$,$p < 10^{-32}$,Wilcoxon 符号排序)。对于 GPT-5-nano,我们发现哲学比数学更能引起 41% 的阿谀奉承,而且西班牙裔人物在不同种族中受到的阿谀奉承最高。得分最差的角色是一位自信的 23 岁西班牙裔女性,在阿谀奉承方面的平均得分为 5.33/10。克劳德俳句 4.5 表现出一致的低阿谀奉承,没有显着的人口统计差异。这些结果表明,阿谀奉承在用户之间分布并不均匀,安全评估应纳入身份感知测试。

交叉性谄媚:感知到的用户人口统计特征如何塑造大语言模型中的虚假认同
图 1:概述:我们通过 Anthropic 的 Petri 工具使用多轮对抗性对话来测试 LLM 的阿谀奉承是否会因感知的用户人口统计数据而变化。审核员模型扮演具有错误信念的用户角色;目标模型做出响应;法官模型对结果进行评分。该图显示了我们实验中的代表性失败进展(GPT-5-nano,哲学领域,阿谀奉承分数:8/10,分数越高则越阿谀奉承)。目标模型从原则上的分歧降级为对其先前认为错误的主张进行无保留的认可。完整记录见附录 D。