论文
群体联盟引发的阿谀奉承:可操纵多元联盟的双面评估
Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment
摘要
群体一致性使语言模型适应人口统计群体,以产生反映该群体的意见、价值观和偏好的响应。奉承是一种有据可查的一致性副产品,它会导致模型过度同意用户,而不管事实和客观信息如何。然而,现有的群体对齐方法和评估仅关注模型与群体观点的匹配程度,忽视了阿谀奉承行为的诱发变化。为了弥补这一差距,我们引入了 \textbf{G}roup \textbf{A}lignment-induced \textbf{S}ycophancy (GAS),并系统地评估了 3 种方法、4 个模型和 13 个人口群体的一致性,包括预期的意见一致性增益和意外的阿谀奉承转变。我们发现不同群体之间的增益和转变是不均匀的:在相同的预算下,一些群体在意见一致方面获得的收益比其他群体更大,并且诱导的阿谀转变形成了特定群体的概况,而不是单一维度的变化。这些结果表明,在使 LLM 适应不同人群时,群体对齐应报告为双边、多维概况,而不是考虑每组差异的单一拟合得分。