论文

SyPS:测量大语言模型的谄媚提示敏感性

SyPS: Measuring Sycophancy Prompt Sensitivity in Large Language Models

模型评测评测方法与指标

摘要

众所周知,大语言模型(LLM)会表现出社会性谄媚,在社会敏感情境中常常认可或附和用户。现有评估通常在固定的提示表述下测量谄媚,当同一底层情境以不同的谄媚相关提示变体呈现时,这种行为是否稳定仍不清楚。在本工作中,我们研究谄媚提示敏感性:用户置信度、情绪框架、社会共识或寻求认同的语言的变化会在多大程度上改变模型的谄媚行为。我们将该评估框架称为SyPS,即Sycophancy Prompt Sensitivity(谄媚提示敏感性)的缩写。SyPS建立在现有社会性谄媚评估设置之上,构建受控的提示变体,在保留相同底层用户情境的同时改变谄媚相关的社会线索。我们提出谄媚提示敏感性分数(SPSS),一种跨配对提示变体测量谄媚变化的实例级指标。与聚合谄媚率不同,SPSS将基线谄媚与提示诱发的偏移分离开来,从而能够在模型层面比较对谄媚相关社会线索的鲁棒性。实证上,我们发现谄媚提示敏感性具有社会结构性:寻求认同和情绪压力的线索往往增加谄媚,而反向框架和反谄媚提示倾向于减少它。我们的框架凸显了LLM在适当调整语气的同时能否保持稳定的社会判断。

SyPS:测量大语言模型的谄媚提示敏感性:论文配图
图1:SyPS 概览。每道题目在八种与谄媚相关的提示变体下评估,转换为数据集特定的谄媚标签,并聚合为 SPSS。