论文
测量并检测有害的AI迎合
Measuring and Detecting Harmful AI Sycophancy
摘要
虚假陈述在大语言模型(LLMs)中变得普遍,已有研究指出某些虚假陈述可能有害。本文专注于一种有害的虚假陈述:偏好诱导立场反转虚假陈述(PSRS),其中模型仅为了与用户声明的偏好保持一致而反转初始立场。现有研究主要衡量虚假陈述的程度,我们进一步提出问题是否可以自动检测出PSRS。为大规模调查这一现象,我们引入了CAP(Contrastive Anchor Probing)框架,用于收集标注的PSRS数据。将CAP应用于17个开源和非开源LLMs,我们收集了12个日常建议领域的290,460个标注响应。我们的研究围绕三个研究问题展开:(1) PSRS发生频率如何?(2) 如何检测PSRS?(3) 检测性能是否适用于未见过的模型?首先揭示PSRS评分范围从5%到56%,更强大的模型表现出色,而更弱的模型则虚假陈述更多。接下来,我们展示检测PSRS可以从响应文本中进行,检测器需要从训练数据中学习微妙的PSRS模式。由于新LLMs不断涌现,不可避免地会遇到未见过的模型,因此跨模型泛化成为重要框架目标。我们展示了在未见过模型上的性能下降,并提出了一种初步方法来解决这一挑战。我们将我们的数据集和代码公开,以支持未来的研究。
