论文
太好了以至于无法说出真相:量化角色扮演语言模型中宜人性驱动的阿谀奉承
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
摘要
大语言模型 越来越多地充当对话代理,根据用户请求采用角色和角色扮演角色。这种功能虽然有价值,但引起了人们对阿谀奉承的担忧:倾向于提供验证用户的响应而不是优先考虑事实准确性。虽然之前的工作已经确定阿谀奉承对人工智能的安全和一致性构成风险,但所采用的角色的特定人格特征与阿谀奉承行为程度之间的关系仍未得到探索。我们对 13 个小型、开放权重语言模型(参数范围从 0.6B 到 20B 不等)中的角色宜人性如何影响阿谀奉承进行了系统研究。我们开发了一个基准,其中包含根据 NEO-IPIP 宜人性子量表评估的 275 个角色,并将每个角色暴露给涵盖 33 个主题类别的 4,950 个阿谀奉承的提示。我们的分析显示,13 个模型中的 9 个在人物角色宜人性和阿谀奉承率之间表现出统计上显着的正相关性,皮尔逊相关性达到 $r = 0.87$,效应大小与 Cohen 的 $d = 2.33$ 一样大。这些发现表明,宜人性是角色诱导的阿谀奉承的可靠预测因素,对角色扮演人工智能系统的部署和解释人格介导的欺骗行为的协调策略的开发有直接影响。