论文
身份与观点如何塑造大语言模型的政治迎合行为
How Identity and Opinion Shape Political Sycophancy in LLMs
摘要
随着大语言模型 (LLM) 越来越多地鼓励用户披露个人资料以获得量身定制的帮助,衡量他们的政治立场变得越来越重要。然而,许多现有的评估政治行为的基准依赖于封闭式问题,并且没有完全捕获模型的立场如何适应交互过程中用户提供的上下文。我们引入了一个框架,可以消除政治阿谀奉承的两个不同触发因素:观点(与明确的叙述相一致)和身份(基于人口标签的刻板印象)。我们使用 450 个手动检查的政治困境作为受控探针,评估了 13 个经过指令调整的LLM。我们发现了一种分离:模型对明确意见的敏感性并不一定能预测其对身份线索的敏感性,反之亦然。当两种信号都存在时,它们的效果通常是次加性的,而不是简单加性的。此外,系统级角色主要改变模型的基线立场,而对用户意见或身份引起的立场转变影响有限。最终,我们的结果表明,LLM的政治立场是互动且可操纵的脆弱性,而不是固定的特征,强调个性化如何放大模型行为中的身份或观点条件的转变。
