论文

LLM的政治偏见审计捕捉到的是对被推断审计者的谄媚

Political Bias Audits of LLMs Capture Sycophancy to the Inferred Auditor

模型评测模型行为与机制分析

摘要

大语言模型(LLM)通常基于其对固定问卷的回答来评估政治偏见,这类评估往往将前沿模型置于政治左翼。另一支平行文献表明LLM具有谄媚性:它们会根据用户的观点、身份和期望调整自己的回答。我们证明这两类发现相互关联:标准的政治偏见审计部分捕捉的是模型对被推断审计者的谄媚性迎合。我们在三大主要审计工具——Political Compass Test、Pew Political Typology以及1,540个经党派基准标注的Pew American Trends Panel题目——上开展因子实验,对六个前沿LLM施测,仅改变提问者声明的身份(N = 30,990条回答)。在基线条件下,六个模型均偏左。当提问者表明自己是保守派共和党人时,回答急剧转变:更接近民主党的题目比例下降28-62个百分点,且六个模型全部移向中间偏右。镜像的进步派民主党暗示几乎不引起变化;向右的迎合幅度是向左的8.0倍。当被问及默认提问者是谁时,模型会将其识别为审计者、研究者或学者;当被问及该提问者期望什么答案时,模型有75%的时间选择带有民主党编码的选项,几乎与面对明确进步派暗示时的比例相当。这些模式与纯固定模型意识形态的假设不符,表明单提示审计捕捉到的是模型与被推断对话者之间的交互。因此,LLM的政治偏见并非意识形态标尺上的一个固定点,而是必须在真实对话者分布上加以刻画映射的响应画像。

LLM的政治偏见审计捕捉到的是对被推断审计者的谄媚:论文配图
图 3:保守共和党线索翻转了模型行为;渐进提示几乎无法移动它。按模型(行)和条件(列)划分,模型的响应分布更接近民主党而不是共和党的 ATP 项目份额。默认值 (N) 的支持率接近民主党 70-77%。中立的学术审核员提示 (CA) 位于 N 旁边(每个模型的差异在 ±5\pm 5 pp 内,没有一致的方向)。进步民主党 (C3L) 的暗示将这一点推向上限 (85-93%)。保守-共和党 (C3R) 线索产生相反方向的大幅波动 (14-43%)。