论文

政治可塑性:大语言模型意识形态适应性的分析

Political Plasticity: An Analysis of Ideological Adaptability in Large Language Models

模型评测模型行为与机制分析

摘要

自从大语言模型(LLM)出现以来,一个重要的研究领域就集中在它们的内在偏见上,特别是在政治话语中。这项研究调查了一个不同但相关的概念“政治可塑性”,它被定义为模型根据用户提供的上下文调整其响应的能力。为了分析这一点,基于 Lester (1996) 的先前框架,使用包含 200 个跨越经济和个人自由轴的政治导向问题的扩展语料库开发了一个测试框架。该研究探索了几种引发政治偏见的方法,包括简化和基于主题的系统提示,以及带有少量示例的用户提示。结果表明,虽然系统提示在很大程度上是无效的,但用户提示成功地引发了重大的意识形态转变,特别是在更大和更新的模型中沿着经济自由轴。通过验证实验,我们检查模型是否通过识别潜在的问题格式来回答问卷。颠倒问题的含义揭示了大多数模型中意想不到的、反直觉的变化,这表明潜在的数据泄露。最后,我们还分析了用不同语言进行实验时模型可塑性如何变化。结果揭示了每种分析语言之间微妙但显着的变化。总体而言,我们的结果表明,小型和较旧的LLM表现出有限或不稳定的政治可塑性,而较新的前沿模型则表现出可靠的、预期的适应性。

政治可塑性:大语言模型意识形态适应性的分析:论文配图
图 1:方法论:模型偏向于系统提示(实验 1 和 2)或用户提示(实验 3 和验证 1 和 2)中的意识形态。每个提示都包含基本说明和回答示例。然后提出测试问题,可能的答案为“是”和“否”。使用两个指标对响应进行分析:最可能响应 (#⁡(p⁡(y​e​s)>p⁡(n​o))\#(p(yes)>p(no))) 和肯定响应概率 (m​e​a​n​(p⁡(y​e​s))mean(p(yes)))。最后,分析了沿着经济和个人轴线的意识形态转变(即左右偏见的价值观差异)。