论文
放大镜:在 大语言模型 内定位和引导党派方向
The Amplifying Mirror: Locating and Steering the Partisan Direction inside a Large Language Model
摘要
大语言模型 正在迅速取代搜索引擎,成为人与信息之间的主要界面。与检索现有内容的搜索引擎不同,LLM 会根据训练期间学习的内部表示生成新颖的文本。在这里,我们表明党派政治身份被编码在模型的激活空间中,并且这个方向直接塑造一代。我们使用美国国会现任议员的 190,491 条推文作为标记训练数据,在 Llama 3.1 8B Instruct 模型的隐藏状态上训练线性探针。我们在第 18 层确定了一个单一的几何轴,该轴将共和党和民主党文本分开,其 AUC 为 0.945,Cohen's d 为 1.94,并使用稀疏自动编码器将该轴分解为可解释的党派特征。沿着这个轴进行因果干预,消除或放大中期的党派成分,会在模型的输出中产生系统性的转变。我们目睹了立场的逆转、语域的转变以及权威的结构化捏造。我们的结果表明,语言模型中的党派偏见不是一种模糊的自然属性,而是一种可以精确定位和引导的学习几何特征。党派偏见不是一个需要修补的错误,而是这些模型如何编码有关用户的信息的结构属性。随着 LLM 取代搜索引擎成为知识界面,了解产品设计(及其后果)对于引导法律、社会和政治从策划的信息生态系统向生成的信息生态系统的转变至关重要。