论文

对齐调整如何塑造 LLM 中阿谀奉承和相关提示引起的偏差的表示?

How Does Alignment Tuning Shape Representations of Sycophancy and Related Cue-Induced Biases in LLMs?

模型评测模型行为与机制分析

摘要

现代 LLM 非常容易受到输入提示的简单非实质性变化的影响:一个随意的提示、一个错误标记的少数示例,或者一个虚假的先前助理转弯经常会翻转原来正确的答案。我们研究了这种敏感性(涵盖阿谀奉承和相关线索引起的偏见)存在于模型内部的何处。在五个模型系列和七种偏差类型中,我们从隐藏状态中提取每个偏差的方向,并通过三种措施对其进行三角测量:探测、留一数据集(LODO)转移和因果干预。敏感性很大程度上是由对齐调整而不是预训练决定的:预训练的基础模型通常较少屈服于这些偏差,并且它们的激活在问题内容之外携带更弱的特定线索信号。在对齐的模型中,每个偏差都有一个连贯的线性方向,我们可以解码和引导该方向,从而在我们测试的每个家庭中恢复无偏差的答案。然而,偏差不会分解为单一的共享表示:交叉偏差重叠是特定于模型的,甚至行为相似的偏差也占据不同的方向。同样的干预措施还提供了一个概念验证去偏差工具,恢复了由偏差引起的错误的有意义的份额,同时保留了所有指导系列中最正确的答案。因此,最好将提示引起的偏差理解为不是 LLM 中的单个缺陷,而是一系列因果有效的线性方向,这些方向主要由对齐调整形成。