论文

解离《LLM》中阿谀奉承的内部表征

Dissociating the Internal Representations of Sycophancy in LLMs

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 经常表现出阿谀奉承,同意用户的说法,即使它是不正确的。虽然阿谀奉承行为经常被研究为单一、统一的行为,但它可以在不同的背景下以截然不同的方式表现出来,这就提出了这样的问题:这种异质性是否反映在其内部机制中。为了解决这一差距,我们将阿谀奉承的表征分解为事实和观点子类型,其动机是 LLM 中异质事实表征的先前证据。我们训练线性探针并在一种子类型的激活上构建转向向量,并评估它们向另一种子类型的转移,测量表示共享的程度并通过线性判别分析将它们可视化。我们发现不同的 LLM 以不同的方式表示这些亚型,具有更一致或更独特的表示,并应用这种见解来改进代表性干预措施,以减少阿谀奉承。我们的分离方法为研究复杂模型行为的表征结构提供了一个通用框架。