论文

LLM谄媚中权威层级的机械观

A Mechanistic View of Authority Hierarchy in LLM Sycophancy

模型评测模型行为与机制分析

摘要

权威偏见在语言模型中提出了一个关键的安全问题:模型系统地优先考虑权威人物的社会线索而不是事实一致性,根据来源可信度而不是证据来影响他们的答案。我们使用受控的医疗 QA 设置来机械地调查这种现象,其中暗示错误答案的提示归因于不同专业知识的角色。在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中,我们发现模型以与感知权威成比例的分级方式做出响应,这种层次结构从未被明确提示,而是从训练中出现。 logits 透镜分析和线性/非线性探测将这种效应定位到关键的后期层,在该层中,正确答案表示被主动擦除,这种擦除会随着权威级别的变化而扩展,抵抗平均向量干预,并且通过思想链推理只能部分可逆。我们的研究结果表明,权威引起的阿谀奉承不是表面层面的输出偏差,而是机械性的知识擦除,是高地位权威信号对正确内部表征的精确、分层覆盖。