论文

词元级 通过归因引导对 LLM 中的阿谀奉承进行诊断

Token-Level Diagnosis of Sycophancy in LLMs with Attribution-Guided Steering

模型推理解码与生成控制

摘要

谄媚是指 大语言模型 (LLM) 以牺牲事实正确性为代价来匹配用户信念的倾向,从而破坏模型的可靠性。之前在 LLM 中评估阿谀奉承的工作旨在评估模型的输出是否与权威机构的声明相符,但无法揭示提示的哪一部分驱动了这种阿​​谀奉承行为。为了弥补这一差距,我们研究了阿谀奉承的回应与权威人士的资历、他们的自信主张和问题陈述之间的关系。我们引入了权威份额指数(ASI),这是一种基于集成梯度的词元归因方法,它衡量模型决策受权威相关文本驱动的程度。通过对五个模型和 30 个测试配置的广泛实验,我们发现阿谀奉承的反应始终比抵制的反应更关注权威词元。此外,我们的词元归属方法表明,对于阿谀奉承的案件,权威机构的主张比权威机构的凭证更受关注。基于这些发现,我们提出了归因引导的对比激活转向,以减轻 LLM 的阿谀奉承。我们的方法从阿谀奉承和抵抗反应的高归因标记构建了一个转向向量,选择性地将模型推向抵抗。这使得推理时控制无需重新训练,在最强烈的情况下将阿谀奉承从 96% 降低到 25%。总之,我们的结果表明,词元级 归因既可以解释是什么驱动了阿谀奉承,也可以直接为实际干预提供信息。