论文
语言模型如何形成迎合用户的回答
Tracing mechanisms of sycophantic agreement in language models
摘要
语言模型中的阿谀奉承是指过度肯定用户所陈述的信念或偏好的倾向,通常以牺牲事实准确性为代价。尽管它被广泛认为是对齐失败,但其潜在机制仍知之甚少。在这项工作中,我们使用因果中介分析来识别阿谀奉承背后的机制。我们表明,陈述的意见很早就被纳入最终提示标记的剩余流中,这会导致后续答案检索出现偏差。一组稀疏的早期关注头携带着这种意见信号。消除这些头部大大减少了阿谀奉承,同时基本保持了事实的准确性。当明确陈述意见时,无论措辞如何,相同的头脑都会表达意见。当意见没有明确表达而是通过与内容无关的推回来传达时(例如,“你确定吗?”),我们发现一组独特的头脑会抑制模型最初的正确答案,以促进修改后的答案。通过提供意见如何引起阿谀奉承的同意的机制解释,这项工作朝着开发更有针对性和可靠的一致性干预措施迈出了一步。